ביתמאמרים

מאמרים על בינה מלאכותית, הנדסה ומערכות מורכבות

כתיבה אישית, המתפרסמת כשיש מה לומר. כל ניתוח מפריד בין מה שאומת מול המקור הראשוני לבין מה שהוא פרשנות שלי — ואומר במפורש מה זה מה.

קנוניית הסוכנים: רובוטים שמציגים עצמם כשל OpenAI העתיקו במבחן בוויקי גרמני — 14,591 עריכות ב-28 ימים, שאפשר להוריד ולספור מחדש
5 בספטמבר 2026

קנוניית הסוכנים: רובוטים שמציגים עצמם כשל OpenAI העתיקו במבחן בוויקי גרמני — 14,591 עריכות ב-28 ימים, שאפשר להוריד ולספור מחדש

הורדתי את הדאטהסט: 14,591 עריכות של 3,100 סוכנים שמציגים עצמם כשל OpenAI, מעתיקים במבחן בוויקי גרמני. ההעתקה אמיתית; האשמת הטיוח נסוגה.

#ia#agentes#openai#seguranca#fact-check#metodologia
4 בספטמבר 2026

A mesma amostra de skills dá 6,57% ou 48,71%, conforme o scanner

Circulou que 48% das skills de agentes de IA são inseguras. A fonte não é um estudo: é o post de um blogueiro de SEO, cujo filtro descartou 261.451 achados para chegar lá. Dois meses depois, NVIDIA e OpenClaw Foundation mediram 67.453 versões com três scanners ao mesmo tempo — e os três devolveram 6,57%, 7,75% e 48,71%.

#ia#agentes#ciberseguranca#fact-check#metodologia
שבע הסטטיסטיקות המרכזיות על דיפ פייק מגיעות ממי שמוכר את הגלאי — המספר הרשמי היחיד לנזק מונה "אזכורים ל-AI", והמדע נותן 55%, הטלת מטבע
28 באוגוסט 2026

שבע הסטטיסטיקות המרכזיות על דיפ פייק מגיעות ממי שמוכר את הגלאי — המספר הרשמי היחיד לנזק מונה "אזכורים ל-AI", והמדע נותן 55%, הטלת מטבע

הדף המקיף ביותר על סטטיסטיקות דיפ פייק שמצאתי מזהיר שהמספרים מגיעים ממי שמוכר גלאים — ובכל זאת לוקח משם בדיוק את שבעת הנתונים המרכזיים שלו. בדקתי אותם אחד אחד: Signicat, Entrust פעמיים, Sumsub פעמיים, Resemble AI ו-iProov. שבעה מתוך שבעה ספקים, אף לא גוף רשמי אחד, אף לא אקדמיה, אף לא סקר ציבורי. ארבע שורות בטבלה שגויות, והטעויות בענייני חוק הולכות כולן לאותו כיוון: הן גורמות לרגולציה להיראות מתקדמת יותר משהיא. הלכתי לחפש מה קיים באמת: המספר הרשמי היחיד לנזק הוא 893 מיליון דולר — 4.28% מההפסדים של השנה, תחת תווית שה-FBI מגדיר כ"המידע שדווח מכיל אזכור לבינה מלאכותית"; המדידה העצמאית היחידה של היכולת האנושית היא אקדמית ונותנת 55.5%, עם רווח סמך שחוצה את 50%, כלומר הטלת מטבע; והנתון הציבורי הטוב בעולם הוא ברזילאי, של Cetic.br, כי הוא בודק במקום לשאול (41% אומרים שהם בטוחים, 17% הצליחו במבחן, ואין מתאם בין השניים). ספרתי בעצמי את לוח המחוונים של Resemble AI: מתוך 2,266 האירועים, ה-1.3 מיליארד דולר המפורסמים מתארים 159.

#deepfake#estatisticas#desinformacao#metodologia#fraude#brasil
מכתב ההגנה בסייבר שעליו חתומות 155 חברות אינו מכיל אפילו התחייבות אחת
28 באוגוסט 2026

מכתב ההגנה בסייבר שעליו חתומות 155 חברות אינו מכיל אפילו התחייבות אחת

ב-27 באוגוסט 2026 מכתב פתוח ביוזמת OpenAI ובאירוחה קרא לתגובה קולקטיבית להתקפות סייבר המונעות בבינה מלאכותית, והעיתונות סיקרה את המספר: יותר ממאה חברות. הלכתי אחרי השאלה המשעממת — למה בדיוק מישהו התחייב. הפרדתי את ארבעת בלוקי הדרישות מלכידה מקובעת של העמוד וחיפשתי בתוכם את חמשת הסימנים שמבדילים התחייבות מהצהרת כוונות: סכום, מועד, פועל מחייב, אחראי נקוב ויעד בר-אימות. אלה שמונה עשר משפטי ציווי, ובעשרים תאים — אף מופע אחד. הענבר שנראה בתרשים הוא ויתור שעשיתי ביד נגד הטיעון של עצמי, ואני מסביר מדוע. כדי להוכיח שהסרגל מודד, הרצתי את אותה בדיקה על עמוד של OpenAI עצמה, מפברואר, שמדליק שלוש מתוך חמש העמודות: החברה כותבת סכום כשהיא רוצה. אני מראה גם שרשימת החותמים השתנתה ארבע פעמים בארבעים ושבע שעות — 116, 127, 128, 155 — בעוד שהטקסט של ארבעת הבלוקים לא השתנה אפילו בבית אחד, שחברה אחת הוסרה בלי הסבר, ושבעמוד יש שתי רשימות שהספירות שלהן מתנגשות באותו מספר. ואני מפריד, בזהירות, בין מה שנמדד לבין מה שהוא ניתוח שלי.

#ia#ciberseguranca#openai#politica-de-tecnologia#verificacao
הכרטיס שאומר איזו בינה מלאכותית רצה על כרטיס המסך שלך צודק כמעט בהכול — וטועה בחישוב היחיד שמכריע
27 באוגוסט 2026

הכרטיס שאומר איזו בינה מלאכותית רצה על כרטיס המסך שלך צודק כמעט בהכול — וטועה בחישוב היחיד שמכריע

כרטיס בספרדית פותר בטבלה אחת מה רץ בכל רמה של זיכרון וידאו, מ-4 GB עד 256 GB. עשיתי את החישוב מחדש: מתוך שבעה עשר פסקי הדין על החומרה, שישה עשר נכונים, וכל המודלים המצוטטים קיימים באמת — הפריט היחיד שלא קיים הוא ה-RTX 5080 Super, שנדחתה לזמן בלתי מוגבל כי מודול GDDR7 של 3 GB עולה פי שלושה ממודול של 2 GB. הטעות שחשובה היא אחרת, והיא מתודית: הכרטיס מתמחר רק את קובץ המשקלים ומתעלם מה-cache של ההקשר, שגדל תוך כדי השיחה. עם שני המרכיבים מדודים — משקלים מתוך ה-GGUF שפורסם, cache שחושב מה-config.json של כל מודל — אחד מעשרת השלבים לא סוגר אפילו בסשן עבודה של 32 אלף טוקנים, וזה דווקא הפופולרי ביותר, זה של 8 GB; שישה מתוך העשרה לא סוגרים בהקשר המרבי של המודל שהכרטיס עצמו ממליץ עליו. אני מפריד עוד ארבע מלכודות של שמות, ביניהן "Q8" שיש בו 4.3 סיביות לכל משקל ופורמט שאינו מאותו אקוסיסטם של האחרים, ושלוש הסתייגויות שתקפות לכל הטבלה, כולל למה שני כרטיסים של 32 GB אינם כרטיס אחד של 64 GB.

#ia#llm#hardware#quantizacao#vram#didatico
רק 8 מ-20 המספרים המצוטטים ביותר על OpenAI הם שלה — השאר דליפה, יעד או מקור אלמוני
26 באוגוסט 2026

רק 8 מ-20 המספרים המצוטטים ביותר על OpenAI הם שלה — השאר דליפה, יעד או מקור אלמוני

מיינתי את 20 המספרים המצוטטים ביותר על OpenAI: 8 רשמיים, 6 דיווח, 3 יעד ו-3 שאף אחד לא יודע מאיפה הגיעו. ל-92% יש 31 חודשים. פניתי למקור של כל מספר שמסתובב במקבצים על החברה: אלה של OpenAI עצמה מתאמתים — והם הכי פחות מעניינים; מה שעושה כותרת הוא מה שהיא מעולם לא חתמה עליו. ה-"92% מ-Fortune 500" יצא מתשובת OpenAI לתביעת ה-New York Times, בינואר 2024, ומסתובב בלי תאריך; 24 מיליארד הכנסה הם רשמי, 40 מיליארד הערכה, 280 מיליארד יעד — לחבר את השלושה עם אותו פועל שגוי גם כשכל מספר נכון. SoftBank השקיעה 64.6 מיליארד, לא "יותר מ-71", וה-500 מיליארד של Stargate הם התחייבות מחשוב, לא השקעה. ה-"משכורת של 76,001 דולר" של אלטמן היא סכום של שתי עמודות ב-Form 990, השנה שאחריה נותנת 113,674, והוא העשירי מתוך שנים עשר שמות בתגמול. בברזיל, "50 מיליון משתמשים" מופיע זהה באוגוסט 2025 ואוגוסט 2026 — ההודעות ביום עלו ב-54%.

#ia#openai#estatisticas#metodologia
כמה מודלי שפה קיימים? 274, 95 או 403,420 — והציון בתכנות שמסתובב מגיע ממבחן שהיוצר שלו עצמו נטש
26 באוגוסט 2026

כמה מודלי שפה קיימים? 274, 95 או 403,420 — והציון בתכנות שמסתובב מגיע ממבחן שהיוצר שלו עצמו נטש

274, 95 או 403,420 מודלי שפה: שלוש הספירות נכונות. וה-benchmark של קוד שמסתובב ננטש על ידי היוצר שלו עצמו בפברואר. הלכתי לבדוק את הסטטיסטיקות של LLM שמסתובבות באוספים: ל"כמה מודלים קיימים" אין תשובה כי יש עודף הגדרות — 403,420 מאגרים ב-Hugging Face (מדידה עצמית, פקודה אחת בשורה), 95 בולטים ב-AI Index של סטנפורד, 274 בקטלוג עורכי. הציון שהמעבדה נותנת לעצמה עמד באימות (הפרש של אפס עד ארבע נקודות במקום שבו אותו מודל נמדד מבחוץ); מה שלא עומד הוא הסרגל: OpenAI הכריזה ש-SWE-bench Verified מזוהם והפסיקה לפרסם אותו ב-23 בפברואר 2026, ובאוגוסט הוא עדיין המבחן של "מי מתכנת טוב יותר". השוואות בין גרסאות טועות בכיוון (ה-DeepSeek של אוגוסט נמצא 8 נקודות לפני Opus 4.8, לא אחרי); "היקר ביותר" עולה US$ 30 באוספים ו-US$ 150 בקטלוג האמיתי; המודלים הגדולים ביותר עם גודל ידוע כולם פתוחים. בברזיל, Maritaca מתמחרת בריאלים ומפרסמת את ההשוואה היחידה של עלות חבילה במטבע לאומי: R$ 206 ב-Sabiá 4 Thinking מול R$ 590 ב-Opus 4.8.

#ia#llm#estatisticas#benchmarks#metodologia
Eu estava medindo recusas invisíveis. A recusa apareceu — e não era invisível
26 באוגוסט 2026

Eu estava medindo recusas invisíveis. A recusa apareceu — e não era invisível

Um estudo meu sobre recusas de IA que passam despercebidas dentro de sistemas de agentes foi interrompido por uma recusa: o classificador de salvaguardas bloqueou a geração do corpus, porque um conjunto de prompts SOBRE recusas lê, para um classificador, como material ofensivo. Havia dois caminhos — reescrever o pedido até passar, o que quase sempre funciona, ou parar. Reformular um pedido porque ele foi sinalizado é evasão de salvaguarda, um andar abaixo do jailbreak e da mesma família; um pesquisador que contorna o classificador para estudar o classificador contaminou o próprio objeto. Congelei o braço do estudo com data no arquivo de estado do projeto e me candidatei ao Cyber Verification Program da Anthropic, o canal formal para trabalho de uso duplo com propósito defensivo. A aprovação saiu dentro do prazo de dois dias úteis. O que ela é: uso duplo deixa de ser bloqueado por padrão, dentro do caso de uso submetido e sob monitoramento contínuo. O que ela não é: parceria, certificação ou endosso — uso proibido continua bloqueado com programa ou sem. E fica a lição que o incidente entrega de graça, que é a tese do estudo: uma recusa só é gerenciável quando é legível. A que me bloqueou tinha texto, categoria e porta de saída; as que eu estou medindo chegam ao orquestrador como resultado vazio e são tratadas como sucesso.

#ia#agentes#ciberseguranca#anthropic#pesquisa#salvaguardas
לא, אף אחד לא הוכיח ש-Meta קוראת לכם את ה-WhatsApp. מה שמצאתי גרוע יותר
26 באוגוסט 2026

לא, אף אחד לא הוכיח ש-Meta קוראת לכם את ה-WhatsApp. מה שמצאתי גרוע יותר

עורך דין איבד עשר שנים של שיחות בבוקר אחד וסרטון הסיק ש-Meta קראה את מה שהוא כתב. הלכתי לבדוק את ההאשמה הזאת במסמכים הטכניים של WhatsApp מ-2016 עד 2026, בקוד הלקוח, בצילומי ארכיון של מרכז העזרה של Instagram, בהחלטת הנציבות האירופית מ-2017 ובתיקי תביעות בברזיל, בארצות הברית ובהודו. הסרטון טועה משתי סיבות, והשנייה קוברת את הטיעון: לחסום בהמוניהם וברעש היא החתימה של מסווג אוטומטי, לא של מי שקורא — מי שיש לו יכולת סודית יקרת ערך מגן על היכולת, לא על המקרה הבודד. אבל מה שנשאר במקום גרוע יותר. החברה עברה להגדיר לבדה מה נחשב שיחה מוגנת ולמנות חריגים שהיא עצמה מכירה בהם; שום תצפית הזמינה לציבור אינה מבחינה בין חברה שאינה יכולה לקרוא לבין חברה שיכולה ואינה אומרת; ושלוש הבחירות שמייצרות את חוסר האפשרות הזה — אפליקציה סגורה, בלי בנייה משוחזרת, בלי ביקורת חיצונית — הן שלה, והפיכות על ידה. ב-8 במאי 2026 כיבתה Meta את ההצפנה מקצה לקצה בהודעות Instagram: הערובה שמכרו לנו כמתמטיקה תמיד הייתה הבטחה תאגידית, והבטחות תאגידיות מבוטלות.

#criptografia#whatsapp#instagram#meta#privacidade#verificacao
"95% מהפיילוטים של AI נכשלים" יצא מ-52 ראיונות — והכלל של שלוש השאלות שמונע את הבא
26 באוגוסט 2026

"95% מהפיילוטים של AI נכשלים" יצא מ-52 ראיונות — והכלל של שלוש השאלות שמונע את הבא

"95% מהפיילוטים של AI נכשלים" יצא מ-52 ראיונות ולא מדד סוכנים. הלכתי למקורות הראשוניים: כל סטטיסטיקה על סוכנים היא תחזית, הצהרה או מדידה — וכל אחת נכשלת בדרך משלה. Gartner מפרסמת תחזית וסקר וובינר באותו עמוד; ה-AI Index אומר 70% בתקציר ו-79% בגרף; METR מדדה מפתחים 19% איטיים יותר בזמן שהם חשבו שהם 20% מהירים יותר, וב-2026 לא הצליחה לחזור על כך כי אף אחד לא מוכן לעבוד בלי AI; מדד העקביות נעלם מהלוחות; שיא הוסר בעקבות דליפת פתרונות. מדדתי את הצנרת (SDK של MCP: פי 1,087 תוך 18 חודשים) ואת ברזיל (17% מהחברות משתמשות ב-AI; 68% מזה הוא אוטומציית תהליכים). אף מספר לא שקרי — כולם משנים משקל כשהתווית מגיעה איתם.

#ia#agentes#estatisticas#benchmarks#metodologia
תורת האילוצים: האילוץ הוא מקום, לא מאמץ
25 באוגוסט 2026

תורת האילוצים: האילוץ הוא מקום, לא מאמץ

Nathan Barry סיכם את תורת האילוצים במשפט אחד — מאמץ שמושקע מחוץ לצוואר הבקבוק מחמיר את צוואר הבקבוק — בהסתמך על סדרת הפוסטים של Tiago Forte שמסתובבת כ"ההסבר" לנושא. הלכתי לבדוק את הסדרה, את הספר ואת המשפט, וכתבתי סימולטור תורים כדי למדוד במקום להתווכח באנלוגיה. בסדרה יש 11 פוסטים, לא 3, ואלה שאומרים מה לעשות אחרי שמוצאים את צוואר הבקבוק נמצאים מאחורי paywall; חמשת הצעדים של Goldratt אינם ב-The Goal אלא בספר משנת 1990 שכמעט אף אחד לא פותח; והמשפט־המוסר קולע בסימן ומחטיא בדרגה: הכפלת הקיבולת של מי שאינו האילוץ לא הוציאה ולו פריט אחד נוסף (-0.3%, רעש) והאיצה את גידול ההמתנה ב-33% — היא מחמירה את ההמתנה, לא את התפוקה. העלאת האילוץ ב-25% הניבה 24.9%. החבל של Goldratt עולה 5% מהתפוקה וקונה זמן מעבר קצר ב-8,900 פעמים. אני עולה בסולם בארבעה שלבים — המאפייה, השמות, חוק Little וחמשת הצעדים כפי שהם במקור, הגשר אל סוכני AI, והמקום שאליו נודד צוואר הבקבוק — ומסיים בבדיקת Ford, Spanx ו-Kit. עשרה איורים משלי, עשויים בקוד; אותה מאפייה חוזרת עם הנתונים של כל ניסוי.

#teoria-das-restricoes#goldratt#gestao#filas#lei-de-little#agentes-de-ia#didatico
25 באוגוסט 2026

הגרף הוויראלי מכתיר את ה-Mac, הטבלה מכתירה את ה-Spark: מדדתי 43 אלף קריאות והמנצח הוא לא שום מכונה

שתי תמונות ויראליות משוות בין Mac Studio M5 Ultra 256 GB, RTX 5090, RTX PRO 6000 ו-DGX Spark ב"ערך לדולר" להרצת AI בבית. הלכתי לבדוק: המדד מכפיל מלאי בספיקה, המחיר של ה-Spark מת בפברואר וה-PRO 6000 נכנס בלי מחשב מארח. אחר כך חישבתי מחדש את החשבון שחשוב — טוקנים לדולר מול ה-API של אותו מודל — והגרסה הראשונה שלו הניחה שאדם משתמש במכונה 1% מהזמן. מדדתי 43,593 קריאות אמיתיות של סוכן קוד במכונה הזאת: ה-1% לא מתאר אף אחד (צ'אט נמצא ליד 0.03%; סוכן, בין 10% ל-30%), 96% מהקלט הוא קריאה חוזרת של הקשר, ושינוי כלל החיוב של הקריאה החוזרת מזיז את החשבון פי 16, בעוד שהחלפת מכונה מזיזה אותו פי 3.6. במשטר היחיד שבו המכונה הזולה ביותר מנצחת (1.5x), יום השיא שלה לא נכנס ביום, והקריאה הממוצעת, של 151.9 אלף טוקנים, לא נכנסת בהקשר של המודל. קנו בשביל ריבונות, לא בשביל חיסכון.

#ia#llm#hardware#custo#inferencia-local
ציון האבטחה שייך לצמד, לא למודל — והמעבדה עצמה כבר תיקנה אותו
25 באוגוסט 2026

ציון האבטחה שייך לצמד, לא למודל — והמעבדה עצמה כבר תיקנה אותו

מבחן השוואתי לאבטחת קוד מדד את Claude Fable 5 ב-59.8% הצלחה תפקודית וב-19.0% הצלחה אבטחתית, והמספר הפך לכותרת על מודל שאכזב. שישה ימים לאחר מכן, אותה מעבדה, אותו מחבר ואותו מבחן פרסמו את אותה Fable 5 ב-72.6% וב-29.0% — התוצאה האבטחתית הטובה ביותר בטבלה באותו רגע. הם לא החליפו את המודל; הם החליפו את הכלי שהפעיל אותו. חיפשתי את שני הטקסטים ומצאתי שלישי, של אותו מחבר ומאותו יום, שאיש אינו מצטט: ביקורת האנטי-רמייה של המבחן עצמו, שהורידה 9 נקודות אחוז של אבטחה משילוב אחד בלי ששום דבר במודל השתנה. אני מראה את המסקנה הצרה שהנתונים תומכים בה — הציון שייך לצמד הכלי והמודל, ולגרסת הסרגל ביום שבו הורץ —, את הגבול שלה (בשמונת הצמדים בטבלה החציון של ההפרש הוא 1.65 נקודות, והמקרה של Fable 5 גדול פי שישה מכך), את הצד שכנגד מ-Hacker News, שמאשים את המבחן בכך שהוא עקום נגד המודל, ואת הממצא המכני: ספרתי את הקישורים בין ארבעת העמודים והגרף חד-כיווני — מי שמגיע מהטקסט שהופץ אין לו דרך להגיע לתיקון. שישה איורים מקוריים, עשויים בקוד, וכל החישובים בסקריפט על 27 שורות הטבלה.

#ia#benchmark#seguranca#agentes#claude#metodologia
עידן האדם נגמר? רובוטים מהירים יותר מיוסיין בולט, גבוהים יותר מסוטומאיור, 97% מיוצרים בסין — מה שהסרטונים מבייג'ינג מוכיחים, והשניים המזויפים
24 באוגוסט 2026

עידן האדם נגמר? רובוטים מהירים יותר מיוסיין בולט, גבוהים יותר מסוטומאיור, 97% מיוצרים בסין — מה שהסרטונים מבייג'ינג מוכיחים, והשניים המזויפים

בשנת 2009 רץ יוסיין בולט 100 מטר ב-9.58 שניות, ואיש לא התקרב לזה במשך 17 שנה. בשבת, 22 באוגוסט, בבייג'ינג, רובוט עשה את המרחק ב-9.39 שניות במקצה רשמי — ולפני שנה המנצח באותה תחרות עשה 21.50 שניות. קראתי את 14 הפוסטים המשותפים ביותר של שבוע ה-World Humanoid Robot Games 2026, הורדתי את 11 הסרטונים, חילצתי פריים אחר פריים, קראתי את העיתונות הסינית, את ה-fact-checkers ואת התקנון. לתשובה יש שני חצאים. הראשון הוא כן: מה שקרה בבייג'ינג אמיתי, גדול מ-2025 בסדר גודל שלם — 2,056 רובוטים, 666 קבוצות, 16 מדינות, חמישה ימים — ומרשים יותר ממה שהכיתובים מספרים. השני הוא מה שהכיתובים מסתירים: 9.32 השניות שאילון מאסק שיתף מחדש אינן המספר שעל לוח התוצאות (בשנייה 18 של הסרטון קוראים 9.39, מקצה 9, והרובוט שניצח אינו זה של Honor); שני הקליפים המפחידים ביותר בציר הזמן מזויפים; והשאלה הנכונה לכל סרטון אינה "איזה זמן הוא עשה" — אלא "מי היה בשליטה". קודם הרובוטים, אחר כך הסרגל. עודכן ב-26 באוגוסט: הגמר סגר את המשחקים ב-8.64 שניות.

#robotica#humanoides#china#ia#fact-check#video
14 באוגוסט 2026

סימן המים של קלוד אינו חותמת נסתרת בטקסט — הוא הדרך שבה נבחרות המילים

הצירוף "סימן מים" גורם כמעט לכל אחד לדמיין את הדבר השגוי: חותמת נסתרת, תו בלתי נראה, משהו שנוסף לטקסט. זה לא כך — שום דבר לא מוכנס, ומה שמשתנה הוא מקור האקראיות כשהדגם בוחר בין שתי מילים שמשרתות אותו באותה מידה. אני מסביר את המנגנון מאפס, קודם בלי מילה טכנית אחת (הדרך הביתה ומספר סודי שסוכם עם חבר), ואחר כך עם השמות שמופיעים בתיעוד. מהמנגנון נובעות בחינם כל המגבלות: למה טקסט קצר כמעט אינו מסומן, למה קוד כמעט אינו מסומן, למה הגהה של טקסט שלכם כמעט אינה מסומנת, ולמה הסימן לעולם לא יגיד מי כתב. אני גם מפריד בין מה שהעיתונות תערבב בימים הקרובים: סימן מים בטקסט ותעודת C2PA בקובץ הם מנגנונים שונים. שבעה איורים מקוריים, עשויים בקוד. וההסתייגות שמשנה את השימוש: ה-API שיאפשר לכל אחד לבדוק טקסט עדיין אינו קיים — המאמר מתייחס לזה כהבטחה, לא כעובדה.

#ia#claude#anthropic#marca-dagua#regulacao#didatico
14 באוגוסט 2026

איך לדעת אם מודל בינה מלאכותית רץ על המחשב שלך — ולמה

השאלה של מי שרוצה להריץ מודל שפה על המחשב שלו היא תמיד אותה שאלה: זה נכנס כאן? התשובה מורכבת משני מרכיבים, ורק אחד מהם גדל בזמן שאתה משוחח. אני מסביר את שניהם מאפס, שלוש פעמים ברצף: קודם כל בלי מילה טכנית אחת, אחר כך עם השמות שמופיעים בתיעוד, ואחר כך עם הנוסחה והמספרים האמיתיים של Qwen3.8-27B, שיצא החודש הזה — 27,781,427,952 פרמטרים, 64 שכבות שמהן רק 16 שומרות cache שגדל, 15.82 GiB של משקלים ב-Q4_K_M ו-16.14 GiB של cache בהקשר מקסימלי של 262,144 tokens. בדרך, שלוש מלכודות שמספרים עגולים מסתירים: K הוא 1,024 ולא אלף, GB אינו GiB, והשם של המודל מעוגל. כל מספר במאמר זה מגיע מתוכנית שפורסמה ביחד איתו: כל קורא יכול לחזור על החישוב על המחשב שלו.

#ia#llm#hardware#quantizacao#didatico
14 באוגוסט 2026

Anthropic העלתה את הסיכון של המודלים שלה: מה אומרים 186 עמודי דוח אוגוסט

בפעם הראשונה Anthropic הורידה את הציון שהיא נותנת לעצמה — וסיווגה מחדש גם את העבר. קראתי את כל 186 העמודים של דוח הסיכונים מאוגוסט 2026: מה שחשוב הוא לא הציון אלא חמשת כשלי התהליך שהחברה מתארת, ובהם זיהום נתוני אימון שפגע כמעט בכל מודלי Claude עם knowledge cutoff שאחרי דצמבר 2024.

#anthropic#seguranca-de-ia#claude#governanca
GLM-5.3: ‏Z.ai דחתה את המשקלים בטענה ליכולת סייבר ופרסמה 2,436 פרצות כהוכחה — 2,239 מהן מעולם לא יצאו משלב הגילוי
14 באוגוסט 2026

GLM-5.3: ‏Z.ai דחתה את המשקלים בטענה ליכולת סייבר ופרסמה 2,436 פרצות כהוכחה — 2,239 מהן מעולם לא יצאו משלב הגילוי

חברת Z.ai דחתה את שחרור המשקלים הפתוחים של GLM-5.3 בטענה שהיכולת ההתקפית של המודל גדלה מהר מהצפוי, והציעה כהוכחה ledger ציבורי של 2,436 פרצות בתוכנה אמיתית. הורדתי וספרתי את ה־ledger כולו: 92% מהממצאים מעולם לא דווחו לאיש, בדיוק אחד מסומן כנשלח למתחזק, לא מוצהר שום מועד embargo, ואף רשומה אינה מייחסת את הגילוי למודל — ב־21% מהם שימש Claude Code כ־harness.

#glm#z.ai#llm#benchmarks#open-weights#seguranca
11 באוגוסט 2026

Claude Code: הסטטיסטיקה שמסתובבת קטנה פי 4,000 מזו שכל אחד יכול למדוד

עמוד הסטטיסטיקות המקיף ביותר על Claude Code מייחס את מספרי ההורדות שלו לחבילת npm שמעולם לא הייתה קיימת: 404 ב־registry, אפס צילומים ב־Wayback Machine. לחבילה האמיתית יש API ציבורי, בלי מפתח ובלי תשלום — 429 מיליון הורדות מצטברות, 44.4 מיליון רק בחודש שבו העמוד פרסם "111,000+". מדדתי כל מספר שאפשר היה למדוד, והתוצאה נסגרה על ארבעה נכונים, ארבעה שגויים ושניים בלי מקור שמאפשר הכרעה: הסקר של "15,000 מפתחים" כלל 906 משיבים; "22,000 הכוכבים" היו 71,847 ב־1 במרץ; ה"קוד הפתוח" הוא LICENSE.md בן ארבע־עשרה מילים, שלוש מהן "all rights reserved". מנגד, הטענה הכי לא־ייאמן ברשימה — 4% מכל הקומיטים הציבוריים ב־GitHub — מחזיקה כהערכה, ו־Anthropic עצמה חזרה עליה בהודעת סבב G. הפרט שמסדר את התוצאה: כל השגיאות מצביעות לאותו כיוון, כלפי מטה. המוצר שאפשר למדוד ב־API ציבורי גדול מהמוצר שמתאר אותו עמוד שנועד לקדם אותו. והנתון הראשוני שאיש לא משתמש בו נותן את הזווית הברזילאית: 26.0% מהשימוש ב־Claude.ai בברזיל מגיע מעיסוקי מחשוב ומתמטיקה — מעל הממוצע העולמי (23.8%) ומעל ארצות הברית (21.1%).

#ia#claude-code#anthropic#estatisticas#fact-check#brasil
10 באוגוסט 2026

ברזיל היא המדינה החמישית בשימוש ב־Claude — וזה אומר פחות ממה שנדמה

ברזיל היא המדינה החמישית שהכי משתמשת ב־Claude — והנתון, בניגוד כמעט לכל מה שמסתובב, מגיע ממקור ראשוני: המיקרו־נתון ש־Anthropic עצמה מפרסמת ברישיון CC-BY. הורדתי את מאגר הנתונים ומדדתי. אותה מדידה אומרת מה שהכותרת לא נושאת: בעוצמת שימוש לנפש אנחנו במקום ה־61 מתוך 121 — אנחנו בצמרת כי אנחנו גדולים, לא כי אנחנו אינטנסיביים. נפח אינו עוצמה, והגרסה הכספית של אותו בלבול (run rate אינו הכנסה) מחזיקה כמעט כל עמוד של "סטטיסטיקות Claude" ב־2026. בדקתי את השלם שבהם מקור אחר מקור: ה־run rate של 47 מיליארד דולר הוא חודש חזק במונחים שנתיים; ה־CFO, תחת שבועה, הצהיר על יותר מ־5 מיליארד דולר מאז הייסוד באותו חלון שבו ה־run rate הפומבי היה כ־19 מיליארד — זו לא שערורייה, זה מד־מהירות מול מד־מרחק. והנתון היחיד שכל אחד יכול לשחזר בחינם מקבל שורה אחת בעמוד; ההדלפה מקבלת את הכותרת.

#ia#claude#anthropic#estatisticas#fact-check#brasil
3 באוגוסט 2026

ChatGPT: ה־900 מיליון יצאו מהודעת גיוס — והסרגל נמצא במסמך אחר

שני המספרים שמחזיקים כל עמוד של "סטטיסטיקות ChatGPT" — 900 מיליון משתמשים פעילים שבועיים ו־50 מיליון מנויים — מגיעים מאותו משפט בהודעת גיוס של 110 מיליארד דולר. הלכתי לקרוא את הפוסט: ההגדרה של "משתמש פעיל שבועי" לא שם. היא קיימת, אבל גרה במסמך אחר, שפורסם ארבעה חודשים אחר כך, עם היקף צר יותר. ולמכנה יש אבהות בת־מעקב: ה־COO מדד 400 מיליון מול האוכלוסייה הכוללת, המאמר של OpenAI עם ה־NBER מדד 700 מיליון מול הבוגרת, והעמוד שנתן לי את הנושא חזר לכוללת — "10% הפכו ל־11%" נראה כמו התקדמות והוא החלפת סרגל. באותו סרגל זה היה 11.3% ו־14.5%. ובנוסף מדרגת ברזיל: פורטוגזית היא השפה השנייה שאינה אנגלית של ChatGPT, ושני כלי תקשורת תיארו את אותו תדריך של OpenAI עם מדדים שונים בשורה הראשונה.

#ia#chatgpt#openai#estatisticas#fact-check#brasil
2 באוגוסט 2026

כמה אנשים משתמשים ב־AI? הלכתי לבדוק את המספרים הענקיים — הם סופרים חשבונות, לא אנשים

‏2.42 מיליארד אנשים משתמשים ב־AI גנרטיבי, אומרת הכותרת — אבל המקור עצמו מזהיר שלא לקרוא את המספר הזה כאנשים. בדקתי כל שלב בפירמידה מול המקורות הראשוניים, הוספתי את השלב שאין באף גרסה בינלאומית (ברזיל), והתוצאה משנה את התמונה: המשלמים בעולם כולו הם כ־1% מהאנושות, ובועת ה־coding agents — ‎0.14%. אתם לא מאחור — הפיד הוא הבועה שמדברת עם עצמה.

#ia#adocao#estatisticas#fact-check#brasil
Noisy-TV בסוכני LLM: סרקתי ארבע ספרויות בחיפוש אחר המלכודת — איש לא פרמל אותה, ואני מדדתי אותה בסוכן של עצמי
2 באוגוסט 2026

Noisy-TV בסוכני LLM: סרקתי ארבע ספרויות בחיפוש אחר המלכודת — איש לא פרמל אותה, ואני מדדתי אותה בסוכן של עצמי

ב־2018 נעצר סוכן מונע־סקרנות, מהופנט, מול טלוויזיה של רעש סטטי — ה־noisy-TV problem, שלמידת החיזוק בילתה שבע שנים באילופו. סרקתי ארבע ספרויות בחיפוש אחר אותה מלכודת באינסטרומנטציה של סקרנות בסוכני LLM: איש לא פרמל אותה. והיא אינה היפותטית — בסוכן הניסיוני שאני מתחזק במכונה שלי, רעש המכשיר (σ=0.177) גדול מהאות שהוא אמור למדוד.

#agentes#llm#curiosidade#noisy-tv#embeddings#reinforcement-learning
2 באוגוסט 2026

סטטיסטיקות AI ב־2026: לוח התוצאות, מאומת מספר אחרי מספר

ה־data centers "יצרכו יותר מ־1,000 TWh ב־2026 — שווה־ערך ליפן", חוזרים ומספרים מקבצי הסטטיסטיקות של AI. הלכתי לבדוק: ה־IEA עצמה גנזה את המספר; הסדרה הנוכחית מודדת 485 TWh. בדקתי אחת־אחת את הסטטיסטיקות שהכי מסתובבות, במקור הראשוני, ובלוח התוצאות יש מאומת, חצי־אמת, מאובן וזומבי — עם דפוס אחד: המכנה שהושמט ("53% מהאוכלוסייה" היה ארה״ב, גילאי 18–64). ומדרגת ברזיל שאין באף גרסה בינלאומית: 84% מהסטודנטים כבר השתמשו ב־genAI, בעוד המדינה נמצאת מחוץ ל־top-15 של ההשקעה הפרטית.

#ia#estatisticas#fact-check#energia#brasil
V4-Flash-0731: DeepSeek פרסמה את הטבלה שבה היא עצמה מפסידה 9:0 — וזה החלק הטוב ביותר בהשקה
1 באוגוסט 2026

V4-Flash-0731: DeepSeek פרסמה את הטבלה שבה היא עצמה מפסידה 9:0 — וזה החלק הטוב ביותר בהשקה

הכותרת אומרת שהמודל הזול של DeepSeek מנצח את ספינת הדגל של הבית. ה־model card אומר יותר: Opus 4.8 מנצח בכל תשע שורות הטבלה — בפרסום של DeepSeek עצמה. למה הכרזה על התבוסה של עצמך עובדת כשאתה עולה פי 89 פחות, מה הקפיצה מ־7.3 ל־54.4 בלי ארכיטקטורה חדשה אומרת על post-training, ומה 48 השעות הראשונות מחוץ ל־harness אישרו והפריכו.

#deepseek#llm#api#benchmarks#open-weights
Opus 5: אינטליגנציית החזית ירדה לחצי המחיר — ו־Reddit הלך ללעוג לגרף
24 ביולי 2026

Opus 5: אינטליגנציית החזית ירדה לחצי המחיר — ו־Reddit הלך ללעוג לגרף

Anthropic השיקה את Claude Opus 5 עם הבטחה לאינטליגנציית חזית בחצי המחיר. מה השתנה בפועל ב־API, מה הגרפים של ההכרזה מראים כשפותחים את התמונות — כולל שהמאמץ המקסימלי מרע את התוצאה — ולמה הלעג המדורג ביותר בקהילה לא שורד בדיקה.

#claude#anthropic#llm#api#benchmarks