
הורדתי את הדאטהסט: 14,591 עריכות של 3,100 סוכנים שמציגים עצמם כשל OpenAI, מעתיקים במבחן בוויקי גרמני. ההעתקה אמיתית; האשמת הטיוח נסוגה.
#ia#agentes#openai#seguranca#fact-check#metodologia
Refiz a conta dos 2,42 bilhões de usuários de IA: cinco degraus, um só dado publicado. O último é a China, que mede por telefone quem usou uma vez em 6 meses.
#ia#estatisticas#china#brasil#metodologia
Circulou que 48% das skills de agentes de IA são inseguras. A fonte não é um estudo: é o post de um blogueiro de SEO, cujo filtro descartou 261.451 achados para chegar lá. Dois meses depois, NVIDIA e OpenClaw Foundation mediram 67.453 versões com três scanners ao mesmo tempo — e os três devolveram 6,57%, 7,75% e 48,71%.
#ia#agentes#ciberseguranca#fact-check#metodologia

בדקתי אחד-אחד את המספרים שמסתובבים על אנרגיה של בינה מלאכותית. לשישה מתוך השבעה הייתה תווית טכנית מוחלפת. השביעי, שהיה מכריע את הרשת בברזיל, לא קיים.
#ia#energia#data-center#brasil#fact-check#metodologia

ארבעת המספרים מאומתים: 57 מול 62 במדד, 0.09 דולר מול 3.14 דולר למשימה. הכותרת על 100 טריליון — לא: המשפט שייך לחברה אחרת.
#glm#z.ai#llm#benchmarks#open-weights#fact-check

בארה״ב יש סדרה חודשית של פיטורים שיוחסו ל-AI (Challenger). בברזיל 37–41% מהתעסוקה חשופים, שימוש שיא ב-ChatGPT וב-Claude — ואין אף נתון על מה שכבר קרה. הלכתי למקורות הראשוניים.
#ia#brasil#fact-check#estatisticas

הדף המקיף ביותר על סטטיסטיקות דיפ פייק שמצאתי מזהיר שהמספרים מגיעים ממי שמוכר גלאים — ובכל זאת לוקח משם בדיוק את שבעת הנתונים המרכזיים שלו. בדקתי אותם אחד אחד: Signicat, Entrust פעמיים, Sumsub פעמיים, Resemble AI ו-iProov. שבעה מתוך שבעה ספקים, אף לא גוף רשמי אחד, אף לא אקדמיה, אף לא סקר ציבורי. ארבע שורות בטבלה שגויות, והטעויות בענייני חוק הולכות כולן לאותו כיוון: הן גורמות לרגולציה להיראות מתקדמת יותר משהיא. הלכתי לחפש מה קיים באמת: המספר הרשמי היחיד לנזק הוא 893 מיליון דולר — 4.28% מההפסדים של השנה, תחת תווית שה-FBI מגדיר כ"המידע שדווח מכיל אזכור לבינה מלאכותית"; המדידה העצמאית היחידה של היכולת האנושית היא אקדמית ונותנת 55.5%, עם רווח סמך שחוצה את 50%, כלומר הטלת מטבע; והנתון הציבורי הטוב בעולם הוא ברזילאי, של Cetic.br, כי הוא בודק במקום לשאול (41% אומרים שהם בטוחים, 17% הצליחו במבחן, ואין מתאם בין השניים). ספרתי בעצמי את לוח המחוונים של Resemble AI: מתוך 2,266 האירועים, ה-1.3 מיליארד דולר המפורסמים מתארים 159.
#deepfake#estatisticas#desinformacao#metodologia#fraude#brasil

ב-27 באוגוסט 2026 מכתב פתוח ביוזמת OpenAI ובאירוחה קרא לתגובה קולקטיבית להתקפות סייבר המונעות בבינה מלאכותית, והעיתונות סיקרה את המספר: יותר ממאה חברות. הלכתי אחרי השאלה המשעממת — למה בדיוק מישהו התחייב. הפרדתי את ארבעת בלוקי הדרישות מלכידה מקובעת של העמוד וחיפשתי בתוכם את חמשת הסימנים שמבדילים התחייבות מהצהרת כוונות: סכום, מועד, פועל מחייב, אחראי נקוב ויעד בר-אימות. אלה שמונה עשר משפטי ציווי, ובעשרים תאים — אף מופע אחד. הענבר שנראה בתרשים הוא ויתור שעשיתי ביד נגד הטיעון של עצמי, ואני מסביר מדוע. כדי להוכיח שהסרגל מודד, הרצתי את אותה בדיקה על עמוד של OpenAI עצמה, מפברואר, שמדליק שלוש מתוך חמש העמודות: החברה כותבת סכום כשהיא רוצה. אני מראה גם שרשימת החותמים השתנתה ארבע פעמים בארבעים ושבע שעות — 116, 127, 128, 155 — בעוד שהטקסט של ארבעת הבלוקים לא השתנה אפילו בבית אחד, שחברה אחת הוסרה בלי הסבר, ושבעמוד יש שתי רשימות שהספירות שלהן מתנגשות באותו מספר. ואני מפריד, בזהירות, בין מה שנמדד לבין מה שהוא ניתוח שלי.
#ia#ciberseguranca#openai#politica-de-tecnologia#verificacao

כרטיס בספרדית פותר בטבלה אחת מה רץ בכל רמה של זיכרון וידאו, מ-4 GB עד 256 GB. עשיתי את החישוב מחדש: מתוך שבעה עשר פסקי הדין על החומרה, שישה עשר נכונים, וכל המודלים המצוטטים קיימים באמת — הפריט היחיד שלא קיים הוא ה-RTX 5080 Super, שנדחתה לזמן בלתי מוגבל כי מודול GDDR7 של 3 GB עולה פי שלושה ממודול של 2 GB. הטעות שחשובה היא אחרת, והיא מתודית: הכרטיס מתמחר רק את קובץ המשקלים ומתעלם מה-cache של ההקשר, שגדל תוך כדי השיחה. עם שני המרכיבים מדודים — משקלים מתוך ה-GGUF שפורסם, cache שחושב מה-config.json של כל מודל — אחד מעשרת השלבים לא סוגר אפילו בסשן עבודה של 32 אלף טוקנים, וזה דווקא הפופולרי ביותר, זה של 8 GB; שישה מתוך העשרה לא סוגרים בהקשר המרבי של המודל שהכרטיס עצמו ממליץ עליו. אני מפריד עוד ארבע מלכודות של שמות, ביניהן "Q8" שיש בו 4.3 סיביות לכל משקל ופורמט שאינו מאותו אקוסיסטם של האחרים, ושלוש הסתייגויות שתקפות לכל הטבלה, כולל למה שני כרטיסים של 32 GB אינם כרטיס אחד של 64 GB.
#ia#llm#hardware#quantizacao#vram#didatico

מיינתי את 20 המספרים המצוטטים ביותר על OpenAI: 8 רשמיים, 6 דיווח, 3 יעד ו-3 שאף אחד לא יודע מאיפה הגיעו. ל-92% יש 31 חודשים. פניתי למקור של כל מספר שמסתובב במקבצים על החברה: אלה של OpenAI עצמה מתאמתים — והם הכי פחות מעניינים; מה שעושה כותרת הוא מה שהיא מעולם לא חתמה עליו. ה-"92% מ-Fortune 500" יצא מתשובת OpenAI לתביעת ה-New York Times, בינואר 2024, ומסתובב בלי תאריך; 24 מיליארד הכנסה הם רשמי, 40 מיליארד הערכה, 280 מיליארד יעד — לחבר את השלושה עם אותו פועל שגוי גם כשכל מספר נכון. SoftBank השקיעה 64.6 מיליארד, לא "יותר מ-71", וה-500 מיליארד של Stargate הם התחייבות מחשוב, לא השקעה. ה-"משכורת של 76,001 דולר" של אלטמן היא סכום של שתי עמודות ב-Form 990, השנה שאחריה נותנת 113,674, והוא העשירי מתוך שנים עשר שמות בתגמול. בברזיל, "50 מיליון משתמשים" מופיע זהה באוגוסט 2025 ואוגוסט 2026 — ההודעות ביום עלו ב-54%.
#ia#openai#estatisticas#metodologia

274, 95 או 403,420 מודלי שפה: שלוש הספירות נכונות. וה-benchmark של קוד שמסתובב ננטש על ידי היוצר שלו עצמו בפברואר. הלכתי לבדוק את הסטטיסטיקות של LLM שמסתובבות באוספים: ל"כמה מודלים קיימים" אין תשובה כי יש עודף הגדרות — 403,420 מאגרים ב-Hugging Face (מדידה עצמית, פקודה אחת בשורה), 95 בולטים ב-AI Index של סטנפורד, 274 בקטלוג עורכי. הציון שהמעבדה נותנת לעצמה עמד באימות (הפרש של אפס עד ארבע נקודות במקום שבו אותו מודל נמדד מבחוץ); מה שלא עומד הוא הסרגל: OpenAI הכריזה ש-SWE-bench Verified מזוהם והפסיקה לפרסם אותו ב-23 בפברואר 2026, ובאוגוסט הוא עדיין המבחן של "מי מתכנת טוב יותר". השוואות בין גרסאות טועות בכיוון (ה-DeepSeek של אוגוסט נמצא 8 נקודות לפני Opus 4.8, לא אחרי); "היקר ביותר" עולה US$ 30 באוספים ו-US$ 150 בקטלוג האמיתי; המודלים הגדולים ביותר עם גודל ידוע כולם פתוחים. בברזיל, Maritaca מתמחרת בריאלים ומפרסמת את ההשוואה היחידה של עלות חבילה במטבע לאומי: R$ 206 ב-Sabiá 4 Thinking מול R$ 590 ב-Opus 4.8.
#ia#llm#estatisticas#benchmarks#metodologia

Um estudo meu sobre recusas de IA que passam despercebidas dentro de sistemas de agentes foi interrompido por uma recusa: o classificador de salvaguardas bloqueou a geração do corpus, porque um conjunto de prompts SOBRE recusas lê, para um classificador, como material ofensivo. Havia dois caminhos — reescrever o pedido até passar, o que quase sempre funciona, ou parar. Reformular um pedido porque ele foi sinalizado é evasão de salvaguarda, um andar abaixo do jailbreak e da mesma família; um pesquisador que contorna o classificador para estudar o classificador contaminou o próprio objeto. Congelei o braço do estudo com data no arquivo de estado do projeto e me candidatei ao Cyber Verification Program da Anthropic, o canal formal para trabalho de uso duplo com propósito defensivo. A aprovação saiu dentro do prazo de dois dias úteis. O que ela é: uso duplo deixa de ser bloqueado por padrão, dentro do caso de uso submetido e sob monitoramento contínuo. O que ela não é: parceria, certificação ou endosso — uso proibido continua bloqueado com programa ou sem. E fica a lição que o incidente entrega de graça, que é a tese do estudo: uma recusa só é gerenciável quando é legível. A que me bloqueou tinha texto, categoria e porta de saída; as que eu estou medindo chegam ao orquestrador como resultado vazio e são tratadas como sucesso.
#ia#agentes#ciberseguranca#anthropic#pesquisa#salvaguardas

עורך דין איבד עשר שנים של שיחות בבוקר אחד וסרטון הסיק ש-Meta קראה את מה שהוא כתב. הלכתי לבדוק את ההאשמה הזאת במסמכים הטכניים של WhatsApp מ-2016 עד 2026, בקוד הלקוח, בצילומי ארכיון של מרכז העזרה של Instagram, בהחלטת הנציבות האירופית מ-2017 ובתיקי תביעות בברזיל, בארצות הברית ובהודו. הסרטון טועה משתי סיבות, והשנייה קוברת את הטיעון: לחסום בהמוניהם וברעש היא החתימה של מסווג אוטומטי, לא של מי שקורא — מי שיש לו יכולת סודית יקרת ערך מגן על היכולת, לא על המקרה הבודד. אבל מה שנשאר במקום גרוע יותר. החברה עברה להגדיר לבדה מה נחשב שיחה מוגנת ולמנות חריגים שהיא עצמה מכירה בהם; שום תצפית הזמינה לציבור אינה מבחינה בין חברה שאינה יכולה לקרוא לבין חברה שיכולה ואינה אומרת; ושלוש הבחירות שמייצרות את חוסר האפשרות הזה — אפליקציה סגורה, בלי בנייה משוחזרת, בלי ביקורת חיצונית — הן שלה, והפיכות על ידה. ב-8 במאי 2026 כיבתה Meta את ההצפנה מקצה לקצה בהודעות Instagram: הערובה שמכרו לנו כמתמטיקה תמיד הייתה הבטחה תאגידית, והבטחות תאגידיות מבוטלות.
#criptografia#whatsapp#instagram#meta#privacidade#verificacao

"95% מהפיילוטים של AI נכשלים" יצא מ-52 ראיונות ולא מדד סוכנים. הלכתי למקורות הראשוניים: כל סטטיסטיקה על סוכנים היא תחזית, הצהרה או מדידה — וכל אחת נכשלת בדרך משלה. Gartner מפרסמת תחזית וסקר וובינר באותו עמוד; ה-AI Index אומר 70% בתקציר ו-79% בגרף; METR מדדה מפתחים 19% איטיים יותר בזמן שהם חשבו שהם 20% מהירים יותר, וב-2026 לא הצליחה לחזור על כך כי אף אחד לא מוכן לעבוד בלי AI; מדד העקביות נעלם מהלוחות; שיא הוסר בעקבות דליפת פתרונות. מדדתי את הצנרת (SDK של MCP: פי 1,087 תוך 18 חודשים) ואת ברזיל (17% מהחברות משתמשות ב-AI; 68% מזה הוא אוטומציית תהליכים). אף מספר לא שקרי — כולם משנים משקל כשהתווית מגיעה איתם.
#ia#agentes#estatisticas#benchmarks#metodologia

Nathan Barry סיכם את תורת האילוצים במשפט אחד — מאמץ שמושקע מחוץ לצוואר הבקבוק מחמיר את צוואר הבקבוק — בהסתמך על סדרת הפוסטים של Tiago Forte שמסתובבת כ"ההסבר" לנושא. הלכתי לבדוק את הסדרה, את הספר ואת המשפט, וכתבתי סימולטור תורים כדי למדוד במקום להתווכח באנלוגיה. בסדרה יש 11 פוסטים, לא 3, ואלה שאומרים מה לעשות אחרי שמוצאים את צוואר הבקבוק נמצאים מאחורי paywall; חמשת הצעדים של Goldratt אינם ב-The Goal אלא בספר משנת 1990 שכמעט אף אחד לא פותח; והמשפט־המוסר קולע בסימן ומחטיא בדרגה: הכפלת הקיבולת של מי שאינו האילוץ לא הוציאה ולו פריט אחד נוסף (-0.3%, רעש) והאיצה את גידול ההמתנה ב-33% — היא מחמירה את ההמתנה, לא את התפוקה. העלאת האילוץ ב-25% הניבה 24.9%. החבל של Goldratt עולה 5% מהתפוקה וקונה זמן מעבר קצר ב-8,900 פעמים. אני עולה בסולם בארבעה שלבים — המאפייה, השמות, חוק Little וחמשת הצעדים כפי שהם במקור, הגשר אל סוכני AI, והמקום שאליו נודד צוואר הבקבוק — ומסיים בבדיקת Ford, Spanx ו-Kit. עשרה איורים משלי, עשויים בקוד; אותה מאפייה חוזרת עם הנתונים של כל ניסוי.
#teoria-das-restricoes#goldratt#gestao#filas#lei-de-little#agentes-de-ia#didatico
שתי תמונות ויראליות משוות בין Mac Studio M5 Ultra 256 GB, RTX 5090, RTX PRO 6000 ו-DGX Spark ב"ערך לדולר" להרצת AI בבית. הלכתי לבדוק: המדד מכפיל מלאי בספיקה, המחיר של ה-Spark מת בפברואר וה-PRO 6000 נכנס בלי מחשב מארח. אחר כך חישבתי מחדש את החשבון שחשוב — טוקנים לדולר מול ה-API של אותו מודל — והגרסה הראשונה שלו הניחה שאדם משתמש במכונה 1% מהזמן. מדדתי 43,593 קריאות אמיתיות של סוכן קוד במכונה הזאת: ה-1% לא מתאר אף אחד (צ'אט נמצא ליד 0.03%; סוכן, בין 10% ל-30%), 96% מהקלט הוא קריאה חוזרת של הקשר, ושינוי כלל החיוב של הקריאה החוזרת מזיז את החשבון פי 16, בעוד שהחלפת מכונה מזיזה אותו פי 3.6. במשטר היחיד שבו המכונה הזולה ביותר מנצחת (1.5x), יום השיא שלה לא נכנס ביום, והקריאה הממוצעת, של 151.9 אלף טוקנים, לא נכנסת בהקשר של המודל. קנו בשביל ריבונות, לא בשביל חיסכון.
#ia#llm#hardware#custo#inferencia-local

מבחן השוואתי לאבטחת קוד מדד את Claude Fable 5 ב-59.8% הצלחה תפקודית וב-19.0% הצלחה אבטחתית, והמספר הפך לכותרת על מודל שאכזב. שישה ימים לאחר מכן, אותה מעבדה, אותו מחבר ואותו מבחן פרסמו את אותה Fable 5 ב-72.6% וב-29.0% — התוצאה האבטחתית הטובה ביותר בטבלה באותו רגע. הם לא החליפו את המודל; הם החליפו את הכלי שהפעיל אותו. חיפשתי את שני הטקסטים ומצאתי שלישי, של אותו מחבר ומאותו יום, שאיש אינו מצטט: ביקורת האנטי-רמייה של המבחן עצמו, שהורידה 9 נקודות אחוז של אבטחה משילוב אחד בלי ששום דבר במודל השתנה. אני מראה את המסקנה הצרה שהנתונים תומכים בה — הציון שייך לצמד הכלי והמודל, ולגרסת הסרגל ביום שבו הורץ —, את הגבול שלה (בשמונת הצמדים בטבלה החציון של ההפרש הוא 1.65 נקודות, והמקרה של Fable 5 גדול פי שישה מכך), את הצד שכנגד מ-Hacker News, שמאשים את המבחן בכך שהוא עקום נגד המודל, ואת הממצא המכני: ספרתי את הקישורים בין ארבעת העמודים והגרף חד-כיווני — מי שמגיע מהטקסט שהופץ אין לו דרך להגיע לתיקון. שישה איורים מקוריים, עשויים בקוד, וכל החישובים בסקריפט על 27 שורות הטבלה.
#ia#benchmark#seguranca#agentes#claude#metodologia

בשנת 2009 רץ יוסיין בולט 100 מטר ב-9.58 שניות, ואיש לא התקרב לזה במשך 17 שנה. בשבת, 22 באוגוסט, בבייג'ינג, רובוט עשה את המרחק ב-9.39 שניות במקצה רשמי — ולפני שנה המנצח באותה תחרות עשה 21.50 שניות. קראתי את 14 הפוסטים המשותפים ביותר של שבוע ה-World Humanoid Robot Games 2026, הורדתי את 11 הסרטונים, חילצתי פריים אחר פריים, קראתי את העיתונות הסינית, את ה-fact-checkers ואת התקנון. לתשובה יש שני חצאים. הראשון הוא כן: מה שקרה בבייג'ינג אמיתי, גדול מ-2025 בסדר גודל שלם — 2,056 רובוטים, 666 קבוצות, 16 מדינות, חמישה ימים — ומרשים יותר ממה שהכיתובים מספרים. השני הוא מה שהכיתובים מסתירים: 9.32 השניות שאילון מאסק שיתף מחדש אינן המספר שעל לוח התוצאות (בשנייה 18 של הסרטון קוראים 9.39, מקצה 9, והרובוט שניצח אינו זה של Honor); שני הקליפים המפחידים ביותר בציר הזמן מזויפים; והשאלה הנכונה לכל סרטון אינה "איזה זמן הוא עשה" — אלא "מי היה בשליטה". קודם הרובוטים, אחר כך הסרגל. עודכן ב-26 באוגוסט: הגמר סגר את המשחקים ב-8.64 שניות.
#robotica#humanoides#china#ia#fact-check#video
הצירוף "סימן מים" גורם כמעט לכל אחד לדמיין את הדבר השגוי: חותמת נסתרת, תו בלתי נראה, משהו שנוסף לטקסט. זה לא כך — שום דבר לא מוכנס, ומה שמשתנה הוא מקור האקראיות כשהדגם בוחר בין שתי מילים שמשרתות אותו באותה מידה. אני מסביר את המנגנון מאפס, קודם בלי מילה טכנית אחת (הדרך הביתה ומספר סודי שסוכם עם חבר), ואחר כך עם השמות שמופיעים בתיעוד. מהמנגנון נובעות בחינם כל המגבלות: למה טקסט קצר כמעט אינו מסומן, למה קוד כמעט אינו מסומן, למה הגהה של טקסט שלכם כמעט אינה מסומנת, ולמה הסימן לעולם לא יגיד מי כתב. אני גם מפריד בין מה שהעיתונות תערבב בימים הקרובים: סימן מים בטקסט ותעודת C2PA בקובץ הם מנגנונים שונים. שבעה איורים מקוריים, עשויים בקוד. וההסתייגות שמשנה את השימוש: ה-API שיאפשר לכל אחד לבדוק טקסט עדיין אינו קיים — המאמר מתייחס לזה כהבטחה, לא כעובדה.
#ia#claude#anthropic#marca-dagua#regulacao#didatico
השאלה של מי שרוצה להריץ מודל שפה על המחשב שלו היא תמיד אותה שאלה: זה נכנס כאן? התשובה מורכבת משני מרכיבים, ורק אחד מהם גדל בזמן שאתה משוחח. אני מסביר את שניהם מאפס, שלוש פעמים ברצף: קודם כל בלי מילה טכנית אחת, אחר כך עם השמות שמופיעים בתיעוד, ואחר כך עם הנוסחה והמספרים האמיתיים של Qwen3.8-27B, שיצא החודש הזה — 27,781,427,952 פרמטרים, 64 שכבות שמהן רק 16 שומרות cache שגדל, 15.82 GiB של משקלים ב-Q4_K_M ו-16.14 GiB של cache בהקשר מקסימלי של 262,144 tokens. בדרך, שלוש מלכודות שמספרים עגולים מסתירים: K הוא 1,024 ולא אלף, GB אינו GiB, והשם של המודל מעוגל. כל מספר במאמר זה מגיע מתוכנית שפורסמה ביחד איתו: כל קורא יכול לחזור על החישוב על המחשב שלו.
#ia#llm#hardware#quantizacao#didatico
בפעם הראשונה Anthropic הורידה את הציון שהיא נותנת לעצמה — וסיווגה מחדש גם את העבר. קראתי את כל 186 העמודים של דוח הסיכונים מאוגוסט 2026: מה שחשוב הוא לא הציון אלא חמשת כשלי התהליך שהחברה מתארת, ובהם זיהום נתוני אימון שפגע כמעט בכל מודלי Claude עם knowledge cutoff שאחרי דצמבר 2024.
#anthropic#seguranca-de-ia#claude#governanca

חברת Z.ai דחתה את שחרור המשקלים הפתוחים של GLM-5.3 בטענה שהיכולת ההתקפית של המודל גדלה מהר מהצפוי, והציעה כהוכחה ledger ציבורי של 2,436 פרצות בתוכנה אמיתית. הורדתי וספרתי את ה־ledger כולו: 92% מהממצאים מעולם לא דווחו לאיש, בדיוק אחד מסומן כנשלח למתחזק, לא מוצהר שום מועד embargo, ואף רשומה אינה מייחסת את הגילוי למודל — ב־21% מהם שימש Claude Code כ־harness.
#glm#z.ai#llm#benchmarks#open-weights#seguranca
עמוד הסטטיסטיקות המקיף ביותר על Claude Code מייחס את מספרי ההורדות שלו לחבילת npm שמעולם לא הייתה קיימת: 404 ב־registry, אפס צילומים ב־Wayback Machine. לחבילה האמיתית יש API ציבורי, בלי מפתח ובלי תשלום — 429 מיליון הורדות מצטברות, 44.4 מיליון רק בחודש שבו העמוד פרסם "111,000+". מדדתי כל מספר שאפשר היה למדוד, והתוצאה נסגרה על ארבעה נכונים, ארבעה שגויים ושניים בלי מקור שמאפשר הכרעה: הסקר של "15,000 מפתחים" כלל 906 משיבים; "22,000 הכוכבים" היו 71,847 ב־1 במרץ; ה"קוד הפתוח" הוא LICENSE.md בן ארבע־עשרה מילים, שלוש מהן "all rights reserved". מנגד, הטענה הכי לא־ייאמן ברשימה — 4% מכל הקומיטים הציבוריים ב־GitHub — מחזיקה כהערכה, ו־Anthropic עצמה חזרה עליה בהודעת סבב G. הפרט שמסדר את התוצאה: כל השגיאות מצביעות לאותו כיוון, כלפי מטה. המוצר שאפשר למדוד ב־API ציבורי גדול מהמוצר שמתאר אותו עמוד שנועד לקדם אותו. והנתון הראשוני שאיש לא משתמש בו נותן את הזווית הברזילאית: 26.0% מהשימוש ב־Claude.ai בברזיל מגיע מעיסוקי מחשוב ומתמטיקה — מעל הממוצע העולמי (23.8%) ומעל ארצות הברית (21.1%).
#ia#claude-code#anthropic#estatisticas#fact-check#brasil
ברזיל היא המדינה החמישית שהכי משתמשת ב־Claude — והנתון, בניגוד כמעט לכל מה שמסתובב, מגיע ממקור ראשוני: המיקרו־נתון ש־Anthropic עצמה מפרסמת ברישיון CC-BY. הורדתי את מאגר הנתונים ומדדתי. אותה מדידה אומרת מה שהכותרת לא נושאת: בעוצמת שימוש לנפש אנחנו במקום ה־61 מתוך 121 — אנחנו בצמרת כי אנחנו גדולים, לא כי אנחנו אינטנסיביים. נפח אינו עוצמה, והגרסה הכספית של אותו בלבול (run rate אינו הכנסה) מחזיקה כמעט כל עמוד של "סטטיסטיקות Claude" ב־2026. בדקתי את השלם שבהם מקור אחר מקור: ה־run rate של 47 מיליארד דולר הוא חודש חזק במונחים שנתיים; ה־CFO, תחת שבועה, הצהיר על יותר מ־5 מיליארד דולר מאז הייסוד באותו חלון שבו ה־run rate הפומבי היה כ־19 מיליארד — זו לא שערורייה, זה מד־מהירות מול מד־מרחק. והנתון היחיד שכל אחד יכול לשחזר בחינם מקבל שורה אחת בעמוד; ההדלפה מקבלת את הכותרת.
#ia#claude#anthropic#estatisticas#fact-check#brasil
שני המספרים שמחזיקים כל עמוד של "סטטיסטיקות ChatGPT" — 900 מיליון משתמשים פעילים שבועיים ו־50 מיליון מנויים — מגיעים מאותו משפט בהודעת גיוס של 110 מיליארד דולר. הלכתי לקרוא את הפוסט: ההגדרה של "משתמש פעיל שבועי" לא שם. היא קיימת, אבל גרה במסמך אחר, שפורסם ארבעה חודשים אחר כך, עם היקף צר יותר. ולמכנה יש אבהות בת־מעקב: ה־COO מדד 400 מיליון מול האוכלוסייה הכוללת, המאמר של OpenAI עם ה־NBER מדד 700 מיליון מול הבוגרת, והעמוד שנתן לי את הנושא חזר לכוללת — "10% הפכו ל־11%" נראה כמו התקדמות והוא החלפת סרגל. באותו סרגל זה היה 11.3% ו־14.5%. ובנוסף מדרגת ברזיל: פורטוגזית היא השפה השנייה שאינה אנגלית של ChatGPT, ושני כלי תקשורת תיארו את אותו תדריך של OpenAI עם מדדים שונים בשורה הראשונה.
#ia#chatgpt#openai#estatisticas#fact-check#brasil
2.42 מיליארד אנשים משתמשים ב־AI גנרטיבי, אומרת הכותרת — אבל המקור עצמו מזהיר שלא לקרוא את המספר הזה כאנשים. בדקתי כל שלב בפירמידה מול המקורות הראשוניים, הוספתי את השלב שאין באף גרסה בינלאומית (ברזיל), והתוצאה משנה את התמונה: המשלמים בעולם כולו הם כ־1% מהאנושות, ובועת ה־coding agents — 0.14%. אתם לא מאחור — הפיד הוא הבועה שמדברת עם עצמה.
#ia#adocao#estatisticas#fact-check#brasil

ב־2018 נעצר סוכן מונע־סקרנות, מהופנט, מול טלוויזיה של רעש סטטי — ה־noisy-TV problem, שלמידת החיזוק בילתה שבע שנים באילופו. סרקתי ארבע ספרויות בחיפוש אחר אותה מלכודת באינסטרומנטציה של סקרנות בסוכני LLM: איש לא פרמל אותה. והיא אינה היפותטית — בסוכן הניסיוני שאני מתחזק במכונה שלי, רעש המכשיר (σ=0.177) גדול מהאות שהוא אמור למדוד.
#agentes#llm#curiosidade#noisy-tv#embeddings#reinforcement-learning
ה־data centers "יצרכו יותר מ־1,000 TWh ב־2026 — שווה־ערך ליפן", חוזרים ומספרים מקבצי הסטטיסטיקות של AI. הלכתי לבדוק: ה־IEA עצמה גנזה את המספר; הסדרה הנוכחית מודדת 485 TWh. בדקתי אחת־אחת את הסטטיסטיקות שהכי מסתובבות, במקור הראשוני, ובלוח התוצאות יש מאומת, חצי־אמת, מאובן וזומבי — עם דפוס אחד: המכנה שהושמט ("53% מהאוכלוסייה" היה ארה״ב, גילאי 18–64). ומדרגת ברזיל שאין באף גרסה בינלאומית: 84% מהסטודנטים כבר השתמשו ב־genAI, בעוד המדינה נמצאת מחוץ ל־top-15 של ההשקעה הפרטית.
#ia#estatisticas#fact-check#energia#brasil

הכותרת אומרת שהמודל הזול של DeepSeek מנצח את ספינת הדגל של הבית. ה־model card אומר יותר: Opus 4.8 מנצח בכל תשע שורות הטבלה — בפרסום של DeepSeek עצמה. למה הכרזה על התבוסה של עצמך עובדת כשאתה עולה פי 89 פחות, מה הקפיצה מ־7.3 ל־54.4 בלי ארכיטקטורה חדשה אומרת על post-training, ומה 48 השעות הראשונות מחוץ ל־harness אישרו והפריכו.
#deepseek#llm#api#benchmarks#open-weights

Anthropic השיקה את Claude Opus 5 עם הבטחה לאינטליגנציית חזית בחצי המחיר. מה השתנה בפועל ב־API, מה הגרפים של ההכרזה מראים כשפותחים את התמונות — כולל שהמאמץ המקסימלי מרע את התוצאה — ולמה הלעג המדורג ביותר בקהילה לא שורד בדיקה.
#claude#anthropic#llm#api#benchmarks