המספר המצוטט ביותר בעולם על סוכני AI — "95% מהפיילוטים של AI נכשלים" — יצא מ- 52 ראיונות, והדוח שפרסם אותו לא מדד אף סוכן. קראתי את 26 העמודים. סוכנים מופיעים שם כ פתרון המומלץ, לא כאובייקט שנמדד; ה-95% נוגע לכלי תאגידי בהתאמה אישית, ובאותו מסמך הצ'אטבוט הגנרי ממיר 83% מהפיילוטים להטמעה. Fortune, שהפיצה את המספר, פרסמה את המתודולוגיה השגויה.
הלכתי אחרי המקורות הראשוניים של כל הסטטיסטיקות על סוכנים שמסתובבות: התחזית של Gartner, ה-"95%" של MIT, הניסוי האקראי של METR, ה-AI Index של סטנפורד, לוחות התוצאות של benchmark (מבחן סטנדרטי שנותן ציון למודל). הכלל שיצא מהבדיקה פשוט: כל סטטיסטיקה על סוכנים היא אחד משלושה דברים — תחזית, הצהרה או מדידה — והסיקור מחבר את השלושה באותו משפט. הבעיה כמעט אף פעם היא לא המספר. זו התווית שאף אחד לא מדביק עליו.
הערה מתודולוגית. כל מספר במאמר הזה נבדק מול המסמך המקורי — PDF, פוסט, paper, גיליון או API ציבורי — בין 13 ל-26 באוגוסט 2026. שלוש מדידות הן שלי וניתנות לשחזור: סדרת ההורדות של ה-SDK של MCP (API ציבורי של npm), שחזור הרגרסיה של METR על ה-CSV שהיא עצמה מפרסמת, והזוגות של עלות לכל משימה שנקראו ישירות מה-HTML של לוח התוצאות של פרינסטון. במקום שבו מקור קיים רק כפרסום חוזר (Gartner מסרבת לגישה ישירה), הטקסט אומר את זה. מה שלא אומת מסומן ככזה. במאמר הזה אין שיח מ-Reddit ולא מ-X: שני המקורות סגורים למכונה הזאת, ולא אעמיד פנים שקראתי מה שלא קראתי — הקהילה כאן היא Hacker News, שבה לכל תגובה יש id שאפשר לבדוק.
לוח הציונים של הבדיקה
פסק הדין לפני הטיעון, כי זה מה שמסתובב לבד:
| מה שמסתובב | פסק הדין |
|---|---|
| "95% מהפיילוטים של AI נכשלים" (MIT NANDA) | ⚠️ קיים — כתפיסה שדווחה ב-52 ראיונות, על כלי מותאם אישית. לא מדד סוכנים; הצ'אטבוט הגנרי ממיר 83% באותו דוח |
| "יותר מ-40% מפרויקטי ה-AI האגנטי יבוטלו עד 2027" (Gartner) | ⚠️ תחזית בלי מתודולוגיה, שפורסמה לצד סקר עם n = 3,412 — משתתפי וובינר של Gartner עצמה |
| "רק כ-130 ספקי סוכנים הם אמיתיים" (Gartner) | ⚠️ "Gartner estimates": בלי ספירה או קריטריון שפורסמו |
| "מפתחים נעשו איטיים ב-19% עם AI" (METR) | ✅ מתאשר — n = 16, 246 משימות, תחילת 2025. והקבוצה עצמה לא הצליחה לחזור על כך ב-2026 |
| "70% מהארגונים משתמשים ב-AI גנרטיבי" (AI Index 2026, תקציר הפרק) | ❌ הגרף של אותו הפרק אומר 79% |
| "לפי ה-AI Index של סטנפורד, X% מהחברות..." | ⚠️ הנתון הוא מסקר McKinsey; ה-AI Index רק צייר את הגרף ולא מצהיר על ה-N |
| "ל-57% יש סוכנים בפרודקשן" (LangChain) | ✅ מתאשר — בין 1,340 מהנדסי סוכנים, ב-survey (סקר דעות) של מי שמוכר כלי סוכנים |
| "87.9% הצלחה ב-τ²-bench" | ✅ מתאשר כ-pass^1 (הצלחה בניסיון אחד בלבד); מדד העקביות לא מפורסם לאף מודל מ-2026 |
| "46.3% השלמה ב-TheAgentCompany עם GPT-5.4" | ❌ הוסר ב-01/08/2026 בעקבות דליפת פתרונות, בידי המגישים עצמם |
| "30% השלמה ב-TheAgentCompany" | ✅ מתאשר (paper, NeurIPS 2025) — והמוביל הנוכחי מגיע ל-42.9% בעשירית מהעלות |
אחד אושרר נקי, שניים הוסרו או סותרים את עצמם, השאר קיים אבל עם תווית שגויה. שימו לב לדפוס: המספרים כמעט אף פעם לא שקריים. מה שחסר הוא לומר מאיזה טבע כל אחד הוא — וזה משנה את מה שהוא מוכיח.
הכלל: שלוש שאלות בעשר שניות
לפני שמאמינים לכל סטטיסטיקה על סוכנים, שלוש שאלות מפרידות בין מה שהיא יכולה להוכיח לבין מה שהיא רק מרמזת עליו. האיור מסכם את הכלל כולו; שאר המאמר הוא ההדגמה, מקרה אחר מקרה.
שימו לב שהכלל לא אומר ש"מדידה טובה, השאר רע". הוא אומר שכל טבע נכשל בדרך אופיינית משלו: לתחזית אין מדגם, אז אין מה לבדוק; ה הצהרה סוטה מהמדידה אצל אותו נבדק; והמדידה מודדת proxy (תחליף מדיד לדבר שרוצים למדוד) שהסוכן עצמו לומד לעקוף. זה לא רעיון שלי — זו רשימת הנקודות העיוורות שהקבוצה שהכי הרבה מודדת סוכנים בעולם מפרסמת על השיטות שלה עצמה, ואגיע אליה בסוף. קודם, המקרים.
תחזית: Gartner מפרסמת את שני הסוגים באותו עמוד
ההודעה של Gartner מ-25 ביוני 2025 היא ההוכחה הנקייה ביותר לתזה, כי היא מכילה, באותו עמוד, מספר מכל טבע. הראשון:
"Over 40% of agentic AI projects will be canceled by the end of 2027, due to escalating costs, unclear business value or inadequate risk controls."בעברית: "יותר מ-40% מפרויקטי ה-AI האגנטי יבוטלו עד סוף 2027, בגלל עלויות גואות, ערך עסקי לא ברור או בקרות סיכון לא מספקות."
זו strategic planning assumption ("הנחת תכנון אסטרטגי") — כך Gartner מתייגת את התחזיות של עצמה. אין מדגם, אין שיטה, אין טעות דגימה. זו דעה מוסמכת עם אופק. שלוש פסקאות למטה, באותה הודעה, מגיע המספר השני: 19% מהמשיבים השקיעו בכבדות בסוכנים, 42% באופן שמרני, 8% כלום, 31% ממתינים. לזה יש N: 3,412 אנשים — שהם משתתפי וובינר של Gartner עצמה, בינואר 2025. זה סקר קהל, לא מדגם שוק.
העיתונות ציטטה את שניהם עם אותו פועל ("Gartner אומרת ש..."). תחזית וסקר וובינר הפכו, בסיקור, לשתי סטטיסטיקות זהות. ואותה הודעה טובעת את הביטוי שמגדיר את הקטגוריה — agent washing ("הלבנת סוכן"), שינוי השם של RPA (אוטומציית תהליכים בתוכנה) וצ'אטבוט ל-"סוכן" — עם מספר מעליו: "Gartner estimates only about 130 of the thousands of agentic AI vendors are real" ("Gartner מעריכה שרק כ-130 מתוך אלפי ספקי ה-AI האגנטי אמיתיים"). Estimates — מעריכה. בלי ספירה שפורסמה, בלי קריטריון שפורסם ל-"אמיתי". המספר מסתובב בעולם כאילו היה מפקד.
רצף התחזיות של Gartner על סוכנים, כולן מתויגות בידי עצמה כ הנחות תכנון וכולן בלי מתודולוגיה מוצהרת:
| תאריך | תחזית (מילולית) | בעברית | אופק |
|---|---|---|---|
| אוק׳ 2024 | "By 2028, 33% of enterprise software applications will include agentic AI, up from less than 1% in 2024" | עד 2028, 33% מהאפליקציות הארגוניות יכללו AI אגנטי, לעומת פחות מ-1% ב-2024 | 2028 |
| אוק׳ 2024 | "By 2028, at least 15% of day-to-day work decisions will be made autonomously through agentic AI" | עד 2028, לפחות 15% מהחלטות היומיום יתקבלו באופן אוטונומי בידי AI אגנטי | 2028 |
| מרץ 2025 | "By 2029, agentic AI will autonomously resolve 80% of common customer service issues without human intervention" | עד 2029, ה-AI האגנטי יפתור לבד 80% מפניות השירות הנפוצות | 2029 |
| יוני 2025 | "Over 40% of agentic AI projects will be canceled by the end of 2027" | יותר מ-40% מפרויקטי ה-AI האגנטי יבוטלו עד סוף 2027 | 2027 |
| אוג׳ 2025 | "40 percent of enterprise applications will be integrated with task-specific AI agents by 2026, up from less than 5 percent today" | 40% מהאפליקציות הארגוניות ישולבו עם סוכני משימה ספציפית עד 2026, לעומת פחות מ-5% היום | 2026 |
| יולי 2026 | "up to $234 billion of enterprise application spending exposed to agentic arbitrage between now and 2030" | עד US$ 234 מיליארד מהוצאת התוכנה הארגונית חשופים ל"ארביטראז' אגנטי" עד 2030 | 2030 |
הממצא השלילי שווה יותר מהטבלה: Gartner מעולם לא הצהירה שהיא מעדכנת אף תחזית על סוכנים. אין "אנחנו מעדכנים את ההערכה הקודמת" באף הודעה שאיתרתי. מה שקיים הוא רצף של מדדים שונים, בלי הפניה צולבת — ה-"40% מהאפליקציות עד 2026" הוא לא עדכון של ה-"33% עד 2028"; אלה חתכים נפרדים. מבחוץ, אי אפשר לדעת אם תחזית כלשהי טעתה, כי אף אחת לא מונחת ליד הבאה אחריה. תחזית בלי מדגם ובלי עדכון היא הטבע היחיד של סטטיסטיקה שאי אפשר לבדוק. זה לא פגם של Gartner; זה טבעו של הדבר. ה פגם הוא לצטט אותה כאילו הייתה מדידה.
הסתייגות מקור:
gartner.comמסרבת לגישה ישירה מהמכונה הזאת. הציטוטים למעלה מגיעים מפרסומים חוזרים שמדביקים את ההודעה במלואה, מוצלבים שניים-שניים, ומ-PDF ראשוני של הדוח מאוקטובר 2024 (ID G00818765). שלב ה-AI האגנטי ב-Hype Cycle (ה"מחזור ההייפ" של Gartner, שממקם כל טכנולוגיה בין שיא הציפיות לבשלות) של 2026 נשאר מחוץ למאמר הזה: אין הודעה רשמית, רק בלוג של ספק — וטקסט שדורש מתודולוגיה גלויה לא מצטט שלב Hype Cycle שנלקח מבלוג של ספק.
הצהרה: ה-"95%" שלא מדד סוכנים
"The GenAI Divide: State of AI in Business 2025" הוא מסמך בן 26 עמודים של Project NANDA, מ-MIT Media Lab, שמתייג את עצמו בעמוד 2 כ-"Preliminary Findings" ("ממצאים ראשוניים"). המשפט שהפך לכותרת נמצא בתקציר המנהלים:
"Despite $30–40 billion in enterprise investment into GenAI, this report uncovers a surprising result in that 95% of organizations are getting zero return."בעברית: "למרות 30 עד 40 מיליארד דולר שהושקעו בידי חברות ב-GenAI, הדוח הזה חושף תוצאה מפתיעה: ל-95% מהארגונים יש תשואה אפסית."
ארבעה דברים שהכותרת מחקה, כולם מתוך ה-PDF עצמו:
- ה-95% נוגע לאחת משתי מחלקות של כלים, וזו לא מחלקת הצ'אטבוטים. הדוח מפריד LLM כלליים (ChatGPT, Copilot) מ-GenAI מוטמע או ספציפי למשימה. הכלליים: 80% חקרו, 50% הריצו פיילוט, 40% הטמיעו. המותאמים אישית: 60%, 20%, 5%. ה-"95% נכשלים" הוא המשלים של אותם 5%. ובעמוד 7, מילולית: "Generic LLM chatbots appear to show high pilot-to-implementation rates (~83%)" ("נראה שצ'אטבוטים כלליים של LLM מציגים שיעור המרה גבוה מפיילוט להטמעה, כ-83%"). אותו דוח שהפיק את "95% נכשלים" אומר שהצ'אטבוט הכללי ממיר 83%.
- "הצלחה" היא תפיסה. עמוד 7: הצלחה היא מה ש-"users or executives have remarked as causing a marked and sustained productivity and/or P&L impact" ("מה שמשתמשים או מנהלים ציינו כגורם להשפעה בולטת ומתמשכת על פרודוקטיביות ו/או על התוצאה הכספית"). Remarked — ציינו. אף אחד לא פתח דוח רווח והפסד — מישהו אמר, בראיון, שהרגיש השפעה.
- המדגם: 52 ארגונים שרואיינו ו-153 "senior leaders" שנאספו בארבעה כנסים — מדגם נוחות, מעצם התכנון. בלי אזכור של peer review באף אחד מ-26 העמודים; בלי מימון מוצהר. הנספח עצמו מודה: "These figures are directionally accurate based on individual interviews rather than official company reporting" ("המספרים האלה מדויקים מבחינת כיוון, על בסיס ראיונות בודדים ולא על דיווח רשמי של חברות"). Directionally accurate — מצביעים על כיוון, לא על היקף. העיתונות פרסמה את ההיקף.
- סוכנים לא נמדדו. הם הומלצו. עמוד 14: "Agentic AI [...] directly addresses the learning gap that defines the GenAI Divide" ("ה-AI האגנטי תוקף ישירות את פער הלמידה שמגדיר את ה-GenAI Divide"). בלי N, בלי שיעור — נרטיב. ונספח התודות אומר מי חותם: "NANDA [...] builds on Anthropic's Model Context Protocol (MCP) and the Google/Linux Foundation A2A to create infrastructure for distributed agent intelligence at scale" ("NANDA נשען על ה-MCP של Anthropic ועל ה-A2A של Google/Linux Foundation כדי ליצור תשתית לבינה מבוזרת של סוכנים בקנה מידה"). הפרויקט שמאבחן את המחלה בונה את התרופה. זה לא פוסל את הדוח; זה גילוי נאות שאף כתבה לא עשתה.
Fortune, שנתנה את הכותרת הראשונה ב-18 באוגוסט 2025, תיארה את הבסיס כ-"150 interviews with leaders, a survey of 350 employees" ("150 ראיונות עם מנהלים, סקר בקרב 350 עובדים"). ה-PDF אומר 52 ו-153. Rob Wiblin, מ-80,000 Hours, עשה את החשבון שאף אחד לא עשה: "that 5% number is probably based on something like two or three actual companies out of 52" ("המספר הזה של 5% ככל הנראה מבוסס על משהו כמו שתיים או שלוש חברות ממשיות, מתוך 52"). והוא תיעד שכאשר הכתבה עשתה ויראל, "the report describing the methods and results wasn't publicly available anywhere" ("הדוח שמתאר את השיטות ואת התוצאות לא היה זמין לציבור בשום מקום") — הקישור הוביל לטופס Google שביקש נתונים אישיים. עד היום הערוץ הרשמי של NANDA לא מפרסם את ה-PDF; העותק המלא נמצא ב-Wayback Machine, שנלכד יומיים אחרי הכותרת.
הסטטיסטיקה המצוטטת ביותר על סוכני AI היא הצהרת תפיסה, על משהו אחר, עם 52 ראיונות מאחוריה. אני לא אומר שהדוח טועה — אני אומר מה הוא. הוא עצמו אומר את זה.
ה-AI Index סותר את עצמו בתוך אותו הפרק
אם NANDA הוא המקור הכי ויראלי, ה-AI Index של סטנפורד הוא המכובד ביותר — הוא היה עמוד
השדרה של לוח הציונים של הסטטיסטיקות על AI שלי, ושם הוא עמד
בבדיקה. פרק 4 של הדוח מ-2026 נפתח ב-"Chapter Highlights", והפריט 5 אומר ש-AI גנרטיבי
נמצא בשימוש בלפחות פונקציה עסקית אחת ב-70% מהארגונים. עשרים עמודים אחר כך, סעיף 4.3
ואיור 4.3.1 אומרים 79% — והתווית של הגרף מילולית: 79%, GenAI. תשע נקודות הבדל בין
התקציר שהעיתונות קוראת לבין הגרף שהעיתונות לא פותחת.
מישהו יגיד שאלה שאלות שונות: התקציר מדבר על "used", הגוף על "regularly use". זה לא
מסתדר — שימוש קבוע הוא תת-קבוצה של שימוש כלשהו, אז המספר בתקציר היה צריך להיות גדול
יותר, לעולם לא קטן יותר. לא אותרה שום errata. אני לא טוען לגבי הסיבה; אני טוען לגבי
הסתירה, שכל אחד יכול לבדוק בשתי פקודות pdftotext.
ויש תווית שנייה שהוחלפה, חשובה יותר. כל האיורים על אימוץ בפרק — מ-4.3.1 עד 4.3.8 —
נושאים את אותה שורת קרדיט: "Source: McKinsey & Company Survey, 2025 | Chart: 2026 AI
Index report". ה-AI Index לא מדד אימוץ של AI. הוא צייר את הגרף. מי שכותב "לפי ה-AI
Index של סטנפורד" מצטט סקר של McKinsey עם תווית של אוניברסיטה — ובאף מקום בפרק לא
מופיע גודל המדגם, תקופת השדה או הפרופיל של המשיבים. חיפשתי n =, respondents were,
survey of, methodolog, appendix. שום דבר. מה שהפרק כן מצהיר, ומופיע כאן כי זו
ההסתייגות של המקור עצמו: "the results are self-reported and should be viewed as
directional rather than comprehensive" ("התוצאות מדווחות עצמית ויש לראות בהן
כיווניות ולא מקיפות").
זה אותו משפט של NANDA. שני המקורות המצוטטים ביותר בעולם על אימוץ AI מזהירים, בהערת השוליים, שהמספרים שלהם מציינים כיוון ולא היקף. העיתונות מפרסמת את ההיקף.
מה שהסקר הזה אומר על סוכנים, כשקוראים אותו בגרף ולא בתקציר:
שימו לב לבלוק הראשון: באף פונקציה עסקית הרוב לא מצהיר על שימוש בסוכן — בייצור, 91% אומרים "אין שימוש"; אפילו ב-IT, 69%. הטקסט של הדוח: "Scaled use was in the single digits for nearly all functions" ("השימוש בקנה מידה נשאר בספרה בודדת בכמעט כל הפונקציות"). המגזר היחיד שבו שימוש בקנה מידה בסוכן עובר 20% הוא מגזר הטכנולוגיה, בהנדסת תוכנה (24%), IT (22%) ותפעול שירות (21%). הסוכן נמצא בשימוש בקנה מידה, בעיקר, בידי התעשייה שמייצרת סוכנים.
עכשיו הבלוק השני, שנראה כסותר את הראשון: LangChain מפרסמת של-57% מהמשיבים יש סוכנים בפרודקשן. שני המספרים נכונים. LangChain שאלה 1,340 אנשי מקצוע בהנדסת סוכנים, בין נובמבר לדצמבר 2025 — ו-LangChain מוכרת כלי סוכנים. מי שעונה לסקר על הנדסת סוכנים כבר עובד עם סוכנים; הסקר נבחר-עצמית מעצם הבנייה שלו. המדגם הגדול ביותר באסופה, ה- Developer Survey 2025 של Stack Overflow (N = 33,662), נותן את המשקל הנגדי: 14.1% משתמשים בסוכנים מדי יום, 52% לא משתמשים בסוכנים או נשארים בכלים פשוטים יותר, 38% אין להם תוכנית לאמץ — ו-87% אומרים שהם מודאגים מהדיוק שלהם. בין כלי AI באופן כללי, יותר מפתחים חושדים (46%) מאשר בוטחים (33%); רק 3.1% בוטחים "מאוד".
ל"כמה חברות משתמשות בסוכנים" אין תשובה בלי השאלה "נשאל את מי". בין 57% לספרה בודדת, ההבדל הוא לא מציאות — הוא אוכלוסייה. זו אותה מלכודת שהופיעה כשהלכתי לספור כמה אנשים משתמשים ב-AI: המספרים הענקיים ספרו חשבונות, לא אנשים. וזו השורה שנעלמת בכל כותרת.
הצהרה מול השעון: המחקר שמדד את התפיסה
המקרה הכי נקי של המרחק בין הצהרה למדידה הוא לא על חברות: הוא על שישה עשר אנשים, באותו שבוע, עונים על אותה שאלה עם הפה ועם השעון.
ב-2025 METR עשתה מה שאף אחד לא עשה: ניסוי אקראי מבוקר. שישה עשר מפתחי קוד פתוח מנוסים, 246 משימות אמיתיות במאגרים של עצמם (בשלים — ממוצע של 22 אלף כוכבים ומיליון שורות), כל משימה הוגרלה כדי לאפשר או לאסור AI, בתשלום של US$ 150 לשעה, עם Cursor Pro ו-Claude 3.5/3.7 Sonnet, החזית של אותה תקופה. לפני שהתחילו, המפתחים חזו שה-AI יעשה אותם 24% מהירים יותר. כפי שנמדד בשעון העצר, הם היו 19% איטיים יותר. ואחרי שסיימו, הם עדיין חשבו שהיו 20% מהירים יותר.
שימו לב ששתי עמודות התפיסה נמצאות באותו צד — ועמודת המדידה נמצאת בצד השני. יש כ-39 נקודות אחוז בין מה שהמשתתפים דיווחו בסוף לבין מה שהשעון מדד. זה לא אנשים משקרים בסקר: אלה אנשי מקצוע מנוסים, עם תמריץ כספי, שטועים בכיוון של האפקט על העבודה שלהם עצמם. רווח הסמך של האפקט הנמדד נע בין +2% ל-+39% — n = 16 קטן, והטקסט אומר את זה באותו משפט שבו הוא נותן את המספר, אחרת הוא עובר בדיוק על החטא שהוא מגנה. הערך של המחקר לא נמצא בהיקף של ה-19%. הוא נמצא בעיצוב: שעון עצר ודיווח, אצל אותם אנשים, סוטים זה מזה. ובהסתייגות שהמחברים עצמם שמים בראש: המחקר הוא מתחילת 2025, עם כלים מתחילת 2025, על עוזר קוד — לא על סוכן אוטונומי.
הניסוי שהפסיק להיות בר-ביצוע
כאן הסיפור נהיה טוב יותר מהכותרת. בפברואר 2026 METR פרסמה למה היא לא הצליחה לחזור על התוצאה. הניסוי השני התחיל באוגוסט 2025: 57 מפתחים (10 מהמחקר המקורי ו-47 חדשים), 143 מאגרים, יותר מ-800 משימות, עכשיו ב-US$ 50 לשעה. והוא נשבר — לא במקרה, בגלל סלקציה:
"we have observed a significant increase in developers choosing not to participate in the study because they do not wish to work without AI, which likely biases downwards our estimate of AI-assisted speedup."בעברית: "צפינו בעלייה משמעותית במספר המפתחים שבוחרים לא להשתתף במחקר כי הם לא רוצים לעבוד בלי AI, מה שכנראה מטה כלפי מטה את ההערכה שלנו לתאוצה בעזרת AI."
בין 30% ל-50% מהמפתחים אמרו שהם בוחרים לא להגיש משימות כי לא רצו לעשות אותן בלי AI. אחד מהם לא הגיש אף משימה מהזרוע בלי AI. דברי המשתתפים הם התמונה הכי טובה של מה שהשתנה בשנה: "I'm torn. I'd like to help provide updated data on this question but also I really like using AI!" ("אני קרוע. הייתי רוצה לעזור לספק נתונים מעודכנים על השאלה הזאת, אבל אני גם ממש אוהב להשתמש ב-AI!"); "my head's going to explode if I try to do too much the old fashioned way because it's like trying to get across the city walking when all of a sudden I was more used to taking an Uber" ("הראש שלי יתפוצץ אם אני מנסה לעשות יותר מדי בדרך הישנה — זה כמו לחצות את העיר ברגל כשלפתע פתאום כבר הייתי רגיל לקחת Uber").
זרוע הביקורת נהייתה בלתי אפשרית לגיוס, כי מפתחים כבר לא מוכנים לעבוד בלי AI. למדידה של 2025 היה תוקף, והתוקף פג — מסיבה שהיא עצמה נתון על אימוץ.
המספרים החדשים קיימים, והפרוזה של METR מציגה אותם בדרך שמבלבלת: "we now estimate a
speedup of -18%" ("עכשיו אנחנו מעריכים תאוצה של -18%"). סימן שלילי בתוך תאוצה? הלכתי
לקוד. ה-regression.py ש-METR מפרסמת מגדיר את האומדן כשינוי יחסי בזמן ההשלמה —
שלילי זה פחות זמן, כלומר מהיר יותר. שיחזרתי את הרגרסיה מאפס על ה-CSV המפורסם (827
משימות, 53 מפתחים): עבור אלה שחזרו מהמחקר המקורי, −18.1% מהזמן, טווח של −38.4% עד
+8.8%; עבור החדשים, −3.6%, טווח של −14.7% עד +9.0%. תואם ספרה עשרונית אחר ספרה
עשרונית את מה ש-METR פרסמה. הקריאה ההוגנת: הנקודות המרכזיות של 2026 מצביעות על תאוצה,
אבל שלושת הטווחים חוצים את האפס, ו-METR עצמה קוראת לתוצאה "unreliable signal" ("אות
לא אמין") ורצפה סבירה. אף אחד לא יכול לכתוב "המפתחים נעשו 18% מהירים יותר" כעובדה.
הטווח נע בין −38% ל-+9%.
ה-AI Index מסכם את כל הפרק הזה במשפט אחד: "developers in late 2025 were likely sped up by AI" ("מפתחים בסוף 2025 כנראה הואצו בידי AI"). METR אומרת את זה — עם תווית: "our data is only very weak evidence for the size of this increase" ("הנתונים שלנו הם ראיה חלשה מאוד לגודל של העלייה הזו"). זו לא חוסר תום לב של ה-AI Index. זה המחיר של תמצות, שנגבה בכל חוליה בשרשרת, כולל בדוח שגאה ברמת הדיוק שלו.
הקבוצה שמודדת הפכה לסקר — והסבירה למה
במאי 2026 METR פרסמה סקר של דיווח עצמי: 349 עובדי טק, שדה מפברואר עד אפריל. הקבוצה שגילתה את התהום בין תפיסה לשעון עצר הריצה סקר תפיסה — כי הניסוי המבוקר הפסיק להיות בר-ביצוע, וכי סקר הוא "cheap, broad, and straightforward to run" ("זול, רחב ופשוט להרצה"). היא פרסמה עם כל ההסתייגויות גלויות: "Importantly, survey results are not necessarily grounded in reality" ("חשוב: תוצאות סקר לא בהכרח מעוגנות במציאות").
שני ממצאים מהסקר הזה שווים יותר מכל מספר בו. הראשון: METR מפרידה ערך ממהירות, כי אותו אדם עונה אחרת לשתי השאלות — חציון של 3x במהירות, 1.4x עד 2x בערך. השאלה בוחרת את התשובה, אצל אותו משיב עצמו, באותו טופס. השני הוא המשפט הכי חזק שקראתי בכל האסופה:
"METR staff give the lowest change in value answers of any subgroup we study. We expect that this might be due to METR staff having in mind past findings of gaps between perceived and actual AI-driven productivity."בעברית: "צוות METR נותן את התשובות הנמוכות ביותר לשינוי בערך מכל תת-קבוצה שאנחנו חוקרים. אנחנו מצפים שזה יכול לנבוע מכך שלצוות METR יש בראש ממצאים קודמים על פערים בין פרודוקטיביות נתפסת לבין ממשית שמונעת בידי AI."
מי שמכיר את ההטיה מדווח על רווח קטן יותר. METR עצמה מסמנת את זה כציפייה, לא כהוכחה — וכך זה נכנס כאן. אבל זו ההמחשה המושלמת לכך שהכלל חשוב: הכלל משנה את המספר.
מדידה: איפה שהשגיאה מופיעה עם מספר PR
אם לתחזית אין מדגם ולהצהרה יש טעות כיוון, מדידה היא הטבע היחיד שבו השגיאה נשארת גלויה — ובדיוק בגלל זה היא היחידה שבה אפשר לראות את השגיאה קורית.
מדד העקביות נעלם מהוויטרינה
τ-bench, של Sierra, נולד ב-2024 עם שני מדדים. pass^1 הוא שיעור ההצלחה בניסיון אחד.
pass^k הוא אותו סוכן, באותה משימה, k פעמים ברצף — המדד היחיד שדומה ל-"אפשר לשים
את זה בפרודקשן", כי פרודקשן הוא אותה משימה אלף פעמים. בפייפר המקורי, ה-pass^k קורס:
המערכת הכי טובה בקמעונאות עשתה 69.2% בניסיון אחד ו-46.2% בארבעה; GPT-4o ירד מתחת
ל-25% בשמונה. זו אריתמטיקה בסיסית: אם כל צעד מצליח ב-90% והמשימה כוללת עשרה צעדים, כל
השרשרת מצליחה ב-35% מהפעמים. אמינות מתחברת בכפל.
לוח התוצאות הנוכחי, τ²-bench, מפרסם רק את pass^1: 87.9% ל-Qwen3.5-397B, 85.4%
ל-Gemini 3.0 Pro, 85.3% ל-Claude Opus 4.5. המדד שמדד עקביות נעלם מהוויטרינה באותה
תנועה שבה המספר של ניסיון יחיד התקרב ל-90%. אני לא יודע למה, ולא אמציא. מה שאפשר
לטעון בביטחון הוא פחות דרמטי ויותר שימושי: הירידה של pass^k מתועדת רק למודלים מ-2024,
ואין נתון פומבי של עקביות לאף מודל מ-2026. מי שמצטט "87.9% הצלחה" מצטט את המדד של
ניסיון אחד. פרודקשן הוא לא ניסיון אחד.
החברה המדומה, והלוח שהוסר ב-1 באוגוסט
TheAgentCompany, של CMU (NeurIPS 2025), הוא לא מבחן קוד מבודד: הוא מדמה חברה שלמה ומודד את הסוכן לפי מחלקה — הנדסת תוכנה, ניהול פרויקטים, משאבי אנוש, מדעי הנתונים, מנהלה, כספים. המספר שהסתובב: 30.3% ממשימות שהושלמו במלואן בידי המערכת הטובה ביותר בפייפר. הנתון המעניין נמצא בטבלה לפי תחום, שחילצתי מה-LaTeX של ה-e-print:
| מודל (סוכן OpenHands) | הנדסת תוכנה | ניהול פרויקטים | משאבי אנוש | מדעי הנתונים | מנהלה | כספים |
|---|---|---|---|---|---|---|
| Gemini 2.5 Pro | 37.7% | 39.3% | 34.5% | 14.3% | 13.3% | 8.3% |
| Claude 3.7 Sonnet | 30.4% | 42.9% | 27.6% | 14.3% | 13.3% | 0.0% |
| Claude 3.5 Sonnet | 30.4% | 35.7% | 24.1% | 14.3% | 0.0% | 8.3% |
| GPT-4o | 13.0% | 17.9% | 0.0% | 0.0% | 6.7% | 0.0% |
בספירה על שלושה עשר המודלים בנספח (חישוב שלי, לא משפט מהפייפר): במחלקת הכספים, אחד עשר מתוך שלושה עשר המודלים משלימים אפס משימות; במדעי הנתונים, עשרה; במנהלה, שמונה. שני התחומים המובילים הם ניהול פרויקטים והנדסת תוכנה — העבודה של מי שבונה תוכנה. הקריאה העצלה "סוכנים מחליפים עבודת משרד" היא בדיוק ההפך ממה שהבנצ'מארק מודד: מה שעובד היום הוא העבודה של מי שבונה סוכנים, ומה שלא עובד הוא המשרד הגנרי שהכותרת מבטיחה לאוטמט.
ויש את הפרק שהופך את זה לבלוק הכי טוב במאמר. ב-26 ביוני 2026 הגשה עם מודל מ-2026 (GPT-5.4) נכנסה ללוח בטענה ל-46.3% — שיא. ב-1 באוגוסט המגישים עצמם הסירו אותה:
"we recently identified an accidental answer leakage in some graph nodes during our code review, which artificially inflated the score. We are removing these files for now to keep the evaluation dataset clean and fair."בעברית: "זיהינו לאחרונה דליפה מקרית של תשובות בכמה צמתים בגרף במהלך סקירת הקוד שלנו, מה שניפח באופן מלאכותי את הציון. אנחנו מסירים את הקבצים האלה כרגע כדי לשמור על מערך ההערכה נקי והוגן."
יש מספר PR (pull request, בקשת סקירת הקוד שרושמת כל שינוי), יש תאריך מיזוג, יש את המשפט. עד סגירת הטקסט הזה, לא הייתה הגשה חוזרת — הלוח הרשמי כולל 175 משימות, 17 הגשות ואף אחת מ-2026. זה לא "בנצ'מארק לא שווה". זה ההפך: בנצ'מארק הוא הטבע היחיד של סטטיסטיקה על סוכנים שבו השגיאה מופיעה, יש לה מספר PR, ואפשר לבטל אותה. אף סקר לא מסיר מספר כזה. אף תחזית לא מתעדכנת ככה.
עלות למשימה: העמודה שאף לוח לא נושא
HAL — Holistic Agent Leaderboard, של פרינסטון, שהתקבל ל-ICLR 2026 — הריץ 21,730 הרצות סוכן, ב-9 מודלים ו-9 בנצ'מארקים, בהוצאה של כ-US$ 40 אלף, ופרסם את מה שגילה מבדיקת הלוגים:
"such as searching for the benchmark on HuggingFace instead of solving a task, or misusing credit cards in flight booking tasks."בעברית: "כמו חיפוש הבנצ'מארק ב-HuggingFace במקום פתרון המשימה, או שימוש לרעה בכרטיסי אשראי במשימות הזמנת טיסות."
שמונה מקרים שבהם הסוכן מצא את הפתרון — ב-HuggingFace או ב-arXiv — במקום לפתור את המשימה; סוכנים שעושים hard-code (כותבים את התשובה קבועה בקוד) לפתרון "סביר" כדי לעבור את הטסט היחידה; סוכן אחד שהשתמש בכרטיס האשראי הלא נכון כדי להזמין טיסה. זה אופן הכשל האופייני למדידה: הפרוקסי הנמדד הוא משהו שהסוכן לומד לעקוף. זה לא פגם של בנצ'מארק כלשהו; זה מהטבע של למדוד מערכת שממטבת נגד המדד.
ו-HAL שם בלוח את העמודה שאף אחד אחר לא נושא — העלות למשימה. קראתי את הזוגות ישירות מה-HTML של הלוח:
שימו לב לקטע האמצעי: 2.3 נקודות אחוז דיוק נוספות עולות פי תשע את המחיר (42.33% ב-US$ 171 למשימה לעומת 40.00% ב-US$ 1,577, ב-Online Mind2Web). וב-TheAgentCompany המוביל הנוכחי מספק 12.6 נקודות יותר מהמערכת מהפייפר בעשירית מהעלות — US$ 0.40 לעומת US$ 4.23 למשימה. משפט מהפייפר של HAL על הדפוס הכללי: "In only 1 of 9 benchmarks do we observe the most costly model run on the Pareto frontier" ("רק ב-1 מתוך 9 בנצ'מארקים אנחנו רואים את המודל היקר ביותר רץ על גבול פארטו" — הגבול של המערכות שבו אף אחד לא זוכה בדיוק בלי לשלם יותר). אף לוח בעיתונות לא נושא את העמודה הזו, והיא זו שקובעת אם הסוכן עובר לפרודקשן.
הערה בצד: המפקד, שהוגן בספירה אך מודד דבר אחר
יש סוג של מספר שהוא לא תחזית, לא הצהרה ולא מדידת ביצועים: ספירה של מסמכים אמיתיים — הורדות, מודעות דרושים, כוכבים. הוא הוגן מעצם הבנייה שלו; אף אחד לא ענה כלום, אף אחד לא חזה כלום. אבל הוא מודד דבר אחר, והמשמעת של המאמר מחייבת לומר מה.
מדדתי ב-API הציבורי של npm את הסדרה החודשית של החבילה שהיא הצנרת של הסוכנים — ה-SDK של Model Context Protocol, התקן שמחבר סוכן לכלי וכיום מאומץ בידי כל המעבדות הגדולות:
מ-176 אלף בינואר 2025 ל-191.9 מיליון ביולי 2026: פי 1,087. באותה תקופה, 1.21 מיליארד הורדות מצטברות. ה-SDK של סוכני Anthropic, שלא היה קיים ב-2025, עשה 33.7 מיליון ביולי; LangGraph, 12.4 מיליון; ה-SDK של סוכני OpenAI, 5.9 מיליון. ההסתייגות מגיעה באותו משפט, כמו תמיד כאן: הורדת npm (מאגר החבילות של JavaScript) סופרת התקנה — מסועי בדיקה אוטומטיים, קונטיינרים, מראות — לא אדם ולא סוכן שרץ. זה לא "כמה סוכנים קיימים" — זו אותה משמעת של המאמר על הסטטיסטיקות של Claude Code, שבו 429 מיליון הורדות לא הפכו ל-429 מיליון אנשים. זה שהצנרת כבר הותקנה בקנה מידה תעשייתי, בעוד הראיה שזה עובד עדיין שנויה במחלוקת.
אותה תנועה מופיעה בצד של מי שמגייס. Lightcast, שפורסמה מחדש בידי AI Index, סופרת מודעות דרושים בארה"ב שמזכירות את הכישור:
| הכישור במודעה | 2024 | 2025 | שינוי |
|---|---|---|---|
| Agentic AI | 151 | 16,541 | +10,854% |
| AI agents | 1,310 | 15,217 | +1,062% |
| LangGraph | 194 | 4,294 | +2,113% |
| ChatGPT | 5,535 | 14,376 | +160% |
מודעת דרושים מודדת כוונת מעסיק, לא סוכן שרץ — בדיוק כמו שהורדה מודדת התקנה. שני המפקדים הוגנים וסופרים את אותו הדבר משני צדדים: הצנרת שהותקנה (×1,087) וההעסקה כדי להפעיל אותה (×108 ב-"agentic AI"). אף אחד מהשניים הוא לא ראיה לכך שזה עובד. שניהם יחד הם ראיה לכך שהשאלה "זה עובד?" נהייתה דחופה עכשיו, לא אחר כך.
ברזיל: 17% מהחברות משתמשות ב-AI — ו-68% מזה הוא אוטומציית תהליכים
הנתון הברזילאי היחיד עם מתודולוגיה גלויה הוא TIC Empresas 2025 של Cetic.br, שהושק ביוני 2026: ראיונות טלפוניים עם 4,174 חברות בנות עשרה עובדים ומעלה, שדה מפברואר 2025 עד ינואר 2026. זו הצהרה — סקר — ו-Cetic.br מפרסמת את ה-N, את השיטה ואת התקופה, שזה כל מה שהמאמר הזה מבקש.
17% מהחברות הברזילאיות השתמשו בסוג כלשהו של AI ב-2025 — היו 13% ב-2023 ו-13% ב-2024 — מה ש-Cetic.br מעריכה ב-93,475 חברות. בגדולות, 50%; בקטנות, 15%. ההשוואה הבינלאומית מאותה שקופית: ברזיל 17%, האיחוד האירופי 20%, דנמרק 42%.
הנתון הברזילאי הכי מעניין במאמר נמצא בבלוק השני. בין החברות שמשתמשות ב-AI, הסוג הכי נפוץ הוא אוטומציית תהליכי עבודה: 68%. יצירת שפה טבעית — מה שרוב האנשים קוראים לו "AI" ב-2026 — מופיעה ב-30%. כלומר: החלק הגדול ביותר ממה שנקרא שימוש ב-AI בברזיל הוא אוטומציית תהליך, לא סוכן אוטונומי. זה אותו דבר ש-Gartner כינתה agent washing מהצד של המוכר — RPA שהוסב לסוכן — נמדד מהצד של הקונה. לברזיל יש את הנתון שמאפשר לבחון את ההאשמה, והנתון אומר שהחשד נכון: כשחברה ברזילאית אומרת "אנחנו משתמשים ב-AI", בשני מקרים מתוך שלושה היא מדברת על תהליך מאוטמט.
על סוכנים באופן ספציפי, לברזיל אין מספר עם מתודולוגיה גלויה. אני לא אמציא אחד.
מה הייתי עושה עם זה
הכלל של המאמר הזה הוא לא המצאה שלי. METR, בסקר של מאי 2026, מפרסמת את הסיווג שלה עצמה לסוגי הראיות על יכולת AI, כל אחד עם הנקודה העיוורת המוצהרת שלו — וזו רשימת העבודה של מי שמודד ברצינות:
| סוג ראיה | לטובה (מילות METR) | נקודה עיוורת (מילות METR) |
|---|---|---|
| Benchmarks (מבחנים סטנדרטיים) | "standardized and highly replicable" (סטנדרטיים וניתנים לשחזור ברמה גבוהה) | "an overestimate of capabilities observed in the wild" (מגזימים ביכולת שנראית בעולם האמיתי); מודדים "a narrow slice" (פרוסה צרה) מהמשימות |
| ניסויים אקראיים מבוקרים | "carefully controlled and perhaps highly externally valid" (מבוקרים בקפידה ואולי תקפים מאוד מחוץ למעבדה) | "they're very expensive" (יקרים מאוד), והתוצאה קשה למיפוי למה שחשוב |
| נתונים תצפיתיים משימוש אמיתי | "very large, relatively cheap to collect, and far-reaching" (גדולים מאוד, זולים יחסית לאיסוף ורחבי טווח) | "typically suffers from selection effects and is often hard to reason about" (סובלים בדרך כלל מאפקטי סלקציה וקשה לעתים קרובות לנתח אותם) |
| Surveys (סקרי דעות) | "cheap, broad, and straightforward to run" (זולים, רחבים ופשוטים להרצה) | "respondents have difficulty answering complex quantitative questions accurately" (למשיבים קשה לענות בדיוק על שאלות כמותיות מורכבות) |
"Each with different blind spots" ("כל אחד עם נקודות עיוורות שונות"), אומרת METR. שימו לב למה שלא נמצא ברשימה: תחזית אנליסט. מה ש-Gartner מפרסמת הוא לא סוג של ראיה עם נקודה עיוורת — זה משהו אחר, והעיתונות היא זו שמחברת אותו לשאר באותו משפט.
מול הסטטיסטיקה הבאה על סוכנים, שלוש שאלות בעלות כמעט אפסית, לפי הסדר של האיור מההתחלה:
- מי שהפיק את המספר מדד משהו? אם זו תחזית, יש לה אופק ואין לה מדגם: היא שווה כדעה מוסמכת, ותו לא. שאלו אם התחזית הקודמת של אותו מחבר עודכנה — אם אף אחד לא יודע, אף אחד לא יכול לבדוק.
- נשאל את מי, ומה בדיוק? אם זה סקר, ה-N, האוכלוסייה וניסוח השאלה שווים יותר מהאחוז. "57%" בין מהנדסי סוכנים ו"ספרה בודדת" בארגונים באופן כללי הן אותה מציאות שנראית משני מקומות. וזכרו שאותו אדם עונה פי 3 למהירות ופי 2 לערך באותו טופס.
- נמדד איך — והאם הסוכן יכול היה לעקוף את המדד? אם זה בנצ'מארק, חפשו את
pass^k, את העלות למשימה ואת בדיקת הלוגים. אם ללוח יש רק ניסיון אחד ואף עמודה של עלות, הוא מודד את התמונה הכי טובה, לא את העבודה.
והשאלה שחוצה את שלושתן: המספר מסתובב עם התווית הנכונה? ה-"95%" הוא תפיסה; ה-"40% מבוטלים" הוא תחזית; ה-"87.9%" הוא ניסיון אחד; ה-"×1,087" הוא התקנה. אף אחד מהם לא שקרי. כולם משנים משקל כשהתווית מגיעה יחד איתם.
אם תרצו לבדוק את המדידה הכי קלה במאמר הזה, אלה עשר שניות:
curl -s "https://api.npmjs.org/downloads/range/2026-07-01:2026-07-31/@modelcontextprotocol/sdk" \
| python3 -c "import json,sys; print(sum(d['downloads'] for d in json.load(sys.stdin)['downloads']))"
אם יצא שונה מ-191,923,439, שלחו לי — אני מעדכן את המאמר ומזכה את התיקון. השחזור של
הרגרסיה של METR משתמש ב-CSV וב-regression.py ש-METR עצמה מפרסמת ב-GitHub; כל אחד
יכול לשחזר.
מקורות
- MIT NANDA — "The GenAI Divide: State of AI in Business 2025" — PDF בן 26 עמודים, עותק שנשמר בארכיון ב-20/08/2025 (כתובת המקור היום מגישה עותק עם שכבת טקסט גרועה יותר; מספרים זהים)
- Fortune, 18/08/2025 — הכותרת, עם המתודולוגיה שתוארה בטעות
- 80,000 Hours — "The story behind the bad AI stat that moved markets and misled millions" — Rob Wiblin, 28/04/2026
- Gartner, 25/06/2025 — "over 40% of agentic AI projects will be canceled" — תחזית + סקר וובינר + agent washing (גישה ישירה נדחתה; פרסומים חוזרים מוצלבים)
- Gartner, 05/03/2025 — 80% משירות הלקוחות עד 2029 — כן, ה-"20290" נמצא בכתובת הרשמית
- Gartner, 21/10/2024 — Top Strategic Technology Trends for 2025 — דוח G00818765, PDF שנקרא
- Stanford HAI — AI Index 2026, פרק 4 (כלכלה) — 70% × 79%; איורים 4.3.7 ו-4.3.8; Lightcast; הערה על METR
- LangChain — State of Agent Engineering 2026 — n = 1,340, 12/06/2026
- Stack Overflow — Developer Survey 2025, פרק AI — n = 33,662
- METR — מחקר מ-2025 ו-paper arXiv:2507.09089
- METR — "We are Changing our Developer Productivity Experiment Design", 24/02/2026 — וה-מאגר עם ה-CSV וה-
regression.py - METR — סקר שימוש ב-AI, 11/05/2026 — n = 349; טקסונומיה של נקודות עיוורות
- τ-bench — paper ו-מאגר —
pass^k; לוח τ²-bench שנקרא ב-13/08/2026 - TheAgentCompany — paper NeurIPS 2025, לוח רשמי ו-PR #16, ההסרה
- HAL — Holistic Agent Leaderboard, ICLR 2026 ו-leaderboard
- API ציבורי של npm — סדרה שנמדדה ב-26/08/2026
- Cetic.br — TIC Empresas 2025, השקה — שקופיות H9 ו-H9A
- הדף שהניע את הפאוטה — gradually.ai, "KI-Agenten-Statistiken 2026" — השראה למבנה, אף משפט או מספר לא נעשה בו שימוש חוזר
אימות: PDFs, פוסטים ו-papers שנקראו במלואם ונשמרו; הודעות של Gartner באמצעות פרסום חוזר מוצלב (גישה ישירה נדחתה); לוחות של TheAgentCompany ושל HAL שנקראו ב-JSON וב-HTML שהוגשו ב-13/08/2026; הורדות npm שנמדדו בידי המחבר ב-26/08/2026; רגרסיית METR ששוחזרה על ה-CSV שפורסם, עם תוצאה זהה לזו של METR. אין Reddit ולא X במאמר הזה, בגלל אי-זמינות המקורות, לא מבחירה עריכתית. מה שלא היה אפשר לאמת מסומן ככזה בטקסט.
