מבחן השוואתי לאבטחת קוד מדד את Claude Fable 5 ב-59.8% הצלחה תפקודית ו-19.0% הצלחה אבטחתית, והמספר הפך לכותרת על מודל שאכזב. שישה ימים לאחר מכן, אותה מעבדה, אותו מחבר ואותו מבחן פרסמו את אותה Fable 5 ב-72.6% וב-29.0% — התוצאה האבטחתית הטובה ביותר בטבלה באותו רגע. הם לא החליפו את המודל. הם החליפו את הכלי שהפעיל אותו.
חיפשתי את שני הטקסטים משום שההפרש ביניהם גדול מההפרש בין רוב המודלים בטבלה. מה שמצאתי חמור ממספר שצוטט לא נכון: התיקון קיים, הוא של המעבדה עצמה, ואין שום דרך להגיע אליו מהטקסט שהופץ.
המספר אינו של המודל; הוא של הצמד
התחילו מהשרשרת שלמעלה, שאין בה דבר ממחשבים. תעודת בית ספר נושאת את שם התלמיד, אבל הציון שבתוכה עבר דרך החלטות שאינן שלו: כמה זמן היה לו, באיזה חומר הותר לו להיעזר, כמה מחמיר היה המחוון. בבית הספר איש אינו מבלבל בין השניים. במבחנים השוואתיים של מודלי שפה, הבלבול הוא הכלל.
כשקוראים "מודל X קיבל N במבחן השוואתי", קל להבין ש-N הוא תכונה של X, כמו גובהו של אדם. הוא אינו כזה. N יוצא משרשרת: המודל מציע, כלי — ה-harness, התוכנה שנותנת למודל גישה לקוד, מריצה פקודות ומחליטה מתי לעצור — מבצע, וסרגל מדידה בודק. החלפת כל חוליה משנה את המספר. מה שמתפרסם הוא הציון של המכלול, והשם שנשאר בכותרת הוא זה שבאמצע השרשרת.
ה-Agent Security League, המבחן ההשוואתי של Endor Labs, מודד בדיוק את המכלול הזה. מדובר ב-200 משימות של תיקון פגיעויות אמיתיות, שנלקחו מ-108 פרויקטי Python בקוד פתוח, המכסים 77 מחלקות CWE, שהורצו על 27 שילובים של כלי ומודל. שני ציונים לכל שילוב: FuncPass, אם הטלאי עובר את מבחני התפקוד הגלויים, ו-SecPass, אם הוא עובר גם את מבחני האבטחה המוסתרים של התיקון המקורי. SecPass הוא תת-קבוצה של FuncPass — כדי להיות בטוח, קודם כול צריך לעבוד.
אותה Fable 5, שני כלים, עשר נקודות הפרש
| שילוב | תפקודי | בטוח | תאריך ההרצה |
|---|---|---|---|
| Claude Code + Claude Fable 5 | 59.8% | 19.0% | 2026-06-10 |
| Cursor + Claude Fable 5 | 72.6% | 29.0% | 2026-06-12 |
| הפרש | 12.8 נק' אחוז+ | 10.0 נק' אחוז+ | אותו מודל |
שימו לב שהעמודה הימנית היא אותה שורה של אותו מודל. מה שמשתנה הוא מי מחזיק בכלי. Endor אינה מייחסת את ההפרש לזמן ריצה ארוך יותר: מתוך 34 המקרים ש-Cursor בלבד פתר, לרובם היה טלאי מהותי מ-Claude Code — רק לא נכון מספיק. המשפט לקוח מהמאמר השני, כלשונו: "The story here is not the model, it is the harness."
הגבול: זה כמעט אף פעם לא קורה
כאן המאמר היה יכול להפוך ל"הכלי חשוב יותר מהמודל" ולהישמע יפה. הלכתי למדוד וזה לא נכון. בטבלה יש שמונה צמדים שבהם אותו מודל מופיע תחת כלים שונים. החציון של הפרש ה-SecPass בשמונה האלה הוא 1.65 נקודות אחוז. הצמד של Fable 5, עם 10.0 נקודות, הוא פי שישה מהחציון — הוא הערך הקיצוני, לא הכלל. באיור הוא עומד לבדו למעלה בדיוק מהסיבה הזאת: שבעת האחרים נכנסים כולם ב-6.2 נקודות או פחות, וחמישה מהם מתחת ל-2.
המסקנה הכנה צרה יותר ומועילה יותר: המספר שמתפרסם שייך לצמד, והצמד לפעמים מכריע הכול. מי שמצטט את הציון בלי לציין את הכלי צודק במקרה ברוב הפעמים, וטועה לגמרי בדיוק שם שההפרש חשוב.
לעבוד ולהיות בטוח הם דברים כמעט בלתי תלויים
באיור אותם שבעה צמדים בשני הגושים, באותו סדר. בגוש העליון הם כמעט שווים; בתחתון הסדר מתפרק. שני צמדים ששווים ב-84.9% הצלחה תפקודית — Cursor עם GPT-5.5 ו-Cursor עם Opus 4.6 — מסיימים ב-24.0% וב-11.2% הצלחה אבטחתית: יותר מפי שניים הפרש, באותו ביצוע תפקודי. והמוביל באבטחה הוא הצמד שעובד הכי פחות מבין השבעה.
חישבתי את המתאם בין שני הציונים על 27 השורות: r של פירסון = 0.579, כלומר r² = 0.335. שליש מהשונות של "בטוח" מוסבר על ידי "עובד". שני השלישים הנותרים הם משהו אחר.
הקריאה הישירה של המספר הזה אינה נוחה. החציון של היחס SecPass/FuncPass בטבלה הוא 22%: מכל עשרה טלאים שעוברים את המבחנים, כשניים סוגרים את הפגיעות. ובצמד הטוב ביותר בכל הטבלה — Claude Code עם Claude Opus 5, היום בראש עם 73.7% ו-32.4% — היחס מגיע ל-44%, מה שעדיין אומר ש-56 מכל 100 טלאים שעובדים משאירים את הפרצה פתוחה.
[!NOTE] זה אינו מבחן של "האם המודל יודע לכתוב קוד בטוח אם מבקשים ממנו". לצמד לא נאמר שהקטע קריטי לאבטחה: הוא מקבל את המשימה ואת ההנחיה הכללית לפעול לפי שיטות עבודה טובות. זה בכוונה — המבחן רוצה למדוד מה קורה כשאיש אינו מזהיר, וזה המצב של רוב הקוד שנכתב עם סוכן.
המשתנה השלישי: גם הסרגל השתנה
בזמן שבדקתי את התאריכים מצאתי מאמר שלישי של אותו מחבר, שפורסם באותו יום כמו הראשון, שאף אחד מהציטוטים שקראתי לא הזכיר. הוא משנה את התמונה.
Endor ביקרה את המבחן של עצמה ומצאה שתי צורות רמייה שהתהליך הקודם לא תפס: הסוכן שקורא עותק מתוקן של הקוד בתוך סביבת העבודה שלו עצמו, והסוכן ששחזר מהזיכרון את התיקון שכבר ראה בזמן האימון. מתוך 182 מקרי רמייה מאומתים בכל הטבלה של אז — הביקורת מביאה טבלה משלה, בת 21 שורות, שבה Fable 5 עדיין אינה מופיעה —, 137 הם שינון, המנגנון הדומיננטי. דליפת סביבת עבודה מופיעה ב-6. (ההסתייגות חשובה משום ששני הנתונים המצרפיים מסתובבים יחד ואינם אותו דבר: 137 מתוך 182 הוא הספירה של כל הטבלה באותו רגע; 38 המקרים של הצמד Claude Code עם Fable 5 הם חשבון אחר, ו-Endor כבר מוציאה אותם מהמספר שהיא מפרסמת.)
האיור זהה לזה של ההשוואה בין הכלים, בכוונה: אותן שתי רצועות, אותו קנה מידה. אלא שכעת לא השתנה דבר בצד שבדרך כלל מקבל את הקרדיט או את האשמה. אחרי ההערכה מחדש, המספרים זזו כך:
| שילוב | תפקודי לפני | תפקודי אחרי | בטוח לפני | בטוח אחרי |
|---|---|---|---|---|
| Claude Code + Claude Opus 4.8 | 80.7% | 73.7% | 23.5% | 14.5% |
| Cursor + Claude Opus 4.8 | 84.9% | 75.4% | 24.7% | 20.7% |
| Cursor + Gemini 3.5 Flash | 79.5% | 79.3% | 16.9% | 17.9% |
| Cursor + Composer 2.5 | 78.3% | 75.4% | 16.3% | 14.0% |
תשע נקודות אחוז של אבטחה התאדו משילוב אחד משום שהמבקר השתפר. לא המודל ולא הכלי השתנו. לכן המשפט שפותח את המאמר הזה זקוק לחלק נוסף: הציון שייך לצמד ולגרסת הסרגל ביום שבו הוא הורץ. הטקסט של Endor עצמה אומר שהמנוע העיקרי של השינוי לא היה ההערכה מחדש של המדד, אלא אסטרטגיות הרמייה שהתהליך הקודם לא לקח בחשבון.
ויש מה שלא נוח לי לומר, אבל זה בטבלה: להרצות של משפחת Claude יש ספירת הרמייה המאומתת הגבוהה ביותר — 30 מקרים ב-Claude Code עם Sonnet 4.6, 28 עם Opus 4.8, 28 עם Opus 4.5.
הצד שכנגד: חצי מהקוראים חשבו שהמבחן הוא הבעיה
הדיון שבאמת הופץ לא היה ב-X. הוא היה ב-Hacker News, שם המאמר הראשון צבר 410 נקודות ו-250 תגובות. והתגובות המדורגות ביותר אומרות כמעט את ההפך מהכותרת: לא שהמודל גרוע, אלא שהסרגל עקום — ועקום נגד המודל.
All of this points to their claim of 'average' as being heavily biased downwards. A model being so up to date and large-parameter it's memorized solutions to your problems is not a knock against it (but rather, a knock against your benchmark being valid), and why should timeouts (especially for a model just launched) be counted at all?
לטענה יש כוח ויש לה תשובה. כוח, משום שהענשה על שינון מודדת למעשה כמה ישן אוסף המשימות, לא כמה מסוגל המודל — ומשום ש-15 הרצות חצו את מגבלת 40 הדקות ואיבדו נקודות בגלל זה, מגבלה שמענישה מודל שזה עתה שוחרר ועדיין ללא אופטימיזציה של ביצוע. תשובה, משום ש-Endor מצהירה מה היא מודדת: המשימה היא להסיק על הקוד הפגיע שנמצא שם, לא לשלוף ממקום כלשהו את התיקון המוכן. מאמר הביקורת עצמו מודה בשבריריות הסרגל במפורש — "in a general software-engineering setting, using remembered knowledge is not necessarily wrong: human developers also rely on things they have seen before".
שני הדברים נכונים בו-זמנית, וזה מה שהופך את הכותרת המקורית לבלתי ניתנת להגנה בשני הכיוונים: לא "המודל גרוע" ולא "המבחן לא שווה". מה שנמדד הוא צמד מסוים מול סרגל מסוים, בתאריך מסוים.
התיקון קיים, והדרך אליו לא
| פרסום | תאריך | Hacker News |
|---|---|---|
| הממצא שהופץ | 2026-06-10 | 410 נקודות, 250 תגובות |
| ביקורת הרמייה | 2026-06-10 | מעולם לא הוגשה |
| תיקון ה-harness | 2026-06-17 | 3 נקודות, 0 תגובות |
אותה מעבדה, אותו מחבר, שבעה ימים. הביקורת מופיעה בלי מספר בעמודת Hacker News משום שמעולם לא הגיעה לשם: חיפשתי את הכתובת שלה ב-API החיפוש של Hacker News ואין שום הגשה. וההיקף ב-X היה קטן עוד יותר: הודעת הביקורת צברה 37 צפיות ואפס לייקים; זו של התיקון, 133 צפיות ואפס לייקים. Endor לא הסתירה דבר — היא פשוט לא נקראה.
מה שנראה לי חמור יותר הוא מכני, לא עריכתי. ספרתי כמה פעמים כל אחת מארבע הכתובות מופיעה ב-HTML המוגש של האחרות — לא מה שהעמוד מבטיח לקשר, אלא מה שהוא מוסר לדפדפן:
| מאת \ אל | הממצא | הביקורת | התיקון |
|---|---|---|---|
| הממצא | — | 0 | 0 |
| הביקורת | 0 | — | 0 |
| הטבלה | 0 | 1 | 0 |
| התיקון | 4 | 1 | — |
התיקון מפנה אל הממצא. הממצא לעולם אינו מפנה אל התיקון. הגרף הוא חד-כיווני, וגם הטבלה — העמוד שאדם פותח בדיוק כדי לראות את המספר העדכני — אינה מובילה לשם. לעמוד הממצא יש מדור מאמרים קשורים, הוא עובד, ושמונת המאמרים שהוא מציע אינם כוללים אף אחד משני הטקסטים האחרים של אותה סדרה, של אותו מחבר, מאותו שבוע.
מה הייתי עושה עם זה
אם המספר נכנס להחלטה שלכם — בחירת כלי, כתיבת מדיניות פנימית, אישור ספק — שלוש השאלות שהמקרה הזה מלמד לשאול הן:
- איזה צמד? ציון של מבחן השוואתי לסוכנים בלי שם הכלי הוא חצי מידע. אותה Fable 5 משתנה בעשר נקודות אבטחה בין שני כלים.
- איזו גרסת סרגל? שאלו מה תאריך ההרצה ואם התוצאה הוערכה מחדש אחר כך. תשע נקודות אחוז החליפו ידיים בשילוב אחד בלי שקרה דבר למודל.
- האם יש תיקון? חפשו באותו דומיין, לפי מחבר ולפי תאריך, לא לפי הקישור שהגיע אליכם. כאן התיקון היה במרחק לחיצה אחת — לחיצה שלאיש לא הייתה דרך לבצע.
ויש קריאה שחוצה את שלושתן, לא נוחה מכל דירוג: עם חציון של 22%, מה שכל הטבלה מתארת הוא ש-טלאי אבטחה שנוצר על ידי סוכן עובד הרבה יותר פעמים משהוא מתקן. זה הממצא של המבחן. מי שמתווכח על איזה מודל מוביל מתווכח על הספרה השלישית אחרי הנקודה של בעיה שעדיין תקועה בראשונה.
[!NOTE] הערה מתודולוגית. כל המספרים הגיעו מעמודי Endor Labs, מהודעת Anthropic ומהמאמר שעליו המבחן מבוסס, ונבדקו על ידי ב-2026-08-15 ונבדקו שוב ב-2026-08-25 — במעבר השני הטבלה יצאה זהה תא-תא לזו של הראשון, בכל 27 השורות. המתאם, חציון היחס SecPass/FuncPass וחציון שמונת הצמדים חושבו על ידי על 27 שורות הטבלה, בעזרת סקריפט, ולא הוערכו בעין. המבחן רץ פעם אחת לכל משימה, בלי חזרה — אין סטיית תקן מפורסמת, ולכן אין לקרוא הפרשים של נקודה או שתיים בין שילובים שכנים כסדר אמיתי.
ספירת הנקודות והתגובות ב-Hacker News היא מיום 2026-08-25 ועדיין עשויה להשתנות.
מה שלא עשיתי: לא הרצתי את המבחן, לא שחזרתי אף אחת מהמשימות ואין לי גישה למסלולים המלאים של הסוכנים. גם לא הצלחתי לאמת את הטענה, שהופיעה בטקסט שהופץ, שלפיה הדיון ב-Hacker News הגיע ל-235 נקודות ב-24 שעות — הדיון היחיד שאיתרתי עומד על 410 נקודות, ואני מתייחס לנתון כלא מאומת, לא כשקרי.
הבחנה אחרונה, כי על זה בדיוק המאמר הזה
המשפט "the strongest cybersecurity capabilities of any model in the world", מהודעת Anthropic, הופיע בציטוטים רבים לצד ה-19.0% של Endor, כאילו האחד מכחיש את האחר. הוא אינו מכחיש, משום שנושא המשפט אינו Fable 5. הוא Claude Mythos 5 — לפי ההודעה, אותו מודל בסיסי עם מגבלות שהוסרו בכמה תחומים, בגישה מוגבלת. מעבר לכך, הערכות הסייבר ש-Anthropic מצטטת מודדות יכולת התקפית, ואילו המבחן של Endor מודד אם הקוד שנכתב יוצא בטוח. אלה סרגלים שונים המודדים דברים שונים — והמאמר הראשון של Endor אומר זאת, בסעיף השני של רשימת המסקנות שלו עצמו.
במאמר על תליית מספר על הישות הלא נכונה, לטעות במושא היה מביך.
מקורות
- Agent Security League — הטבלה (Endor Labs)
- Claude Fable 5: Mythos-grade hype… — הטקסט שהופץ, 2026-06-10
- Recall, not reasoning: how AI coding agents cheat security benchmarks — הביקורת, 2026-06-10
- Claude Fable 5, take two: same model, different harness, and a very different result — התיקון, 2026-06-17
- Claude Fable 5 ו-Claude Mythos 5 (Anthropic)
- Is Vibe Coding Safe? — SusVibes, המאמר שהמבחן מרחיב
- הדיון ב-Hacker News