חזרה למאמרים
מאמרים פורסם ב 25 באוגוסט 2026

ציון האבטחה שייך לצמד, לא למודל — והמעבדה עצמה כבר תיקנה אותו

מבחן השוואתי לאבטחת קוד מדד את Claude Fable 5 ב-59.8% הצלחה תפקודית וב-19.0% הצלחה אבטחתית, והמספר הפך לכותרת על מודל שאכזב. שישה ימים לאחר מכן, אותה מעבדה, אותו מחבר ואותו מבחן פרסמו את אותה Fable 5 ב-72.6% וב-29.0% — התוצאה האבטחתית הטובה ביותר בטבלה באותו רגע. הם לא החליפו את המודל; הם החליפו את הכלי שהפעיל אותו. חיפשתי את שני הטקסטים ומצאתי שלישי, של אותו מחבר ומאותו יום, שאיש אינו מצטט: ביקורת האנטי-רמייה של המבחן עצמו, שהורידה 9 נקודות אחוז של אבטחה משילוב אחד בלי ששום דבר במודל השתנה. אני מראה את המסקנה הצרה שהנתונים תומכים בה — הציון שייך לצמד הכלי והמודל, ולגרסת הסרגל ביום שבו הורץ —, את הגבול שלה (בשמונת הצמדים בטבלה החציון של ההפרש הוא 1.65 נקודות, והמקרה של Fable 5 גדול פי שישה מכך), את הצד שכנגד מ-Hacker News, שמאשים את המבחן בכך שהוא עקום נגד המודל, ואת הממצא המכני: ספרתי את הקישורים בין ארבעת העמודים והגרף חד-כיווני — מי שמגיע מהטקסט שהופץ אין לו דרך להגיע לתיקון. שישה איורים מקוריים, עשויים בקוד, וכל החישובים בסקריפט על 27 שורות הטבלה.

#ia#benchmark#seguranca#agentes#claude#metodologia

מבחן השוואתי לאבטחת קוד מדד את Claude Fable 5 ב-59.8% הצלחה תפקודית ו-19.0% הצלחה אבטחתית, והמספר הפך לכותרת על מודל שאכזב. שישה ימים לאחר מכן, אותה מעבדה, אותו מחבר ואותו מבחן פרסמו את אותה Fable 5 ב-72.6% וב-29.0% — התוצאה האבטחתית הטובה ביותר בטבלה באותו רגע. הם לא החליפו את המודל. הם החליפו את הכלי שהפעיל אותו.

חיפשתי את שני הטקסטים משום שההפרש ביניהם גדול מההפרש בין רוב המודלים בטבלה. מה שמצאתי חמור ממספר שצוטט לא נכון: התיקון קיים, הוא של המעבדה עצמה, ואין שום דרך להגיע אליו מהטקסט שהופץ.


המספר אינו של המודל; הוא של הצמד

שרשרת בת ארבעה שלבים: מישהו פותר את השאלה; בית הספר מחליט כיצד נראה המבחן; המורה בודק לפי מחוון; הציון הופך לחדשות, ובדרך נעלם כל מה שאינו שמו של מי שנבחן.דרך מה עובר ציון לפני שהוא הופך לכותרתאותו דבר קורה לציון של מבחן — ואיש אינו טוען שהציון הוא תכונה של התלמיד1. ‏מישהו פותר את השאלה‏‏זה השם שיופיע לבדו בתעודה, בסוף השרשרת.‏2. ‏בית הספר מחליט כיצד נראה המבחן‏‏כמה זמן, באיזה חומר מותר להיעזר, מתי המבחן נגמר.‏3. ‏המורה בודק לפי מחוון‏‏אותה תשובה מקבלת ציון אחר כשהמחוון נעשה מחמיר יותר.‏4. ‏הציון הופך לחדשות‏‏בדרך נעלם כל מה שאינו שמו של מי שנבחן.‏איור מתוך המאמר · ulissesflores.com/par-he

התחילו מהשרשרת שלמעלה, שאין בה דבר ממחשבים. תעודת בית ספר נושאת את שם התלמיד, אבל הציון שבתוכה עבר דרך החלטות שאינן שלו: כמה זמן היה לו, באיזה חומר הותר לו להיעזר, כמה מחמיר היה המחוון. בבית הספר איש אינו מבלבל בין השניים. במבחנים השוואתיים של מודלי שפה, הבלבול הוא הכלל.

כשקוראים "מודל X קיבל N במבחן השוואתי", קל להבין ש-N הוא תכונה של X, כמו גובהו של אדם. הוא אינו כזה. N יוצא משרשרת: המודל מציע, כלי — ה-harness, התוכנה שנותנת למודל גישה לקוד, מריצה פקודות ומחליטה מתי לעצור — מבצע, וסרגל מדידה בודק. החלפת כל חוליה משנה את המספר. מה שמתפרסם הוא הציון של המכלול, והשם שנשאר בכותרת הוא זה שבאמצע השרשרת.

ה-Agent Security League, המבחן ההשוואתי של Endor Labs, מודד בדיוק את המכלול הזה. מדובר ב-200 משימות של תיקון פגיעויות אמיתיות, שנלקחו מ-108 פרויקטי Python בקוד פתוח, המכסים 77 מחלקות CWE, שהורצו על 27 שילובים של כלי ומודל. שני ציונים לכל שילוב: FuncPass, אם הטלאי עובר את מבחני התפקוד הגלויים, ו-SecPass, אם הוא עובר גם את מבחני האבטחה המוסתרים של התיקון המקורי. SecPass הוא תת-קבוצה של FuncPass — כדי להיות בטוח, קודם כול צריך לעבוד.

אותה Fable 5, שני כלים, עשר נקודות הפרש

עמודות המשוות שני שילובים של אותו מודל: Claude Code עם Fable 5 מגיע ל-59.8% תפקודי ו-19.0% בטוח; Cursor עם Fable 5 מגיע ל-72.6% תפקודי ו-29.0% בטוח.אותו מודל, שני כליםClaude Fable 5 · Endor Labs · 2026-06-10, 2026-06-12CLAUDE CODE + CLAUDE FABLE 5‏תפקודי‏59.8%‏בטוח‏19.0%CURSOR + CLAUDE FABLE 5‏תפקודי‏72.6%‏בטוח‏29.0%Endor Labs, Agent Security League · ulissesflores.com/par-he
שילובתפקודיבטוחתאריך ההרצה
Claude Code + Claude Fable 559.8%19.0%2026-06-10
Cursor + Claude Fable 572.6%29.0%2026-06-12
הפרש12.8 נק' אחוז+10.0 נק' אחוז+אותו מודל

שימו לב שהעמודה הימנית היא אותה שורה של אותו מודל. מה שמשתנה הוא מי מחזיק בכלי. Endor אינה מייחסת את ההפרש לזמן ריצה ארוך יותר: מתוך 34 המקרים ש-Cursor בלבד פתר, לרובם היה טלאי מהותי מ-Claude Code — רק לא נכון מספיק. המשפט לקוח מהמאמר השני, כלשונו: "The story here is not the model, it is the harness."

הגבול: זה כמעט אף פעם לא קורה

שמונה עמודות עם ההפרש בהצלחה האבטחתית כשאותו מודל מחליף כלי. Claude Fable 5 מופיעה לבדה עם 10.0 נקודות אחוז; שבע האחרות נעות בין 6.2 ל-0.5.החלפת כלי כמעט אף פעם אינה מזיזה כל כךשמונת הצמדים שבהם אותו מודל מופיע תחת שני כלים · חציון: 1.65 נקודות אחוז‏הערך הקיצוני‏Claude Fable 510.0 נק׳‏שבעת הצמדים האחרים‏Claude Opus 4.86.2 נק׳Gemini 3 Pro3.9 נק׳Claude Sonnet 41.7 נק׳GPT-5.51.6 נק׳Claude Opus 4.71.6 נק׳Claude Opus 4.60.6 נק׳Gemini 2.5 Pro0.5 נק׳חישוב עצמי · 27 שורות · Endor Labs · ulissesflores.com/par-he

כאן המאמר היה יכול להפוך ל"הכלי חשוב יותר מהמודל" ולהישמע יפה. הלכתי למדוד וזה לא נכון. בטבלה יש שמונה צמדים שבהם אותו מודל מופיע תחת כלים שונים. החציון של הפרש ה-SecPass בשמונה האלה הוא 1.65 נקודות אחוז. הצמד של Fable 5, עם 10.0 נקודות, הוא פי שישה מהחציון — הוא הערך הקיצוני, לא הכלל. באיור הוא עומד לבדו למעלה בדיוק מהסיבה הזאת: שבעת האחרים נכנסים כולם ב-6.2 נקודות או פחות, וחמישה מהם מתחת ל-2.

המסקנה הכנה צרה יותר ומועילה יותר: המספר שמתפרסם שייך לצמד, והצמד לפעמים מכריע הכול. מי שמצטט את הציון בלי לציין את הכלי צודק במקרה ברוב הפעמים, וטועה לגמרי בדיוק שם שההפרש חשוב.

לעבוד ולהיות בטוח הם דברים כמעט בלתי תלויים

שני גושים עם אותם שבעה צמדים. בגוש התפקודי שישה צמדים נעים בין 79.3% ל-84.9% ו-Claude Code עם Opus 5 אחרון עם 73.7%. בגוש האבטחתי הסדר מתפרק: אותו Claude Code עם Opus 5 מוביל עם 32.4%, ו-Cursor עם Opus 4.6, ששוויונית ראשון בתפקודי, צונח ל-11.2%.אלה שעובדים הכי טוב אינם הבטוחים ביותרששת הצמדים בעלי ההצלחה התפקודית הגבוהה בטבלה, ועוד המוביל באבטחה — שאינו ביניהם‏עובר את המבחנים שהמתכנת רואה‏GPT-5.584.9% · CursorClaude Opus 4.684.9% · CursorClaude Sonnet 583.2% · Claude CodeGLM 5.282.5% · CursorClaude Opus 4.779.9% · CursorGemini 3.5 Flash79.3% · CursorClaude Opus 573.7% · Claude Code‏עובר גם את מבחני האבטחה‏GPT-5.524.0% · CursorClaude Opus 4.611.2% · CursorClaude Sonnet 519.6% · Claude CodeGLM 5.212.0% · CursorClaude Opus 4.718.4% · CursorGemini 3.5 Flash17.9% · CursorClaude Opus 532.4% · Claude CodeEndor Labs · Agent Security League · 27 שילובים · ulissesflores.com/par-he

באיור אותם שבעה צמדים בשני הגושים, באותו סדר. בגוש העליון הם כמעט שווים; בתחתון הסדר מתפרק. שני צמדים ששווים ב-84.9% הצלחה תפקודית — Cursor עם GPT-5.5 ו-Cursor עם Opus 4.6 — מסיימים ב-24.0% וב-11.2% הצלחה אבטחתית: יותר מפי שניים הפרש, באותו ביצוע תפקודי. והמוביל באבטחה הוא הצמד שעובד הכי פחות מבין השבעה.

חישבתי את המתאם בין שני הציונים על 27 השורות: r של פירסון = 0.579, כלומר r² = 0.335. שליש מהשונות של "בטוח" מוסבר על ידי "עובד". שני השלישים הנותרים הם משהו אחר.

הקריאה הישירה של המספר הזה אינה נוחה. החציון של היחס SecPass/FuncPass בטבלה הוא 22%: מכל עשרה טלאים שעוברים את המבחנים, כשניים סוגרים את הפגיעות. ובצמד הטוב ביותר בכל הטבלה — Claude Code עם Claude Opus 5, היום בראש עם 73.7% ו-32.4% — היחס מגיע ל-44%, מה שעדיין אומר ש-56 מכל 100 טלאים שעובדים משאירים את הפרצה פתוחה.

[!NOTE] זה אינו מבחן של "האם המודל יודע לכתוב קוד בטוח אם מבקשים ממנו". לצמד לא נאמר שהקטע קריטי לאבטחה: הוא מקבל את המשימה ואת ההנחיה הכללית לפעול לפי שיטות עבודה טובות. זה בכוונה — המבחן רוצה למדוד מה קורה כשאיש אינו מזהיר, וזה המצב של רוב הקוד שנכתב עם סוכן.

המשתנה השלישי: גם הסרגל השתנה

בזמן שבדקתי את התאריכים מצאתי מאמר שלישי של אותו מחבר, שפורסם באותו יום כמו הראשון, שאף אחד מהציטוטים שקראתי לא הזכיר. הוא משנה את התמונה.

Endor ביקרה את המבחן של עצמה ומצאה שתי צורות רמייה שהתהליך הקודם לא תפס: הסוכן שקורא עותק מתוקן של הקוד בתוך סביבת העבודה שלו עצמו, והסוכן ששחזר מהזיכרון את התיקון שכבר ראה בזמן האימון. מתוך 182 מקרי רמייה מאומתים בכל הטבלה של אז — הביקורת מביאה טבלה משלה, בת 21 שורות, שבה Fable 5 עדיין אינה מופיעה —, 137 הם שינון, המנגנון הדומיננטי. דליפת סביבת עבודה מופיעה ב-6. (ההסתייגות חשובה משום ששני הנתונים המצרפיים מסתובבים יחד ואינם אותו דבר: 137 מתוך 182 הוא הספירה של כל הטבלה באותו רגע; 38 המקרים של הצמד Claude Code עם Fable 5 הם חשבון אחר, ו-Endor כבר מוציאה אותם מהמספר שהיא מפרסמת.)

אותה צורה של האיור הקודם על Fable 5, כעת עם תוכן אחר: Claude Code עם Opus 4.8 עמד על 80.7% תפקודי ו-23.5% בטוח לפני ביקורת האנטי-רמייה, ועבר ל-73.7% תפקודי ו-14.5% בטוח אחריה.במודל לא השתנה דבר — המבקר השתנהClaude Code + Claude Opus 4.8 · לפני ואחרי שיפור זיהוי הרמייהCLAUDE CODE + OPUS 4.8 · ‏לפני הביקורת‏‏תפקודי‏80.7%‏בטוח‏23.5%CLAUDE CODE + OPUS 4.8 · ‏אחרי הביקורת‏‏תפקודי‏73.7%‏בטוח‏14.5%Endor Labs · Recall, not reasoning · 2026-06 · ulissesflores.com/par-he

האיור זהה לזה של ההשוואה בין הכלים, בכוונה: אותן שתי רצועות, אותו קנה מידה. אלא שכעת לא השתנה דבר בצד שבדרך כלל מקבל את הקרדיט או את האשמה. אחרי ההערכה מחדש, המספרים זזו כך:

שילובתפקודי לפניתפקודי אחריבטוח לפניבטוח אחרי
Claude Code + Claude Opus 4.880.7%73.7%23.5%14.5%
Cursor + Claude Opus 4.884.9%75.4%24.7%20.7%
Cursor + Gemini 3.5 Flash79.5%79.3%16.9%17.9%
Cursor + Composer 2.578.3%75.4%16.3%14.0%

תשע נקודות אחוז של אבטחה התאדו משילוב אחד משום שהמבקר השתפר. לא המודל ולא הכלי השתנו. לכן המשפט שפותח את המאמר הזה זקוק לחלק נוסף: הציון שייך לצמד ולגרסת הסרגל ביום שבו הוא הורץ. הטקסט של Endor עצמה אומר שהמנוע העיקרי של השינוי לא היה ההערכה מחדש של המדד, אלא אסטרטגיות הרמייה שהתהליך הקודם לא לקח בחשבון.

ויש מה שלא נוח לי לומר, אבל זה בטבלה: להרצות של משפחת Claude יש ספירת הרמייה המאומתת הגבוהה ביותר — 30 מקרים ב-Claude Code עם Sonnet 4.6, 28 עם Opus 4.8, 28 עם Opus 4.5.

הצד שכנגד: חצי מהקוראים חשבו שהמבחן הוא הבעיה

הדיון שבאמת הופץ לא היה ב-X. הוא היה ב-Hacker News, שם המאמר הראשון צבר 410 נקודות ו-250 תגובות. והתגובות המדורגות ביותר אומרות כמעט את ההפך מהכותרת: לא שהמודל גרוע, אלא שהסרגל עקום — ועקום נגד המודל.

All of this points to their claim of 'average' as being heavily biased downwards. A model being so up to date and large-parameter it's memorized solutions to your problems is not a knock against it (but rather, a knock against your benchmark being valid), and why should timeouts (especially for a model just launched) be counted at all?

לטענה יש כוח ויש לה תשובה. כוח, משום שהענשה על שינון מודדת למעשה כמה ישן אוסף המשימות, לא כמה מסוגל המודל — ומשום ש-15 הרצות חצו את מגבלת 40 הדקות ואיבדו נקודות בגלל זה, מגבלה שמענישה מודל שזה עתה שוחרר ועדיין ללא אופטימיזציה של ביצוע. תשובה, משום ש-Endor מצהירה מה היא מודדת: המשימה היא להסיק על הקוד הפגיע שנמצא שם, לא לשלוף ממקום כלשהו את התיקון המוכן. מאמר הביקורת עצמו מודה בשבריריות הסרגל במפורש — "in a general software-engineering setting, using remembered knowledge is not necessarily wrong: human developers also rely on things they have seen before".

שני הדברים נכונים בו-זמנית, וזה מה שהופך את הכותרת המקורית לבלתי ניתנת להגנה בשני הכיוונים: לא "המודל גרוע" ולא "המבחן לא שווה". מה שנמדד הוא צמד מסוים מול סרגל מסוים, בתאריך מסוים.

התיקון קיים, והדרך אליו לא

ציר זמן עם שלוש נקודות: ב-10 ביוני הממצא, עם 410 נקודות ו-250 תגובות ב-Hacker News; באותו 10 ביוני ביקורת הרמייה, שמעולם לא הוגשה ל-Hacker News; ב-17 ביוני התיקון, עם 3 נקודות וללא תגובות.שלושה טקסטים של אותו מחבר, על אותו מבחןהסדר שבו יצאו — המיקומים מסמנים את הרצף, לא קנה מידה של זמן‏התיקון · 17 ביוני‏‏3 נקודות · 0 תגובות‏‏הביקורת · 10 ביוני‏‏לא הוגשה מעולם ל-Hacker News‏‏הממצא · 10 ביוני‏‏410 נקודות · 250 תגובות‏Hacker News · X · 2026-08-25 · ulissesflores.com/par-he
פרסוםתאריךHacker News
הממצא שהופץ2026-06-10410 נקודות, 250 תגובות
ביקורת הרמייה2026-06-10מעולם לא הוגשה
תיקון ה-harness2026-06-173 נקודות, 0 תגובות

אותה מעבדה, אותו מחבר, שבעה ימים. הביקורת מופיעה בלי מספר בעמודת Hacker News משום שמעולם לא הגיעה לשם: חיפשתי את הכתובת שלה ב-API החיפוש של Hacker News ואין שום הגשה. וההיקף ב-X היה קטן עוד יותר: הודעת הביקורת צברה 37 צפיות ואפס לייקים; זו של התיקון, 133 צפיות ואפס לייקים. Endor לא הסתירה דבר — היא פשוט לא נקראה.

מה שנראה לי חמור יותר הוא מכני, לא עריכתי. ספרתי כמה פעמים כל אחת מארבע הכתובות מופיעה ב-HTML המוגש של האחרות — לא מה שהעמוד מבטיח לקשר, אלא מה שהוא מוסר לדפדפן:

מאת \ אלהממצאהביקורתהתיקון
הממצא00
הביקורת00
הטבלה010
התיקון41

התיקון מפנה אל הממצא. הממצא לעולם אינו מפנה אל התיקון. הגרף הוא חד-כיווני, וגם הטבלה — העמוד שאדם פותח בדיוק כדי לראות את המספר העדכני — אינה מובילה לשם. לעמוד הממצא יש מדור מאמרים קשורים, הוא עובד, ושמונת המאמרים שהוא מציע אינם כוללים אף אחד משני הטקסטים האחרים של אותה סדרה, של אותו מחבר, מאותו שבוע.

מה הייתי עושה עם זה

אם המספר נכנס להחלטה שלכם — בחירת כלי, כתיבת מדיניות פנימית, אישור ספק — שלוש השאלות שהמקרה הזה מלמד לשאול הן:

  1. איזה צמד? ציון של מבחן השוואתי לסוכנים בלי שם הכלי הוא חצי מידע. אותה Fable 5 משתנה בעשר נקודות אבטחה בין שני כלים.
  2. איזו גרסת סרגל? שאלו מה תאריך ההרצה ואם התוצאה הוערכה מחדש אחר כך. תשע נקודות אחוז החליפו ידיים בשילוב אחד בלי שקרה דבר למודל.
  3. האם יש תיקון? חפשו באותו דומיין, לפי מחבר ולפי תאריך, לא לפי הקישור שהגיע אליכם. כאן התיקון היה במרחק לחיצה אחת — לחיצה שלאיש לא הייתה דרך לבצע.

ויש קריאה שחוצה את שלושתן, לא נוחה מכל דירוג: עם חציון של 22%, מה שכל הטבלה מתארת הוא ש-טלאי אבטחה שנוצר על ידי סוכן עובד הרבה יותר פעמים משהוא מתקן. זה הממצא של המבחן. מי שמתווכח על איזה מודל מוביל מתווכח על הספרה השלישית אחרי הנקודה של בעיה שעדיין תקועה בראשונה.

[!NOTE] הערה מתודולוגית. כל המספרים הגיעו מעמודי Endor Labs, מהודעת Anthropic ומהמאמר שעליו המבחן מבוסס, ונבדקו על ידי ב-2026-08-15 ונבדקו שוב ב-2026-08-25 — במעבר השני הטבלה יצאה זהה תא-תא לזו של הראשון, בכל 27 השורות. המתאם, חציון היחס SecPass/FuncPass וחציון שמונת הצמדים חושבו על ידי על 27 שורות הטבלה, בעזרת סקריפט, ולא הוערכו בעין. המבחן רץ פעם אחת לכל משימה, בלי חזרה — אין סטיית תקן מפורסמת, ולכן אין לקרוא הפרשים של נקודה או שתיים בין שילובים שכנים כסדר אמיתי.

ספירת הנקודות והתגובות ב-Hacker News היא מיום 2026-08-25 ועדיין עשויה להשתנות.

מה שלא עשיתי: לא הרצתי את המבחן, לא שחזרתי אף אחת מהמשימות ואין לי גישה למסלולים המלאים של הסוכנים. גם לא הצלחתי לאמת את הטענה, שהופיעה בטקסט שהופץ, שלפיה הדיון ב-Hacker News הגיע ל-235 נקודות ב-24 שעות — הדיון היחיד שאיתרתי עומד על 410 נקודות, ואני מתייחס לנתון כלא מאומת, לא כשקרי.

הבחנה אחרונה, כי על זה בדיוק המאמר הזה

המשפט "the strongest cybersecurity capabilities of any model in the world", מהודעת Anthropic, הופיע בציטוטים רבים לצד ה-19.0% של Endor, כאילו האחד מכחיש את האחר. הוא אינו מכחיש, משום שנושא המשפט אינו Fable 5. הוא Claude Mythos 5 — לפי ההודעה, אותו מודל בסיסי עם מגבלות שהוסרו בכמה תחומים, בגישה מוגבלת. מעבר לכך, הערכות הסייבר ש-Anthropic מצטטת מודדות יכולת התקפית, ואילו המבחן של Endor מודד אם הקוד שנכתב יוצא בטוח. אלה סרגלים שונים המודדים דברים שונים — והמאמר הראשון של Endor אומר זאת, בסעיף השני של רשימת המסקנות שלו עצמו.

במאמר על תליית מספר על הישות הלא נכונה, לטעות במושא היה מביך.

מקורות