חזרה למאמרים
מאמרים פורסם ב 24 ביולי 2026

Opus 5: אינטליגנציית החזית ירדה לחצי המחיר — ו־Reddit הלך ללעוג לגרף

Anthropic השיקה את Claude Opus 5 עם הבטחה לאינטליגנציית חזית בחצי המחיר. מה השתנה בפועל ב־API, מה הגרפים של ההכרזה מראים כשפותחים את התמונות — כולל שהמאמץ המקסימלי מרע את התוצאה — ולמה הלעג המדורג ביותר בקהילה לא שורד בדיקה.

#claude#anthropic#llm#api#benchmarks

Anthropic השיקה היום את Claude Opus 5. משפט המכירה נמצא במסך הראשון של ההכרזה: המודל "comes close to the frontier intelligence of Claude Fable 5 at half the price". התגובה המדורגת ביותר בקהילה, שעות ספורות אחר כך, הייתה לעג לגרף הבנצ'מרקים שמלווה את ההכרזה.

הלכתי לבדוק את הגרף. הלעג לא מחזיק מעמד — והסיבה מעניינת יותר מהבדיחה.


מה השתנה בפועל

ההכרזה הרשמית מביאה את העובדות הניתנות לאימות, בלי שם תואר:

פריטOpus 5
ה־ID של המודל ב־APIclaude-opus-5
מחיר5 דולר למיליון טוקני קלט · 25 דולר על הפלט
חלון קונטקסט1 מיליון טוקנים (ברירת מחדל וגם מקסימום)
פלט מקסימלי128 אלף טוקנים
רמות מאמץlow · medium · high · xhigh · max (ברירת מחדל: high)
זמינותClaude API, Amazon Bedrock, Google Cloud, Microsoft Foundry
בתוכניותClaude Max ו־Claude Pro

שימו לב למחיר: הוא בדיוק המחיר של Opus 4.8. ה"חצי מחיר" של ההכרזה אינו הוזלה ביחס למודל הקודם — זו השוואה ל־Fable 5, שעולה 10 דולר / 50 דולר. ההבחנה הזאת חמקה מחלק ניכר מהסיקור ויצרה בלבול לגיטימי בקהילה עצמה.

כלומר: באותו כסף שכבר שילמתם על Opus 4.8, ‏Anthropic טוענת שהיא מספקת משהו קרוב לצמרת הליין שלה. אם זה יתאמת בשימוש אמיתי, האפקט המעשי אינו "המודל השתפר" — הוא עלות ההרצה של משימה ארוכה ואוטונומית ירדה מדרגה.

שינויי ה־API שאף אחד לא שם ב־press release

חמישה פרטים שמתגלים רק כשקוראים את התיעוד במקום את ההכרזה, וחשובים יותר מכל עמודה בגרף למי שיש לו קוד בפרודקשן:

  1. חשיבה הפכה לברירת המחדל. ב־Opus 4.8, השמטת הפרמטר thinking פירושה ריצה בלי הסקה מורחבת. ב־Opus 5, השמטה פירושה לחשוב. זה שינוי שקט של עלות — וגרוע מזה, של קטיעה: ה־max_tokens הוא תקרה על ההסקה ועוד התשובה. כל endpoint שמעולם לא הגדיר thinking והידק את ה־max_tokens סביב גודל התשובה עלול להתחיל לקטוע טקסט באמצע.
  2. לכיבוי ההסקה יש עכשיו תקרה. thinking: {type: "disabled"} מתקבל רק עם מאמץ high ומטה. בשילוב עם xhigh או max, ה־API מחזיר שגיאת 400. והוולידציה היא לכל בקשה בנפרד: קריאה מאוחרת יותר שמעלה את המאמץ נשברת מעצמה, גם אם הקודמות עברו.
  3. המינימום ל־cache ירד מ־1024 ל־512 טוקנים. prompt שכבר פסלתם כ"קצר מדי בשביל cache" נכנס עכשיו ל־cache — בלי לשנות שורת קוד אחת.
  4. הסירוב הפך לחלק מהחוזה. ל־Opus 5 יש אמצעי הגנה מוגברים בסייבר ומסווגים שיכולים לסרב לבקשה: חוזר HTTP 200, עם stop_reason: "refusal" וקטגוריה. מי שקורא את content[0] ישירות — נשבר. קיים פרמטר fallbacks שמנתב את הבקשה שסורבה למודל אחר בתוך אותה קריאה — ובקטגוריית ה־cyber היעד המומלץ הוא Opus 4.8 עצמו.
  5. אפשר להחליף את סט הכלים באמצע השיחה בלי לפסול את ה־prompt cache (בטא mid-conversation-tool-changes-2026-07-01). קודם לכן, נגיעה ב־tools באמצע הדרך עיבדה מחדש את כל ה־prefix.

ושני פרטים תפעוליים ששווים כסף: ל־Opus 5 יש bucket משלו ל־rate limit, נפרד מה־pool המשולב של דגמי Opus 4.x — הגירת טראפיק לשם לא משחררת מקום ב־bucket הישן ולא יורשת ממנו את המכסה. וה־Priority Tier לא מכסה את Opus 5, אף שהוא מכסה את Fable 5 ואת Opus 4.8.

קיים גם מצב מהיר (speed: "fast"), שמריץ את אותו מודל עם פלט מהיר בהרבה בכפל המחיר — 10 דולר / 50 דולר. רק ב־Claude API: הוא לא קיים ב־Bedrock, ב־Google Cloud או ב־Foundry.


המספרים

טקסט ההכרזה מפרסם כמעט הכול בתור טענה יחסית ("פי שלושה מהמקום השני", "בחצי העלות"). הערכים המוחלטים נמצאים בגרפים — שהם תמונות. פתחתי את התמונות ותעתקתי. הטבלה שלמטה היא הטבלה של ההכרזה עצמה, בשלמותה:

BenchmarkOpus 5Fable 5Opus 4.8GPT-5.6 Sol
coding אג'נטי בטרמינל · Frontier-Bench v0.143.3%33.7%21.1%34.4%
עבודת ידע · GDPval-AA v21861174715931736
בעיות חדשות לחלוטין · ARC-AGI-330.2%1.5%7.8%
חיפוש אג'נטי · BrowseComp90.8%87.4%84.3%90.4%
Humanity's Last Exam · עם כלים64.7%63.9%57.9%
שימוש במחשב · OSWorld 2.070.6%66.1%55.7%62.6%
coding אג'נטי · DeepSWE v1.168.8%69.7%59.0%72.7%
coding אג'נטי · FrontierCode v1.1 Main53.4%53.5%46.5%47.5%
תהליכים עסקיים · AutomationBench26.0%17.4%17.0%18.1%
משפטי · Legal Agent Benchmark11.7%13.3%10.4%2.5%
בריאות · HealthBench Professional59.8%66.0%57.4%60.5%

הקפיצה האמיתית נמצאת בשתי השורות הראשונות ובשלישית. ב־Frontier-Bench, ‏Opus 5 יותר ממכפיל את התוצאה של Opus 4.8. ב־ARC-AGI-3 — מבחן הבעיות החדשות באמת, שהמודל לא יכול היה לראות באימון — הוא רושם 30.2% מול 7.8% של המקום השני, כמעט פי ארבעה.

הערה מתודולוגית. הטבלה שמה את Opus 4.8 על 21.1% ב־Frontier-Bench; גרף המאמץ מאותה הכרזה שם את אותו מודל קרוב ל־18.8%. זו אינה סתירה — הגרף מצהיר על סטאפ אחר (harness ‏mini-SWE-agent, ‏backend של GKE, ממוצע של חמישה ניסיונות למשימה). חלק מהעיתונות פרסם את המספר של הגרף כאילו היה המספר של הטבלה.

הגרף שמעניין אינו גרף העמודות

ההכרזה כוללת משפחת גרפים שהסיקור התעלם ממנה: עלות למשימה מול ביצועים, עם נקודה לכל רמת מאמץ. שם התזה של ההשקה מופיעה — או לא מופיעה.

גרף של עלות לניסיון מול ציון ב־Frontier-Bench v0.1. העקומה של Opus 5 נמצאת מעל ומשמאל לשאר: במאמץ הזול ביותר היא כבר עוקפת את Opus 4.8 במאמץ היקר ביותר, ונקודת המאמץ המקסימלי שלה יורדת מעט מתחת לנקודה שלפניה.coding אג'נטי: כמה עולה כל נקודהFrontier-Bench v0.1 — נקודה אחת לכל רמת מאמץ (low → max)01020304050$1$2$3$5$10$20$30Opus 5Fable 5Opus 4.8GPT-5.6 Solעלות לניסיון (דולר, סקאלה לוגריתמית)מקור: הגרפים של הכרזת Anthropic (24.7.2026) — הערכים נקראו ויזואלית, לא מטבלה.ציון (%)

שתי קריאות קופצות משם, ואף אחת מהשתיים לא נמצאת בטקסט ההכרזה:

Opus 5 במאמץ הזול ביותר מנצח את Opus 4.8 ביקר ביותר. בערך 25.7% ב־5.60 דולר לניסיון, מול 18.8% ב־17 דולר. תוצאה טובה יותר, בהוצאה של בערך שליש. זה כל טיעון ההשקה מרוכז בשתי נקודות — והוא לא מופיע באף עמודה.

מאמץ max מרע את התוצאה. העקומה מטפסת עד xhigh ‏(44.3%) ויורדת ב־max ‏(43.3%). אותו דבר קורה במדד ה־coding של Artificial Analysis. התיעוד מזהיר שה־max עלול לתת תשואה פוחתת ו"לחשוב יותר מדי" במשימה פשוטה; כאן זה נמדד, בחומרים של היצרן עצמו. מי שיירש את ההרגל לקבע max "כי זה הכי טוב" משלם יותר כדי לקבל ציון נמוך יותר.

איך הושגו שני המספרים האלה. הטבלה שלמעלה היא תעתוק ישיר. ערכי העקומה, לעומת זאת, נקראו מהגרף שפורסם, שמגיע בלי טבלה — אלה קירובים של קריאה ויזואלית בסקאלה לוגריתמית, לא נתונים מטבלה. צורת העקומות היא מה שחשוב; הספרות אחרי הנקודה — לא.

והערת שוליים של הגרף ששווה יותר מהגרף עצמו: "Opus 4.8 served as fallback on safety-classifier refusals for Opus 5 and Fable 5." ‏Anthropic עצמה נאלצה להפעיל את מנגנון ה־fallback בעקבות סירוב בתוך סבב הבנצ'מרק. סעיף 4 ההוא מרשימת ה־API אינו היפותזה הגנתית: הוא תפעול שגרתי.


על הלעג של Reddit

הת'רד הרשמי ב־r/ClaudeAI צבר מאות נקודות, והתגובה המדורגת ביותר — בפער — לא עסקה ביכולת. היא הייתה פרודיה על הטון המתחנף של Claude עצמו, מיושמת על גרף הבנצ'מרקים, עם הבדיחה שהעובדה ש"המספרים גדולים או קטנים אלה מאלה" היא load-bearing. מיד מתחת, משתמש מצביע על כך שהעמודה שהודגשה כמנצחת ב־coding אג'נטי רשמה 53.4% מול 53.5% של המתחרה, ומסכם: "Typical Anthropic math".

הלכתי לבדוק את ההאשמה הספציפית הזאת, והיא לא מחזיקה. שני המספרים קיימים — הם ה־FrontierCode v1.1 Main, בשורה השמינית של הטבלה שלמעלה. אלא שההדגשה היא על 53.5% של Fable 5, לא על 53.4% של Opus 5. הטבלה מסמנת את המתחרה כמנצח בחמש מתוך אחת־עשרה שורות, כולל אחת שבה מי שמנצח הוא GPT-5.6 Sol. זה לא גרף שמסתיר תבוסה; זה גרף שמציג את התבוסות בהבלטה.

הסקפטיות עדיין מכוילת נכון — גרף של יצרן הוא חומר שיווקי, גם כשהמספרים נכונים, וההרגל לבדוק הוא ההרגל הנכון. אבל שווה לרשום את תוצאת הבדיקה: במקרה הזה החומר החזיק מעמד. מה שלא החזיק הוא הגרסה שהסתובבה עליו.

ויש גם את העייפות, שהופיעה אף היא בראש הת'רד: "I'm tired boss". אנחנו ביולי 2026 וזה מודל החזית החמישי של Anthropic בתוך חודשים ספורים — Opus 4.7, ‏Opus 4.8, ‏Sonnet 5, ‏Fable 5, ועכשיו Opus 5. יש עלות אנושית בהערכה מחדש של prompt, ‏effort, עלות ומגבלות כל שישה שבועות, והיא לא נכנסת לאף בנצ'מרק.


הפרדוקס של ספינת הדגל

הנקודה המעניינת ביותר בדיון לא הייתה הגרף, אלא שאלה תמימה של משתמש: אם Opus 5 כמעט טוב כמו ספינת הדגל, למה ספינת הדגל מטופלת כמודל בסיכון מוגבר, ואילו זה יוצא כהשקה רגילה, בתוכנית Pro?

התשובה נמצאת בהכרזה עצמה, והיא ספציפית יותר משציפיתי. Opus 5, אומרת Anthropic, "אינו מקדם את החזית ביכולות מסוכנות דו־שימושיות" ונשאר מאחורי Mythos 5 — האח של Fable 5, המוגבל לתוכנית סגורה — במחקר ביולוגי ובסייבר התקפי. הפרט המכריע הוא איך ה"מאחור" הזה מתחלק: בזיהוי פגיעות Opus 5 מתואר כדומה ל־Mythos 5; בניצול שלה — הוא מאחור.

זו בחירה הנדסית, לא צירוף מקרים — וזה ההסבר הסביר ביותר לכך שההשקה זולה ורחבה: שתי היכולות הופרדו. מציאת הפרצה וייצור ה־exploit הפסיקו ללכת יחד. אם זה ניתן לשחזור, זו תוצאה חשובה יותר מכל נקודת אחוז בבנצ'מרק.

עם הסתייגות שהשיווק לא עושה: "השקה רגילה" אין פירושה השקה בלי מנעול. המודל יוצא עם אמצעי הגנת סייבר מוגברים ועם מסווגים שמסרבים לבקשות — כפי שהערת השוליים של גרף הבנצ'מרק מראה בלי כוונה.


מה הייתי עושה עם זה

לא אעמיד פנים שבדקתי את המודל בפרודקשן ארבע שעות אחרי ההשקה. מה שאפשר לומר ביושר הוא איפה הייתי מסתכל קודם:

המאמץ הפך למנוף האמיתי. עם חמש רמות וברירת מחדל סבירה (high), המשתנה שמכריע עלות, latency ואיכות הפסיק להיות "איזה מודל" והפך ל"כמה מאמץ במסלול הזה". ההמלצה של Anthropic עצמה היא להתחיל ב־xhigh לעבודת קוד ו־agent, ‏high לכל השאר — ואז לסרוק כלפי מטה, כי low ו־medium חזקים באופן מפתיע במודל הזה. הגרף שלמעלה מראה למה, ומראה גם שקצה הסולם אינו המקום הטוב ביותר בסולם.

לפני שמחליפים את ה־string של המודל, לבדוק ארבעה דברים: מסלולים שמעולם לא הגדירו thinking (ה־max_tokens עלול לקטוע עכשיו), מסלולים שמשלבים הסקה כבויה עם מאמץ xhigh/max (הופכים לשגיאת 400), את מידות ה־rate limit ב־bucket החדש, ואת הטיפול ב־stop_reason לפני קריאת תוכן התשובה.

ולמחוק את הוראות הבדיקה. זו נוגדת אינטואיציה: תיעוד ההגירה ממליץ להסיר מה־prompts הוראות מסוג "בדוק את העבודה שלך לפני שאתה עונה". Opus 5 כבר מאמת את עצמו, ולהורות לו לבדוק שוב מייצר עבודה כפולה בלי רווח. באותו היגיון, מי שהייתה לו הוראה שמנחה את המודל להאציל יותר ל־subagents צריך להסיר אותה: Opus 5 מאציל יותר מה־4.8, ועכשיו הבעיה היא העודף.

ולחכות למבחן צד־שלישי. מה שיכריע אם Opus 5 הוא מה שהוא טוען שהוא אינו העמודה הגבוהה יותר ולא הטבלה הישרה; זו העלות למשימה שהושלמה בקוד שלכם עצמכם, נמדדת על ידיכם, שבוע אחרי שההייפ שוכך.


מקורות

המחיר, הקונטקסט, התנהגות ה־API והמגבלות נבדקו מול התיעוד הרשמי ב־24 ביולי 2026. מספרי טבלת הבנצ'מרקים תועתקו מהאיורים של ההכרזה; מספרי עקומת העלות נקראו ויזואלית מהגרף ומסומנים בטקסט כקירוב. את ספירת ההצבעות בת'רד של Reddit לא אימתתי מחדש.