חזרה למאמרים
מאמרים פורסם ב 4 בספטמבר 2026

GLM 5.3 Flash: ‏חמש נקודות מתחת ל‑Fable בשלושה אחוזים מהעלות למשימה — והכותרת על 100 טריליון החליפה פועל בדרך

ארבעת המספרים מאומתים: 57 מול 62 במדד, ‏0.09 דולר מול 3.14 דולר למשימה. הכותרת על 100 טריליון — לא: המשפט שייך לחברה אחרת.

#glm#z.ai#llm#benchmarks#open-weights#fact-check
GLM 5.3 Flash: ‏חמש נקודות מתחת ל‑Fable בשלושה אחוזים מהעלות למשימה — והכותרת על 100 טריליון החליפה פועל בדרך

מודל במשקלים פתוחים קיבל 57 במדד האינטליגנציה של Artificial Analysis, במקום שבו Claude Fable 5 קיבל 62, וגבה 0.09 דולר על המשימה שעבורה Fable גבה 3.14 דולר. ארבעת המספרים מגיעים ממודד חיצוני, לא מהיצרן, ובדקתי אותם היום מחדש, אחד‑אחד, בדפים של כל מודל.

הכותרת שהסתובבה לא הייתה זו. הכותרת הייתה ש‑Z.ai משרתת מאה טריליון טוקנים ביום על שבבים סיניים. הלכתי לחפש את המשפט המקורי: הוא קיים, הוא של חברה אחרת, הוא בזמן דקדוקי שגוי, והוא דיבר על מבצע. העלות מאומתת; הכותרת לא. המאמר הזה מפריד בין השניים.


הערה מתודולוגית — לקרוא לפני ציטוט של מספר כלשהו מכאן. ה‑Intelligence Index ("מדד האינטליגנציה") של Artificial Analysis הוא ממוצע של כמה מבחנים מנורמלים. שלוש הסתייגויות שתקפות להשוואה כולה: (1) הדף של Claude Fable 5 מודד את התצורה "Adaptive Reasoning, Max Effort, Opus 4.8 Fallback" ("חשיבה מסתגלת, מאמץ מרבי, עם נפילה ל‑Opus 4.8") והדף של GLM-5.3-Flash מודד את וריאנט החשיבה היחיד שהוא מפרסם — אין כאן אותו סרגל מאמץ; (2) מדד של מודל בן ימים הוא זמני, והמחיר שמזין את העלות למשימה הוא מחיר המחירון, שנמצא היום במבצע; (3) לחלק 57 ב‑62 ולהכריז "92% מהאינטליגנציה" הוא בדיוק סוג החישוב שהמאמר הזה קיים כדי לא לעשות — חמש הנקודות החסרות הן המשימות הקשות ביותר באוסף, ומדד מורכב אינו מתיר יחסים. כאן שני הצירים הולכים בנפרד: הפרש נקודות מצד אחד, יחס עלות מהצד השני.

לוח התוצאות, לפני הגוף

מה שהסתובבפסק דין
320 מיליארד פרמטרים בסך הכול, 18 מיליארד פעילים, רישיון MIT✅ מאומת — כתוב בכרטיס הרשמי
מדד 57 מול 62 של Claude Fable 5✅ מאומת — Artificial Analysis, 02/09/2026
0.09 דולר מול 3.14 דולר למשימה✅ מאומת — Artificial Analysis, 02/09/2026
צורך כמעט כפול טוקנים ביציאה (150 מיליון מול 83 מיליון)✅ מאומת — וזה לא הופך את החשבון
Terminal-Bench 2.1 = 84.3 ו‑Deep-SWE = 63.4⚠️ מספרי היצרן, בלי מתקן בדיקה מפורסם
"Z.ai שירתה 100 טריליון טוקנים ביום"לא מאומת — המשפט שייך לחברה אחרת, ובזמן דקדוקי אחר
"רץ על המחשב שלך"⚠️ תלוי במחשב — שקר במחשב נייד רגיל, אמת בתחנת עבודה גדולה
"מקום ראשון ב‑GDPval בפער גדול"❌ לא מצאתי שום מקור
"בטלו את המנויים שלכם"❌ הוא השני הכי איטי מבין השישה שמדדתי, והוא לא הזול ביותר למשימה

הגוף מוכיח שורה אחר שורה, בסדר שבו אדם שמעולם לא שמע על שום דבר מזה מסוגל לעקוב.


כמה עולה משימה, בלי מילה טכנית אחת

שתי מוניות נוסעות לאותה כתובת. הראשונה מכירה קיצור דרך וגובה הרבה לקילומטר. השנייה עושה סיבוב ארוך בהרבה וגובה פרוטות לקילומטר. שתיהן מגיעות. השאלה שחשובה אינה מי נסע פחות: אלא מה הראה המונה כשנפתחה הדלת.

שתי שורות באותה גאומטריה. המונית היקרה נסעה מה שמקביל ל‑83 יחידות מרחק והמונה הראה מאה דולר. המונית הזולה נסעה 150 יחידות, כמעט פי שניים, והמונה הראה שני דולר ושמונים ושבעה סנט. העמודה הארוכה יותר היא של המונית הזולה; החשבון הגבוה יותר הוא של המונית היקרה.שתי נסיעות לאותה כתובתהעמודה היא המרחק שנסע; המספר הוא החשבון בסוף הנסיעהכמה נסעה כל מונית לאותה כתובתמה שהמונה הראההמונית היקרהמסלול קצר, תעריף גבוה100.00 דולרהמונית הזולהמסלול ארוך, תעריף נמוך2.87 דולרהמונית הזולה נסעה פי 1.8 והחשבון יצא 2.9% מזה של השנייה.אנלוגיה, לא מדידה: היחסים הם של המספרים האמיתיים באיורים הבאים. · ulissesflores.com/flash-he

שימו לב להיפוך באיור: העמודה הארוכה נמצאת בשורה התחתונה והחשבון הגבוה בשורה העליונה. זה כל העניין. לקרוא לזה "עלות למשימה" זה רק לתת שם למונה — מה שמשלמים אינו המסלול, אלא ההגעה. כשמישהו משווה שני מודלים של בינה מלאכותית לפי מחיר ה‑token ("טוקן", פיסות הטקסט שהמודל מייצר, והיחידה שבה מחייבים אותו), הוא משווה את מחיר הקילומטר. זו ההשוואה השגויה, ובדיוק בגללה מדדתי 43 אלף קריאות אמיתיות כדי לגלות מי משלם על הקריאה החוזרת במאמר קודם.

אותן שתי מוניות, עם השמות האמיתיים

עכשיו אותו איור, עם הנתונים המדודים. המונית היקרה היא Claude Fable 5. המונית הזולה היא GLM-5.3-Flash, שהושק על ידי החברה הסינית Z.ai ב‑26 באוגוסט 2026 תחת רישיון MIT — 320 מיליארד פרמטרים בסך הכול, 18 מיליארד פעילים בכל טוקן.

אותן שתי שורות מהאיור הקודם, עכשיו עם השמות האמיתיים. Claude Fable 5 הוציא 83 מיליון טוקנים ביציאה ועלה 3 דולר ו‑14 סנט למשימה, עם 62 נקודות מדד. GLM-5.3-Flash הוציא 150 מיליון טוקנים ועלה 9 סנט למשימה, עם 57 נקודות.אותה נסיעה, עם השמות: 57 מול 62, ‏0.09 דולר מול 3.14 דולרהעמודה היא כמה יציאה הוציא כל מודל כדי לענות על כל אוסף המשימותטוקנים ביציאה שהוצאו בהערכהעלות למשימהאינטליגנציהClaude Fable 5מאמץ מרבי, חשיבה מסתגלת3.14 דולר62 נקודותGLM-5.3-Flash320 מיליארד סה״כ, 18 פעילים, MIT0.09 דולר57 נקודותהוציא כמעט כפול טוקנים והמשימה עלתה 2.9% מהמחיר של השנייה.‏Artificial Analysis, הדפים של שני המודלים, נבדקו ב‑02/09/2026. · ulissesflores.com/flash-he

‏Intelligence Index 57 מול 62 (Artificial Analysis, 02/09/2026); 0.09 דולר מול 3.14 דולר למשימה באותו אוסף, באותו תאריך. שני הקווים של המאמר יוצאים משם, וכל אחד יכול לפתוח מחדש את שני הדפים ולבדוק. שימו לב למה שהאיור אינו אומר: הוא אינו אומר של‑Flash יש 92% מהאינטליגנציה של Fable. הוא אומר שהוא נמצא חמש נקודות מתחת במדד מורכב, ושהמשימה יוצאת ב‑2.9% מהמחיר. אלה טענות מסוגים שונים, וערבוב ביניהן הוא הצעד הראשון של כל כותרת עקומה.

הוא צורך כמעט כפול טוקנים — ובגלל זה החשבון יורד

ההתנגדות המתבקשת היא שמחיר לטוקן מטעה: מודל פטפטן יכול להיות זול יותר במחירון ויקר יותר בחשבונית. זו התנגדות טובה, ובמקרה הזה היא כבר מקבלת מענה בתוך המספר — כי Flash הוא הפטפטן מבין השניים.

שתי שורות. Claude Fable 5 גובה חמישים דולר למיליון טוקנים ביציאה וכל ההערכה עלתה 5,455 דולר ו‑22 סנט, עם 83 מיליון טוקנים. GLM-5.3-Flash גובה חמישים סנט למיליון, ההערכה שלו עלתה 138 דולר ו‑2 סנט, עם 150 מיליון טוקנים. העמודה של Fable תופסת את כל המסלול; זו של Flash היא קו דק.פי מאה זול יותר לטוקן, כמעט כפול טוקניםהעמודה היא עכשיו מחיר המחירון למיליון טוקנים ביציאה; המספר הוא כל חשבון ההערכהמחיר מחירון למיליון טוקנים ביציאהכל חשבון ההערכהטוקנים שהוצאוClaude Fable 550.00 דולר למיליון טוקנים5,455.22 דולר83 מיליוןGLM-5.3-Flash0.50 דולר למיליון טוקנים138.02 דולר150 מיליוןפי מאה זול יותר לטוקן, כמעט כפול טוקנים: חשבון קטן פי 39.מחירי מחירון ועלות כוללת של ההערכה: Artificial Analysis, ‏02/09/2026. · ulissesflores.com/flash-he

הקו הדק כמעט בלתי נראה בשורה התחתונה הוא כל הטיעון: 0.50 דולר מול 50.00 דולר על אותו מיליון טוקנים ביציאה — פי מאה פחות. ‏Flash שרף 150 מיליון טוקנים מול 83 מיליון של Fable, פי 1.8, ולמרות זאת החשבון הסגור של ההערכה היה 138.02 דולר מול 5,455.22 דולר — פי שלושים ותשעה פחות. הרעבתנות קיימת, היא מדודה, והפרש התעריף בולע אותה עוד לפני החשבונית.

זה עונה על ההתנגדות של מחיר לטוקן, ורק עליה. זה לא עונה אם המשימות שהושלמו הן אותן משימות — וזו שאלה ששום מדד מצרפי לא עונה עליה במקומכם.


המשפט על 100 טריליון החליף פועל ובעלים בתשעה ימים

עכשיו החלק שגרם לי לכתוב את המאמר. הטענה שנסעה הכי רחוק בהשקה הזו הייתה שהמודל משורת במאה טריליון טוקנים ביום על שבבים סיניים. הלכתי לחפש את המופע הראשון של המשפט. הוא קיים, יש לו קישור, והוא לא של Z.ai.

מי שכתב אותו הייתה OpenCode — לא מעבדת בינה מלאכותית, אלא תוכנית הטרמינל שדרכה הרבה אנשים משוחחים עם המודלים האלה. והפוסט לא הכריז על הישג הנדסי: הוא הכריז על מבצע של שבוע עם מודל עדיין אנונימי, בכינוי "Ox Alpha", שאיש לא ידע של מי הוא.

"Ox Alpha (stealth model) is free for the next week — 1M Context — Multi-modal — Zero Data Retention. Generous rate limits, near unlimited usage. We have capacity for 100T tokens per day, lets see what you can do"

בעברית: "‏Ox Alpha (מודל חשאי) חינם לשבוע הקרוב — מיליון טוקנים של הקשר — רב‑מודאלי — אפס שמירת נתונים. מגבלות שימוש נדיבות, שימוש כמעט בלתי מוגבל. יש לנו קיבולת ל‑100 טריליון טוקנים ביום, בואו נראה מה תצליחו לעשות." — ‏@opencode ב‑X, 20 באוגוסט 2026

שמרו שתי מילים: "יש לנו" ו**"קיבולת"**. זו OpenCode מדברת על התשתית של עצמה, וזו הצעה, לא מדידה. ב‑22 באוגוסט Techmeme כבר חזר על המשפט עם הסייג במקומו — "a stealth model from an unknown AI lab ... and capacity for 100T tokens/day" ("מודל חשאי ממעבדת בינה מלאכותית לא ידועה... וקיבולת ל‑100 טריליון טוקנים ביום"). איש עדיין לא ידע מי בנה את המודל.

בתשעת הימים שלאחר מכן, המשפט איבד סייג אחר סייג.

שרשרת של שישה שלבים. ראשון: ב‑20 באוגוסט OpenCode מכריזה על שבוע חינם ואומרת שיש לה קיבולת ל‑100 טריליון טוקנים ביום. שני: ב‑22 באוגוסט העיתונות חוזרת על המילה קיבולת ומציינת שמחבר המודל אינו ידוע. שלישי, מסומן בענבר: ב‑26 באוגוסט SemiAnalysis כותבת ש‑100 הטריליון משורתים. רביעי, בענבר: Wccftech מציבה את מעבדת Zhipu במקום האפליקציה. חמישי, בענבר: the-decoder מייחס את הנפח ל‑Z.ai. שישי, בענבר: הסרטון מה‑29 קובע ש‑Z.ai שירתה מאה טריליון טוקנים ביום.איך 'יש לנו קיבולת ל' הפך ל'Z.ai שירתה'שש חוליות, לכל אחת קישור ותאריך; בענבר, המקום שבו הטענה חדלה להיות זו של המקור הראשוני1. ‏20/08 — OpenCode מכריזה על שבוע חינם"יש לנו קיבולת ל‑100 טריליון טוקנים ביום" — אפליקציית הטרמינל, על המבצע.2. 22/08 — העיתונות חוזרת: קיבולת, מחבר לא ידוע‏Techmeme ו‑Wccftech: "מודל חשאי ממעבדה לא ידועה". איש לא ידע של מי.3. ‏26/08 — SemiAnalysis מחליפה את הפועל"‏100 הטריליון ביום משורתים על שבב סיני." קיבולת הפכה לנפח.4. ‏26/08 — Wccftech שמה את המעבדה במקום האפליקציהכותרת: Zhipu "חושפת שרצה על GPU סיניים ומשרתת 100 טריליון ביום".5. ‏27/08 — the-decoder מייחס ל‑Z.ai"‏Z.ai שירתה 100 טריליון טוקנים ביום." הנושא עכשיו הוא המעבדה.6. 29/08 — הסרטון סוגר את השרשרת"היא שירתה מאה טריליון טוקנים ביום" — נאמר על Z.ai, כעובדה גמורה.פוסטים ומאמרים ראשוניים, נבדקו ב‑01 וב‑02/09/2026; תאריכים נגזרו מהמזהה של כל פוסט. · ulissesflores.com/flash-he

קראו את האיור מלמעלה למטה ושימו לב ששני דברים משתנים, לא אחד. משתנה הפועל — מ"יש לנו קיבולת ל" (הצעה) ל"משרתת" (מדידה). ומשתנה הנושא — מ‑OpenCode, אפליקציית טרמינל, ל‑Z.ai, מעבדה שמעולם לא אמרה את המספר הזה. החוליות האמצעיות מפורסמות וניתן לקרוא אותן: SemiAnalysis כתבה "the 100T tokens per day is served on Chinese chip" ("‏100 הטריליון טוקנים ביום משורתים על שבב סיני") בשרשור שלה; ‏Wccftech הפכה את זה לכותרת עם הפועל בהווה מתמשך; וthe-decoder כבר כתב, ב‑27 באוגוסט, ש‑Z.ai היא ש"שירתה 100 טריליון טוקנים ביום".

ההודעה הרשמית של Z.ai אינה מכילה את המספר. מה שהחברה כן טענה, בפוסט ההשקה, היה דבר אחר — והדבר האחר הזה בולט בפני עצמו: "Previously previewed as Ox Alpha, running entirely on Chinese AI chips" ("הוצג קודם לכן כ‑Ox Alpha, ורץ כולו על שבבי בינה מלאכותית סיניים"). להריץ מודל חזית בלי חומרה אמריקאית היא הכותרת האמיתית של ההשקה הזו, והיא לא הייתה זקוקה למספר המנופח.

מה אפשר לומר על הסבירות, עם ההנחות על השולחן

אני לא יכול להוכיח שמאה הטריליון לא קרו — אף אחד לא יכול להוכיח שלילה כזו מבחוץ. אפשר לעשות שני דברים הגונים.

הראשון הוא להסתכל על המדידה הציבורית היחידה שקיימת, תוך הצהרה מה היא. ‏OpenRouter, שהוא אחד מכמה ערוצי הפצה, פרסם ש‑Ox Alpha היה "the biggest model ever on OpenRouter, processing over 20 trillion tokens in 6 days" ("המודל הגדול ביותר אי פעם ב‑OpenRouter, שעיבד יותר מ‑20 טריליון טוקנים ב‑6 ימים") — כ‑3.3 טריליון ביום. זה לא הסך הכול של Z.ai, זה של ערוץ אחד, ולכן זה לא משמש לומר "נמדד X מול נטען Y". זה משמש לומר שהנפח הגדול ביותר שנרשם אי פעם בערוץ הזה, במודל שהיה נושא השבוע והיה חינם, נשאר סדר גודל מתחת למספר שהסתובב.

השני הוא לתת סדר גודל. מאה טריליון טוקנים ביום, ממעבדה אחת, הם בסדר הגודל של מה שמעבדת גוגל כולה (כ‑107 טריליון ביום, לפי הנתון של 3.2 קוודריליון בחודש שפורסם במאי 2026) ומשהו בין 55% ל‑70% ממה שצורכת סין כולה — שתי ההערכות הציבוריות של הצריכה הסינית הן 180 ו‑140 טריליון ביום. זה לא בלתי אפשרי — זה יוצא דופן, וטענה יוצאת דופן דורשת ראיה באותו גודל. implicator.ai רשם את החור במפורש: "none of the serving results has been independently audited" ("אף אחת מתוצאות השירות לא עברה ביקורת עצמאית"). ויש עמימות שלבדה מזיזה את החשבון פי עשרה עד פי מאה: אף אחד מהמקורות לא אומר אם "טוקנים" הם של כניסה או של יציאה — לקרוא טקסט זול וניתן להקבלה, לכתוב טקסט יקר וטורי. בלי המילה הזו, המספר אינו ניתן לאימות אפילו עקרונית.


עלות למשימה אינה הציר היחיד, ו‑Flash מפסיד באחרים

כאן חוזר האיור של האנלוגיה, באותה גאומטריה ועם יותר נתונים: עכשיו אלה ששת המודלים שהצלחתי לאמת אחד‑אחד ב‑Artificial Analysis. העמודה נשארת מה שמוציאים; המספר נשאר מה שמקבלים.

שש שורות מסודרות לפי ניקוד. Claude Fable 5, ‏62 נקודות, 3 דולר ו‑14 סנט למשימה, 64.6 טוקנים בשנייה. GLM-5.3, ‏60 נקודות, 68 סנט, 69.6 בשנייה. Kimi K3, ‏60 נקודות, 84 סנט, 37.8 בשנייה. GLM-5.3-Flash מודגש, 57 נקודות, 9 סנט, 42.5 בשנייה. Gemini 3.7 Flash, ‏56 נקודות, 40 סנט, 279.4 בשנייה. GPT-5.6 Luna, ‏52 נקודות, 5 סנט, 126.4 בשנייה. העמודה הקצרה ביותר היא של Luna, לא של Flash.אותה נסיעה, עם שש מוניות: מי שגובה הכי מעט למשימה אינו Flashעמודה: עלות למשימה של המדד. מספר: נקודות אינטליגנציה. מימין, מהירות היציאהכמה עלתה כל משימהנקודות במדדמהירותClaude Fable 5סגור, מאמץ מרבי6264.6 טוקן/ש׳GLM-5.3האח הגדול, מ‑14 באוגוסט6069.6 טוקן/ש׳Kimi K3משקלים פתוחים, מאמץ מרבי6037.8 טוקן/ש׳GLM-5.3-Flashמשקלים פתוחים, רישיון MIT5742.5 טוקן/ש׳Gemini 3.7 Flashסגור, מאמץ גבוה56279.4 טוקן/ש׳GPT-5.6 Lunaסגור, מאמץ מרבי52126.4 טוקן/ש׳‏Flash אינו הזול ביותר למשימה, והוא השני הכי איטי ברשימה.‏Artificial Analysis, שישה דפי מודל נבדקו ב‑02/09/2026. · ulissesflores.com/flash-he

העמודה הקצרה ביותר באיור אינה של Flash: היא של GPT-5.6 Luna, שגובה חמישה סנט למשימה. ‏Flash מספק חמש נקודות מדד יותר בכמעט כפול מהמחיר למשימה — וזו עסקה שאפשר להגן עליה, אבל זו עסקה, לא ניצחון. ובעמודה הימנית המצב מחמיר: Flash מייצר 42.5 טוקנים בשנייה, מול 279.4 של Gemini 3.7 Flash. יותר מפי שישה איטי יותר עבור נקודת מדד אחת.

זו לא תצפית שלי: זו הביקורת שHacker News העלה ראשון, והיא הייתה ראויה להופיע בסיקור. קורא סיכם זאת כך — "Gemini 3.7 flash 56 intel / 0.40 cost / 338 speed. GLM 5.3 flash 57 / 0.09 / 49. I have both ... and see no reason for choosing GLM 5.3 Flash" ("‏Gemini 3.7 flash: ‏56 אינטליגנציה, 0.40 עלות, 338 מהירות. GLM 5.3 flash: ‏57, ‏0.09, ‏49. יש לי את שניהם... ואני לא רואה סיבה לבחור ב‑GLM 5.3 Flash"). המספרים שלו אינם תואמים במדויק את אלה שמדדתי היום — מהירות משתנה לפי ספק ולפי יום — אבל הכיוון תואם, והכיוון הוא מה שמעניין.

אותם שישה, עכשיו בגרף:

פיזור של חמישה מודלים, עם העלות למשימה בציר האופקי הלוגריתמי ומדד האינטליגנציה בציר האנכי. GLM-5.3-Flash מופיע מודגש בזהב ב‑9 סנט ו‑57 נקודות. Claude Fable 5 נמצא בקצה היקר, ב‑3 דולר ו‑14 סנט ו‑62 נקודות. GPT-5.6 Luna נמצא שמאלה יותר, ב‑5 סנט ו‑52 נקודות. Gemini 3.7 Flash נמצא ב‑40 סנט ו‑56 נקודות, ו‑GLM-5.3 ב‑68 סנט ו‑60 נקודות.אינטליגנציה לפי עלות משימהמדד האינטליגנציה של Artificial Analysis מול העלות למשימה, בסולם לוגריתמי50556065$0.03$0.1$0.3$1$3GLM-5.3-FlashClaude Fable 5GPT-5.6 LunaGemini 3.7 FlashGLM-5.3עלות למשימה של המדד (דולר, סולם לוגריתמי)‏Artificial Analysis, חמישה דפי מודל נבדקו ב‑02/09/2026; ‏Kimi K3 נשאר בטבלה. · ulissesflores.com/flash-heמדד אינטליגנציה (Artificial Analysis)

הטבלה המלאה, עם Kimi K3 שלא נכנס לגרף:

מודלמדדעלות למשימהמהירותמחיר למיליון (כניסה / יציאה)
Claude Fable 5623.14 דולר64.6 טוקן/ש׳10.00 / 50.00 דולר
GLM-5.3600.68 דולר69.6 טוקן/ש׳1.40 / 4.40 דולר
Kimi K3600.84 דולר37.8 טוקן/ש׳3.00 / 15.00 דולר
GLM-5.3-Flash570.09 דולר42.5 טוקן/ש׳0.15 / 0.50 דולר
Gemini 3.7 Flash560.40 דולר279.4 טוקן/ש׳0.75 / 3.75 דולר
GPT-5.6 Luna520.05 דולר126.4 טוקן/ש׳0.20 / 1.20 דולר

השורה של GLM-5.3 ראויה לפסקה משלה, כי זו ההשוואה שכמעט אף אחד לא עשה: האח הגדול, שעליו כתבתי ב‑14 באוגוסט, עושה 60 נקודות ב‑0.68 דולר למשימה. ‏Flash עושה 57 ב‑0.09 דולר. שלוש נקודות מדד עולות פי שבע וחצי יותר בתוך אותו בית. זו החלטת הניתוב הקונקרטית ביותר שההשקה הזו מציעה, והיא לא תלויה באמונה בשום כותרת.

איפה Flash נשבר, לפי המודד השני

‏Artificial Analysis אינו הסרגל העצמאי היחיד. גם LiveBench כבר רשם את המודל, והדיוקן שלו ספציפי יותר — ושימושי יותר:

מודלממוצע כלליתכנותציות להוראותעלות למשימה
GLM-5.376.179.069.30.450 דולר
GLM-5.3-Flash71.679.052.80.031 דולר

בתכנות Flash משתווה לחלוטין לאח הגדול — 79.0 מול 79.0 — וכל החור נמצא בציות להוראות: 52.8 מול 69.3. אם השימוש שלכם הוא כתיבת קוד בתוך פיגום שכבר אומר מה לעשות, הזול מספק את אותו הדבר. אם השימוש שלכם הוא סוכן חופשי שצריך לציית לחוזה ארוך, 16.5 נקודות ההפרש הן החשבון שתשלמו בעבודה חוזרת. זה אותו לקח שכבר הופיע כאן כשהראיתי שציון הבטיחות שייך לצמד, לא למודל.

ויש מספר של היצרן ששווה לבדוק בזהירות: הכרטיס הרשמי מכריז על 63.4 ב‑Deep-SWE, הסתובבה שמועה על ~80%, וההרצה המלאה והעצמאית היחידה של 113 המשימות שאיתרתי — של Henry Zhang — נתנה 58.4%: "The Rumored ~80% pass rate is completely incorrect. Actual benchmark result is 58.4%" ("שיעור ההצלחה של ~80% שעליו רננו שגוי לחלוטין. התוצאה האמיתית היא 58.4%"). שלושה מספרים לאותו מבחן, והנמוך שבהם הוא היחיד עם הליך מוצהר.


פתוח לפי הרישיון, סגור בפועל: 328 ג׳יגה‑בייט

הרישיון הוא MIT — המתירני ביותר שקיים, בלי הרשמה ובלי שער. זו מעלה אמיתית וראוי לומר אותה. מה ש"פתוח" לא אומר הוא "נכנס למחשב שלכם".

הורדתי את רשימת הקבצים של המאגר דרך ה‑API של Hugging Face וסיכמתי: 62 קובצי משקלים, 328.3 ג׳יגה‑בייט. זו לא הערכה בעין, זה סכום הבלובים. הקהילה כבר פרסמה גרסאות דחוסות — התהליך נקרא קוונטיזציה, והוא המקבילה להקלטת אותה מוזיקה בפחות ביטים: תופס פחות, מאבד מעט נאמנות.

חמש שורות עם קו מקווקו של ייחוס ב‑128 ג׳יגה‑בייט. גרסת 1 ביט תופסת כ‑100 ג׳יגה‑בייט ונכנסת. זו של 3 ביט תופסת 128 עד 150 ג׳יגה‑בייט ונמצאת בגבול. זו של 4 ביט תופסת 162 עד 210 ג׳יגה‑בייט ולא נכנסת. המשקלים שפורסמו, 62 קבצים בדיוק FP8, תופסים 328.3 ג׳יגה‑בייט ולא נכנסים. הגרסה המקורית של 16 ביט תופסת 650 ג׳יגה‑בייט ולא נכנסת.פתוח לפי הרישיון: כמה זיכרון דורשת כל גרסההקו המקווקו הוא 128 ג׳יגה‑בייט, התקרה של מחשב נייד עילי; העמודות הן רק המשקליםזיכרון שרק המשקלים תופסיםבמכונה של 128 ג׳יגה1 ביטהקוונטיזציה הקטנה ביותר שפורסמהנכנס3 ביטטווח של 128 עד 150 ג׳יגהבגבול4 ביט (Q4_K_XL)טווח של 162 עד 210 ג׳יגהלא נכנסהמשקלים שפורסמו62 קבצים, 328.3 ג׳יגה ב‑FP8לא נכנס16 ביט (BF16)דיוק האימון המקורילא נכנס128 ג׳יגה: התקרה של נייד עילירק הקוונטיזציה הקטנה ביותר נכנסת לנייד — ואף חשבון כאן לא כולל מטמון.קוונטיזציות של Unsloth ו‑API של Hugging Face, ‏02/09/2026 — רק המשקלים; מטמון ההקשר לא פורסם. · ulissesflores.com/flash-he

הקריאה ההגונה של האיור הזה מורכבת משני חצאים, והסיקור נתן רק אחד. זה שקר שהוא רץ "על המחשב שלכם" אם המחשב שלכם הוא נייד רגיל: רק הדחיסה האגרסיבית ביותר, של 1 ביט, נכנסת ל‑128 ג׳יגה‑בייט. וזו אמת שהוא רץ על תחנת עבודה של 128 עד 256 ג׳יגה‑בייט — יש אנשים שמדווחים בדיוק על זה ב‑Hacker News, אחד מהם אומר שזה "the first local model that feels good enough to me to be a 'main' model" ("המודל המקומי הראשון שנראה לי טוב מספיק כדי להיות המודל הראשי"). לומר רק את החצי הראשון היה חטא המסגור עצמו שהמאמר הזה מוקיע.

וחסר רכיב בכל חשבון למעלה. המספרים באיור הם רק המשקלים. כשהראיתי איך לדעת אם מודל רץ על הכרטיס שלכם, השגיאה שהכריעה את כל הטבלה הייתה בדיוק זו: הכרטיס תקצב את המשקלים ושכח את מטמון ההקשר, שגדל תוך כדי שיחה. עבור Flash, איש לא פרסם את הרכיב הזה. אז הסרגל הנכון הוא: המספרים באיור הם הרצפה, והרצפה כבר לא נכנסת.


המחיר הוא קמפיין, ויש לו תאריך סיום

השלב האחרון הוא הקל ביותר לשכוח והמשפיע ביותר על ההחלטה של מי שעומד לאמץ.

ציר זמן של ארבע נקודות. עד 26 באוגוסט, שבוע החינם של Ox Alpha. ב‑26 באוגוסט, המחירון הרשמי של 15 ו‑50 סנט למיליון טוקנים. היום, חצי מזה. ב‑9 בספטמבר 2026, מסומן כהתראה, המבצע נגמר.המחיר שאתם רואים הוא מבצע עד 9 בספטמברמשבוע החינם של המודל האנונימי ועד המחירון המלא שחוזר בעוד שבוע09/09/2026המבצע נגמרהיוםחצי: 0.075 / 0.2526/08מחירון: 0.15 / 0.50עד 26/08‏Ox Alpha, שבוע חינםדף המחירים הרשמי של Z.ai, נבדק ב‑02/09/2026. · ulissesflores.com/flash-he

דף המחירים של Z.ai אומר, היום, בשורה אחת: "GLM-5.3-Flash is available at a 50% discount ... The promotion ends at 24:00 on September 9, 2026 (UTC+8, Singapore time)" ("‏GLM-5.3-Flash זמין בהנחה של 50%... המבצע מסתיים בשעה 24:00 ב‑9 בספטמבר 2026, שעון סינגפור"). כניסה ב‑0.075 דולר ויציאה ב‑0.25 דולר היום; 0.15 ו‑0.50 דולר אחר כך.

שתי הסתייגויות שהסיקור ערבב, וגם אני ערבבתי לפני שבדקתי היום:

  1. העלות למשימה במאמר הזה אינה תלויה במבצע. ‏0.09 הדולר יוצאים ממחיר המחירון המלא, שהוא מה ש‑Artificial Analysis השתמש בו. אם המבצע ייגמר, המספר לא זז. מי שמשלם היום חצי הוא זה שיראה את החשבון מכפיל את עצמו.
  2. אין "שכבה חינמית" של GLM-5.3-Flash ב‑Z.ai. מה שטבלת המחירים מסמנת כ‑"Limited-time Free" ("חינם לזמן מוגבל") היא עמודת אחסון המטמון, לא השימוש במודל. השימוש החינמי שהרבה אנשים ראו היה שבוע החשיפה של "Ox Alpha" ב‑OpenCode וב‑OpenRouter, כשהמודל עדיין אנונימי — אותו מבצע שממנו יצא המשפט על מאה הטריליון.

מה שהבדיקה לא הגיעה אליו

זה החלק שנוטה להיעלם מטקסטים של השקה, והוא זה ששווה הכי הרבה.

  • לא בדקתי את המודל בייצור. הוא בן פחות משבוע; כל טענה שלי על "איך הוא מתנהג בקוד שלכם" הייתה המצאה.
  • פוסט ההשקה הרשמי של Z.ai נותר בלתי קריא עבורי. הכתובת מגיבה, אבל מחזירה רק את הקליפה של האתר; קורא הטקסט שניסיתי החזיר תוכן של מסמך אחר לגמרי. שום דבר שתלוי בלעדית בפוסט הזה לא נכנס לכאן.
  • לא מצאתי מקור ל"מקום ראשון ב‑GDPval בפער גדול". חיפשתי; זה לא קיים בשום מקום שהגעתי אליו. נרשם כטענה לא מאומתת.
  • לא הצלחתי לצטט את r/LocalLLaMA. התשובות הגיעו בלי מחבר ובלי תאריך שניתן לייחס, וציטוט בלי מקור לא נכנס.
  • לא אימתתי כמה שבבים Z.ai השתמשה בהם. המספר "100 אלף שבבים מקומיים" שמופיע במצרפים אינו נשען על הצהרה ראשונית שאיתרתי.
  • המדד הוא של עכשיו. מודל בן ימים נוטה לשנות מיקום כשהמודד מעבד מחדש. למספרים כאן יש תאריך כי התאריך הוא חלק מהמספר.
  • מודל שביעי הופיע אחרי שהאיורים נסגרו. בבדיקה חוזרת של הכול ב‑02/09/2026, GPT-5.6 Terra התחיל להגיב ב‑Artificial Analysis: אותו מדד 57 של Flash, ב‑0.53 דולר למשימה — כמעט פי שישה יקר יותר על אותו מספר, ופי 2.4 מהיר יותר. לא עשיתי מחדש את האיורים, שסגורים על השישה שמדדתי אחד‑אחד; אני רושם זאת כאן כי הנתון מחזק את החשבון במקום לסתור אותו, והשמטת ממצא בגלל שהגיע מאוחר הייתה החטא שהמאמר הזה מוקיע לכל אורכו. ‏GPT-5.6 Soul, שהסרטון מצטט, עדיין ללא דף במודד.

מה הייתי עושה עם זה

לנתב לפי משימה, לא לפי מנוי. הנתון הישים ביותר בהשקה אינו העימות מול Fable 5: הוא העימות מול האח מהבית. שלוש נקודות מדד עולות פי שבע וחצי יותר בין GLM-5.3 ל‑Flash. אם העבודה שלכם היא מה ש‑LiveBench מכנה תכנות, השניים משתווים ב‑79.0 — ואתם משלמים את ההפרש על לא כלום.

למדוד את "ציות ההוראות" שלכם לפני שמחליפים. החור של 52.8 מול 69.3 הוא האזהרה הספציפית ביותר שקיימת על המודל הזה. קחו עשרים משימות אמיתיות מהמצבור שלכם עם הוראות ארוכות, הריצו בשניהם, וספרו כמה חזרו בדרישה לתיקון. הספירה הזו, לא המדד, היא שמכריעה.

לספור מהירות יחד עם מחיר. יותר מפי שישה איטי מ‑Gemini 3.7 Flash זה אנשים שמחכים. לאצווה לילית זה לא עולה כלום; למי שמקליד ומחכה, זה עולה הכול.

לרשום את 9 בספטמבר ביומן. אם תבנו את התקציב עם המחיר של היום, הוא מכפיל את עצמו בעוד שבוע.

ולחשוד בכל משפט שמרוויח פועל בדרך. הכלל שנשאר מהמאמר הזה אינו על Z.ai: הוא ש"יש לנו קיבולת ל" ו"משרתת" הן טענות שונות, ושהמרחק ביניהן נכנס בתשעה ימים של שכפול. כשמספר יוצא דופן מגיע אליכם, חפשו את המופע הראשון שלו. הוא בדרך כלל במרחק שלוש הקלקות, ובדרך כלל אומר משהו אחר.


עשו את החשבון מחדש

שום דבר כאן לא תלוי באמון בי. ארבעת המספרים של הכותרת יוצאים משני דפים ציבוריים — artificialanalysis.ai/models/glm-5-3-flash ו‑artificialanalysis.ai/models/claude-fable-5 — וגודל המאגר יוצא משורת טרמינל אחת:

curl -s 'https://huggingface.co/api/models/zai-org/GLM-5.3-Flash?blobs=true' \
  | python3 -c "import json,sys; d=json.load(sys.stdin); \
    print(sum(f['size'] for f in d['siblings'] if f['rfilename'].endswith('.safetensors'))/1e9, 'GB')"

בעברית: הפקודה מבקשת מ‑Hugging Face את רשימת הקבצים של המאגר ומסכמת את הגודל של כל אלה ששומרים משקלים. התוצאה יוצאת בג׳יגה‑בייט.

אם יוצא לכם אחרת ממה שכתוב כאן, שלחו לי את התוצאה עם התאריך: אני מתקן את המאמר ונותן קרדיט למי שהצביע.

מקורות

כל מספרי המדד, העלות למשימה, המהירות והמחיר נבדקו על ידי ב‑01/09/2026 ונבדקו שוב ב‑02/09/2026, בדפים החיים של Artificial Analysis ושל Z.ai; גודל המאגר סוכם דרך ה‑API של Hugging Face בשני התאריכים, בתוצאה זהה. בין בדיקה לבדיקה זזו רק המהירויות — הן ממוצע נע של המודד —, והקריאה של 02/09/2026 היא זו שמפורסמת כאן. ציטוטי הקהילה נאספו ב‑30/08/2026 וב‑01/09/2026 והועתקו מהפוסטים המקוריים, עם קישור בכל אחד; התרגומים שלי. תאריכי הפוסטים של שרשרת 100 הטריליון לא נקראו מהמסך: כל אחד נגזר מהמזהה של הפוסט עצמו, שנושא את חותם הזמן — וחמשת התאריכים תואמים את מה שרשם האיסוף. תאריך המאמר של Wccftech (‏26/08/2026, ‏16:01 UTC) נקרא מכותרת הדף עצמו ב‑02/09/2026. המספרים של LiveBench ושל הקוונטיזציות של Unsloth נקראו מהדפים הציבוריים ב‑01/09/2026 ונבדקו שוב ב‑02/09/2026, ללא שינוי. פוסט ההשקה הרשמי של Z.ai לא היה נגיש באף ניסיון, ושום דבר במאמר הזה לא תלוי בו.