מודל במשקלים פתוחים קיבל 57 במדד האינטליגנציה של Artificial Analysis, במקום שבו Claude Fable 5 קיבל 62, וגבה 0.09 דולר על המשימה שעבורה Fable גבה 3.14 דולר. ארבעת המספרים מגיעים ממודד חיצוני, לא מהיצרן, ובדקתי אותם היום מחדש, אחד‑אחד, בדפים של כל מודל.
הכותרת שהסתובבה לא הייתה זו. הכותרת הייתה ש‑Z.ai משרתת מאה טריליון טוקנים ביום על שבבים סיניים. הלכתי לחפש את המשפט המקורי: הוא קיים, הוא של חברה אחרת, הוא בזמן דקדוקי שגוי, והוא דיבר על מבצע. העלות מאומתת; הכותרת לא. המאמר הזה מפריד בין השניים.
הערה מתודולוגית — לקרוא לפני ציטוט של מספר כלשהו מכאן. ה‑Intelligence Index ("מדד האינטליגנציה") של Artificial Analysis הוא ממוצע של כמה מבחנים מנורמלים. שלוש הסתייגויות שתקפות להשוואה כולה: (1) הדף של Claude Fable 5 מודד את התצורה "Adaptive Reasoning, Max Effort, Opus 4.8 Fallback" ("חשיבה מסתגלת, מאמץ מרבי, עם נפילה ל‑Opus 4.8") והדף של GLM-5.3-Flash מודד את וריאנט החשיבה היחיד שהוא מפרסם — אין כאן אותו סרגל מאמץ; (2) מדד של מודל בן ימים הוא זמני, והמחיר שמזין את העלות למשימה הוא מחיר המחירון, שנמצא היום במבצע; (3) לחלק 57 ב‑62 ולהכריז "92% מהאינטליגנציה" הוא בדיוק סוג החישוב שהמאמר הזה קיים כדי לא לעשות — חמש הנקודות החסרות הן המשימות הקשות ביותר באוסף, ומדד מורכב אינו מתיר יחסים. כאן שני הצירים הולכים בנפרד: הפרש נקודות מצד אחד, יחס עלות מהצד השני.
לוח התוצאות, לפני הגוף
| מה שהסתובב | פסק דין |
|---|---|
| 320 מיליארד פרמטרים בסך הכול, 18 מיליארד פעילים, רישיון MIT | ✅ מאומת — כתוב בכרטיס הרשמי |
| מדד 57 מול 62 של Claude Fable 5 | ✅ מאומת — Artificial Analysis, 02/09/2026 |
| 0.09 דולר מול 3.14 דולר למשימה | ✅ מאומת — Artificial Analysis, 02/09/2026 |
| צורך כמעט כפול טוקנים ביציאה (150 מיליון מול 83 מיליון) | ✅ מאומת — וזה לא הופך את החשבון |
| Terminal-Bench 2.1 = 84.3 ו‑Deep-SWE = 63.4 | ⚠️ מספרי היצרן, בלי מתקן בדיקה מפורסם |
| "Z.ai שירתה 100 טריליון טוקנים ביום" | ❌ לא מאומת — המשפט שייך לחברה אחרת, ובזמן דקדוקי אחר |
| "רץ על המחשב שלך" | ⚠️ תלוי במחשב — שקר במחשב נייד רגיל, אמת בתחנת עבודה גדולה |
| "מקום ראשון ב‑GDPval בפער גדול" | ❌ לא מצאתי שום מקור |
| "בטלו את המנויים שלכם" | ❌ הוא השני הכי איטי מבין השישה שמדדתי, והוא לא הזול ביותר למשימה |
הגוף מוכיח שורה אחר שורה, בסדר שבו אדם שמעולם לא שמע על שום דבר מזה מסוגל לעקוב.
כמה עולה משימה, בלי מילה טכנית אחת
שתי מוניות נוסעות לאותה כתובת. הראשונה מכירה קיצור דרך וגובה הרבה לקילומטר. השנייה עושה סיבוב ארוך בהרבה וגובה פרוטות לקילומטר. שתיהן מגיעות. השאלה שחשובה אינה מי נסע פחות: אלא מה הראה המונה כשנפתחה הדלת.
שימו לב להיפוך באיור: העמודה הארוכה נמצאת בשורה התחתונה והחשבון הגבוה בשורה העליונה. זה כל העניין. לקרוא לזה "עלות למשימה" זה רק לתת שם למונה — מה שמשלמים אינו המסלול, אלא ההגעה. כשמישהו משווה שני מודלים של בינה מלאכותית לפי מחיר ה‑token ("טוקן", פיסות הטקסט שהמודל מייצר, והיחידה שבה מחייבים אותו), הוא משווה את מחיר הקילומטר. זו ההשוואה השגויה, ובדיוק בגללה מדדתי 43 אלף קריאות אמיתיות כדי לגלות מי משלם על הקריאה החוזרת במאמר קודם.
אותן שתי מוניות, עם השמות האמיתיים
עכשיו אותו איור, עם הנתונים המדודים. המונית היקרה היא Claude Fable 5. המונית הזולה היא GLM-5.3-Flash, שהושק על ידי החברה הסינית Z.ai ב‑26 באוגוסט 2026 תחת רישיון MIT — 320 מיליארד פרמטרים בסך הכול, 18 מיליארד פעילים בכל טוקן.
Intelligence Index 57 מול 62 (Artificial Analysis, 02/09/2026); 0.09 דולר מול 3.14 דולר למשימה באותו אוסף, באותו תאריך. שני הקווים של המאמר יוצאים משם, וכל אחד יכול לפתוח מחדש את שני הדפים ולבדוק. שימו לב למה שהאיור אינו אומר: הוא אינו אומר של‑Flash יש 92% מהאינטליגנציה של Fable. הוא אומר שהוא נמצא חמש נקודות מתחת במדד מורכב, ושהמשימה יוצאת ב‑2.9% מהמחיר. אלה טענות מסוגים שונים, וערבוב ביניהן הוא הצעד הראשון של כל כותרת עקומה.
הוא צורך כמעט כפול טוקנים — ובגלל זה החשבון יורד
ההתנגדות המתבקשת היא שמחיר לטוקן מטעה: מודל פטפטן יכול להיות זול יותר במחירון ויקר יותר בחשבונית. זו התנגדות טובה, ובמקרה הזה היא כבר מקבלת מענה בתוך המספר — כי Flash הוא הפטפטן מבין השניים.
הקו הדק כמעט בלתי נראה בשורה התחתונה הוא כל הטיעון: 0.50 דולר מול 50.00 דולר על אותו מיליון טוקנים ביציאה — פי מאה פחות. Flash שרף 150 מיליון טוקנים מול 83 מיליון של Fable, פי 1.8, ולמרות זאת החשבון הסגור של ההערכה היה 138.02 דולר מול 5,455.22 דולר — פי שלושים ותשעה פחות. הרעבתנות קיימת, היא מדודה, והפרש התעריף בולע אותה עוד לפני החשבונית.
זה עונה על ההתנגדות של מחיר לטוקן, ורק עליה. זה לא עונה אם המשימות שהושלמו הן אותן משימות — וזו שאלה ששום מדד מצרפי לא עונה עליה במקומכם.
המשפט על 100 טריליון החליף פועל ובעלים בתשעה ימים
עכשיו החלק שגרם לי לכתוב את המאמר. הטענה שנסעה הכי רחוק בהשקה הזו הייתה שהמודל משורת במאה טריליון טוקנים ביום על שבבים סיניים. הלכתי לחפש את המופע הראשון של המשפט. הוא קיים, יש לו קישור, והוא לא של Z.ai.
מי שכתב אותו הייתה OpenCode — לא מעבדת בינה מלאכותית, אלא תוכנית הטרמינל שדרכה הרבה אנשים משוחחים עם המודלים האלה. והפוסט לא הכריז על הישג הנדסי: הוא הכריז על מבצע של שבוע עם מודל עדיין אנונימי, בכינוי "Ox Alpha", שאיש לא ידע של מי הוא.
"Ox Alpha (stealth model) is free for the next week — 1M Context — Multi-modal — Zero Data Retention. Generous rate limits, near unlimited usage. We have capacity for 100T tokens per day, lets see what you can do"
בעברית: "Ox Alpha (מודל חשאי) חינם לשבוע הקרוב — מיליון טוקנים של הקשר — רב‑מודאלי — אפס שמירת נתונים. מגבלות שימוש נדיבות, שימוש כמעט בלתי מוגבל. יש לנו קיבולת ל‑100 טריליון טוקנים ביום, בואו נראה מה תצליחו לעשות." — @opencode ב‑X, 20 באוגוסט 2026
שמרו שתי מילים: "יש לנו" ו**"קיבולת"**. זו OpenCode מדברת על התשתית של עצמה, וזו הצעה, לא מדידה. ב‑22 באוגוסט Techmeme כבר חזר על המשפט עם הסייג במקומו — "a stealth model from an unknown AI lab ... and capacity for 100T tokens/day" ("מודל חשאי ממעבדת בינה מלאכותית לא ידועה... וקיבולת ל‑100 טריליון טוקנים ביום"). איש עדיין לא ידע מי בנה את המודל.
בתשעת הימים שלאחר מכן, המשפט איבד סייג אחר סייג.
קראו את האיור מלמעלה למטה ושימו לב ששני דברים משתנים, לא אחד. משתנה הפועל — מ"יש לנו קיבולת ל" (הצעה) ל"משרתת" (מדידה). ומשתנה הנושא — מ‑OpenCode, אפליקציית טרמינל, ל‑Z.ai, מעבדה שמעולם לא אמרה את המספר הזה. החוליות האמצעיות מפורסמות וניתן לקרוא אותן: SemiAnalysis כתבה "the 100T tokens per day is served on Chinese chip" ("100 הטריליון טוקנים ביום משורתים על שבב סיני") בשרשור שלה; Wccftech הפכה את זה לכותרת עם הפועל בהווה מתמשך; וthe-decoder כבר כתב, ב‑27 באוגוסט, ש‑Z.ai היא ש"שירתה 100 טריליון טוקנים ביום".
ההודעה הרשמית של Z.ai אינה מכילה את המספר. מה שהחברה כן טענה, בפוסט ההשקה, היה דבר אחר — והדבר האחר הזה בולט בפני עצמו: "Previously previewed as Ox Alpha, running entirely on Chinese AI chips" ("הוצג קודם לכן כ‑Ox Alpha, ורץ כולו על שבבי בינה מלאכותית סיניים"). להריץ מודל חזית בלי חומרה אמריקאית היא הכותרת האמיתית של ההשקה הזו, והיא לא הייתה זקוקה למספר המנופח.
מה אפשר לומר על הסבירות, עם ההנחות על השולחן
אני לא יכול להוכיח שמאה הטריליון לא קרו — אף אחד לא יכול להוכיח שלילה כזו מבחוץ. אפשר לעשות שני דברים הגונים.
הראשון הוא להסתכל על המדידה הציבורית היחידה שקיימת, תוך הצהרה מה היא. OpenRouter, שהוא אחד מכמה ערוצי הפצה, פרסם ש‑Ox Alpha היה "the biggest model ever on OpenRouter, processing over 20 trillion tokens in 6 days" ("המודל הגדול ביותר אי פעם ב‑OpenRouter, שעיבד יותר מ‑20 טריליון טוקנים ב‑6 ימים") — כ‑3.3 טריליון ביום. זה לא הסך הכול של Z.ai, זה של ערוץ אחד, ולכן זה לא משמש לומר "נמדד X מול נטען Y". זה משמש לומר שהנפח הגדול ביותר שנרשם אי פעם בערוץ הזה, במודל שהיה נושא השבוע והיה חינם, נשאר סדר גודל מתחת למספר שהסתובב.
השני הוא לתת סדר גודל. מאה טריליון טוקנים ביום, ממעבדה אחת, הם בסדר הגודל של מה שמעבדת גוגל כולה (כ‑107 טריליון ביום, לפי הנתון של 3.2 קוודריליון בחודש שפורסם במאי 2026) ומשהו בין 55% ל‑70% ממה שצורכת סין כולה — שתי ההערכות הציבוריות של הצריכה הסינית הן 180 ו‑140 טריליון ביום. זה לא בלתי אפשרי — זה יוצא דופן, וטענה יוצאת דופן דורשת ראיה באותו גודל. implicator.ai רשם את החור במפורש: "none of the serving results has been independently audited" ("אף אחת מתוצאות השירות לא עברה ביקורת עצמאית"). ויש עמימות שלבדה מזיזה את החשבון פי עשרה עד פי מאה: אף אחד מהמקורות לא אומר אם "טוקנים" הם של כניסה או של יציאה — לקרוא טקסט זול וניתן להקבלה, לכתוב טקסט יקר וטורי. בלי המילה הזו, המספר אינו ניתן לאימות אפילו עקרונית.
עלות למשימה אינה הציר היחיד, ו‑Flash מפסיד באחרים
כאן חוזר האיור של האנלוגיה, באותה גאומטריה ועם יותר נתונים: עכשיו אלה ששת המודלים שהצלחתי לאמת אחד‑אחד ב‑Artificial Analysis. העמודה נשארת מה שמוציאים; המספר נשאר מה שמקבלים.
העמודה הקצרה ביותר באיור אינה של Flash: היא של GPT-5.6 Luna, שגובה חמישה סנט למשימה. Flash מספק חמש נקודות מדד יותר בכמעט כפול מהמחיר למשימה — וזו עסקה שאפשר להגן עליה, אבל זו עסקה, לא ניצחון. ובעמודה הימנית המצב מחמיר: Flash מייצר 42.5 טוקנים בשנייה, מול 279.4 של Gemini 3.7 Flash. יותר מפי שישה איטי יותר עבור נקודת מדד אחת.
זו לא תצפית שלי: זו הביקורת שHacker News העלה ראשון, והיא הייתה ראויה להופיע בסיקור. קורא סיכם זאת כך — "Gemini 3.7 flash 56 intel / 0.40 cost / 338 speed. GLM 5.3 flash 57 / 0.09 / 49. I have both ... and see no reason for choosing GLM 5.3 Flash" ("Gemini 3.7 flash: 56 אינטליגנציה, 0.40 עלות, 338 מהירות. GLM 5.3 flash: 57, 0.09, 49. יש לי את שניהם... ואני לא רואה סיבה לבחור ב‑GLM 5.3 Flash"). המספרים שלו אינם תואמים במדויק את אלה שמדדתי היום — מהירות משתנה לפי ספק ולפי יום — אבל הכיוון תואם, והכיוון הוא מה שמעניין.
אותם שישה, עכשיו בגרף:
הטבלה המלאה, עם Kimi K3 שלא נכנס לגרף:
| מודל | מדד | עלות למשימה | מהירות | מחיר למיליון (כניסה / יציאה) |
|---|---|---|---|---|
| Claude Fable 5 | 62 | 3.14 דולר | 64.6 טוקן/ש׳ | 10.00 / 50.00 דולר |
| GLM-5.3 | 60 | 0.68 דולר | 69.6 טוקן/ש׳ | 1.40 / 4.40 דולר |
| Kimi K3 | 60 | 0.84 דולר | 37.8 טוקן/ש׳ | 3.00 / 15.00 דולר |
| GLM-5.3-Flash | 57 | 0.09 דולר | 42.5 טוקן/ש׳ | 0.15 / 0.50 דולר |
| Gemini 3.7 Flash | 56 | 0.40 דולר | 279.4 טוקן/ש׳ | 0.75 / 3.75 דולר |
| GPT-5.6 Luna | 52 | 0.05 דולר | 126.4 טוקן/ש׳ | 0.20 / 1.20 דולר |
השורה של GLM-5.3 ראויה לפסקה משלה, כי זו ההשוואה שכמעט אף אחד לא עשה: האח הגדול, שעליו כתבתי ב‑14 באוגוסט, עושה 60 נקודות ב‑0.68 דולר למשימה. Flash עושה 57 ב‑0.09 דולר. שלוש נקודות מדד עולות פי שבע וחצי יותר בתוך אותו בית. זו החלטת הניתוב הקונקרטית ביותר שההשקה הזו מציעה, והיא לא תלויה באמונה בשום כותרת.
איפה Flash נשבר, לפי המודד השני
Artificial Analysis אינו הסרגל העצמאי היחיד. גם LiveBench כבר רשם את המודל, והדיוקן שלו ספציפי יותר — ושימושי יותר:
| מודל | ממוצע כללי | תכנות | ציות להוראות | עלות למשימה |
|---|---|---|---|---|
| GLM-5.3 | 76.1 | 79.0 | 69.3 | 0.450 דולר |
| GLM-5.3-Flash | 71.6 | 79.0 | 52.8 | 0.031 דולר |
בתכנות Flash משתווה לחלוטין לאח הגדול — 79.0 מול 79.0 — וכל החור נמצא בציות להוראות: 52.8 מול 69.3. אם השימוש שלכם הוא כתיבת קוד בתוך פיגום שכבר אומר מה לעשות, הזול מספק את אותו הדבר. אם השימוש שלכם הוא סוכן חופשי שצריך לציית לחוזה ארוך, 16.5 נקודות ההפרש הן החשבון שתשלמו בעבודה חוזרת. זה אותו לקח שכבר הופיע כאן כשהראיתי שציון הבטיחות שייך לצמד, לא למודל.
ויש מספר של היצרן ששווה לבדוק בזהירות: הכרטיס הרשמי מכריז על 63.4 ב‑Deep-SWE, הסתובבה שמועה על ~80%, וההרצה המלאה והעצמאית היחידה של 113 המשימות שאיתרתי — של Henry Zhang — נתנה 58.4%: "The Rumored ~80% pass rate is completely incorrect. Actual benchmark result is 58.4%" ("שיעור ההצלחה של ~80% שעליו רננו שגוי לחלוטין. התוצאה האמיתית היא 58.4%"). שלושה מספרים לאותו מבחן, והנמוך שבהם הוא היחיד עם הליך מוצהר.
פתוח לפי הרישיון, סגור בפועל: 328 ג׳יגה‑בייט
הרישיון הוא MIT — המתירני ביותר שקיים, בלי הרשמה ובלי שער. זו מעלה אמיתית וראוי לומר אותה. מה ש"פתוח" לא אומר הוא "נכנס למחשב שלכם".
הורדתי את רשימת הקבצים של המאגר דרך ה‑API של Hugging Face וסיכמתי: 62 קובצי משקלים, 328.3 ג׳יגה‑בייט. זו לא הערכה בעין, זה סכום הבלובים. הקהילה כבר פרסמה גרסאות דחוסות — התהליך נקרא קוונטיזציה, והוא המקבילה להקלטת אותה מוזיקה בפחות ביטים: תופס פחות, מאבד מעט נאמנות.
הקריאה ההגונה של האיור הזה מורכבת משני חצאים, והסיקור נתן רק אחד. זה שקר שהוא רץ "על המחשב שלכם" אם המחשב שלכם הוא נייד רגיל: רק הדחיסה האגרסיבית ביותר, של 1 ביט, נכנסת ל‑128 ג׳יגה‑בייט. וזו אמת שהוא רץ על תחנת עבודה של 128 עד 256 ג׳יגה‑בייט — יש אנשים שמדווחים בדיוק על זה ב‑Hacker News, אחד מהם אומר שזה "the first local model that feels good enough to me to be a 'main' model" ("המודל המקומי הראשון שנראה לי טוב מספיק כדי להיות המודל הראשי"). לומר רק את החצי הראשון היה חטא המסגור עצמו שהמאמר הזה מוקיע.
וחסר רכיב בכל חשבון למעלה. המספרים באיור הם רק המשקלים. כשהראיתי איך לדעת אם מודל רץ על הכרטיס שלכם, השגיאה שהכריעה את כל הטבלה הייתה בדיוק זו: הכרטיס תקצב את המשקלים ושכח את מטמון ההקשר, שגדל תוך כדי שיחה. עבור Flash, איש לא פרסם את הרכיב הזה. אז הסרגל הנכון הוא: המספרים באיור הם הרצפה, והרצפה כבר לא נכנסת.
המחיר הוא קמפיין, ויש לו תאריך סיום
השלב האחרון הוא הקל ביותר לשכוח והמשפיע ביותר על ההחלטה של מי שעומד לאמץ.
דף המחירים של Z.ai אומר, היום, בשורה אחת: "GLM-5.3-Flash is available at a 50% discount ... The promotion ends at 24:00 on September 9, 2026 (UTC+8, Singapore time)" ("GLM-5.3-Flash זמין בהנחה של 50%... המבצע מסתיים בשעה 24:00 ב‑9 בספטמבר 2026, שעון סינגפור"). כניסה ב‑0.075 דולר ויציאה ב‑0.25 דולר היום; 0.15 ו‑0.50 דולר אחר כך.
שתי הסתייגויות שהסיקור ערבב, וגם אני ערבבתי לפני שבדקתי היום:
- העלות למשימה במאמר הזה אינה תלויה במבצע. 0.09 הדולר יוצאים ממחיר המחירון המלא, שהוא מה ש‑Artificial Analysis השתמש בו. אם המבצע ייגמר, המספר לא זז. מי שמשלם היום חצי הוא זה שיראה את החשבון מכפיל את עצמו.
- אין "שכבה חינמית" של GLM-5.3-Flash ב‑Z.ai. מה שטבלת המחירים מסמנת כ‑"Limited-time Free" ("חינם לזמן מוגבל") היא עמודת אחסון המטמון, לא השימוש במודל. השימוש החינמי שהרבה אנשים ראו היה שבוע החשיפה של "Ox Alpha" ב‑OpenCode וב‑OpenRouter, כשהמודל עדיין אנונימי — אותו מבצע שממנו יצא המשפט על מאה הטריליון.
מה שהבדיקה לא הגיעה אליו
זה החלק שנוטה להיעלם מטקסטים של השקה, והוא זה ששווה הכי הרבה.
- לא בדקתי את המודל בייצור. הוא בן פחות משבוע; כל טענה שלי על "איך הוא מתנהג בקוד שלכם" הייתה המצאה.
- פוסט ההשקה הרשמי של Z.ai נותר בלתי קריא עבורי. הכתובת מגיבה, אבל מחזירה רק את הקליפה של האתר; קורא הטקסט שניסיתי החזיר תוכן של מסמך אחר לגמרי. שום דבר שתלוי בלעדית בפוסט הזה לא נכנס לכאן.
- לא מצאתי מקור ל"מקום ראשון ב‑GDPval בפער גדול". חיפשתי; זה לא קיים בשום מקום שהגעתי אליו. נרשם כטענה לא מאומתת.
- לא הצלחתי לצטט את r/LocalLLaMA. התשובות הגיעו בלי מחבר ובלי תאריך שניתן לייחס, וציטוט בלי מקור לא נכנס.
- לא אימתתי כמה שבבים Z.ai השתמשה בהם. המספר "100 אלף שבבים מקומיים" שמופיע במצרפים אינו נשען על הצהרה ראשונית שאיתרתי.
- המדד הוא של עכשיו. מודל בן ימים נוטה לשנות מיקום כשהמודד מעבד מחדש. למספרים כאן יש תאריך כי התאריך הוא חלק מהמספר.
- מודל שביעי הופיע אחרי שהאיורים נסגרו. בבדיקה חוזרת של הכול ב‑02/09/2026, GPT-5.6 Terra התחיל להגיב ב‑Artificial Analysis: אותו מדד 57 של Flash, ב‑0.53 דולר למשימה — כמעט פי שישה יקר יותר על אותו מספר, ופי 2.4 מהיר יותר. לא עשיתי מחדש את האיורים, שסגורים על השישה שמדדתי אחד‑אחד; אני רושם זאת כאן כי הנתון מחזק את החשבון במקום לסתור אותו, והשמטת ממצא בגלל שהגיע מאוחר הייתה החטא שהמאמר הזה מוקיע לכל אורכו. GPT-5.6 Soul, שהסרטון מצטט, עדיין ללא דף במודד.
מה הייתי עושה עם זה
לנתב לפי משימה, לא לפי מנוי. הנתון הישים ביותר בהשקה אינו העימות מול Fable 5: הוא העימות מול האח מהבית. שלוש נקודות מדד עולות פי שבע וחצי יותר בין GLM-5.3 ל‑Flash. אם העבודה שלכם היא מה ש‑LiveBench מכנה תכנות, השניים משתווים ב‑79.0 — ואתם משלמים את ההפרש על לא כלום.
למדוד את "ציות ההוראות" שלכם לפני שמחליפים. החור של 52.8 מול 69.3 הוא האזהרה הספציפית ביותר שקיימת על המודל הזה. קחו עשרים משימות אמיתיות מהמצבור שלכם עם הוראות ארוכות, הריצו בשניהם, וספרו כמה חזרו בדרישה לתיקון. הספירה הזו, לא המדד, היא שמכריעה.
לספור מהירות יחד עם מחיר. יותר מפי שישה איטי מ‑Gemini 3.7 Flash זה אנשים שמחכים. לאצווה לילית זה לא עולה כלום; למי שמקליד ומחכה, זה עולה הכול.
לרשום את 9 בספטמבר ביומן. אם תבנו את התקציב עם המחיר של היום, הוא מכפיל את עצמו בעוד שבוע.
ולחשוד בכל משפט שמרוויח פועל בדרך. הכלל שנשאר מהמאמר הזה אינו על Z.ai: הוא ש"יש לנו קיבולת ל" ו"משרתת" הן טענות שונות, ושהמרחק ביניהן נכנס בתשעה ימים של שכפול. כשמספר יוצא דופן מגיע אליכם, חפשו את המופע הראשון שלו. הוא בדרך כלל במרחק שלוש הקלקות, ובדרך כלל אומר משהו אחר.
עשו את החשבון מחדש
שום דבר כאן לא תלוי באמון בי. ארבעת המספרים של הכותרת יוצאים משני דפים ציבוריים — artificialanalysis.ai/models/glm-5-3-flash ו‑artificialanalysis.ai/models/claude-fable-5 — וגודל המאגר יוצא משורת טרמינל אחת:
curl -s 'https://huggingface.co/api/models/zai-org/GLM-5.3-Flash?blobs=true' \
| python3 -c "import json,sys; d=json.load(sys.stdin); \
print(sum(f['size'] for f in d['siblings'] if f['rfilename'].endswith('.safetensors'))/1e9, 'GB')"
בעברית: הפקודה מבקשת מ‑Hugging Face את רשימת הקבצים של המאגר ומסכמת את הגודל של כל אלה ששומרים משקלים. התוצאה יוצאת בג׳יגה‑בייט.
אם יוצא לכם אחרת ממה שכתוב כאן, שלחו לי את התוצאה עם התאריך: אני מתקן את המאמר ונותן קרדיט למי שהצביע.
מקורות
- מדד עצמאי: Artificial Analysis — הדפים של
glm-5-3-flash,claude-fable-5,glm-5-3,kimi-k3,gemini-3-7-flashו‑gpt-5-6-luna - סרגל עצמאי שני: LiveBench
- משקלים וכרטיס רשמי: huggingface.co/zai-org/GLM-5.3-Flash
- מחירים: docs.z.ai/guides/overview/pricing
- ההודעה של Z.ai: @Zai_org ב‑X
- המשפט המקורי על 100 הטריליון: @opencode ב‑X · Techmeme, 22/08/2026 · SemiAnalysis · the-decoder · implicator.ai
- מדידה של ערוץ אחד: @OpenRouter ב‑X
- הרצה עצמאית של Deep-SWE: Henry Zhang ב‑X
- השוואה בין שני ה‑GLM: Together AI
- קוונטיזציות: Unsloth
- קבלת פנים: שרשור ב‑Hacker News
כל מספרי המדד, העלות למשימה, המהירות והמחיר נבדקו על ידי ב‑01/09/2026 ונבדקו שוב ב‑02/09/2026, בדפים החיים של Artificial Analysis ושל Z.ai; גודל המאגר סוכם דרך ה‑API של Hugging Face בשני התאריכים, בתוצאה זהה. בין בדיקה לבדיקה זזו רק המהירויות — הן ממוצע נע של המודד —, והקריאה של 02/09/2026 היא זו שמפורסמת כאן. ציטוטי הקהילה נאספו ב‑30/08/2026 וב‑01/09/2026 והועתקו מהפוסטים המקוריים, עם קישור בכל אחד; התרגומים שלי. תאריכי הפוסטים של שרשרת 100 הטריליון לא נקראו מהמסך: כל אחד נגזר מהמזהה של הפוסט עצמו, שנושא את חותם הזמן — וחמשת התאריכים תואמים את מה שרשם האיסוף. תאריך המאמר של Wccftech (26/08/2026, 16:01 UTC) נקרא מכותרת הדף עצמו ב‑02/09/2026. המספרים של LiveBench ושל הקוונטיזציות של Unsloth נקראו מהדפים הציבוריים ב‑01/09/2026 ונבדקו שוב ב‑02/09/2026, ללא שינוי. פוסט ההשקה הרשמי של Z.ai לא היה נגיש באף ניסיון, ושום דבר במאמר הזה לא תלוי בו.
