חזרה למאמרים
מאמרים פורסם ב 14 באוגוסט 2026

GLM-5.3: ‏Z.ai דחתה את המשקלים בטענה ליכולת סייבר ופרסמה 2,436 פרצות כהוכחה — 2,239 מהן מעולם לא יצאו משלב הגילוי

חברת Z.ai דחתה את שחרור המשקלים הפתוחים של GLM-5.3 בטענה שהיכולת ההתקפית של המודל גדלה מהר מהצפוי, והציעה כהוכחה ledger ציבורי של 2,436 פרצות בתוכנה אמיתית. הורדתי וספרתי את ה־ledger כולו: 92% מהממצאים מעולם לא דווחו לאיש, בדיוק אחד מסומן כנשלח למתחזק, לא מוצהר שום מועד embargo, ואף רשומה אינה מייחסת את הגילוי למודל — ב־21% מהם שימש Claude Code כ־harness.

#glm#z.ai#llm#benchmarks#open-weights#seguranca

Z.ai השיקה היום, 14 באוגוסט, את GLM-5.3 עם טיעון שאף מעבדת open weights — עד כמה שהסיקור מתעד — לא השתמשה בו קודם: המודל נעשה טוב מדי באבטחה התקפית, ולכן המשקלים יתעכבו בשבועיים. ההכרזה של החברה עצמה אומרת את זה בשורה אחת: "API access and open weights will be released in stages following rigorous safety evaluations."

ההוכחה המוצעת נדיבה וניתנת לאימות: ledger ציבורי ב־cvd.z.ai עם 2,436 פגיעויות שנמצאו ב־269 פרויקטים של תוכנה אמיתית. זה סוג הראיה שאפשר לבקר — אז ביקרתי אותה. הורדתי את ה־payload של עמוד ה־ledger (2 MB, 2,436 הרשומות מוטמעות בו) וספרתי שדה אחר שדה.

2,239 מהפגיעויות האלה — 92% — עדיין בשלב "התגלתה". הן מעולם לא דווחו לאיש. בדיוק אחת מסומנת כ־"נשלחה למתחזק". ויש היעדר גדול עוד יותר: אף אחת מ־2,436 הרשומות אינה מייחסת את הגילוי למודל. המחרוזת "GLM" לא מופיעה ולו פעם אחת בכל מאגר הנתונים.


מה השתנה בפועל

העובדות הניתנות לאימות, מתוך הפוסט הרשמי, התיעוד והכרזת החברה ב־X:

פריטGLM-5.3
מה זהאותו מודל־בסיס של 743B של GLM-5.2, עם post-training מוגדל — הארכיטקטורה ללא שינוי
קונטקסט1 מיליון טוקנים · פלט של עד 128 אלף
רמות מאמץlow · high · max (ברירת מחדל max)
שינוי ששובר קודכיבוי ה־thinking אינו נתמך עוד — קריאה ישנה עם thinking.type: "disabled" נכשלת
מחיר לטוקןלא פורסם — לטבלה הרשמית אין שורה של GLM-5.3 (זו של 5.2 עומדת על 1.40 דולר קלט / 4.40 דולר פלט)
זמינות ביום הראשוןGLM Coding Plan ו־ZCode. API ו־open weights: "בשלבים"
משקליםהובטחו לעוד כשבועיים, אחרי "safety evaluation and hardening"
רישיוןלא הוצהר — רישיון ה־MIT של GLM-5.2 אינו מתפרש אוטומטית

המשפט שמארגן את ההשקה כולה הוא זה של ההכרזה עצמה: השיפורים הגיעו מ־"post-training on the 743B base model". אותו בסיס, אותו גודל, מתכון חדש. שמרו את זה; הוא חוזר שני סעיפים הלאה.

השקת open weights בלי משקלים, בלי מחיר ובלי רישיון

שווה לומר את זה במפורש, כי הסיקור דילג על כך: ביום ההשקה, GLM-5.3 אינו מודל open weights. אין ריפוזיטורי ב־Hugging Face, אין model card, אין רישיון מוצהר, אין מחיר לטוקן וה־API הציבורי אינו פתוח. יש מנוי חודשי ו־agent קנייני. כל היתר הוא הבטחה עם תאריך — והתאריך הוא בדיוק זה שמשמש כטיעון האבטחה.


הטבלה בשלמותה

הפוסט מביא 16 בנצ'מרקים מול 7 מתחרים. הטבלה המלאה, מתומללת מהנתונים של הפוסט עצמו:

בנצ'מרקGLM-5.3GLM-5.2Kimi K3DeepSeek-V4 ProQwen3.8-MaxOpus 4.8Fable 5GPT-5.6 Sol
Terminal Bench 2.188.281.088.387.986.685.088.088.8
Terminal Bench 3.028.34.617.421.133.734.6
DeepSWE (v1.1)66.946.267.562.756.658.069.772.7
NL2Repo58.048.958.061.155.969.7
ProgramBench19.09.517.510.515.533.023.0
FrontierSWE78.167.566.588.2
SWE-Marathon (v1.1)42.519.448.148.833.142.5
PostTrainBench39.831.732.032.941.836.2
CyberGym84.577.280.083.378.578.183.883.6
ExploitGym (2h / 6h)105 / 13029 / 3936 / 7014 / 2680 / 120181 / 247216 / 293
ExploitBench54.424.432.228.840.078.076.5
Toolathlon Verified73.059.976.574.172.576.274.774.9
AutomationBench (v1.0.6)48.226.246.743.239.841.046.245.8
Agents' Last Exam (CLI)28.523.827.625.727.025.723.828.6
HLE עם כלים62.554.759.860.056.257.963.964.5
GDPval-AA v2 (Elo)17691508168215901739158817431730

הקפיצה מעל GLM-5.2 אמיתית וגדולה — Terminal Bench 3.0 מ־4.6 ל־28.3, ExploitBench מ־24.4 ל־54.4, SWE-Marathon יותר מהוכפל. אבל הקריאה הכנה של הטבלה כולה צנועה מהכותרת: ל־GLM-5.3 יש את המספר המוחלט הטוב ביותר בשלוש מתוך שש־עשרה השורות (CyberGym, ‏AutomationBench, ‏GDPval-AA). הטענה "most capable open-weights model for coding" נסתרת בידי הטבלה עצמה ב־ארבע מתוך שמונה שורות הקוד — Terminal Bench 2.1, ‏DeepSWE ו־SWE-Marathon לטובת Kimi K3, ‏NL2Repo לטובת DeepSeek —, ויש חמישית מחוץ למקטע הקוד, ב־Toolathlon, גם היא לטובת Kimi. כולם פתוחים.

הערה מתודולוגית — קראו לפני שאתם מצטטים את הטבלה הזאת. כל ההערכות הורצו בידי Z.ai עצמה, וכמעט כולן בתוך Claude Code 2.1.207, במאמץ max. ל־ExploitBench יש רק 41 משימות; תקציבי ה־ExploitGym מנורמלים לפי throughput בעזרת מספרים של Artificial Analysis, אבל רק לשלושה מודלים (GLM-5.3 ב־115 tok/s, ‏Kimi K3 ב־40, ‏Qwen3.8-Max ב־47) — השיטה שהוחלה על המודלים של Anthropic ושל OpenAI אינה מוצהרת. בשני בנצ'מרקים (SWE-Marathon ו־PostTrainBench) Z.ai הסירה בדיקות anti-cheat רשמיות, בנימוק של false positives. ו־Z.ai Code Bench, שעליו נשען המספר המצוטט ביותר בהשקה, הוא פרטי ובלתי ניתן לביקורת.

הפרט שבו הטבלה והגרף לא מספרים את אותו סיפור

שתי אי־עקיבויות שמתגלות רק בהצלבה של הנתונים עם האיור שפורסם.

העמודה של Anthropic היא שני מוצרים שונים. בטבלה, שם העמודה הוא Fable 5 (w/ fallback). באיור הסייבר ובטקסט הרץ, אותם המספרים (83.8 ב־CyberGym, ‏78.0 ב־ExploitBench, ‏181/247 ב־ExploitGym) מיוחסים ל־Mythos 5. אלה מודלים עם עמדות בטיחות שונות: שניהם חולקים את אותו מודל מתחת, אבל Fable 5 נושא אמצעי הגנה נוספים דווקא עבור יכולת דו־שימושית, ואילו Mythos 5 מוגש בלעדיהם לארגונים מאושרים — ושימוש דו־שימושי הוא בדיוק מה ששלושת הבנצ'מרקים האלה מודדים. במבחן של יכולת התקפית, לדעת אם אמצעי ההגנה היו דלוקים הוא המבחן. הפוסט לעולם לא מסביר את ה־"(w/ fallback)".

והמוביל של ExploitGym נעלם מהגרף. הטקסט אומר ש־"Mythos 5 remains well ahead at 181 and 247 tasks". לפי הנתונים של הטבלה עצמה, מי שנמצא הרחק מלפנים הוא GPT-5.6 Sol, עם 216 ו־293 — והעמודה שלו פשוט אינה קיימת בפאנל ה־ExploitGym של האיור הרשמי, אף שהמודל מופיע במקרא ומופיע בשני הפאנלים האחרים. המספר נמצא בטבלה; העמודה והמשפט, לא.


ה־ledger: ‏2,436 ממצאים, אחד נשלח למתחזק

כאן נמצא לב ההשקה, וכאן הראיה עשירה ביותר — כי Z.ai פרסמה את הנתונים.

הפוסט טוען: "After expert review, screening, and deduplication, the model identified 2.436 vulnerabilities across 269 projects, including 1.097 medium-to-high severity issues." ה־ledger הציבורי מפרט כל אחת מהן, עם חומרה, פרויקט, hash של commit ושלב בתהליך הגילוי המתואם. ספרתי את 2,436 הרשומות:

גרף waffle עם 2,436 נקודות, אחת לכל פגיעות ב־ledger הציבורי של Z.ai, צבועות לפי שלב: 2,239 בשלב הגילוי, 84 דווחו, 1 נשלחה למתחזק, 29 אושרו, 30 תוקנו ו־53 פורסמו בפומבי.2,436 הפגיעויות של ה־ledger של Z.ai, לפי שלבכל נקודה היא פגיעות · השלב הנוכחי בתהליך הגילוי המתואם, נקרא ב־14 באוגוסט 2026התגלתה2,239 · 92% — מעולם לא דווחהדווחה84 · 3.4%נשלחה למתחזק1 · 0.04%אושרה29 · 1.2%תוקנה30 · 1.2%פורסמה בפומבי53 · 2.2% — 37 בערב ההשקהמקור: ה־payload הציבורי של ה־ledger ב־cvd.z.ai/ledger/, נספר רשומה אחר רשומה ב־14 באוגוסט 2026. הסכום סוגר: 2,239 + 84 + 1 + 29 + 30 + 53 = 2,436.

הפאנל שבאתר מכריז על המספרים הגדולים: 2,436 ממצאים, 1,097 קריטיות וגבוהות, 269 פרויקטים, התקלה הוותיקה ביותר מ־1981, 26.6 שנות חיים בממוצע לפני הגילוי. כולם מתאימים לנתונים. מה שהפאנל לא מראה הוא ההתפלגות לפי שלב, והיא זו שמסייגת את טיעון האבטחה:

שלבממצאים
התגלתה (ולא יותר מזה)2,239
דווחה84
נשלחה למתחזק1
אושרה29
תוקנה30
פורסמה בפומבי53

בהגינות כלפי המספר: השלב הרשום הוא הנוכחי, ולכן 113 הממצאים שכבר עברו את "דווחה" — כולל 30 שתוקנו ו־53 שפורסמו — כן הגיעו לאיזשהו מתחזק. הבעיה אינה בראש המשפך אלא בבסיסו: 2,239 ממצאים נעצרים בשלב הגילוי, ועליהם הבטחת האחריות צריכה לדבר. אוסף שבו 92% מהפריטים תקועים לפני המגע הראשון הוא מלאי, לא תוכנית גילוי מתואם. זה לא הופך את הממצאים לשקריים; זה הופך את המשפט "אנחנו פועלים באחריות" להבטחה, לא להיסטוריה. והאתר אינו מפרסם שום מועד embargo — חיפשתי בכל קוד העמוד: אין מדיניות של 90 יום, ואף לא של מועד כלשהו. פגיעות קריטית בלי מועד גילוי היא פגיעות שנשמרת לזמן בלתי מוגבל. מתוך 107 הקריטיות, 92 עדיין ב"התגלתה".

שלושה דברים נוספים שהספירה חושפת:

  1. 37 מתוך 53 הפרסומים הפומביים יצאו ב־13 באוגוסט — ערב ההשקה. עד שלשום היו ל־ledger 16 פריטים פומביים.
  2. הממוצע של 26.6 שנים מגיע מ־244 רשומות, לא מ־2,436. רק 10% מהמאגר כולל שנת ההחדרה מלאה; בחישוב מחדש על אותן 244 יוצא 26.5 שנים. והבסיס מוטה: 88 מתוך 244 הן משנות ה־1980, עם 47 ב־1987 לבדה ו־20 ב־1981 — תקלות מתקופת הפרוטוקולים, שנספרות במימושים שונים (BIND, ‏Unbound, ‏Dnsmasq, ‏PowerDNS, ‏NetBSD, ‏Solaris, ‏Windows, ‏macOS…). המשפט "כל פגיעות הייתה מוסתרת בממוצע 26.6 שנים" מתאר תת־קבוצה נבחרת, לא את האוסף.
  3. החומרה "medium-to-high" של הפוסט היא דבר אחר. 1,097 של הפאנל הם critical (107)
    • high (990) — התווית של האתר עצמו היא "CRITICAL & HIGH". ‏Medium ומעלה היו מסתכמים ב־2,383. המספר נכון; שם התואר, לא.

מי מצא את 2,436 הפגיעויות

המשפט הרשמי הוא "the model identified 2,436 vulnerabilities". המטא־נתונים של ה־ledger מספרים אחרת — ועם שמות פרטיים. כל רשומה נותנת קרדיט לחוקר ולharness, ואף אחת לא נותנת קרדיט למודל:

חוקר שזוכה בקרדיטממצאיםharness שנעשה בו שימושממצאים
Clouditera Security1,364VulnForge1,364
מעבדת NASP (Tsinghua)325Claude Code (Anthropic)517
מעבדת AOSP (Nankai)212Vulcanix325
nsfocus205בלי harness מוצהר230
Z.ai Security2

הפוסט כנה בעניין הזה בשורה שכמעט כל הסיקור התעלם ממנה: "we have been working with several security teams in China to run our models against real-world codebases". זו תוכנית red team במיקור חוץ בהשתתפות ארבעה מוסדות, שבה Z.ai עצמה חתומה על שני ממצאים. 2,436 הם תוצאה של המכלול — מודל, כלי, צוות אנושי, ביקורת ודה־דופליקציה —, לא של מודל שנקרא כסוכן אוטונומי.

והנתון עם האירוניה הגדולה ביותר בהשקה: 517 מהממצאים (21%) הופקו עם Claude Code כ־harness — הכלי של Anthropic, אותה חברה שהמודלים שלה משמשים כתקרה בבנצ'מרקי הסייבר של הפוסט, ואותה חברה שבכליה Z.ai מריצה את כל ההערכות שלה. ה־harness אינו קובע את המודל: ‏Claude Code מדבר עם כל API, וקרוב לוודאי שהוא הפעיל GLM. אבל ה־ledger אינו מאפשר לאמת את זה — אין שדה של מודל — והאפקט הוא שהרישום הציבורי של יכולת GLM-5.3 נותן קרדיט, בחמישית מהמקרים, למוצר של המתחרה.


החריזה: שתי מעבדות בשבועיים, אותו מתכון

ב־1 באוגוסט כתבתי כאן על V4-Flash-0731 של DeepSeek, שההשקה שלו כולה הייתה "re-post-training, not a new design" — אותה ארכיטקטורה, קפיצה מ־7.3 ל־54.4 ב־DeepSWE. שבועיים אחר כך, Z.ai עושה בדיוק אותו דבר עם אותה אמירה: אותו בסיס של 743B, ‏Terminal Bench 3.0 מ־4.6 ל־28.3, והמשפט בהכרזה שאומר שהכול הגיע מה־post-training.

הכתבה ההיא הסתיימה בהימור שהחזית האג'נטית מוגבלת פחות בגודל המודל ויותר באיכות ה־pipeline של ה־post-training. שבועיים הם מעט מכדי לקרוא לזה מגמה, אבל המקרה השני הגיע מהר וממעבדה אחרת — ומשקיע עם היסטוריה בתחום רשם את אותה תדהמה באותו יום: "Something has happened with post-training as shown by DeepSeek flash & GLM-5.3 updates. Same base, big improvement in perf to frontier levels. Can't explain this by even logit distillation."

המתכון, שוב, אינו מפורסם. הסטאק המצוטט — IndexCache ל־sparse attention, ‏SAO ל־RL אסינכרוני והפריימוורק slime — ציבורי ומתועד, אבל המאמרים מתארים את GLM-5.2: התקציר של SAO אומר מילולית שהוא שימש ב־5.2, וה־README של slime מונה מודלים עד 5.2. ההרחבה ל־5.3 היא טענה של פוסט ההשקה, לא של המאמרים. שווה לציין גם ש־IndexCache הוא הנדסת inference, לא של post-training — פי 1.82 ב־prefill, פי 1.48 ב־decode. לתייק את זה תחת "מתכון ה־post-training" זו נדיבות של הנרטיב כלפי עצמו.


מה הקהילה ראתה ב־24 שעות

הת'רד של ההשקה ב־Hacker News עבר 530 נקודות ו־230 תגובות ביום הראשון, והוויכוח לא היה על בנצ'מרקים — הוא היה על מי מורשה להשתמש ביכולת התקפית.

הספקנות כיוונה בדיוק לטיעון האבטחה. התגובה הישירה ביותר היא של cubefox: "What safety evaluation? What safety hardening? They already evaluated it and found it to be highly capable at exploiting security vulnerabilities." קורא אחר, tmsh, סיכם את הספק הטכני בשש מילים: "Is post-training magic just overfitting to benchmarks?" מחוץ ל־HN, הביקורת החדה ביותר הייתה של Lou: "Open weights in two weeks is a tease, not openness."

וצץ נושא שלא ציפיתי שישלוט בשיחה: סירוב. מפתחים רבים סיפרו שהם עוברים למודלים סיניים לא בגלל מחיר או איכות, אלא כי המודלים המערביים מסרבים לעבודת אבטחה לגיטימית. SwellJoe: "The Fable guardrails have trained me to pretty much exclusively use Opus when using Claude Code (lately I'm focused on a lot of security and security-adjacent stuff, which Fable refuses to do)." 112233 הרחיק לכת: "Why should I apply for cybersecurity approval in order to have model debug a program it is writing itself?" ו־ virgildotcodes ניסח את הטיעון המבני: "we have a world of attackers using open and closed source models against a much smaller group of maintainers".

גם הטיעון הנגדי היה שם, והוא כנה: wren6991 העיר שזה "quite hard to separate Mythos the model from Mythos the campaign" — יכולת ונרטיב שיווקי נעשים בלתי נפרדים כששניהם מוכרזים יחד. ההערה תקפה במלואה גם להשקה של היום.

מה שהרשים טכנית היה הגודל. wren6991 שוב: ‏GLM-5.3 עושה את זה עם "one quarter the total parameter count of K3 (and 40% active parameter count)". ו־ unrvl22: "this is 744b and its head to head with Kimi K3 (2.8T), smashes DS v4 pro (1.5T)".


מה שעדיין לא קיים

שווה לרשום את הרשימה, כי היא קצרה ומכרעת. עד הבוקר, Artificial Analysis אינה מפרטת את GLM-5.3 באף אחד מהעמודים שלה — בלי מדד אינטליגנציה, בלי מחיר, בלי מהירות נמדדת. זה נורמלי ביום ההשקה, עם פרט אחד שאינו: ‏Z.ai מצטטת את Artificial Analysis כמקור לשני מספרים בהכרזה שלה עצמה (115 ה־tok/s שמנרמלים את ExploitGym ו־1,769 של GDPval-AA v2). שניהם מופיעים רק בחומר של Z.ai.

גם אלה אינם קיימים: משקלים, רישיון, model card, מחיר לטוקן, API ציבורי וכל שחזור עצמאי של כל מספר בהשקה הזאת.


מה הייתי עושה עם זה

לא בדקתי את GLM-5.3 — ביום ההשקה לא היה מה לבדוק מחוץ למנוי. איפה הייתי מסתכל:

להתייחס ל־ledger כאל המוצר המעניין ביותר, ולדרוש את המועד. הרעיון של רישום ציבורי, עם hash של commit לכל ממצא, הוא טוב וראוי שיהפוך לתקן — Z.ai ממציאה בפומבי תהליך שהמעבדות הסגורות מריצות בפרטיות. אבל מה שהיא פרסמה היום הוא מלאי שבו 92% מהפריטים תקועים בשלב הגילוי ובלי מועד embargo מוצהר. השאלה שצריך לשאול בעוד שבועיים אינה "המשקלים יצאו?", אלא "כמה מאותם 2,239 הגיעו למתחזק?". המספר הזה הוא המבחן של טיעון האבטחה כולו.

לא לבלבל בין harness למודל — בשני הכיוונים. ההשקה מודדת הכול בתוך Claude Code ונותנת לו קרדיט על 517 ממצאים. אם אתם משווים מודלים, הסרגל צריך להיות שלכם: אותו harness, אותם כלים, אותו תקציב טוקנים. זה תקף לבנצ'מרק שאתם קוראים ולמבחן שאתם מריצים.

למדוד יעילות טוקנים, לא רק דיוק. המספר שהכי ניתן להגנה בהשקה אינו הגדול ביותר: ‏GLM-5.3 מגיע ל־31.4% במאמץ high תוך הוצאה של כ־50 אלף טוקני פלט למשימה, לעומת 29.5% של Opus 4.8 בהוצאה של 120 אלף. זו אותה רמה בפחות ממחצית ההוצאה. אבל הבנצ'מרק פנימי ופרטי, והשוואת high של האחד מול max של האחר היא בחירה של מי שמפרסם — ב־max, ‏GLM-5.3 מגיע ל־34.5% ו־Fable 5 מוביל עם 39.5%. אם עלות למשימה שהושלמה היא הקריטריון שלכם, זו השורה שיש לשחזר עם ה־backlog שלכם.

ולחכות לשבועיים לפני שקוראים לזה פתוח. מודל בלי משקלים, בלי רישיון ובלי מחיר אינו מודל פתוח באיחור — הוא הכרזה. אם המשקלים ייצאו תחת MIT בסוף אוגוסט, ההשקה תהפוך למה שהיא מבטיחה להיות. עד אז, הדבר היחיד הניתן לביקורת ש־Z.ai סיפקה הוא ה־ledger. וה־ledger, אחרי ביקורת, אומר פחות מהכותרת.


מקורות

מספרי הבנצ'מרקים תומללו מהנתונים של הפוסט הרשמי עצמו (העמוד הוא אפליקציית JavaScript; הנתונים מגיעים בחבילה שהוא טוען) ונבדקו מול האיורים שפורסמו ומול הטבלה של Kingy AI — שלושת המקורות מתאימים. ספירת ה־ledger היא שלי: הורדתי את ה־payload הציבורי של cvd.z.ai/ledger/ ב־14 באוגוסט 2026 וספרתי את 2,436 הרשומות לפי שלב, חומרה, חוקר ו־harness; הסכום לפי שלב סוגר ב־2,436 והחומרה משחזרת את הפאנל שבאתר (107 קריטיות + 990 גבוהות = 1,097). ממוצע 26.5 השנים שחישבתי מחדש משתמש באותן 244 רשומות עם שנת הכנסה החדרה מלאה. היעדר מדיניות של מועד embargo אומת בחיפוש בקוד העמוד. ציטוטי הקהילה נאספו ב־14 באוגוסט 2026 ואומתו אחד־אחד מול המקור המקורי — אלה של Hacker News דרך ה־API הציבורי של Algolia, ואלה של X דרך התוכן הגולמי של כל פוסט — וכל אחד מהם מקושר. ניקוד הת'רד הוא זה של רגע האיסוף. המחירים והיעדר שורת GLM-5.3 נבדקו מחדש בטבלה הרשמית של Z.ai ב־14 באוגוסט 2026; היעדר המודל ב־Artificial Analysis אומת בעמודי המודלים, ה־leaderboard ו־GDPval-AA באותו בוקר.