שלוש ספירות של "כמה מודלי שפה קיימים" — 274, 95 ו-403,420 — כולן נכונות, וההבדל ביניהן אינו טעות של מישהו: זו הגדרת "מודל". הלכתי לבדוק את הסטטיסטיקות של LLM (large language model, מודל השפה בקנה מידה גדול שעומד מאחורי ChatGPT, Claude ואחרים) שמסתובבות באוספים משנת 2026, ומצאתי בעיה גדולה יותר מהספירה: ה-benchmark של תכנות שמשמש כסרגל ל"מי מוביל" הוכרז כמזוהם על ידי היוצר שלו עצמו בפברואר, שהפסיק לפרסם את הציון — ושישה חודשים אחר כך הוא עדיין הסרגל.
הסרגל שיצא מהבדיקה מצטמצם לשתי שאלות. "מודל לפי מי?" פותר את הספירה. "ציון שניתן על ידי מי, לאיזו גרסה, במבחן שעדיין מודד?" פותר את לוח התוצאות. אף מספר במאמר הזה אינו שקרי. כמעט כולם משנים משקל כשהתג מצטרף אליהם.
הערה מתודולוגית. כל מספר נבדק מול המקור המקורי — model card (תעודת הזהות הטכנית שהמעבדה מפרסמת עם המודל), PDF, paper, עמוד מחירים רשמי או API פומבי — ב-26 באוגוסט 2026. שלוש מדידות הן שלי וניתנות לשכפול: ספירת המאגרים ב-Hugging Face (הפקודה בסוף המאמר), קריאת הטבלה המלאה של Vals AI (86 מודלים, שנשלפה מה-HTML של העמוד, לא מהתקציר), וטבלת המחירים של שבעה ספקים שנקראה בעמודים הרשמיים. במקום שהמקור קיים רק בעותק מאורכב (OpenAI חוסמת קריאה אוטומטית), הטקסט אומר "Wayback". חילוץ אוטומטי ראשון של המחירים של xAI הגיע מפוברק ונפסל — הפרשה מופיעה בסעיף המחירים, וזו הסיבה שמחיר נכנס לכאן רק מעמוד רשמי שנקרא בעיניים. אין Reddit ולא X במאמר הזה: הקהילה היא Hacker News, שבו לכל תגובה יש id.
לוח הניקוד של הבדיקה
הפסיקה לפני הטיעון, כי זה מה שמסתובב בעצמו. "מה שמסתובב" הוא מה שאוספי הסטטיסטיקות של LLM חוזרים עליו ב-2026 — העמוד הגרמני שהניע את הכתבה הזו הוא הדוגמה המלאה ביותר שמצאתי, עם 274 מודלים בקטלוג ו-235 קישורים.
| מה שמסתובב | פסק דין |
|---|---|
| "יש 274 LLM-ים, מ-35 ספקים" | ⚠️ זה הקטלוג של אתר. ל-Hugging Face יש 403,420 מאגרים עם התג; ה-AI Index של סטנפורד סופר 95 "בולטים" ב-2025. שלוש הגדרות, שלושה מספרים |
| "Claude Fable 5 מוביל בתכנות עם 95.0% ב-SWE-bench Verified" | ⚠️ 95.0% מתאים ב-System Card של Anthropic (ממוצע של 5 ניסיונות). לא מוביל: באותה טבלה Mythos 5 עושה 95.5%, ובהערכה עצמאית Opus 5 עושה 97.0% |
| "DeepSeek-V4-Pro: 80.6%, כ-8 נקודות אחרי Opus 4.8" | ❌ 80.6% הוא הציון של הגרסה מאפריל. הגרסה הנוכחית (0813) מודדת 96.4% בהערכה העצמאית — 8 נקודות לפני Opus 4.8. והתעודה של הגרסה החדשה לא מפרסמת בכלל את המדד הזה |
| "GPT-5.5: 82.6% ב-Vals-AI-Harness" | ✅ 82.6% מתאים (Vals AI, 19/08/2026). אבל "Vals-AI-Harness" אינו benchmark: זה SWE-bench Verified שרץ על ידי Vals — ובאותה טבלה, 82.6% נמצא 14.4 נקודות מהמוביל |
| "GPT-5.5 Pro הוא היקר ביותר: 30 דולר למיליון tokens בכניסה" | ❌ o1-pro, שעדיין נמכר, עולה 150 דולר — פי חמישה יותר. ה"מקדם 600" בין הזול ביותר ליקר ביותר הוא, בקטלוג האמיתי, מקדם 3,000 |
| "OpenAI מחזיקה 35 מודלים, Anthropic 19, Google 18" | ❌ אותו עמוד אומר 38, 20 ו-27 חמישה סעיפים אחר כך |
| "AI Index: ארה״ב השיקה כ-60 מודלים בולטים ב-2025, סין כ-35; יותר מ-90% מגיעים מהתעשייה" | ✅ מתאים: 59 ו-35; 91.2% |
| "ל-GPT-4 יש 1.76 טריליון פרמטרים (הערכה)" | ⚠️ זה מעולם לא היה של OpenAI: הדוח הטכני אומר שהוא לא חושף את הגודל. המספר מגיע מ-George Hotz ומ-SemiAnalysis (2023). העמוד מקשר ל-Wikipedia |
| "Llama 4 Scout ו-Qwen-Long: 10 מיליון tokens של הקשר" | ⚠️ מתאים עם כוכבית: Qwen-Long מגיע ל-10 מיליון רק דרך upload של קובץ (טקסט מודבק: 1 מיליון); Scout אומן עם 256 אלף |
| "Gemini 3.1 Pro: 94.3% ב-GPQA Diamond; Kimi K3: 93.5%" | ⚠️ 93.5% מתאים במאגר של Kimi K3 (self-report). את ה-94.3% לא מצאתי בעמוד של Google. ובהערכה העצמאית שניהם כבר נעקפו |
| "6 מתוך 10 המובילים ב-Chatbot Arena סגורים" | ⚠️ בטבלה מ-21/08/2026 לא מצאתי אף מודל עם משקלים פתוחים בין עשרת הראשונים (הראשון שברור שהוא פתוח הוא ה-13; הסתייגות: ה-10 הוא kimi-k3-max, וריאנט של מודל שהמשקלים הבסיסיים שלו פתוחים). וה-Arena מודדת העדפה בשיחה, לא קוד |
| "Kimi K3: 2.8 טריליון פרמטרים, 896 מומחים, משקלים פתוחים ב-27/07, 3 דולר / 15 דולר" | ✅ הכול מתאים בתעודה הרשמית — וחסר המחיר עם cache (0.30 דולר), פי עשרה פחות |
שלוש מתאימות נקי, שלוש שגויות, שש קיימות עם התג הלא נכון. שימו לב שהטעויות החמורות הן כולן טעויות השוואה, לא טעויות מספר: כל ציון בודד נמצא במקור שהעמוד מצטט. מה שלא נמצא בשום מקום הוא הסרגל שמתיר להציב שני ציונים זה לצד זה.
הסרגל: "מודל לפי מי?"
"כמה מודלים קיימים" היא השאלה הפשוטה ביותר בנושא ואין לה תשובה — לא כי חסר נתון, אלא כי יש עודף של הגדרות. האיור מסכם את השלוש שמופיעות באוספים; שאר הסעיף מראה ששלושתן נכונות.
שימו לב לתיבה הראשונה. Hugging Face הוא המחסן הציבורי שבו מעבדות ואנשים מפרסמים
מודלים, וכל פרסום הוא "מאגר". שאלתי את עמוד החיפוש של האתר כמה מאגרים נושאים
את התג text-generation (יצירת טקסט, התג של ה-LLM-ים): 403,420 ב-04:43 של 26 באוגוסט;
403,535 ב-11:55 של אותו יום. המספר גדל תוך כדי הקריאה, כי הוא סופר הכול — כל עותק דחוס,
כל כוונון עדין שסטודנט עשה, כל גרסת בדיקה. המאגר הכי מורד מהאצווה (24.4 מיליון הורדות) הוא
Qwen3-0.6B, מודל קטן מדי כדי להופיע בכל דירוג יכולת שהוא.
התיבה השנייה היא ההפך: רשימה שנעשית ביד. ה-AI Index של סטנפורד משתמש במאגר של Epoch AI, שמסמן מודל כ"בולט" בזכות פריצת דרך טכנית, חשיבות היסטורית או ציטוטים — והדוח מזהיר, בטקסט: "This is a manual curation, so the dataset is not a census of all AI models" ("זו אצירה ידנית, ולכן מערך הנתונים אינו מפקד של כל מודלי ה-AI"). לפי הקריטריון הזה, ל-2025 היו 93 מודלים בולטים מהתעשייה ו-2 מהאקדמיה — 95. באיור הבא באותו פרק, שמסווג את ההשקות לפי סוג הגישה, בסיס החישוב הוא 102. אותו דוח, שתי ספירות, הפרש של שבעה מודלים — כי החתכים שונים.
התיבה השלישית היא הקטלוג העורכי: מישהו מחליט מה "נחשב מודל" עבור הקהל שלו. העמוד הגרמני מציג רשימה של 274, מ-35 ספקים — וסותר את עצמו בתוך הגוף שלו: בסעיף 2 ל-OpenAI יש 35 מודלים, ל-Anthropic 19 ול-Google 18; בסעיף 7, 38, 20 ו-27, ומופיעה Alibaba עם 42 שסעיף 2 לא הזכיר. זו לא חוסר יושר; זה מה שקורה כשלקטלוג יש חתכים שונים ("מודלים פעילים" באיור אחד, "כל ההיסטוריה" באחר) ואף אחד לא כותב את החתך ליד המספר.
אף אחת משלוש הספירות לא עונה על שאלת הקורא, שהיא "כמה מודלים חשובים לי" — ואת זו רק הוא יכול לספור. מה שאפשר לעשות הוא להראות את אותו ספק תחת שלוש ההגדרות, כדי שגודל התהום ייראה.
שימו לב ל-OpenAI: 5 מאגרים, 20 מודלים בולטים, 38 בקטלוג — אותה חברה, אותה שנה.
ב-Hugging Face היא כמעט לא קיימת (פרסמה רק את המודלים הפתוחים gpt-oss), ו-Anthropic לא
קיימת בכלל: אפס מאגרים, כי לאף מודל Claude אין משקלים מפורסמים. באצירה של Epoch AI הסדר
מתהפך: OpenAI היא זו שהשיקה הכי הרבה מודלים בולטים ב-2025, ואחריה Google (14) ו-Alibaba
(11). ובקטלוג העורכי Alibaba מובילה, כי העורך החליט לרשום כל וריאנט של Qwen. המשפט
"לחברה X יש יותר מודלים" לא אומר כלום בלי ההגדרה לצדו — ושלוש ההגדרות הופכות את הפודיום.
ציון שניתן על ידי מי: מבחן הקוד שהיוצר נטש
בכל אוסף מ-2026 יש סעיף "מי הכי טוב בתכנות", והסרגל תמיד אותו הסרגל: SWE-bench Verified, benchmark (מבחן סטנדרטי שנותן ציון למודל) עם 500 בעיות אמיתיות שנלקחו ממאגרי קוד פתוח — המודל מקבל תיאור של תקלה וצריך לתקן אותה; מערך של בדיקות אוטומטיות אומר אם הוא צדק. העמוד הגרמני מפרסם ארבעה ציונים: Claude Fable 5 עם 95.0%, Opus 4.8 עם 88.6%, DeepSeek-V4-Pro עם 80.6% ו-Kimi K2.6 עם 80.2%, ומסיק שה-DeepSeek נמצא "בערך 8 נקודות מאחור". הלכתי אחרי הארבעה. כולם נמצאים במקור המצוטט. ואף אחת מההשוואות לא עומדת, משלוש סיבות שנערמות.
הסיבה הראשונה היא החמורה ביותר והפחות מצוטטת. ב-23 בפברואר 2026 OpenAI — שיצרה את ה"Verified" באוגוסט 2024, כשעברה על 1,699 בעיות מ-SWE-bench המקורי עם מהנדסים אנושיים עד שנשארו 500 — פרסמה טקסט שכותרתו "Why SWE-bench Verified no longer measures frontier coding capabilities" ("למה SWE-bench Verified כבר לא מודד יכולות תכנות חלוציות"). שתי מסקנות, מצוטטות מהמקור:
"We audited a 27.6% subset of the dataset that models often failed to solve and found that at least 59.4% of the audited problems have flawed test cases that reject functionally correct submissions."
בעברית: "בדקנו תת-קבוצה של 27.6% מהמערך שהמודלים לעיתים קרובות נכשלים לפתור וגילינו שלפחות 59.4% מהבעיות שנבדקו כוללות מקרי בדיקה פגומים, שדוחים פתרונות נכונים מבחינה פונקציונלית."
"In our analysis we found that all frontier models we tested were able to reproduce the original, human-written bug fix [...] indicating that all of them have seen at least some of the problems and solutions during training. [...] This is why we have stopped reporting SWE-bench Verified scores, and we recommend that other model developers do so too."
בעברית: "בניתוח שלנו גילינו שכל מודלי החזית שבדקנו הצליחו לשחזר את התיקון המקורי, שנכתב בידי בני אדם [...], מה שמעיד שכולם ראו לפחות חלק מהבעיות והפתרונות במהלך האימון. [...] לכן הפסקנו לפרסם ציוני SWE-bench Verified, וממליצים שגם שאר מפתחי המודלים יעשו את אותו הדבר."
בתרגום המנגנון למי שלא מתכנת: המבחן משתמש בבעיות ציבוריות, עם הפתרונות הציבוריים לצדן, שנלקחו מאותם מאגרים שהמעבדות משתמשות בהם לאימון. ייתכן שהמודל "ראה את המבחן עם המחוון" לפני שביצע אותו. OpenAI מדדה את מה שנשאר מהקִדמה — "improving from 74.9% to 80.9% in the last 6 months" ("משתפר מ-74.9% ל-80.9% ב-6 החודשים האחרונים") — והחליטה שמה שעולה מכאן ואילך מודד חשיפה למבחן, לא יכולת. שישה חודשים אחר כך, הטבלה של המעריך העצמאי מראה שבעה מודלים עם 95% ומעלה. הדיון הגיע ל-Hacker News באפריל (343 נקודות, 181 תגובות); השורה עם הכי הרבה קולות מסכמת את הספקנות במשפט אחד: "Goodhart's Law in reverse, what can't be gamed gets rejected" ("חוק גודהארט הפוך: מה שלא ניתן לרמות בו נדחה" — תגובה 47911060). קורא אחר: "This feels very much like 'we are now moving the goal posts'" ("זה מרגיש מאוד כמו 'עכשיו אנחנו מזיזים את השערים'", 47910902). שתי הקריאות אפשריות. מה שלא אפשרי הוא להשתמש, באוגוסט, בסרגל שהיצרן אסף בפברואר בלי לומר זאת לקורא.
התוצאה המעשית כבר נמצאת בתעודות הטכניות: OpenAI כבר לא מפרסמת את הציון, והמעבדות הפתוחות עוברות למדד אחר. ב-System Card של Fable 5, העמודה "GPT-5.5" בשורת SWE-bench Verified נושאת קו מפריד. בתעודה של Kimi K2.6, העמודה "GPT-5.4", אותו דבר. Kimi K3, Qwen 3.8 ו-GLM-5.2 כבר לא מדווחים את המדד הקלאסי — הם החליפו אותו ב-SWE-bench Pro, DeepSWE, FrontierSWE. המקום היחיד שבו כולם עדיין ניתנים להשוואה הוא מעריך חיצוני, שמריץ את המבחן הישן עם אותו harness (מערך הכלים שהמודל מקבל כדי לעבוד) לכולם. זו Vals AI, ובה מופיעה הסיבה השנייה.
שימו לב קודם למה שלא השתנה בין הבלוק האפור לכחול. הציון ש-Anthropic מפרסמת ל-Fable 5 (95.0%, ממוצע של חמישה ניסיונות, ב-System Card) הוא אותו ציון ש-Vals מודדת מבחוץ; גם זה של Opus 4.8 (88.6% בשניהם). DeepSeek מפרסמת 80.6% ל-V4-Pro מאפריל, במצב ההיגיון היקר יותר; Vals מודדת את אותו מודל ב-77.4%. Kimi K2.6: 80.2% מול 76.2%. ה-self-report (הציון שהמעבדה נותנת לעצמה) עומד באימות: במקום שבו אותו מודל נמדד על ידי שניהם, ההפרש נע בין אפס לארבע נקודות. זה סותר את ההשערה שממנה יצאתי — ציפיתי שההערכה העצמאית תפיל את הציונים הרשמיים — והתוצאה מתפרסמת בכל זאת.
מה שלא עומד הוא הבלוק הזהוב. ה"80.6%" שמסתובב שייך ל-DeepSeek-V4-Pro Preview,
שפורסם ב-22 באפריל; התעודה עודכנה לאחרונה ב-22 ביוני. ב-13 באוגוסט DeepSeek השיקה
את הגרסה הסופית, DeepSeek-V4-Pro-0813, במאגר נפרד — והתעודה החדשה לא מפרסמת שום
ציון SWE-bench Verified (משתמשת ב-DeepSWE, Cybergym ואחרים). מי שמודד את ה-0813 היא
Vals: 96.4%, מקום שני מתוך 86 מודלים, אחרי רק Opus 5 (97.0%) ולפני GPT-5.6 Sol,
Grok 4.6 ו-Fable 5 עצמו. המשפט "DeepSeek נמצא 8 נקודות מאחורי Opus 4.8" משווה את הציון
מאפריל של אחד עם הציון ממאי של השני; עם הגרסאות מאוגוסט, DeepSeek נמצא 8 נקודות
לפני. אף אחד משני המספרים אינו שקרי. ההשוואה כן.
הסיבה השלישית היא הבנאלית ביותר: הובלה ב-benchmark יש לה תוקף של שבועות. העמוד הגרמני
הוא מ-23 באוגוסט ואומר ש-Fable 5 "מוביל עם 95.0%". באותו System Card שמביא את ה-95.0%,
Mythos 5 עושה 95.5%. ב-Vals, מ-19 באוגוסט, Opus 5 עושה 97.0%. וה"82.6% ב-Vals-AI-Harness"
מאותו עמוד הוא הציון היחיד שמגיע ממעריך עצמאי — עם השם השגוי ("Vals-AI-Harness" אינו
benchmark, זו Vals שמריצה את SWE-bench Verified עם ה-harness mini-swe-agent, רק עם
שורת הפקודה bash) ובלי ההקשר: באותה טבלה, 82.6% נמצא 14.4 נקודות מהמוביל. כבר סיפרתי
כאן איך DeepSeek פרסמה את הטבלה שבה היא עצמה מפסידה 9 ל-0
ואיך Z.ai דחתה את המשקלים של GLM-5.3 ופרסמה מה שהמודל חשב: המעבדות היו
כנות יותר בתעודות מאשר הסיקור שמסכם אותן.
הסרגל של הסעיף הזה, בשורה אחת: ציון benchmark משווה רק כשארבעת השדות תואמים — אותו מבחן, אותו מערך כלים, אותה גרסה, אותו תאריך. הסיקור נוטה לפגוע בראשון ולהתעלם משלושת האחרים.
מה זה עולה: אותו מבחן, עם העמודה שאף אחד לא מפרסם
אם הציון הבודד לא מכריע כלום, מה כן מכריע? בטבלה של Vals יש עמודה שאף אוסף לא מעתיק: עלות למשימה, בדולרים, לאותו מבחן שרץ על אותו מערך כלים. זו ההשוואה היחידה של מחיר שחוצה ספקים בלי להיות תלויה בכמה tokens (חתיכות הטקסט שהמודל קורא ומייצר, יחידת החיוב) כל אחד מוציא כדי לחשוב — כי היא מודדת את ההוצאה האמיתית, בסוף המשימה.
שימו לב לשתי הנקודות הגבוהות ביותר: Opus 5 פותר 97.0% מהמשימות ב-US$ 1.29 כל אחת; DeepSeek-V4-Pro-0813 פותר 96.4% ב-US$ 0.10. שישה עשיריות נקודה עולים פי שנים עשר וחצי המחיר. ושימו לב לנקודה הימנית ביותר: Fable 5, ב-US$ 2.05 למשימה, פותר פחות מ-Opus 5 ועולה יותר — ה-System Card מסביר שהציון של Fable "משקף את אמצעי ההגנה של הייצור שלו", כלומר, המודל היקר ביותר של Anthropic אינו זה שהכי מדייק במבחן הזה. בצד הזול, GPT-5.6 Luna עושה 93.0% בארבעה סנט, ו-DeepSeek V4 Flash, 88.8% בסנט אחד — אותו ציון של Opus 4.8, שעולה US$ 1.92 למשימה. כבר הראיתי כאן, במדידת 43 אלף שיחות, שמחיר לטוקן אינו עלות למשימה; הטבלה הזו היא אותו לקח עם מעריך אחר.
זה מסביר למה ה"יקר ביותר" וה"זול ביותר" של האוספים כמעט אף פעם לא תואמים לקטלוג.
העמוד הגרמני אומר שהמחירים נעים בין US$ 0.05 (GPT-5 nano) ל-US$ 30 (GPT-5.5 Pro) למיליון
tokens בכניסה — "מקדם של 600". בטבלה הרשמית של OpenAI, שנקראה ב-26 באוגוסט, o1-pro
עדיין נמכר ב-US$ 150 בכניסה ו-US$ 600 ביציאה; gpt-5.4-pro עולה את אותם US$ 30 של
5.5 Pro. המקדם האמיתי בין הזול ביותר ליקר ביותר בקטלוג הוא 3,000. ומחיר הטבלה
אפילו לא המחיר: DeepSeek גובה על V4-Pro-0813 US$ 1.32 למיליון tokens בכניסה בשעות
העומס ו-US$ 0.66 מחוצה להן, ויורד ל-US$ 0.044 כשהבקשה חוזרת על טקסט שכבר עובד
(cache hit, הפגיעה במטמון). Kimi K3 עולה US$ 3 במחירון ו-US$ 0.30 עם cache.
מספר מחיר יחיד למודל הוא בחירה עורכית, לעולם לא עובדה.
פרנתזה על שיטה, כי היא משנה במה כדאי לכם לבטוח. באיסוף החומר למאמר הזה, חילוץ אוטומטי ראשון של עמוד המחירים של xAI החזיר טבלה שלמה, סבירה, עם מודלים וערכים — ומפוברקת: בעמוד האמיתי היה מודל אחד (Grok 4.6, US$ 2 / US$ 6) והכלי מילא את השאר. היא נפסלה ונבנתה מחדש ביד. זו הסיבה שמחיר נכנס לכאן רק מעמוד רשמי שבן אדם קרא, עם תאריך; כל אוסף שלא אומר מאיפה לקח את המחיר נמצא צעד אחד מאותה טעות.
פרמטרים והקשר: המספר הענק הוא תמיד של מודל פתוח
אחרי "מי מוביל" באה "מי הכי גדול". כאן התבנית מתהפכת: המספרים הגדולים ביותר שפורסמו הם כולם של מעבדות שפותחות את המשקלים (המיליארדים של המספרים שמרכיבים את המודל, מפורסמים להורדה), ולמודלים המובילים הסגורים אין מספר בכלל.
שימו לב לבלוק התחתון: ארבעה פסים ריקים. זה לא היעדר נתון באיסוף שלי; זה נתון שלא קיים. הדוח הטכני של GPT-4 אומר, בטקסט: "this report contains no further details about the architecture (including model size)" ("הדוח הזה לא מכיל פרטים נוספים על הארכיטקטורה, כולל גודל המודל"), בגלל "נוף תחרותי" ו"השלכות ביטחוניות". ה"1.76 טריליון" שכל אוסף חוזר עליו נולד ביוני 2023, מהשערה של George Hotz (מייסד Comma.ai) — שמונה מודלים של 220 מיליארד — ומדוח של SemiAnalysis, חברת ניתוח מוליכים למחצה. OpenAI מעולם לא אישרה ולא הכחישה. העמוד הגרמני מסמן את המספר כהערכה, וזה נכון; ומקשר, כמקור, ל-Wikipedia — ששם השמועה קובצה.
בבלוק העליון, המספרים אמיתיים ונבדקו תעודה אחר תעודה, עם ניואנס שהאוספים משמיטים: כמעט כולם MoE (mixture of experts, תמהיל מומחים — למודל יש הרבה בלוקים ומשתמש במעטים בכל פעם). ל-Kimi K3 יש 2.8 טריליון פרמטרים בסך הכול, אבל הוא מפעיל 16 מתוך 896 מומחים לכל token: 104 מיליארד עובדים בכל פעם, 3.7% מהסך הכול. DeepSeek-V4-Pro: 1.6 טריליון בסך הכול, 49 מיליארד פעילים. להשוות "2.8 טריליון" עם 175 המיליארד של GPT-3 מ-2020 — שהשתמש בכולם בבת אחת — זה כמו להשוות את גודל הבניין למספר החדרים המוארים.
חלון ההקשר (כמה טקסט המודל מסוגל לקרוא בבת אחת) נופל לאותה מלכודת. העמוד אומר ש-Llama 4 Scout ו-Qwen-Long "מובילים עם 10 מיליון tokens" — בערך שלושים כרכים של Harry Potter. שני המספרים נמצאים במקורות הרשמיים. Meta אומרת גם ש-Scout אומן עם 256 אלף tokens של הקשר ומגיע ל-10 מיליון בזכות הכללת אורך (טכניקת אקסטרפולציה, לא משטר האימון). Alibaba אומרת ש-Qwen-Long מגיע ל-10 מיליון רק דרך upload של קובץ עם הפניה לפי מזהה; טקסט שמודבק ישירות בהודעה עוצר ב-1 מיליון. ו-Kimi K3, עם המספר הגדול ביותר של פרמטרים, יש לו הקשר של 1,048,576 tokens — מיליון אחד, לא עשרה. כבר הסברתי כאן מה חלון ההקשר עולה בזיכרון כשהמודל רץ על המחשב שלכם; הלקח הוא אותו: המספר על העטיפה הוא התקרה התאורטית, והתעודה מביאה את התנאים.
פרמטרים והקשר הם שני הנתונים הסטטיסטיים שבהם המספר הרשמי הוא תמיד הגדול ביותר האפשרי — והערת השוליים תמיד קטנה יותר.
ברזיל: ההשוואה היחידה של עלות בריאלים
אף אוסף בינלאומי של סטטיסטיקות LLM לא כולל שורה על ברזיל — לעמוד הגרמני יש אפס. הלכתי לחפש מה קיים במקור רשמי ומצאתי יותר ממה שציפיתי, עם שלילה אחת באמצע.
שימו לב שהאיור הוא של עלות, לא של ציון — וזו ההשוואה היחידה של עלות חבילה שלמה במטבע לאומי שמצאתי במקור רשמי. Maritaca AI, מקמפינס, מפרסמת את משפחת Sabiá 4 עם מחיר בריאלים: R$ 5 למיליון tokens בכניסה ו-R$ 20 ביציאה ב-Sabiá 4 (R$ 40 בגרסת Thinking, שחושבת לפני שהיא עונה), R$ 1 ו-R$ 4 ב-Sabiazinho 4, ו-30% יותר בוריאנטים "BR-SP", עם "היסק ועיבוד המתבצעים 100% בשטח הלאומי". אותו תיעוד מפרסם את הציונים של Sabiá 4 במבחנים ברזילאיים (97.4% בחוקים ברזילאיים; 86.6% במצרף ENEM/USP/OAB; ציון 7.49 מתוך 10 בכתיבת מסמך משפטי) ואת עלות הרצת החבילה השלמה בכל מתחרה: R$ 206 ב-Sabiá 4 Thinking, R$ 281 ב-Gemini 3.1 Pro, R$ 449 ב-GPT-5.4, R$ 590 ב-Opus 4.8. זה self-report — זו החברה מודדת את המתחרים עם המבחנים שלה — וזה נכנס לכאן עם התג הזה, לפי אותו סרגל של הסעיף הקודם: הציון תקף כהצהרת המעבדה עד שמישהו יריץ אותו מבחוץ.
השלילה: לא קיים פרויקט בשם "BR-LLM", למרות שהמונח מסתובב. מה שכן קיים, במקור רשמי או בעיתונות, הן יוזמות עם שם משלהן — Sabiá (Maritaca), Amazônia IA (WideLabs, עם Oracle ו-NVIDIA, בלי benchmark מספרי שפורסם) ותוכנית SoberanIA (MCTI וממשלת Piauí, דצמבר 2025), שהעמוד הרשמי שלה סיפק למחשב הזה רק CAPTCHA ולכן היא נשארת כאן כלא מאומתת. ו"ChatPetrobras", שלפעמים מצוטט כ-LLM לאומי, הוא יישום עבור 110 אלף עובדים שנבנה על גבי GPT דרך Azure — מוצר מעל מודל של צד שלישי, לא מודל.
בצד השימוש, Cetic.br מודד את מה שהאוספים רק מעריכים: 17% מהחברות הברזילאיות עם יותר מ-10 עובדים השתמשו ב-AI ב-2025 (13% ב-2024; 50% בין הגדולות), כש"יצירת שפה טבעית" קופצת מ-20% ל-30% — הקטגוריה שצמחה הכי הרבה, וזו הקטגוריה של ה-LLM-ים; מבין משתמשי האינטרנט, 32% כבר השתמשו ב-AI גנרטיבי, בערך 50 מיליון בני אדם. כבר הראיתי כאן למה "50 מיליון ברזילאים" היא ספירת האנשים היחידה שבאמת סופרת אנשים; תקפה אותה אזהרה.
לברזיל יש מחיר בריאלים, מבחן בפורטוגזית ושימוש נמדד — מה שאין לה הוא נוכחות באף אוסף שמסתובב.
מה הייתי עושה עם זה
שתי שאלות, עשר שניות כל אחת, לפני שחוזרים על כל סטטיסטיקה של LLM.
- "מודל לפי מי?" אם המספר הוא של מאגרים, זו מדידת פעילות; אם הוא של "בולטים", זו אצירה עם קריטריון מפורסם; אם הוא קטלוג, זו החלטה עורכית. שלושתם שימושיים. אף אחד לא מחליף מקום עם האחר — ודירוג של "למי יש יותר מודלים" בלי ההגדרה לצדו הופך את הפודיום בהתאם להגדרה.
- "ציון שניתן על ידי מי, לאיזו גרסה, במבחן שעדיין מודד?" Self-report של מעבדה עמד באימות של המאמר הזה — אבל הוא משווה רק עם self-report מאותו תאריך, על אותו מערך כלים, מאותה גרסה. שני ציונים מתעודות שונות זה לצד זה הם הטעות הנפוצה ביותר והבלתי נראית ביותר. וה-SWE-bench Verified, הסרגל הסטנדרטי של 2026, נאסף על ידי היוצר עצמו בפברואר: מי שמצטט אותו באוגוסט צריך לומר את זה.
וכלל מחיר אחד: לעולם לא מספר אחד למודל. כניסה, יציאה, cache, שעה וגרסה; או, עדיף, עלות למשימה שנמדדה על ידי מישהו מבחוץ.
אם תרצו לבדוק את המדידה הכי קלה במאמר הזה, זה עשר שניות:
curl -s "https://huggingface.co/models?pipeline_tag=text-generation" -A "Mozilla/5.0" \
| grep -o "numTotalItems[^,}]*"
יֵצא יותר מ-403,420 — זה גדל ב-115 מאגרים בין 04:43 ל-11:55 של 26 באוגוסט. אם ייצא פחות, או אם תמצאו את הציון של SWE-bench Verified של DeepSeek-V4-Pro-0813 באיזו תעודה רשמית, שלחו לי: אני מעדכן את המאמר ומזכה את התיקון.
מקורות
- Hugging Face — página de modelos com a etiqueta text-generation —
numTotalItemsmedido em 26/08/2026 (04:43 e 11:55); contagens por organização via?author= - Stanford HAI — AI Index Report 2026, capítulo 1 (Research and Development) — seção 1.1, Figuras 1.1.1, 1.1.4–1.1.6 e 1.1.8–1.1.9; capítulo Technical Performance (3,3% × 0,5%)
- OpenAI — "Introducing SWE-bench Verified", 13/08/2024 e OpenAI — "Why SWE-bench Verified no longer measures frontier coding capabilities", 23/02/2026 — ambos lidos em cópia do Wayback (o site recusa leitura automatizada); discussão no Hacker News, item 47910388
- Vals AI — SWE-bench Verified — tabela "Updated 8/19/2026", 86 modelos, campos
accuracyecost_per_testextraídos do HTML em 26/08/2026; harnessmini-swe-agent - Anthropic — Claude Fable 5 & Claude Mythos 5 System Card (PDF) — Tabela 8.1.A e seção 8.2
- DeepSeek — model card do DeepSeek-V4-Pro (Preview) e DeepSeek-V4-Pro-0813; preços oficiais; relatório técnico arXiv 2606.19348
- Moonshot AI — model card do Kimi K2.6, Kimi K3, repositório do Kimi K3 e preços
- Qwen — model card do Qwen3.8-2.4T-A95B; Alibaba Cloud — Qwen-Long, contexto longo
- Meta — "The Llama 4 herd"; Mistral — Mixtral 8x22B; OpenAI — gpt-oss-120b
- OpenAI — "Language Models are Few-Shot Learners" (GPT-3), arXiv 2005.14165; GPT-4 Technical Report, arXiv 2303.08774 — seção 2
- Preços oficiais lidos em 26/08/2026: OpenAI · Anthropic · Google Gemini · Mistral · xAI
- Arena (ex-LMArena) — leaderboard de texto — 21/08/2026, 7.906.317 votos, 394 modelos; Artificial Analysis — GPQA Diamond
- Maritaca AI — documentação (modelos e benchmarks) e preços; Amazônia IA; Petrobras — ChatPetrobras
- Cetic.br — TIC Empresas 2025 e TIC Domicílios 2025
- Página que motivou a pauta — gradually.ai, "LLM-Statistiken 2026" — inspiração de estrutura; nenhuma frase ou número reaproveitado sem conferência
אימות: תעודות טכניות, PDF-ים, papers ועמודי מחירים נקראו במלואם ונשמרו ב-26/08/2026; פוסטים של OpenAI דרך עותק מאורכב; הטבלה של Vals AI נשלפה מה-HTML שהוגש (86 מתוך 86 שורות); ספירות ה-Hugging Face נמדדו על ידי. הציטוטים באנגלית תורגמו על ידי; המקורות והמדידות זהים למקור בפורטוגזית. ה-94.3% של Gemini 3.1 Pro ב-GPQA Diamond ועמוד SoberanIA לא אומתו במקור הרשמי ומסומנים ככה בטקסט. אין Reddit ולא X במאמר הזה, בשל היעדר זמינות של המקורות.
