DeepSeek הוציאה את V4-Flash מהבטא ב־31 ביולי תחת שם הקוד V4-Flash-0731, והכותרת שהסתובבה הייתה אחת: המודל הזול של הבית מנצח עכשיו את ספינת הדגל V4-Pro בכל תשעת הבנצ'מרקים האג'נטיים שפורסמו. זה נכון — וזה לא החלק המעניין.
נכנסתי ל־model card הרשמי. לטבלה שממנה נולדה הכותרת יש שתי עמודות שהסיקור לא מזכיר, ובאחת מהן Claude Opus 4.8 מנצח את V4-Flash-0731 בכל תשע השורות. תשע–אפס, בפרסום של DeepSeek עצמה. מה חברה מרוויחה מהכרזה על התבוסה של עצמה — זו השאלה הנכונה על ההשקה הזאת, והתשובה נמצאת במחיר.
מה השתנה בפועל
העובדות הניתנות לאימות, מתוך ה־model card הרשמי ומ־טבלת המחירים של ה־API:
| פריט | V4-Flash-0731 |
|---|---|
| מה זה | ה־preview של אפריל שעבר re-post-training — הארכיטקטורה ללא שינוי |
| פרמטרים | 284B בסך הכל (304B עם מודול ה־DSpark) · 13B פעילים לכל טוקן |
| קונטקסט | 1 מיליון טוקנים · פלט של עד 384 אלף במאמץ high/max |
| רמות מאמץ | low · high · max (שלוש, לא חמש) |
| מחיר | 0.14 דולר למיליון טוקני קלט · 0.28 דולר על הפלט |
| Cache hit | 0.0028 דולר — הנחה של 98% ביחס לקלט |
| רישיון | MIT, משקלים פתוחים, בלי access gate |
| זמינות | Hugging Face + API בבטא ציבורית |
המשפט המכריע בהכרזה הוא דווקא זה שמושך הכי פחות תשומת לב: השיפורים מגיעים מ־"re-post-training, not a new design". אותה ארכיטקטורה, אותו endpoint, אותו מחיר, אותה latency — הם החליפו רק את שלב האימון האחרון. שמרו את המשפט הזה; הוא עוד יחזור.
הפרטים התפעוליים ששווים כסף
ארבעה סעיפים שמתגלים רק למי שקורא את התיעוד, כמנהג הבית:
- הנחת ה־cache היא המוצר הנסתר. 98% הנחה על ה־prefix השמור ב־cache (הנורמה בתעשייה מסתובבת סביב 90%). agent ארוך־טווח עם system prompt יציב משלם כמעט רק על הפלט.
- תמחור שעות שיא הוכרז, בלי תאריך. התיעוד מזהיר שה־API יעבור לתעריף כפול — פי שניים בחלונות 9:00–12:00 ו־14:00–18:00 שעון בייג'ין. מי שמתכנן להריץ batch בזול כבר יודע לאיזה אזור זמן לתזמן.
- ה־Responses API מכסה רק את ה־Flash. הפורמט התואם ל־Codex עובד היום רק על
deepseek-v4-flash; ה־Pro מובטח לתחילת אוגוסט. - V4-Pro לא עודכן. גם לא המודלים באתר ובאפליקציה. ההשקה היא ה־Flash לבדו — מה שהופך את הטבלה שלמטה למוזרה עוד יותר.
הטבלה המלאה
הטבלה מה־model card, בשלמותה — עם שתי העמודות שהכותרת דילגה עליהן:
| Benchmark | Flash-0731 | Flash (אפריל) | Pro (אפריל) | GLM-5.2 | Opus 4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | — | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 | 12.9 | 27.2 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 | 61.8 | 71.6 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 | 54.5 | 71.7 |
שתי קריאות, לפי סדר ההשתאות.
העמודה של ה־Flash של אפריל עצמו. ב־DeepSWE, ה־preview רשם 7.3; ה־0731 רושם 54.4 — פי שבעה וחצי, בלי לגעת בפרמטר ארכיטקטורה אחד. ב־Cybergym, מ־38.7 ל־76.7. אם המספרים האלה יחזיקו מעמד מחוץ ל־harness של הבית, זו ההדגמה האגרסיבית ביותר עד כה לכך שמתכון ה־post-training שווה היום יותר מהעיצוב של המודל — עלות ההשגה של מתחרה ירדה מ"לאמן מודל אחר" ל"לאמן מחדש את השלב האחרון של מה שכבר יש לך".
העמודה של Opus 4.8. מנצח את כל תשע השורות. DeepSeek בחרה לפרסם את זה — לא בנספח, בטבלה הראשית של ה־card. זו לא רשלנות; זה טיעון המכירות כשקוראים אותו מהסוף להתחלה, והוא עובד רק בגלל הסעיף הבא.
הערה מתודולוגית — לקרוא לפני שמצטטים את הטבלה הזאת. הבנצ'מרקים האג'נטיים רצו ב־"minimal mode" של ה־DeepSeek Harness, שלא פורסם, עם
temperature 1.0ומאמץmax. עד שה־harness יראה אור, אף אחד מהמספרים האלה אינו ניתן לשחזור בלתי תלוי. וזהירות מהצלבת הכרזות: ה־"AutomationBench Public" בטבלה הזאת נותן ל־Opus 4.8 ציון 27.2, בעוד הטבלה בהכרזת Opus 5, שבוע קודם לכן, נתנה לאותו מודל 17.0 ב־"AutomationBench" — subset ו־harness שונים, מספר שאי אפשר להשוות. אותו דבר תקף ל־DeepSWE (כאן בלי סיומת גרסה; שם, "v1.1"). בנצ'מרק של יצרן משווים רק בתוך ההכרזה שלו עצמו.
להפסיד 9:0 כשאתה עולה אחד חלקי 89
החשבון שהטבלה לא מציגה: Opus 4.8 עולה 5 דולר לקלט ו־25 דולר לפלט למיליון טוקנים — אותם מחירים כמו Opus 5, כפי שאומת במאמר על ההשקה שלו. V4-Flash-0731 עולה 0.14 דולר ו־0.28 דולר. פי 36 פחות בקלט; פי 89 פחות בפלט. הפער הממוצע בטבלה הוא אחוז חד־ספרתי לשורה.
וכאן מגיע מבחן צד־שלישי — זה שהמאמר על Opus 5 הסתיים בבקשה עליו — והפעם הוא הגיע ביום ההשקה. Artificial Analysis מדדה את ה־0731 ב־50 ב־Intelligence Index. השכונה, לשם הקשר: GPT-5.6 Luna ו־GLM-5.2 על 51, Gemini 3.6 Flash על 50, Kimi K3 על 57, Claude Opus 5 על 61 — וה־V4-Pro של DeepSeek עצמה על 44, שש נקודות מתחת למודל הזול של הבית.
הקפיצה האנכית בגרף היא ההשקה כולה: 10 נקודות מדד באותו מחיר, הקו מטפס בלי לזוז ימינה. Artificial Analysis מעריכה את העלות למשימה של ה־0731 בכ־60% פחות מזו של GPT-5.6 Luna באותה רצועת אינטליגנציה — אפקט שחייב פחות למחיר המחירון ויותר להנחת ה־cache של 98%.
בגלל זה פרסום התבוסה 9:0 עובד כפרסומת: הטבלה לא טוענת "אנחנו הכי טובים"; היא טוענת "אנחנו כמה נקודות מאחורי מי שגובה פי 89 יותר". עבור פלח השוק שמחליט לפי עלות למשימה שהושלמה — agents ששורפים מיליוני טוקנים ביום — הטיעון השני הוא החזק יותר. עם ההסתייגות הקבועה: את מרחק "הנקודות הבודדות" מודד ה־harness הלא־מפורסם של DeepSeek עצמה; הגרסה הבלתי תלויה, בינתיים, היא רק המדד המצרפי של AA.
מה המדד הזה לא אומר. ה־Intelligence Index הוא ממוצע מצרפי — הוא לא מודד את מקרה השימוש שלכם, ו־AA עדיין לא פרסמה את הפירוק האג'נטי של ה־0731. הפער של 11 הנקודות בינו לבין Opus 5 יכול להיות לא רלוונטי ל־autocomplete ומכריע עבור agent שמפעיל טרמינל במשך שעות. שני הדברים נכנסים לאותו מספר.
ה־post-training הפך למוצר
הפרט הטכני עם ההשלכה האסטרטגית: קפיצה מ־7.3 ל־54.4 בבנצ'מרק של הנדסת תוכנה בלי ארכיטקטורה חדשה פירושה שהחזית האג'נטית מוגבלת כרגע פחות על ידי גודל המודל ויותר על ידי איכות צינור ה־post-training — דאטה של מסלולי agent, RL על שימוש בכלים, harness של הערכה. ארכיטקטורה מתפרסמת ב־papers; מתכון ה־post-training הוא הסוד התעשייתי של הרגע. DeepSeek פתחה את המשקלים ושמרה את המתכון — MIT לארטיפקט, שתיקה על השיטה שיצרה אותו. זה open-weights, לא open-science, וההבחנה מעולם לא הייתה גלויה כל כך.
באותה חבילה מגיע DSpark, מודול ה־speculative decoding שמתואר ב־paper משלו: מהיר ב־60% עד 85% למשתמש, נמדד על טראפיק אמיתי במערכת ה־serving של DeepSeek — לא על שולחן מעבדה. ההסתייגות של ה־paper עצמו: השיפור נכון ב־throughput תואם, תחת אילוצי האינטראקטיביות של הפרודקשן שלהם; ה־deploy המקומי שלכם לא יורש את המספר אוטומטית.
48 השעות הראשונות מחוץ ל־harness
להשקה יש שני קהלים, והם מדדו דברים שונים.
מחנה ההרצה המקומית חגג את מה שאפשר לשקול. המשקלים הרשמיים רצים על שני DGX Spark ב־82 tok/s בשיא (60–72 טיפוסי) עם הקונטקסט של 1M; על RTX 5090 עם 192 GB של RAM ב־12 tok/s — "not frontier level... but pretty good at functional code"; והפזמון החוזר שכל Mac עם 128 GB מריץ עכשיו "coding ברמת Opus" מקומית. בצד ה־API, משתמש אחד סיכם את חשבון היום: 110 מיליון טוקנים מעובדים, 0.77 דולר.
המחנה הסקפטי כיוון בדיוק לאן שההערה המתודולוגית למעלה מצביעה. התגובה המדורגת ראשונה (+385) בת'רד המרכזי של r/LocalLLaMA נפתחת עם כל ההסתייגות באות נטויה: "*in benchmarks". מפתח אחד סיכם את הבעיה המבנית: "evaluate model + harness, not weights". אחר, אחרי כמה סבבים על harness בלתי תלוי, ראה איכות "extremely inconsistent" וסיווג את התוצאה הטובה הראשונה כ־"lucky run". והייתה גם מדידה של רגרסיה: טוב יותר ביצירת HTML, גרוע מה־preview ב־JSON ובהסקה, throughput מתמשך נמוך ב־7%. היו גם מי שקראו לטבלה cherry-picking — האשמה שהעמודה של Opus 4.8, שפורסמה על ידי DeepSeek עצמה, עונה עליה בעצמה.
ו־Artificial Analysis עצמה סיבכה את המספר של עצמה. במדד AA-Omniscience, החברה דיווחה כי הדיוק של ה־0731 נשאר ללא שינוי על 37%; מה שירד ב־11 נקודות הוא שיעור ההזיות. חלק מהקפיצה של 10 הנקודות במדד המצרפי, אם כך, הוא לא המודל שיודע יותר — הוא המודל שממציא פחות. עבור agent אוטונומי זה אולי השיפור בעל הערך הרב ביותר בחבילה; הוא פשוט לא זה שהכותרת רומזת אליו.
MIT, בלי gate, על MacBook של 128 GB
לציר השלישי של ההשקה אין בנצ'מרק: המשקלים נמצאים ב־Hugging Face תחת MIT, בלי הרשמה. עם 13B פעילים לכל טוקן, גרסת ה־3 ביט רצה על בערך 110 GB של RAM+VRAM משולבים — בתוך MacBook של 128 GB; גרסת ה־8 ביט דורשת 162 GB. מודל שמתחרה ברצועת ה־50 נקודות של AA, מסוגל לפעול כ־agent, רץ בשלמותו על המכונה המקומית, הוא תקרה חדשה לקטגוריית "לא תלוי ב־API של אף אחד" — עם התקרה הקבועה שמצורפת אליה: מהירות של תחנת עבודה, לא של דאטהסנטר.
מה הייתי עושה עם זה
לא בדקתי את ה־0731 בפרודקשן — הוא יצא לפני יומיים. איפה הייתי מסתכל קודם:
למדוד עלות למשימה, לא לטוקן. הלקח של הגרף: מחיר מחירון נמוך פי 89 הופך לעלות נמוכה פי 89 רק אם שיעור השלמת המשימות עומד בקצב. המבחן הכן הוא ה־backlog של המשימות האמיתיות שלכם, אותו prompt, שני המודלים, עלות למשימה שהושלמה — וה־harness הלא־מפורסם שלהם הוא עוד סיבה למדוד עם שלכם.
לתכנן את ה־agent סביב ה־cache. הנחה של 98% על ה־prefix משנה את הארכיטקטורה האופטימלית: system prompt ארוך ויציב הופך כמעט חינמי; מה שעולה כסף הוא לשנות את ה־prefix. שווה לסדר מחדש מה קבוע ומה דינמי ב־prompt שלכם לפני שמשווים מחיר עם מתחרה כלשהו.
לתזמן הרצות batch מחוץ לשעות השיא של בייג'ין. התעריף הכפול שהוכרז מכפיל את העלות בחלונות ידועים (9:00–12:00 ו־14:00–18:00, שעון סין). pipeline לילי ברזילאי נופל מחוץ לשיא — בחינם.
ולא להצליב טבלאות של הכרזות. אותו Opus 4.8 מקבל 27.2 בהכרזה אחת ו־17.0 באחרת, על "אותו" בנצ'מרק. כל השוואה שתרכיבו מהדבקת מספרים מפוסטים שונים שגויה מעצם הבנייה. הסרגל היחיד שנחשב הוא זה שאתם מחזיקים בעצמכם.
מקורות
- ה־model card הרשמי: huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
- מחירים: api-docs.deepseek.com/quick_start/pricing
- ה־paper של DSpark: arxiv.org/abs/2607.05147 · הדוח הטכני של V4: arxiv.org/abs/2606.19348
- מדד בלתי תלוי: officechai.com — V4-Flash-0731 ב־Artificial Analysis
- סיקור: MarkTechPost · TechTimes · XenoSpectrum
המחירים והמפרטים נבדקו מול התיעוד הרשמי של DeepSeek ב־1 באוגוסט 2026; טבלת הבנצ'מרקים תועתקה מה־model card ב־Hugging Face; ערכי הגרף מגיעים מהמדד הציבורי של Artificial Analysis ומטבלאות המחירים הרשמיות — נקודת ה־preview של אפריל (≈40) נגזרת מהשיפור המדווח של 10 הנקודות, לא ממדידה ישירה. ציטוטי הקהילה נאספו ב־1 באוגוסט 2026 באמצעות חיפוש ב־X וב־Reddit ותועתקו מהפוסטים המקוריים, כל אחד עם הקישור שלו; ספירת ההצבעות נכונה לרגע האיסוף. המחיר של Opus 4.8/5 (5 דולר קלט, 25 דולר פלט) אומת שוב ב־1 באוגוסט 2026 מול דף המחירים הרשמי של Anthropic.