חזרה למאמרים
מאמרים פורסם ב 27 באוגוסט 2026

הכרטיס שאומר איזו בינה מלאכותית רצה על כרטיס המסך שלך צודק כמעט בהכול — וטועה בחישוב היחיד שמכריע

כרטיס בספרדית פותר בטבלה אחת מה רץ בכל רמה של זיכרון וידאו, מ-4 GB עד 256 GB. עשיתי את החישוב מחדש: מתוך שבעה עשר פסקי הדין על החומרה, שישה עשר נכונים, וכל המודלים המצוטטים קיימים באמת — הפריט היחיד שלא קיים הוא ה-RTX 5080 Super, שנדחתה לזמן בלתי מוגבל כי מודול GDDR7 של 3 GB עולה פי שלושה ממודול של 2 GB. הטעות שחשובה היא אחרת, והיא מתודית: הכרטיס מתמחר רק את קובץ המשקלים ומתעלם מה-cache של ההקשר, שגדל תוך כדי השיחה. עם שני המרכיבים מדודים — משקלים מתוך ה-GGUF שפורסם, cache שחושב מה-config.json של כל מודל — אחד מעשרת השלבים לא סוגר אפילו בסשן עבודה של 32 אלף טוקנים, וזה דווקא הפופולרי ביותר, זה של 8 GB; שישה מתוך העשרה לא סוגרים בהקשר המרבי של המודל שהכרטיס עצמו ממליץ עליו. אני מפריד עוד ארבע מלכודות של שמות, ביניהן "Q8" שיש בו 4.3 סיביות לכל משקל ופורמט שאינו מאותו אקוסיסטם של האחרים, ושלוש הסתייגויות שתקפות לכל הטבלה, כולל למה שני כרטיסים של 32 GB אינם כרטיס אחד של 64 GB.

#ia#llm#hardware#quantizacao#vram#didatico
סולם של עשרה שלבי זיכרון, מ-4 GB עד 256 GB. בכל שלב עמודה אופקית שהמסילה שלה מייצגת את הזיכרון הזמין באותה רמה, והמילוי שלה מראה, בערימה, את משקלי המודל המומלץ ואת cache ההקשר. תשעה מתוך עשרת השלבים נכנסים בהקשר הייחוס של 32 אלף טוקנים; שלב 8 GB כבר גולש. בהקשר המרבי של כל מודל, שישה מתוך עשרת השלבים גולשים: 4 GB, 8 GB, 16 GB, 24 GB, 32 GB ו-64 GB עוברים את קו הקיבולת, בעוד 48 GB, 96 GB, 128 GB ו-256 GB נשארים בתוכו.סולם ה-VRAM, עם שני מרכיבי החישובכל מסילה היא הזיכרון של אותה רמה; הקו הלבן הוא הגבול שלה.4 GBGPU משולבתGemma 4 E2B QAT q4_0עד 32K8 GBRTX 5060 / 4060Gemma 4 12B QAT q4_0עד 8K16 GBRTX 5060 Ti / 4080Gemma 4 12B Q8_0עד 32K24 GBRTX 3090 / 4090Qwen3.8-27B UD-Q4_K_Mעד 128K32 GBRTX 5090 / M6Qwen3.8-27B UD-Q6_Kעד 128K48 GBM5 Pro (48 GB)Qwen3.8-27B Q8_0עד 256K64 GB2x RTX 5090 / M5 ProQwen3.8-27B BF16עד 128K96 GBRTX PRO 6000 / M5 UltraQwen3.8-Flash-Next UD-Q2_K_XLעד 256K128 GBDGX Spark / M5 MaxQwen3.8-Flash-Next UD-Q4_K_XLעד 256K256 GBM5 Ultra / 2x DGX SparkDeepSeek V4 Flash 0731 UD-Q8_K_XLעד 256Kמשקלי המודלcache ב-32K הקשרמה שכבר לא נכנס בהקשר המרבימשקלים: הגודל האמיתי של קובץ ה-GGUF ב-Hugging Face Hub. Cache: חושב מתוך ה-config.json של כל מודל. אומת ב-27/08/2026 — ulissesflores.com

איך לקרוא: כל עמודה היא רמת זיכרון. הכחול הוא קובץ המשקלים; הסגול, ה-cache בהקשר עבודה של 32 אלף טוקנים; האדום, מה שעוד היה חסר בהקשר המרבי של המודל. כשהעמודה עוברת את הקו הלבן, השלב הזה תקף רק בשיחה קצרה.

מסתובב ברשת כרטיס בספרדית שפותר בטבלה אחת את השאלה הכי נשאלת של מי שרוצה להריץ בינה מלאכותית בבית: כמה זיכרון וידאו יש לך, ומה רץ על זה. עשר רמות, מ-4 GB עד 256 GB, כל אחת עם כרטיס המסך והמודל המתאים.

הורדתי את רשימת הקבצים, קראתי את ה-config.json של המודלים ועשיתי את החישובים מחדש. התוצאה הפתיעה אותי בכיוון ההפוך ממה שציפיתי: הכרטיס צודק כמעט בהכול. מתוך שבעה עשר פסקי הדין על החומרה, שישה עשר נכונים. כל המודלים המצוטטים קיימים באמת, עם השמות הנכונים. זה לא כרטיס שהמציא מישהו שמעולם לא פתח טרמינל.

ולמרות זאת הוא לא עונה על השאלה שהוא מבטיח לענות עליה. כי הוא מתמחר רק חצי מהחישוב.

מה הכרטיס קולע אליו, וזה הרבה

כרטיסי המסך נכונים. ל-RTX 5060 ול-4060 יש 8 GB; ל-5060 Ti יש 16 GB (והיא קיימת גם בגרסת 8 GB, שהכרטיס לא מזכיר); ל-4080 יש 16 GB; ל-3090 יש 24 GB; ל-5090 יש 32 GB. ל-RTX PRO 6000 Blackwell יש 96 GB בשלוש המהדורות — Workstation, Max-Q ו-Server — שנבדלות רק במעטפת ההספק. ל-DGX Spark יש 128 GB של זיכרון מאוחד.

גם השבבים של Apple. וכאן טעיתי לפני שבדקתי: חשבתי שהרשימה הפכה את ההיררכיה, כי היא נתנה 96 GB ל-M5 Ultra ו-128 GB ל-M5 Max. היא לא הפכה. ה-96 GB הם תצורת הבסיס של M5 Ultra; ה-128 GB הם התקרה של M5 Max. היררכיית התקרות האמיתית היא M5 Ultra 512 GB, M5 Max 128 GB, M5 Pro 64 GB, M5 ו-M6 32 GB — והיא נשמרת בקפדנות. הכרטיס ערבב רצפות עם תקרות, וזה מבלבל, אבל כל תא הוא תצורה שאפשר באמת לקנות.

גם ה-M6 נכון, והוא חדש עד כדי כך שכמעט פסלתי אותו: הוא הוכרז ב-25 באוגוסט 2026, יומיים לפני האימות הזה. השבב הראשון של Apple ב-2 nm, עד 32 GB של זיכרון מאוחד, רוחב פס של 170 GB/s, בכורה ב-Mac mini עם משלוח החל מ-22 בספטמבר.

כל המודלים קיימים: Gemma 4 (הדור הנוכחי של Google, שיצא באפריל, הראשון במשפחה תחת רישיון Apache 2.0), Qwen3.8-27B, Qwen3.8-Flash-Next ו-DeepSeek V4 Flash 0731. הקוונטיזציות המצוטטות קיימות במאגרים המצוינים.

הפריט היחיד ברשימה שלא קיים

ה-RTX 5080 Super מעולם לא יצאה לשוק.

ה-24 GB שהכרטיס מייחס לה היו המפרט המתוכנן, אף פעם לא זה של מוצר שנשלח. המקורות החזקים בענף — VideoCardz, TechPowerUp, Tom's Hardware — מתארים את סדרת SUPER כנדחית לזמן בלתי מוגבל, והסיבה כלכלית: מודול GDDR7 של 3 GB עולה בערך פי שלושה ממודול של 2 GB, בשוק שבו הביקוש של מרכזי הנתונים בולע את ההיצע. יש דיווח על ביטול סופי, אבל רק במקור משני חלש, ואני לא מקדם "דווח כמבוטל" ל"מבוטל".

בשביל הקורא, מה שחשוב הוא מעשי: השורה הזו ממליצה על חומרה שאי אפשר לקנות. ברמת 24 GB, מה שקיים היום הוא RTX 3090 (יד שנייה) או RTX 4090. תיקנתי את זה באיור.

הטעות שמכריעה: הכרטיס מתמחר רק את המשקלים

כאן נמצאת הבעיה האמיתית, והיא לא של חומרה ולא של שמות.

לזיכרון שמודל תופס יש שני מרכיבים. הראשון הוא קובץ המשקלים — קבוע, ידוע עוד לפני שהורדת משהו, והוא היחיד שהכרטיס מתמחר. השני הוא ה-cache של ההקשר: מבנה ששומר את מה שכבר נקרא וגדל תוך כדי השיחה. הוא מתחיל קרוב לאפס ולא מפסיק לעלות עד גבול ההקשר.

כתבתי מאמר שלם על המרכיב השני הזה — איך הוא עובד, למה הנוסחה שמסתובבת בכרטיסים ויראליים טועה בפקטור של שש עד עשרים במודלים של 2026, ואיך לחשב את שלך: איך לדעת אם מודל בינה מלאכותית רץ על המחשב שלך — ולמה. מי שרוצה את הנוסחה ואת הגזירה, המקום הוא שם. כאן אני משתמש בתוצאה.

מסקנה מעשית: "נכנס" היא לא תכונה של המודל. היא תכונה של הזוג (מודל, הקשר). כרטיס שלא אומר מהו ההקשר טוען טענה שאי אפשר לאמת — וברוב השורות, ההקשר המשתמע קצר מדי לשימוש אמיתי.

שלב אחרי שלב, עם שני המרכיבים

המשקלים למטה הם הגודל האמיתי של קובץ ה-GGUF שפורסם, מומר ל-GiB. ה-cache יצא מה-config.json של כל מודל, עם אצווה 1 ו-cache ב-16 סיביות.

זיכרוןהמודל של הכרטיסמשקלים+ cache 32K+ cache בהקשר המרבינכנס עד
4 GBGemma 4 E2B QAT q4_03.123.57 ✅4.88 ❌32K
8 GBGemma 4 12B QAT q4_06.508.66 ❌22.66 ❌8K
16 GBGemma 4 12B Q8_011.8013.96 ✅27.96 ❌32K
24 GBQwen3.8-27B UD-Q4_K_M15.3317.47 ✅31.47 ❌128K
32 GBQwen3.8-27B UD-Q6_K20.4722.61 ✅36.61 ❌128K
48 GBQwen3.8-27B Q8_027.0529.19 ✅43.19 ✅256K
64 GBQwen3.8-27B BF1650.9153.05 ✅67.05 ❌128K
96 GBQwen3.8-Flash-Next UD-Q2_K_XL73.4574.31 ✅79.56 ✅256K
128 GBQwen3.8-Flash-Next UD-Q4_K_XL103.68104.54 ✅109.79 ✅256K
256 GBDeepSeek V4 Flash 0731 UD-Q8_K_XL150.75153.44 ✅172.25 ✅256K

הערכים ב-GiB. "ההקשר המרבי" הוא ההקשר הגדול ביותר שמדדתי לכל מודל: 128K ב-Gemma 4 E2B, 256K בשאר.

שלב אחד מתוך עשרה לא סוגר אפילו בסשן עבודה רגיל. שישה מתוך עשרה לא סוגרים בהקשר המרבי של המודל שהכרטיס עצמו ממליץ עליו.

השלב שנשבר: 8 GB

זו השורה הפופולרית ביותר בכרטיס, כי זה כרטיס המסך הנמכר ביותר. וזו השורה שלא מחזיקה מים.

ה-Gemma 4 12B ב-q4_0 הרשמי של Google תופס 6.50 GiB של משקלים בכרטיס מסך של 8 GB. נשארים 1.5 GiB. ה-cache צורך 0.66 GiB ב-8 אלף טוקנים של הקשר — נכנס, בדוחק. ב-32 אלף טוקנים ה-cache עולה ל-2.16 GiB והסך הכול מגיע ל-8.66 GiB בכרטיס מסך של 8 GB. לא נכנס. ו-32 אלף טוקנים זה לא הקשר אקזוטי: זה קובץ קוד בינוני, או חצי שעה של שיחה.

מי שילך לפי השורה הזו יוריד 7 GB, יריץ, ימצא את זה מצוין בהודעות הראשונות ויראה את התהליך מת באמצע משימה אמיתית — בלי להבין למה. זה הסוג הגרוע ביותר של המלצה שגויה: זו שעובדת בבדיקה ונכשלת בשימוש.

ברמת 16 GB קורה דבר דומה, דיסקרטי יותר. הכרטיס מציע את Gemma 4 26B A4B ב-Q4_K_M כאפשרות "על הגבול". במדידה, הוא מעבר לגבול: 15.65 GiB של משקלים ועוד 1.35 GiB של cache ב-32K נותנים 17.00 GiB בכרטיס מסך של 16 GB.

והשלב של 4 GB סוגר רק בטקסט טהור. ה-Gemma 4 E2B הוא מולטימודלי, והמקרן (projector) שהוא נושא כדי לראות תמונה ולשמוע אודיו שוקל עוד 0.92 GiB: איתו, ה-3.57 GiB הופכים ל-4.49 GiB וכרטיס המסך של 4 GB לא מחזיק. הכרטיס ממליץ על מודל שרואה, ברמה שבה נכנס רק החלק שקורא.

ובכיוון ההפוך, הכרטיס שמרן מדי ב-96 GB: הוא ממליץ על Flash-Next ב-UD-Q2_K_XL (73.45 GiB), אבל UD-Q3_K_XL (83.81 GiB) ועוד 6.11 GiB של cache בהקשר המרבי מסתכמים ב-89.92 GiB ונכנסים בנוחות. ברמה הזו אפשר לבחור קוונטיזציה טובה יותר מהמוצעת.

ארבע מלכודות של שמות

NVFP4 שייך לאקוסיסטם אחר. הכרטיס מציג את NVFP4 לצד Q4_K_M, Q6_K ו-Q8_0, כאילו היו אפשרויות מאותו התפריט. הן לא. ה-Q* הם פורמטים של GGUF, מ-llama.cpp. NVFP4 הוא פורמט 4 סיביות של NVIDIA שרץ ב-vLLM וב-SGLang, דורש tensor cores של Blackwell ומגיע ממאגר אחר. לבחור ביניהם זה לא לבחור קוונטיזציה — זה לבחור מחסנית תוכנה אחרת.

ה-Q4_K_M וה-Q6_K של Qwen3.8-27B קיימים רק עם הקידומת UD-. במאגר של Unsloth, קובצי ה-GGUF היחידים בלי קידומת הם Q4_0, Q4_1, Q8_0 ו-BF16. מי שיחפש לפי השם שבכרטיס לא ימצא את הקובץ.

ה-"Q8" של DeepSeek הוא לא 8 סיביות לכל משקל. ל-UD-Q8_K_XL של DeepSeek V4 Flash 0731 יש 161.87 GB עבור 304 מיליארד פרמטרים — מה שנותן בערך 4.3 סיביות לכל משקל, לא 8. Unsloth עצמה כותבת בכרטיס המודל (model card) שהקובץ הזה גדול רק ב-7 GB מה-Q4. התווית מתארת את הדיוק של חלק מהטנזורים, לא את הממוצע של הקובץ.

ה-GB של ה-Hub הוא לא ה-GB של הכרטיס. גודל קובץ מתפרסם במיליארדי בייטים; זיכרון וידאו נספר בחזקות של שתיים. זה הפרש של 7%, מספיק כדי להפוך "נכנס" ל"לא נכנס" בשורות הצפופות. המרתי הכול ל-GiB בטבלה.

שלוש הסתייגויות שתקפות לכל הטבלה

השורות עם ✅ עדיין אופטימיות. משקלים ועוד cache אינם התפוסה הכוללת של התהליך: חסרים ההקשר של CUDA או Metal, האקטיבציות הביניים ומה שמערכת ההפעלה והתצוגה כבר צורכות. הוסיפו 1 עד 2 GB ועבדו עם רווחה של 10% עד 15%.

שני כרטיסים אינם כרטיס אחד גדול. "2× RTX 5090 = 64 GB" נכון אריתמטית ומטעה ארכיטקטונית. דור Blackwell הצרכני חסר NVLink: צריך לפרוס את המודל בין שני הכרטיסים, והתעבורה בין השכבות עוברת דרך ה-PCIe. זה נחשב כקיבולת מצטברת עם קנס חיבוריות, אף פעם לא כמאגר יחיד. אותו הדבר תקף לשני ה-DGX Spark של 256 GB: הקישור של 200 Gb/s ביניהם נותן בערך 25 GB/s מול 273 GB/s של הזיכרון המקומי. זיכרון מאוחד באמת, ברשימה הזו, יש רק ב-Apple Silicon וב-DGX Spark בודד.

במק, לא כל הזיכרון המאוחד שייך ל-GPU. macOS שומר חלק מהמאגר למערכת. הגבול ניתן לכוונון — במכונה הזו, sysctl iogpu.wired_limit_mb מחזיר 0, שמשמעותו "השתמש בברירת המחדל של המערכת" — אבל Apple לא מפרסמת מהי ברירת המחדל הזו. זו כנראה הסיבה שהכרטיס נותן ל-M5 Max של 128 GB קוונטיזציה קטנה יותר מאשר ל-DGX Spark של 128 GB, וההבחנה הוגנת: שני מספרים זהים לא שווים אותו דבר בפועל.

מה הייתי עושה עם זה

אם יש לך 8 GB, אל תוריד את ה-12B בציפייה לעבוד איתו. השתמש ב-Gemma 4 E4B, או קבל את ה-12B עם הקשר מוגבל ל-8K והגדר את השרת לכך במפורש, במקום לגלות את הגבול כשהתהליך ימות.

אם יש לך 24 או 32 GB, ה-Qwen3.8-27B הוא בחירה טובה — אבל תכנן את גודל ההקשר. ב-128 אלף טוקנים הוא נכנס; במקסימום של 262,144, לא. מי שצריך את ההקשר המרבי ברמה הזו חייב לקוונטז גם את ה-cache, עם --cache-type-k ו---cache-type-v ב-llama.cpp. קוונטיזציה של קובץ המשקלים לא מכווצת את ה-cache — אלה דברים נפרדים, וזה הבלבול הנפוץ ביותר שאני רואה.

ובכל רמה: לפני שבוחרים את הקוונטיזציה, מחליטים על ההקשר. הסדר ההפוך הוא מה שמייצר כרטיסים כמו זה.

איך לעשות את החישוב הזה מחדש

המספרים בעמוד הזה אינם של צד שלישי. המשקלים הם הגודל של הקבצים שפורסמו; ה-cache יצא מתוכנית שקוראת את ה-config.json של כל מודל ומפרידה בין השכבות ששומרות cache לאלה שלא. התוכנית שבונה את הטבלה מפורסמת יחד איתה: gerar-dataset.py.

כל שורה נושאת את המאגר שממנו יצא המשקל, והחישוב הוא חיסור — אפשר לבדוק כל תא ביד.

מקורות

אומת ב-27 באוגוסט 2026. גודלי הקבצים נקראו ב-Hugging Face Hub באותו התאריך; ה-cache חושב מתוך קובצי ה-config.json שפורסמו, ולא נמדד בזמן ריצה. היעדרה של ה-RTX 5080 Super ותצורות הזיכרון של Apple נבדקו במקורות המפורטים. מה שלא נבדק מוצהר ככזה בגוף המאמר.