H100 עדיין המלך: GB200 NVL72 לא מוכן לאימון בקנה מידה קדמי

דוח של SemiAnalysis מאוגוסט 2025 קובע בפשטות: נכון לאותו זמן, אף מעבדה קדמית או ספק ענן גדול לא הצליח להריץ אימון מגה-סקייל על GB200 NVL72. H100, H200 ו-TPU של גוגל נותרו החומרה היחידה שבאמת סוגרת ריצות אימון בקנה מידה קדמי (frontier-scale). בלאקוול אולי נראה מרשים על הנייר, אבל במציאות התוכנה עדיין לא הבשילה והאמינות גוררת השבתות שמחסלות את יתרון הביצועים-ל-דולר.
יותר מאלפיים H100 בבנצ'מרק: MFU, TCO וג'אול לטוקן
הדוח מתבסס על ריצות בנצ'מרק על פני למעלה מ-2,000 מעבדי H100, עם ניתוח של ניצול פלופס מודל (MFU), עלות בעלות כוללת (TCO) ועלות לאימון מיליון טוקנים. הנתונים נפרסו על פני גדלי אשכולות מ-128 עד 2,048 מעבדים, ועל פני גרסאות תוכנה שונות של Nvidia, מה שמאפשר לראות איך הבשלת הסטאק משפרת יעילות לאורך זמן. נוספה גם מסגרת אנרגטית: ג'אול לטוקן (joules per token), מותאם לצריכה שנתית ממוצעת של משק בית אמריקאי, כדי לתת הקשר חברתי לעלות החשמל.
GB200 על Llama4 400B MoE ו-DeepSeek 670B MoE, אבל האמינות הורגת את היתרון
בחלקו השני של הדוח מוצגים בנצ'מרקים של GB200 NVL72 על Llama4 400B MoE ו-DeepSeek 670B MoE, בהשוואה לתוצאות H100 קודמות. הביצועים הגולמיים נראים מבטיחים, אלא שהדוח מכניס לחישוב ה-perf-per-TCO גם השבתות (downtime) מאמינות ירודה וזמן הנדסה אבוד. התוצאה: יתרון הביצועים-ל-דולר של GB200 נעלם כשהוא פוגש את המציאות התפעולית. כשלונות בק-פליין (backplane) וחוסר יציבות כללי הם הגורמים המרכזיים.
הראמפ איטי מהדורות קודמים, אבל לא דרמטית
לפי SemiAnalysis, העלייה לאוויר (ramp) של GB200 NVL72 איטית מעט מקודמיו, אבל לא בפער גדול. ההערכה בדוח הייתה שעד סוף 2025 התוכנה תשתפר משמעותית, ובשילוב ארכיטקטורות מודל שמתוכננות מראש לעולם scale-up גדול יותר, צפויים רווחי יעילות ניכרים. בצד האמינות, האתגרים יישארו משמעותיים וידרשו שיתוף פעולה הדוק יותר בין Nvidia לשותפותיה, אבל האקוסיסטם צפוי לגייס משאבים לפתרון מהיר.
גיוס מהנדסים כמדד לעומק הבדיקה
סגירת הדוח כוללת מודעת דרושים של SemiAnalysis עצמם: מהנדס/ת חד/ש-בוגר/ת לצוות הנדסה, עם דגש על בנצ'מרקים בקנה מידה גדול על פני ספקים מרובים (AMD, NVIDIA, TPU, Trainium), פיתוח CI/CD רפרודוקטיבי ואמינות מערכות. הדרישות, פייתון חזק, רקע SRE, DevOps מודרני, משקפות את רמת התשתית שנדרשת כדי לייצר את סוג הנתונים שהדוח מציג.