אנבידיה חושפת קפיצה של פי 30 בתפוקה לוואט למערכות ורה רובין NVL72 מול GB300 NVL72 בעומסי סוכנים

מה שמאחורי המספרים
לפי נתוני OpenRouter, עומסי עבודה של AI סוכני (agentic) צורכים פי 15 יותר טוקנים מבקשת צ'אט פשוטה. הסיבה: סוכן שחוקר חברה לצורך החלטת השקעה שולף בסיסי נתונים פיננסיים, סורק ידיעות ודיווחים, מפעיל תת-סוכן להשוואות עמיתים והערכות שווי, ואז מסנתז הכול להמלצה. בכל שלב הטוקנים המצטברים הופכים לקלט של השלב הבא, ולכן טיפול בהקשר ארוך (long-context) נעשה קריטי לביצועים. אותו דפוס חוזר בפיתוח תוכנה, שירות לקוחות ומחקר מעמיק.
איך מודדים עומסי סוכנים
אנבידיה מדדה את התפוקה באמצעות עומס העבודה SemiAnalysis AgentX, שמבוסס על סשנים אמיתיים של קידוד סוכני עם גדילת הקשר, קריאות כלי (tool calls) והפעלת תת-סוכנים משומרים. התוצאות, שממתינות עדיין לביקורת של SemiAnalysis, מראות שמערכת GB300 NVL72 כבר מספקת פי 15 תפוקה למגה-וואט מול ארכיטקטורת הופר (Hopper) במודל DeepSeek V4 Pro. ורה רובין מרחיבה את היתרון הזה לפי 30 מול GB300 באותו מודל. הנתונים לא כוללים עדיין ביצועי מעבד ורה (Vera CPU) לקריאות כלי.
מודלים שנבדקו ואופטימיזציית חשמל
הבדיקות כללו את המודלים Kimi K3, MiniMax M3, GLM5.3, Qwen3.5 ו-DeepSeek V4 Pro. טכנולוגיית DSX MaxLPS של אנבידיה מנהלת הספק ברמת ה-GPU, המארז (rack) והעומס, ומאפשרת לדחוס עד 40% יותר GPUs באותו תקציב מגה-וואט, מה שדוחף את התפוקה לוואט גבוה יותר בקנה מידה של מפעלי AI. מכיוון שתפוקה למגה-וואט קובעת הכנסות ועלות למיליון טוקנים קובעת שולי רווח, השיפור מתורגם ישירות לכלכלה: עד פי 35 עלות נמוכה יותר למיליון טוקנים מול GB300 NVL72.
המשמעות בקצה הייצור
עבור מפעלי AI מוגבלי הספק, המספרים האלה אומרים שאפשר להריץ סוכנים ברצף, בקנה מידה רחב, על כל מגוון העומסים של הלקוחות. אנבידיה מציינת שאופטימיזציות תוכנה רצופות ימשיכו לשפר ביצועים הן בורה רובין והן ב-GB300. השאלה הפתוחה נותרה כמה מהפער הנוכחי ייסגר כשהביקורת העצמאית תושלם וכשביצועי המעבד המרכזי ייכנסו למשוואה.