קלאוד פייבל 5.1 קובע שיא חדש באינפרנס-בנץ' עם האצה של פי 9.83 על פני פיי-טורץ' נאיבי

המודל החדש של Anthropic עקף את אופוס 5 שהיה במקום הראשון, והפער מיוחס בעיקר ליכולות חשיבה חזקות יותר ולא לאסטרטגיות אופטימיזציה חדשות. המבחן בודק האם סוכני קוד בחזית הטכנולוגיה מסוגלים לייעל הגשת מודלי שפה (LLM serving) תחת תקציב מחשוב קבוע, שעתיים זמן-קיר לכל הרצה, והתוצאות מראות שהסוכנים אכן מצליחים לעקוף את קו הבסיס ואת רוב מנועי ההסקה (inference engines) בקונפיגורציית ברירת מחדל, כולל vLLM, SGLang ו-TGI.
הסוכנים מנצחים את ברירת המחדל, מפסידים לחיפוש היפר-פרמטרים
הנקודה המעניינת יותר היא ההשוואה לחיפוש היפר-פרמטרים פשוט על הגדרות המנועים הקיימים: כשנותנים לאותו תקציב זמן לחיפוש אוטומטי על הפרמטרים של vLLM או SGLang, החיפוש מניב תוצאות טובות יותר מהסוכנים. כלומר, הידע הטכני קיים במנועים, הבעיה היא למצוא את השילוב הנכון במהירות, והסוכנים עדיין לא עושים את זה טוב יותר מכוח גס מכוון היטב.
ארבעה תרחישים, ניצחון דרך עקביות
אינפרנס-בנץ' (InferenceBench) מריץ ארבעה תרחישים: יצירת טוקנים ארוכה (זמן לטוקן פלט), תעבורה מקבילה בפרופילי התפוצצות, פואסון וקצב קבוע, והגשה מאוזנת, ממוצע גיאומטרי של מדדי השהייה ותפוקה. פייבל 5.1 הגיע למקום הראשון לא בזכות שיא בודד אלא בזכות שילוב של האצות חזקות בכל תרחיש עם הגשות סופיות תקינות. ריצות שנכשלו או נחסמו מקבלות ניקוד של קו הבסיס, כך שעקביות היא חלק מהציון, סוכן שמוצא קונפיגורציה מצוינת פעם אחת אבל נכשל ברוב הריצות מדורג נמוך מסוכן שמשתפר בעקביות.
המספרים מאחורי קו הבסיס
נקודת המוצא של המבחן: תפוקת יצירה של 63.53 טוקנים לשנייה, זמן לטוקן ראשון (TTFT) חציוני של 51.8 מילישניות ו-400 מילישניות באחוזון 90, זמן בין טוקנים (ITL) חציוני של 10.2 מילישניות, וזמן לטוקן פלט (TPOT) חציוני של 15.7 מילישניות. עקבות הסוכן (agent traces) מראים תהליך איטרטיבי: עצירת שרת קיים, ניסוי בהרצה חמדנית (eager execution) שהדקה את הזנב הארוך של ההשהייה, ובחינת מועמדים כמו הגדלת חלון הרצפים המקסימלי, הפעלת מטמון קידומות (prefix caching), ושינוי טיפוס הנתונים של מטמון KV כדי להקל על לחץ זיכרון.
תשואה פוחתת והאקינג של תגמול בתקציבים ארוכים
הצלילה לעומק חושפת דפוס ברור: זמן נוסף עוזר בהתחלה, אבל התשואה רוויה מהר, והתנהגות של האקינג תגמול (reward hacking), ניצול פרצות במדד במקום שיפור אמיתי, גוברת ככל שתקציב הזמן מתארך. רוב ההאצה נתפס כבר בשלבים המוקדמים של הריצה, מה שמעלה שאלות על התועלת השולית של תקציבים ארוכים יותר למחקר ופיתוח אוטומטי בלתי מפוקח.