Artificial Analysis משיק מדד מאוחד לסוכני קוד: שלושה בנצ'מרקים, ציון אחד

הפלטפורמה Artificial Analysis פרסמה את ה-Coding Agent Index, ציון משוקלל שמאחד שלושה בנצ'מרקים ציבוריים שונים לתמונה אחת של ביצועי סוכני קוד. המדד משלב את DeepSWE v1.1 עם 113 משימות הנדסת תוכנה, Terminal-Bench 4.0 עם 66 משימות עבודה בטרמינל, ו-SWE-Atlas-QnA עם 124 שאלות טכניות על מאגרי קוד. כל רכיב בודק יכולת אחרת: הבנת ארכיטקטורה וקריאת קוד, ביצוע תיקונים וכתיבת טלאים שעוברים מבחנים, וניווט סביבת שורת-פקודה מרובת שלבים.
מתודולוגיה: pass@1 מנורמל למשימה
החישוב מתבסס על ממוצע pass@1 מנורמל ברמת המשימה. עבור כל משימה מריצים שלושה ניסיונות, ממצעים את הציון שלה, ואז ממצעים על פני כל המשימות כך שלכל משימה משקל שווה. כל התוצאות בינאריות, הצלחה או כישלון, וניסיון יכול להסתיים "נקי" ועדיין לקבל אפס אם לא עבר את המאמת. ב-SWE-Atlas-QnA השיטה מיושרת עם Task Resolve Rate של Scale AI. הגישה הזו מונעת הטיה לטובת משימות קלות או קשות במיוחד, אבל גם מוחקת ניואנסים של איכות תיקון חלקי.
עלות, טוקנים וזמן ריצה, לא רק ציון
לצד הציון המשולב מפרסמת Artificial Analysis ארבעה צירים נוספים: עלות למשימה לפי תמחור API נוכחי (כולל הנחות מטמון), צריכת טוקנים כוללת ופילוח לפי סוג, זמן ריצה פעיל למשימה, ושיעור סירובי בטיחות. הנתונים מאפשרים להשוות יעילות (כמה טוקנים ודולרים נשרפים כדי לפתור משימה) ולא רק מי מגיע ראשון. רבים מהמשתמשים יגיעו לסוכנים דרך מנויים ולא תשלום פר-טוקן, אז העלות המוצגת היא אינדיקטור ולא חשבונית סופית.
Reward Hacking: כשהסוכן מרמה את המדד
מדד חדש יחסית בדף הוא Reward Hacking Rate, התדירות שבה סוכן מקבל תגמול על משימה בלי שהפגין את היכולת שהמשימה מודדת. זו בעיה מוכרת בלמידת חיזוק: המודל לומד לנצל פרצות במאמת במקום לפתור את הבעיה. פרסום השיעור הזה לצד הציון הראשי מכריח השוואה הוגנת יותר, כי ציון גבוה עם שיעור האקינג גבוה שווה פחות מציון נמוך יותר עם אפס ניצול פרצות.
השוואת Harnesses, עדיין לא כאן
הפלטפורמה מבטיחה השוואה בין ה-harnesses השונים שמריצים את הסוכנים (Coming soon). זה קריטי כי אותו מודל על harness שונה יכול להניב תוצאות שונות דרמטית, ניהול הקשר, הרשאות הרצה, וכלי עריכה משנים את המשחק. עד שזה יתפרסם, המדד הנוכחי משקף ביצועים בתצורה הספציפית שנבדקה, לא תכונה מהותית של המודל לבדו.
מה חסר: אין נתוני ביצועים גולמיים בטבלה
הדף מציג גרפים ומגמות אבל לא טבלה עם המספרים הגולמיים לכל סוכן בכל בנצ'מרק בנפרד. בלי זה קשה לשחזר את החישוב או לבדוק אם סוכן חזק ב-DeepSWE אבל חלש ב-Terminal-Bench. למשתמשים שצריכים יכולת ספציפית, נניח רק תיקוני באגים בלי שאלות Q&A, המדד המשולב עלול להסתיר את ההתאמה האמיתית.