הרתמה שכתב המודל: רק 34 מ־64 שינויים באבולוציה עברו הכללה

צוות חוקרים של ByteDance Seed, יחד עם אוניברסיטת SUTD בסינגפור, ג'ורג'יה טק, M-A-P ו-TokenWave.AI, פרסם את HarnessDev, בנצ'מרק שהופך את כיוון הבדיקה: במקום למדוד את תשובת המודל, הוא מודד את קוד ההרתמה (agent harness) שהמודל כותב בעצמו. הרתמה היא הלולאה שמריצה את המודל, הכלים, ניהול ההקשר, השחזור והווריפיקציה; הבדלים ביניהן מסבירים למה GPT-5 פותר 35.2% מהמשימות ב-Terminus 2 אבל 49.6% ב-Codex CLI עם אותם משקלים.
מה נבדק ואיך
שישה מודלים, Opus 4.8, GPT-5.5, Gemini 3.1 Pro, DeepSeek V4 Pro, Qwen 3.7 Max ו-Seed 2.0 Pro, קיבלו זרע חלש זהה (פרימיטיבי קבצים, חיפוש ותהליכים, בלי לולאה, מתכנן או וריפייר) ונדרשו לבנות הרתמה מלאה לכל אחד מחמישה בנצ'מרקים בארבע דומיינים: קוד (SWE-bench Pro, Terminal-Bench 2.1), חיפוש (BrowseComp), כתיבה (EQ-Bench3) וניסויי ML (MLE-bench). סך הכול 2,207 משימות. כל מודל בנה שלוש הרתמות לכל בנצ'מרק (ממוצע @3). ההערכה נעשתה בשני אופנים: Self-Eval, אותה מודל שכתב גם מריץ, ו-Unified-Eval, כולם רצים תחת Gemini 3.1 Pro כמבצע (executor).
התוצאות: אופוס מוביל בממוצע, אבל הפערים תלויים בדומיין
ב-Self-Eval אופוס 4.8 השיג 67.8 בממוצע מול רפרנס אנושי של 86.2. בקוד: אופוס 69.3 ב-SWE-Pro מול 80.0 רפרנס, ג'מיני הוביל ב-Terminal-Bench עם 68.8 מול 88.8. בחיפוש הפער הכי רחב: GPT-5.5 הגיע ל-52.6 ב-BrowseComp מול 92.2 רפרנס. בכתיבה אופוס עקף את הרפרנס (84.6 מול 83.7), וב-ML שניהם אופוס (32.9) וג'מיני (32.4) עברו את ה-24.0 של הרפרנס האנושי. הרפרנסים לקוד, טרמינל וחיפוש נלקחו מדוח GPT-5.6 של OpenAI, לא מריצות חוזרות.
נפח קוד לא מנבא איכות, והרבה קוד מת
18 הרתמות הוסיפו 17,111 שורות נטו, אבל ג'מיני הוסיף הכי מעט (1,006 שורות) והוביל בטרמינל. מספר הבדיקות העצמיות בקושי התאם לציון (ספירמן 0.13-0.26); מספר קריאות הרוויזיה התאם טוב יותר (0.57). מתוך 108 רכיבי קוד שנוצרו, 72 הופעלו בפועל ו-18 לא נורו מעולם, כולם ניהול מצב וזיכרון. 11 מ-18 הרתמות הגדירו מחלקת State, אבל אף אירוע צ'קפוינט לא הופיע ב-26,679 מסלולי הרצה. 124 מ-587 פיצ'רי כתיבה היו קוד מת.
החלפת המבצע מערבבת את הדירוג, ולפעמים שוברת
ב-MLE-bench צריכת הטוקנים השתנתה פי 19: GPT-5.5 השיג 19.1% מדליות עם 29.3 מיליון טוקנים, DeepSeek V4 הגיע ל-19.6% עם 208.4 מיליון. כשהמבצע הוחלף לג'מיני, Qwen הרוויח 17.6 נקודות ב-BrowseComp ו-12.9 ב-MLE-bench, אבל אופוס צנח ב-SWE-Pro מ-69.3 ל-33.0, חלקית כי אחת ההרתמות שלו הקשיחה מגבלת 120 צעדים סביב המבצע המקורי. בהרתמת החיפוש של אופוס, שיעור השאילתות הכפולות קפץ מ-10.1% ל-88.2% אחרי ההחלפה.
אבולוציה: 9 שושלות, 73 גרסאות רשמיות, 34 שינויים שעברו
שלב האבולוציה אפשר לכל יוצר לתקן את הקוד שלו מול 100 משימות SWE-bench Pro קבועות וכל 89 משימות Terminal-Bench 2.1, עם תקציב של 10 זוגות הערכה רשמיים ועד שני גישושים של חמש משימות בין זוגות. 9 שושלות (5 self-runtime, 4 עם ג'מיני קבוע) הפיקו 73 גרסאות רשמיות ו-64 החלפות סמוכות, אבל רק 34 מהן שיפרו גם את 630 משימות ה-held-out שהיוצר לא ראה. המסקנה: מודלים יודעים לכתוב הרתמות עובדות, אבל רוב הניסיונות שלהם לשפר אותן באבולוציה מכוונת לא מחזיקים מחוץ לסט האימון.