בנצ'מרק חדש בודק אם אג'נטים שורדים שעות של עבודה אוטונומית

מאט סטאלון (Matt Stallone) הכריז על SWE Odyssey, בנצ'מרק סטנדרטי במשפחת ההערכות לטווח אולטרה-ארוך שנועדה לענות על שאלה פשוטה: האם אג'נטים מסוגלים לעבוד עצמאית במשך שעות ועדיין לבנות את המוצר הנכון. ההכרזה מגיעה על רקע רוויה הולכת וגוברת של בנצ'מרקים קיימים, שמפסיקים להבדיל בין המודלים המתקדמים ביותר.
57 משימות בחמישה ז'אנרים עם הקשר של עשרות מיליוני טוקנים
הבנצ'מרק כולל 57 משימות שמתפרסות על פני חמישה ז'אנרים: בניית מוצרים מאפס (בסגנון Slack), תיקון באגים מושרשים עמוק, אופטימיזציית ביצועים, ותרגום מערכות שלמות בין שפות (חשבו על שכתוב ל-Bun). ממוצע הטוקנים למשימה נע בין 30 מיליון ליותר, סדר גודל שמכריח את האג'נט לשמור הקשר לאורך זמן ארוך במיוחד.
שיטת הערכה שונה מהותית: בלי שופט LLM ובלי סוויטות נסתרות
השינוי הגדול ביותר הוא במדידת נכונות. SWE Odyssey לא משתמש ב-LLM כשופט קוד ולא מסתמך על סוויטות בדיקה נסתרות. במקום זאת, המערכת בוחנת את המוצר המסופק דרך צופים התנהגותיים דטרמיניסטיים (deterministic behavioral observers). אם המוצר דורש הרשמה, הצופה בודק את זרימת ההרשמה בפועל; אם נדרשת עריכה שיתופית, הצופה מאמת שהיא עובדת בזמן אמת.
מטרות מבוססות רתמה (harness-based goals) גרמו לאג'נטים לעבוד יותר, אבל לא תמיד בכיוון הנכון
הנתונים חשפו דפוס מעניין: כשהמשימות הוגדרו דרך `/goal` מבוסס רתמה, האג'נטים ביצעו יותר עבודה, אבל חלק גדול ממנה היה טנגנציאלי למפרט. GPT-5.6-Sol נצפה נכנס ללולאות של מימוש פיצ'רים, כתיבת בדיקות נוספות, ואז מימוש מחדש מול אותן בדיקות, מאמץ עודף שלא קידם את התוצאה הנדרשת.
פער יעילות דרמטי בין המודלים המובילים
הטרייסים (traces) חשפו פער יעילות משמעותי: Claude-Sonnet-5 צרך יותר מכפול טוקנים בהשוואה ל-GPT-5.6-Sol, אבל לא הצליח להיחלץ מרצועת הביצועים שלו. בטווחים אולטרה-ארוכים, אוטונומיה מתבררת כשמירה על כוונה, תכנון המשימות הנכונות בסדר הנכון, והימנעות מעבודה מיותרת, לא רק כמות הטוקנים שנשרפים.
תיקוף נכונות דרך שתי מימושי ייחוס ומוטציות מכוונות
לצורך ציון נכונות, כל מפרט נצפה נבדק מול שתי מימושי ייחוס (reference implementations) שנבנו באופן בלתי תלוי, וכן מול סט מלא של מוטציות ממוקדות (targeted mutations) שמוכיחות שכל התנהגות גם ניתנת למימוש וגם נאכפת משמעותית בזמן הניקוד. בזמן שאג'נטים חקרו את הסביבה הווירטואלית...