אותו מודל, רתמה אחרת: תוצאות שונות לגמרי

מאמר חדש שפורסם כפרה-פרינט ב-arXiv מראה שמה שמחליט כמה טוב סוכן קוד (coding agent) פותר משימות אינו רק המודל, אלא גם ה"רתמה" (harness) שעוטפת אותו. הרתמה היא המערכת שקובעת מה המודל רואה, באילו כלים הוא יכול להשתמש, ואיך העבודה נמשכת. החוקרים השאירו את המודל והמשימות קבועים, והחליפו רק את תצורת הרתמה. התוצאה: שיפור דו-ספרתי במדדי הצלחה, בלי לגעת במשקלים בכלל.
שתי תצורות, אותו היסטוריון
בניסוי השוו שתי גרסאות של אותה רתמה. תצורת הביקורת (control) מזינה למודל את כל השיחה בסדר כרונולוגי מלא. תצורת הטיפול (treatment) שומרת את אותו תיעוד, אבל מקצרת מכנית תוצאות כלים ישנות כשה-contexto מתמלא, ומגיבה כשהעבודה נתקעת או חוזרת על עצמה. שלושה בנצ'מרקים שימשו לבדיקה: SWE-bench Verified, SWE-bench Pro ו-FeatureBench. הניסוי המרכזי רץ בחלון הקשר צפוף של 20,480 טוקנים, עם מגבלת זמן של 480 שניות לניסיון, על 169 משימות של Verified.
המספרים בחלון הצפוף לא משאירים מקום לספק
בתנאים האלה, הטיפול הקפיץ את שיעור המעבר מכישלון להצלחה (F2PF) הממוצע למשימה מ-28% ל-49%, ואת מספר הפתרונות המלאים מ-43 ל-72. זה לא שיפור שולי, זה הבדל בין "בקושי עובד" ל"ממש פותר". והכי חשוב: אותה תצורת טיפול קפואה, בלי שום כוונון מחדש (retuning) ספציפי למודל, שיפרה את שני המדדים גם על שלושה מודלים נוספים בעלי ארכיטקטורות שונות. כלומר, המנגנון עובד כהכללה, לא כהתאמה נקודתית.
בחלון רחב התמונה מורכבת יותר
כשהרחיבו את חלון ההקשר ובדקו את Qwen3.6, התוצאות על Verified ו-Pro היו קרובות בין שתי התצורות. FeatureBench דווקא שמר על F2PF גבוה יותר תחת הטיפול. עוד ממצא מעניין: בחלון הרחב, הטיפול צרך פחות טוקנים של פרומפט לכל תור (turn). זה הגיוני, כשה-history מנוהל טוב יותר, לא צריך לדחוף למודל את כל הזבל שהצטבר.
המסקנה המתבקשת: תפסיקו להעריך מודל לבד
המאמר טוען, ובצדק, שהערכות של סוכני קוד חייבות להתייחס לצמד מודל+רתמה כיחידה אחת שנבדקת. לפרסם ציון של מודל על SWE-bench בלי לציין איזו רתמה הריצה אותו זה כמו לפרסם צריכת דלק של מנוע בלי להגיד באיזה רכב הוא מותקן. הרתמה היא לא פרט טכני זניח; היא חלק מה-solver.
כמה סייגים לפני שמתלהבים
זה פרה-פרינט, לא עבר שיפוט עמיתים. הניסויים מכסים שלושה בנצ'מרקים ספציפיים וקבוצה מוגבלת של מודלים; לא ברור איך זה מתנהג על משימות ארוכות יותר, שפות אחרות, או בסביבת פרודקשן אמיתית עם קודבייסים של מיליוני שורות. וגם: "משקלים פתוחים" זה לא "קוד פתוח", המודלים שנבדקו לא בהכרח זמינים לשימוש חופשי. אבל הנקודה המרכזית עומדת: הנדסת הרתמה היא כבר לא עבודת אינסטלציה, היא חלק מהמחקר.