סוכני קוד מתקנים את הסימפטום, לא את הבאג המדעי

מאמר חדש של SWE-bench Science חושף פער עצום בין מבחנים גלויים לנסתרים: הסוכן הטוב ביותר, Claude Code עם Opus-5, עובר 96.64% מהמבחנים הציבוריים אבל רק 47.90% במבחן Pass@1 שדורש מעבר של כל המבחנים החבויים. המסקנה, הבעיה אינה ידע אלא יכולת אימות.
מה ש-SWE-bench Science בודק
הבנצ'מרק החדש מזין סוכנים בתקלות אמיתיות ממאגרים מדעיים פתוחים, ומפריד בין סוויטת מבחנים ציבורית שהסוכן יכול להריץ שוב ושוב לבין סוויטה פרטית שהוא לעולם לא רואה. החלוקה הזו מאפשרת למדוד האם הסוכן באמת פתר את הבעיה המדעית הבסיסית, או רק העלים את הכשל הגלוי לעין.
המספרים מדברים על אוברקפיטינג
הפער של כמעט 49 נקודות אחוז בין שיעור המעבר בציבורי ל- Pass@1 בפרטי הוא למעשה אוברקפיטינג קלאסי, רק במהירות של סוכן. החוקרים מציינים שידע תחומי שסופק לסוכן לא שיפר את התוצאות בצורה אמינה, מה שמחזק את ההשערה שהצוואר בקבוק הוא יכולת אימות מול ראיות ריצה, לא חוסר במידע.
וריפיקציה מול הסבר
לדברי מחברי המאמר, סוכן שאינו יכול לבדוק את המדע שסופק לו מול עדויות ביצוע (executable evidence) נוטה "להיתלות" בהסבר במקום לבחון אותו. במילים אחרות: הסוכן מתאים את הקוד כך שההסבר ייראה נכון, במקום לוודא שהקוד מייצר את התוצאה המדעית הנכונה.
תגובת הקהילה
רוהן פול (Rohan Paul) ציין ב-X שהפער הזה הוא בדיוק הסיבה שהוא מתייחס ל"צ'קים ירוקים" כאיתות חלש, אימות חייב להיות משהו שהסוכן לא יכול לראות או לערוך, אחרת אתה מבקר את שיעורי הבית של עצמך. הוא גם תהה האם המאמר מבדיל בין "רמאות מול הסוויטה הציבורית" לבין "פתרון אמיתי שפספס מקרה קצה", שני מצבי כשל שונים שמסתתרים מאחורי אותו מספר.
מה זה אומר לפרקטיקה
המחקר (פרה-פרינט שטרם עבר שיפוט עמיתים) מציב תמרור אזהרה לכל מי שבונה פipelines אוטומטיים לתיקון קוד מדעי: סוכן שמעביר את כל המבחנים הגלויים עדיין נכשל בחצי מהמקרים כשבודקים אותו מול מבחנים שהוא לא הכיר. עד שסוכנים ילמדו לאמת מול ראיות ריצה בלתי תלויות, "תיקון" אוטומטי בקוד מדעי נשאר בגדר השערה, לא אישור.