הבנצ'מרקים משתפרים, אבל התנאים להחלפת ג'וניורים עדיין לא התקיימו

האופק שמתארך והמציאות שנשארת במקום
הנתונים החדשים של METR מראים שאופק הזמן, האורך שבו מודל מצליח ב־50% מהמשימות, הוכפל כל שבעה חודשים מ־2019 עד 2025, והקצב אף הואץ ב־2024-2026. אלא ש־50% הצלחה לא מאפשר לאייש תפקיד; אופק ה־80% קצר דרמטית, ומודלים מתקרבים לשלמות רק במשימות של פחות מארבע דקות אנושיות, בעוד שבמשימות של יותר מארבע שעות הם נכשלים ב־90% מהמקרים. חשוב מכך: המשימות של METR מכוונות להיות עצמאיות ומוגדרות היטב, מה שאדם ללא הקשר קודם עושה בשעתיים, בעוד חצי השנה הראשונה של ג'וניור מוקדשת כולה לרכישת הקשר: איזה שירות אחראי למה, למה קיימת ההפשטה הזו, למי פונים. הבנצ'מרק מודד בדיוק את החלק שנשלל ממנו הקושי האמיתי.
כשהמעבדה שיצרה את המבחן מוותרת עליו
בפברואר 2026 OpenAI הפסיקה לדווח על SWE-bench Verified והמליצה לאחרים לנהוג כך. בבדיקה של 27.6% מהדאטהסט התגלה שלפחות 59.4% מהבעיות שנבדקו הכילו קייסים פגומים שדוחים פתרונות תקינים, ונמצאה זיהום: מודלי חזית שיחזרו טלאים מדויקים ופרטי בעיות מילה במילה, עדות לחשיפה באימון. התוצאה הרשמית טיפסה מ־74.9% ל־80.9% בחצי שנה, אבל הכשלים הנותרים נבעו ברובם מתכונות הדאטהסט, לא ממגבלות המודל. במעבר לסוויטות קשות יותר ונקיות יותר, SWE-bench Pro, Terminal-Bench, בנצ'מרקים ארוכי־אופק חדשים, הציונים צונחים הרחק מהמספרים שמככבים בפוסטי ההשקה.
עלות האימות מול עלות ההאצלה
התנאי השלישי, ולעתים קרובות המוזנח, הוא שעלות הבדיקה של פלט הסוכן תרד מתחת לעלות ההאצלה לאדם. METR הריצה ניסוי מבוקר אקראי עם 16 מהנדסי קוד פתוח מנוסים, והראיות הניסיוניות כאן הן הנקיות ביותר שיש. כשהמודל מייצר קוד שנראה תקין אבל מכיל באגים עדינים, זמן הסקירה של מהנדס בכיר עולה על הזמן שהיה לוקח לו לכתוב את הקוד מלכתחילה. כל עוד פער זה קיים, המודל נשאר כלי עזר, לא תחליף.
התנאי הרביעי שלא תלוי בשלפניו
הכותב מצביע על תנאי רביעי שאמור להדאיג דווקא משום שהוא אינו דורש את שלושת הקודמים. גם אם המודלים יישארו בלתי אמינים במשימות ארוכות, גם אם הבנצ'מרקים ימשיכו להיות מוטים, וגם אם אימות יישאר יקר, ארגונים עשויים להחליט להחליף ג'וניורים בכל זאת, מטעמי תקציב או לחץ ניהולי. זו החלטה ארגונית, לא טכנולוגית, והיא עלולה להתקבל הרבה לפני שהתנאים הטכניים יבשילו.