רק 41.2% הצלחה ב-WeaveBench - המדד הגבוה ביותר שנרשם עד היום

האמינות של סוכנים ארוכי-טווח עדיין רחוקה מלהיות מושגת, למרות השיפורים במודלים. על גבי סט הבדיקה WeaveBench, הכולל 114 משימות היברידיות שמשלבות ממשק גרפי ושורת פקודה, שיעור ההצלחה הרשמי הגבוה ביותר עומד על 41.2% בלבד, מה שמצביע על פער משמעותי לפני שניתן יהיה להשתמש בטכנולוגיה בייצור. המודלים הקיימים מצליחים לבצע צעדים מקומיים, אך ללא מצב מבוקר ומתועד במפורש הם מאבדים את היכולת לשמור על עקביות המשימה כולה. כתוצאה מכך, סוכן שמסוגל לפתור שלב בודד עלול עדיין להיכשל כאשר ההיסטוריה שלו הופכת ללא-אמינה - הוא אינו יודע מה הושלם, מה נכשל ומה נותר.
המאמר המציג את LongHorizon-Harness מתייחס לבעיה כאל בעיית ניהול מצב משימה (task-state problem) ומציע שהאמינות תלויה לא רק במודל עצמו אלא גם במבנה (ה-harness) שמסביבו. הצוות טוען שהמעבר מניהול זיכרון פנימי של המודל לרישום חיצוני ומבוקר של כל שלב הוא המפתח לשיפור האמינות.
צ'מת, מרצה בסטנפורד, סיכם את המצב במילים ישירות: “Long-horizon tasks are still a joke. They do not work, and I do not care what anybody says. Do not show me a stupid evaluation. Do not tell me about some dumb script you ran for 48 hours. Long-horizon tasks are not handled well. They simply do not work.”
הנתון עדיין נמוך.