מסגרת חדשה מייצרת 37 אלף סביבות טרמינל ריאליסטיות לאימון סוכנים

חוקרים הציגו את Terminal-Universe, מסגרת שבונה סביבות טרמינל שלמות מתוך מסלולי פעולה של סוכנים (agent trajectories), ומנפיקה 37.3 אלף מרחבי עבודה "מספיקי-משימה" (task-sufficient) המיועדים לאימון המשך (post-training) ולהערכה. במקום להסתפק בדגימות קוד מבודדות או בפקודות בודדות, המערכת משחזרת את ההקשר המלא: מבנה קבצים, מצב מערכת, היסטוריית הרצה ותלויות בין שלבים. המאמר זמין כפרה-פרינט ב-Papers with Code.
איך זה עובד
הצינור (pipeline) לוקח טרייקטוריות שנאספו מסוכנים שמבצעים משימות בקוד אמיתי, ומפרק אותן לרצפים של מצב-פעולה-תוצאה. כל רצף הופך לסביבת טרמינל עצמאית שאפשר לאתחל מחדש, להריץ בה פקודות ולבדוק אם הסוכן משחזר את ההצלחה. התוצר הוא קורפוס של 37,300 סביבות כאלה, שכל אחת מהן מכילה את המינימום הנדרש כדי לפתור משימה ספציפית, בלי רעש מיותר, בלי תלויות חיצוניות שלא נלכדו במקור.
שיפור מדיד בבנצ'מרקים קיימים
כשהחוקרים הריצו SFT (אימון מפוקח) על הקורפוס החדש, הם דיווחו על קפיצה של 11.9 נקודות בביצועי סיבוב-בודד (single-round) על Terminal-Bench 2.1, ועל שיפור של 13.8 נקודות בביצועי רב-סיבובי (multi-round) על EvoCode-Bench v2. שני הבנצ'מרקים בודקים יכולת של מודלים לכתוב, להריץ ולתקן קוד בתוך טרמינל חי, לא רק להשלים קטעים סטטיים. המספרים מגיעים ישירות מהמאמר ולא עברו אימות חיצוני.
למה זה משנה לאימון סוכנים
עד עכשיו, רוב הקורפוסים לאימון סוכני קוד התבססו על מאגרי GitHub גולמיים או על זוגות שאלה-תשובה סינתטיים. הבעיה: סוכן שלומד מקבצים מנותקים לא נתקל במציאות של טרמינל, שגיאות הרצה, תלויות חסרות, מצב מערכת משתנה. Terminal-Universe מנסה לסגור את הפער הזה על ידי אספקת סביבות שניתן להריץ בהן הכול מקצה לקצה, בלי תשתית חיצונית. זה מקרב את האימון לתנאי פריסה אמיתיים (deployment conditions).
סייגים ושאלות פתוחות
המאמר הוא פרה-פרינט שטרם עבר שיפוט עמיתים. החוקרים לא פרסמו מדדי השוואה מול קורפוסים קיימים באותו גודל, ולא פירטו כמה מהשיפור נובע מגודל הקורפוס לעומת איכות השחזור. גם לא ברור עד כמה הסביבות מגוונות בדומיינים (ווב, מערכות, נתונים) והאם יש הטיה לכיוון משימות מסוימות שהיו נפוצות בטרייקטוריות המקוריות. הקוד והנתונים טרם שוחררו לציבור במועד הפרסום.