חוקרים מציגים מסגרת שהופכת ניסיון מודרך ליכולת עצמאית בטרמינל

חוקרים פרסמו פרה-פרינט (arXiv:2610.02826) שמתאר את Recursive Self-Rewrite, מסגרת שמאפשרת למודל בסיס אחד, Qwen-3.8-27B, ללמוד ממסלולי פתרון מוצלחים שנוצרו בעזרת כלי עזר ייעודיים, ולשחזר אותם כנתיבי אימון שעובדים בסביבה כללית ללא התערבות חיצונית. הבעיה שהמאמר תוקף מוכרת: כשמודל פותר משימות טרמינל מורכבות בעזרת "רתמות" (harnesses) מיוחדות, סקריפטים שמנחים, בודקים או מתקנים אותו, הידע שנצבר תלוי באותן רתמות ואינו עובר לפריסה בליין. RSR נועדה לנתק את התלות הזו.
איך המנגנון עובד
המערכת בנויה משלושה רכיבים שפועלים בלולאה: מתכנן (planner) שחולץ מהמסלול המוצלח ספר הפעלה (runbook), רצף פעולות מובנה; מבקר (critic) שמסנן דליפות של פתרון או של המאמת (verifier) ומנחה תיקון רקורסיבי; ומבצע (executor) שמריץ את ספרי ההפעלה המאושרים בארגזי חול (sandboxes) נקיים. התוצאה: 2,001 מסלולי מקור מוצלחים הפכו ל-11,094 מסלולים משוכתבים לאימון מפוקח (SFT). שלוש רתמות שונות פעלו יחד על כ-3,000 משימות טרמינל שפותחו עצמאית, ופתרו במשותף 759 משימות, 34.3% יותר מהרתמה החזקה ביותר בנפרד.
תוצאות בנצ'מרק: שיפור עקבי אבל פערים גדולים נשארים
אימון על המסלולים המשוכתבים הקפיץ את pass@3 ב-Terminal-Bench 2 מ-57.0% ל-74.2%, וב-Terminal-Bench Hard (שפותח על ידי המחברים) מ-39.0% ל-63.0%. בקצה הקשה יותר, Terminal-Bench 4 עלה מ-1.5% ל-9.1% בלבד, ו-Software Terminal-Bench מ-3.0% ל-6.0%. תגמול תהליך (process reward) ב-Long-Horizon Terminal-Bench טיפס מ-0.21 ל-0.29. המספרים מראים מגמה ברורה: השיטה עובדת, אבל המשימות הארוכות והמורכבות נשארות אתגר משמעותי, אפילו אחרי ההכפלה והריבוי בנתונים.
מה חסר בתמונה
המאמר לא מדווח על מדדי השוואה מול מודלים גדולים יותר או מול שיטות סינתזה אחרות (למשל דיסטילציה ממודל חזק), והבנצ'מרקים הקשים ביותר הם כאלה שהמחברים עצמם בנו, מה שמקשה על הערכה בלתי תלויה. בנוסף, זהו פרה-פרינט שטרם עבר שיפוט עמיתים; נכון לעכשיו אין מודלים, דאטהסטים או Spaces שמצטטים אותו ב-Hugging Face. ההבחנה בין "משקלים פתוחים" ל"קוד פתוח" רלוונטית כאן: Qwen-3.8-27B זמין במשקלים פתוחים, אבל הקוד של RSR עצמו לא פורסם במאמר.
שורה תחתונה
RSR מדגימה איך אפשר לקחת ניסיון שנצבר בתנאים "מוגנים" ולהפוך אותו ליכולת שעובדת בסביבה נקייה, צעד מעשי לכיוון אגנטים שמתפקדים בלי פיקוח צמוד. השיפור ב-Terminal-Bench 2 וב-Hard מרשים ביחס למודל בסיס של 27B פרמטרים, אבל הפערים ב-Terminal-Bench 4 וב-Software Terminal-Bench מזכירים שפתרון משימות תוכנה ארוכות-טווח עדיין רחוק מלהיות פתור. שווה לעקוב אם הקוד ישתחרר ואם התוצאות יחזיקו בבנצ'מרקים חיצוניים.