סקיל-גלו מארגן מיומנויות במשפחות פרוצדורליות

חוקרים הציגו שיטה חדשה לארגון הידע שצוברים סוכני שפה גדולים לאורך זמן. במקום לשמור כל משימה בנפרד או לדחוס הכול למסמך יחיד, המערכת מזהה את התהליך המשותף לקבוצת משימות דומות, שומרת רק את השלד שלו, ומשחזרת את הפרטים הספציפיים בכל הרצה מחדש.
איך זה עובד בפועל
הבעיה המוכרת: כשסוכן כותב מיומנות (skill) טקסטואלית אחרי כל משימה, הספרייה או מתנפחת לאלפי פריטים שכל אחד תקוע בהקשר המקורי שלו, או נדחסת למסמך כללי מדי שלא עוזר במשימות קונקרטיות. סקיל-גלו (SkillGLoW) פותר את זה בשני שלבים, המקומי והגלובלי. ברמה המקומית הסוכן כותב מיומנות מההרצה הנוכחית; ברמה הגלובלית מיומנויות ששייכות לאותה "משפחה פרוצדורלית" מאוחדות ל-Prior מופשט, נקי מפרטי מופע (de-instantiated). את הפרטים החסרים המערכת מייצרת מחדש בזמן אמת לכל משימה חדשה. שער קבלה (commit gate) מכניס Prior לספרייה רק אם הרצה אמיתית מראה שהוא לא מוריד ביצועים.
תוצאות על ארבעה בנצ'מרקים
הניסויים הקיפו ארבעה תחומים, חשיבה מתמטית, אוטומציית טרמינל, תיקון תוכנה ושליטה גופנית (embodied control), על שלושה מודלים שונים. מול בסיס ללא מיומנויות, ה-Priors הוסיפו 17.2 נקודות בממוצע על משימות קשות, עם שיפור חיובי בכל 12 הרצות השיפור-המתמשך. כשהפעילו גם שחזור מקומי קפץ הפער ל-18.0 נקודות. הספרייה נשארה רזה: Prior אחד לכל משפחה פרוצדורלית, פי 3.6 יותר קומפקטית ממאגר פר-משימה שטוח.
השוואה למתחרה קיים
באותו פרוטוקול בדיקה, גלו ניצח אופטימייזר מסמך-יחיד שפורסם קודם ב-15 מתוך 21 תאי השוואה. המבחן המשכנע ביותר הגיע מחוץ להתפלגות האימון: בלי שום התאמה, הספרייה הקפיצה הצלחה במשימות ALFWorld שלא נראו קודם מ-73.9% ל-83.9%. זה ראיה חזקה לכך שמה שעובר הלאה הוא התהליך הפותר, לא זיכרון המשימה הספציפית.
הערות וסייגים
המאמר מופיע כפרה-פרינט ב-arXiv ועדיין לא עבר שיפוט עמיתים. הקוד והנתונים זמינים, מה שמאפשר שחזור, אבל המדדים נמדדו בסביבות סימולציה ולא בפרודקשן אמיתי. עדיין לא ברור איך השיטה תתנהג כשמספר המשפחות הפרוצדורליות יגדל לסדרי גודל של אלפים, או כשהמודל הבסיסי יוחלף בגרסה חדשה לגמרי.