מודל אחד לומד מתיעוד צוותי ומשכתב את ספר המשחקים של הסוכנים

מאמר חדש של סטנפורד ו-Together AI מראה שצוות של שלושה מודלים, שלומד מתיעוד שיחות קודמות איך לחלק תפקידי בדיקה ואתגור, פותר בעיות שאף אחד מהם לא הצליח לפתור לבד. במבחני מתמטיקה ופיזיקה הצוות הגיע ל-66.7% דיוק, לעומת 48.8% של המודל החזק ביותר בנפרד, והביס גם בחירה אידיאלית מתוך התשובות שכל מודל ייצר בעצמו, כלומר שיתוף הפעולה ייצר תשובות נכונות שלא היו באף פלט בודד.
למה דיון והצבעה לא מספיקים
הגישה המקובלת היום ב-multi-agent systems היא לתת למודלים לנהל דיון ואז להצביע. בפועל זה בעיקר בוחר תשובה שכבר היתה למישהו, ולא מייצר ידע חדש. החוקרים זיהו שהבעיה אינה בחוסר יכולת של המודלים, אלא בהיעדר מבנה: בלי חלוקת תפקידים ברורה, מי בודק, מי מאתגר, מי משחק devil's advocate, הדיון מתכנס מהר מדי להסכמה שגויה.
למידה מ-15 דוגמאות בלבד
החידוש כאן הוא מודל-מנהל (meta-model) שעובר על תיעוד ריצות קודמות של הצוות, מזהה דפוסי כישלון ומשכתב את הפרוטוקול: מי מכפיל-בודק את מי, מתי מכניסים אתגר נגדי, ואיך מעבירים את השרביט בין שלבי הפתרון. הלמידה הזו הסתכמה ב-15 בעיות תרגול בלבד, כמות זניחה ביחס לנתוני אימון סטנדרטיים, והספיקה כדי לשנות מהותית את ההתנהגות הקולקטיבית.
תוצאות שמדברות בעד עצמן
על בנצ'מרקים של מתמטיקה ופיזיקה הצוות המתואם השיג 66.7% ממוצע, מול 48.8% של המודל הטוב ביותר בסולו. חשוב יותר: הצוות עקף גם Oracle selection, בחירה מושלמת בדיעבד מבין התשובות שהמודלים כבר ייצרו בנפרד. המשמעות היא שה-interaction עצמו יצר מסלולי חשיבה שלא היו נגישים לאף מודל בנפרד, לא רק סינן טוב יותר את הקיים.
תפקידים ברורים במקום תסריט קבוע
המסקנה המעשית: במקום להריץ תסריט דיון-והצבעה קבוע, כדאי להגדיר תפקידים מפורשים, checker, challenger, synthesizer, ולתת למודל-מנהל לעדכן את חלוקת העבודה על בסיס היסטוריית ריצות. זה הופך את ה-pipeline למשהו שמשתפר עם הזמן, בלי צורך ב-fine-tuning כבד או בנתונים מסומנים חדשים.