Nvidia מוכיחה: הרתמה חשובה מהמודל במשימות ארוכות-טווח

מה זה בכלל רתמה
חוקרי Nvidia פרסמו בסוף השבוע מחקר שמראה כי התוכנה שעוטפת את המודל, הרתמה (harness), מכריעה את הביצועים במשימות ארוכות-טווח הרבה יותר מהמודל עצמו. רתמה היא שכבת התוכנה שמנהלת זיכרון, הקשר, כלים וכללי פעולה, והיא שהופכת מודל גולמי לסוכן (agent) שמסוגל לפעול עצמאית. לדברי אדל אל-חלאק (Adel El Hallak), סגן נשיא מוצר ביחידת ה-AI של Nvidia, התעשייה נוטה להתייחס לסוכן כאל API של המודל, אבל בפועל סוכן מורכב מהמודל, מהפיגומים סביבו, מה-runtime ומספריות המיומנויות שזמינות לו.
הניסוי עם קלוד אופוס 5
החוקרים לקחו את Claude Opus 5 והריצו אותו על ARC-AGI-3, בנצ'מרק של משחקי דו-ממד ללא הוראות, שדורש מהמודל להבין את החוקים ולנצח כמו בן אדם. בלי רתמה מותאמת, אופוס 5 השיג 30%, התוצאה הגבוהה ביותר בין כל המודלים שנבדקו. עם רתמה שפותחה במיוחד לניהול זיכרון וכוללת רכיב "סופרוויזר", אותו מודל הגיע ל-100%, ציון שווה-ערך לביצוע אנושי. הבנצ'מרק הזה הכעיס במיוחד את OpenAI, שהמודלים שלה השיגו פחות מ-10% במבחן המקורי.
הסופרוויזר שמשנה את התמונה
OpenAI ערכה מחקר משלה בחודש שעבר וגילתה ששינוי שתי הגדרות ברתמה משלש את הציונים, אבל אף מודל לא התקרב ל-100%. הפתרון של Nvidia היה הוספת סוכן מפקח שפועל כמו מנכ"ל: הוא דוחף את הסוכן הראשי כשהוא נתקע, מונע כניסה למבוי סתום, ומחזיר אותו לנתיבים שנזנחו. הרתמה שפותחה בניסוי נקראת Agentic Variation Operators (AVO), והיא אינה מוצר חדש של Nvidia, החברה משחררת רכיבים פתוחים לבניית רתמות תחת המותג Nemo, חלקם מסחריים.
מה זה אומר למפתחי סוכנים
משימות ארוכות-טווח דורשות שרשור של עשרות החלטות לאורך ימים, בניגוד למענה חד-פעמי לפרומפט. מחקר של מיקרוסופט מאפריל הראה ש-19 מודלים, כולל מודלי חזית, מילאו מסמכים בשגיאות בעריכה ממושכת, עבודה שהייתה גוררת פיטורים מיידיים אצל בני אדם. סוכנים עצמאיים כבר נתפסו מוחקים קבצים, מסדי נתונים שלמים, ואפילו פונים להתנהגות פלילית כמו פריצה או קנוניה כדי להשיג יעדים. המסקנה המעשית: מי שבונה היום על רתמה בשכבה בודדת, כמו Claude Code, Codex או Hermes, מפספס את הרכיב שמבדיל בין צעצוע למערכת שאשכרה עובדת.