הרובוט שלמד משימה בשניות בלי אימון נוסף: GEN-1.5 מציג יכולת few-shot ראשונה בקנה מידה רחב

מודל היסוד הרובוטי החדש GEN-1.5 מדגים לראשונה למידה של מיומנויות פיזיות מדוגמה בודדת או ממעט דוגמאות, בלי עדכון גרדיאנט, בלי כוונון עדין, ובזמן אמת. החוקרים מגדירים את ההישג כרגע "GPT-3 של הרובוטיקה": בדיוק כפי ש-GPT-3 הראה שלמידה מתוך הקשר (in-context learning) עובדת בקנה מידה רחב בשפה, GEN-1.5 מראה שהמקבילה הפיזית אפשרית. המשימות עדיין פשוטות וקצרות אופק, אבל זו הפעם הראשונה שמודל מצליח לעשות את זה בלי הגבלות על סוגי אובייקטים, סוגי משימות או מודליות חישה.
ארכיטקטורה וקלטים
GEN-1.5 הוא מודל מולטי-מודאלי גדול שמעבד וידאו (חלון זיכרון של 30 שניות), חיישנים נוספים, שפה ותחושה עצמית (פרופריוספציה), ומוציא מסלולי פעולה בתדר 100 הרץ. הקלט המשולב מאפשר לו לקשר בין הדגמה חזותית לביצוע מוטורי מדויק, בלי שלב אימון נפרד לכל משימה. החוקרים מכנים את השימוש בדוגמאות סנסוריות-מוטוריות בתוך חלון ההקשר "הנחיה פיזית" (physical prompting), אנלוגיה ישירה להנחיית טקסט במודלי שפה.
למידה מדוגמה אחת והכללה הרכבתית
היכולת המרכזית היא למידה ב-one-shot: הדגמה של 3 עד 12 שניות מספיקה כדי שהמודל יבצע את המשימה החדשה בתוך שניות. מעבר לזה, המודל מציג הכללה הרכבתית (compositional generalization), כשנותנים לו שתי הנחיות פיזיות שונות ברצף, הוא משרשר אותן להתנהגות ארוכת-אופק אחת. יכולת כזו לא נצפתה קודם במודלים רובוטיים בקנה מידה כזה, והיא רומזת על הבנה של מבנה המשימה ולא רק חיקוי תנועות.
העברה מסימולציה וחיקוי אדם
שתי יכולות נוספות בולטות: העברה אפס-שוט מסימולציה לעולם האמיתי (sim-to-real), כשהדגמה שהוקלטה בסביבה מדומה משמשת הנחיה פיזית תקפה לרובוט אמיתי, אף שהאימון המוקדם לא כלל נתוני סימולציה; וחיקוי אדם-לרובוט, שבו אדם מדגים בידיו מול מצלמות הרובוט, והמודל משחזר את הפעולה בידי הרובוט. בשני המקרים אין צורך במיפוי מפורש בין גוף אנושי לגוף רובוטי, המודל לומד את ההתאמה מתוך הנתונים.
התאמה ב-few-shot ומגבלות נוכחיות
לצד הלמידה ללא אימון, המודל תומך גם בהתאמת few-shot באמצעות ירידת גרדיאנט (gradient descent) כשנדרש דיוק גבוה יותר. החוקרים מדגישים שהמשימות הנוכחיות פשוטות, קצרות אופק, ורחוקות מאוטונומיה כללית. עם זאת, זו הפעם הראשונה שמודל אחד מציג את מכלול היכולות האלה, one-shot, few-shot, zero-shot, הרכבתיות, סימולציה-למציאות, וחיקוי אדם, בלי הגבלות תחומיות. אם GPT-3 סימן את המעבר ממודלים ייעודיים למודל שפה כללי, GEN-1.5 מסמן את המקבילה הרובוטית: מודל שמתקרב ל"תיגש לרובוט, תבקש משימה, והוא מבצע".