סקילד חושפת את S1: מודל יסוד שלומד משימה של עשר דקות מדוגמה בודדת

סקילד (Skild AI) השיקה את S1, מודל יסוד (foundation model) שמבצע משימות מניפולציה ארוכות, מעל עשר דקות, לאחר צפייה בסרטון הדגמה יחיד, בלי שום כוונון עדין. המודל פועל דרך למידה בהקשר (in-context learning): מקבל סרטון כפרומפט, ומוציא רצף פעולות רובוטיות המשלים את המשימה בכל סביבה ועל כל גוף רובוטי (embodiment).
איך זה עובד בפועל
החברה מדגימה הכנת קפה, שתילת עציץ וטיגון פנקייקס, משימות שלא הופיעו בנתוני האימון המוקדם. כשהצוות חיפש במאגר האימון דוגמאות להיפוך פנקייק, לא נמצא אף מקרה; S1 הסיק את הפעולה מהסרטון הבודד. בניגוד למודל שפה שמייצר טקסט, כאן הפלט הוא מסלולי תנועה ובקרה מוטורית, והמודל אמור להכליל לגוף רובוטי שונה מזה שבסרטון.
השוואה למודלי VLA קיימים
לדברי סקילד, במשימות מוכרות S1 משתווה לביצועים של מודלי VLA (Vision-Language-Action) שמופעלים בפרומפט שפה. היתרון מופיע במשימות חדשות: ככל שהאימון המוקדם גדל, הפער גדל אקספוננציאלית. החברה טוענת שכדי להגיע לאותה דיוק ש-S1 משיג מדוגמה אחת, מודלי VLA נוכחיים היו זקוקים ל-50 עד 100 שעות איסוף נתונים ואימון נוסף.
עמידות ואלתור בזמן אמת
המודל לא משחזר את ההדגמה אחת לא אחת. לפי החברה, הוא מגלה הבנה של השכל הישר (common-sense): עמיד בפני הפרעות, מאלתר כשיש טעות, גם אם האדם בסרטון לא תיקן אותה, ולפעמים מבצע בדיוק גבוה יותר מהמדגים האנושי. אם הטענות נכונות, זהו שינוי פרדיגמה: במקום לאסוף מאות שעות הדגמה לכל משימה חדשה, מספיק סרטון אחד.
מרובוטיקה ניידת למניפולציה כללית
בשנה שעברה הציגה סקילד את לוקופורמר (Locoformer), שהדגים למידה בהקשר לניידות: שליטה בכל רובוט והתאמה להפרעות כמו רגליים שבורות או גלגלים נעולים. S1 מרחיב את אותה יכולת למניפולציה כללית. החברה מכנה את התוצאה "מוח אומני-גופי" (omni-bodied brain); אם הרובוט יכול לזוז, המוח יזיז אותו, גם בגוף חדש לגמרי.
פריסה ראשונית ושלב הבא
S1 נפרס כבר היום אצל שותפים תעשייתיים מוגבלים, עם הרחבה ללקוחות נוספים בחודשים הקרובים. בסקילד מגדירים את המודל "האור הראשון בנתיב חדש לאינטליגנציה כללית המעוגנת בעולם הפיזי". בלוג טכני מפורט אמור להתפרסם בהמשך.