חוקרים מטסינגואה וטנסנט מציגים מודל שפה-ראייה קפוא שמניע רובוטים בפקודות תנועה פשוטות

RoboDawn מגיע ל-73.6% הצלחה ב-one-shot על RoboTwin 2.0 C2R, ומכה מדיניות שאומנו על דאטה רובוטי מלא, בלי אימון נוסף בכלל.
איך זה עובד בפועל
הצוות לקח VLM קיים, הקפיא את המשקולות שלו, ולימד אותו לתרגם הוראות שפה טבעית לרצף פקודות בסיסיות: זוז, סובב, פתח/סגור גריפר. בלי fine-tuning על פעולות רובוטיות, בלי איסוף דאטה ייעודי, רק פרומפטינג חכם ומבנה פקודות מינימלי. הגישה מזכירה את מה ש-RT-2 ניסה לעשות, אבל כאן ה-VLM נשאר לגמרי קפוא, והבקרה מתבצעת בשכבה דקה מעליו.
המספרים שמאחורי הכותרת
על הבנצ'מרק RoboTwin 2.0 C2R, סוויטה שמדמה משימות מניפולציה בסביבה פוטוריאליסטית, RoboDawn משיג 73.6% הצלחה ב-one-shot. לשם השוואה, מדיניות BC ו-RL שאומנו על מלוא דאטה האימון של RoboTwin מגיעות לתוצאות נמוכות יותר. והנה הקיק: הביצועים ממשיכים להשתפר ככל שמאפשרים יותר צעדי אינפרנס (inference-time scaling), בלי לגעת במשקולות.
למה זה משנה את המשחק
המשמעות היא שהידע הגלום ב-VLM גדול מספיק כדי לכסות מרחב פעולות רובוטי רחב, אם רק יודעים איך לחלץ אותו. במקום לאמן מודל ייעודי לכל משימה או רובוט, אפשר להשתמש ב"מוח" קיים ולהשאיר את האדפטציה לשכבת בקרה דקה. זה מוריד דרמטית את עלות הכניסה לרובוטיקה כללית, ומעביר את הפוקוס מאיסוף דאטה רובוטי יקר להנדסת פרומפטים ומבני פקודות.
מה חסר בתמונה
הפרינט (arXiv:2609.229) לא מפרט מדדי השהיה, צריכת מחשוב באינפרנס, או עמידות להפרעות ויזואליות ופיזיות בעולם האמיתי. RoboTwin הוא סימולציה, הפער לסביבה פיזית (sim-to-real) עדיין לא נמדד כאן. גם לא ברור איך הגישה מתמודדת עם משימות ארוכות-אופק שדורשות תכנון היררכי, ולא רק רצף פקודות אטומיות.
השורה התחתונה
RoboDawn מראה ש-VLM קפוא + ממשק פקודות מינימלי = בקר רובוטי חזק באופן מפתיע. אם המגמה של inference-time scaling תחזיק גם במעבר לעולם האמיתי, אנחנו מסתכלים על נתיב מהיר בהרבה לרובוטיקה כללית, בלי לאמן מודל חדש לכל פלטפורמה. הפרויקט זמין ב-robodawn.top.