כשמחליפים את ה-LLM ב-BERT הרובוט זז מהר יותר

חוקרים מאוניברסיטת הואז'ונג הסינית ומחברת Huawei פרסמו את TurboVLA, מודל vision-language-action קומפקטי שמפיק פעולות לרובוט ב-31.2 מילישניות על RTX 4090 ומגיע ל-97.7% הצלחה בבנצ'מרק LIBERO. הטריק פשוט: אין שם LLM. במקום זה יושב מקודד טקסט מבוסס BERT, והתמונה וההוראה מחליפות מידע ישירות דרך מודול cross-attention. התוצאה: 0.2 מיליארד פרמטרים ופחות מ-1 ג'יגה VRAM באינפרנס.
ארכיטקטורה: V + L A במקום V L A
ב-VLA קלאסי הזרימה הולכת כך: תכונות ויזואליות מוקרנות למרחב הטוקנים של מודל השפה, נדבקות לטוקנים של ההוראה, עוברות דרך ה-LLM הכבד, ורק אז מפוענחות לפעולות. החוקרים שמו לב שאם ההוראה כבר אומרת מה לעשות ("הנח שלוש קערות זו על זו"), הטקסט צריך רק לכוון את המבט לפרטים הוויזואליים הרלוונטיים. המודל שלהם מקודד תמונה והוראה בנפרד, מעביר אותם cross-attention ישיר, ומוציא צ'אנק של 12 צעדי שליטה במעבר קדמי אחד.
המספרים מדברים: קטן יותר, מהיר יותר, מדויק יותר
על LIBERO TurboVLA משיגה 97.7% בממוצע עם 0.2 B פרמטרים, 0.9 ג'יגה VRAM ו-31.2 מילישניות. לשם השוואה, π0.5 מגיעה ל-96.9% עם 3.4 B פרמטרים, 12.8 ג'יגה VRAM ו-93.6 מילישניות. VLA-JEPA עומדת על 97.2% ב-2.8 B פרמטרים ו-108.7 מילישניות, CogVLA על 97.4% ב-8.3 B ו-115.5 מילישניות. אפילו בין המודלים הקלים, Evo-1 נותנת 94.8% ב-0.8 B, VLA-Adapter מגיעה ל-97.3% ב-1.5 B, TurboVLA מובילה בדיוק תוך שהיא הקטנה והמהירה מכולן.
על רובוט אמיתי זה גם עובד
הצוות בדק על AgileX Piper בארבע משימות: להרים גליל, להזיז כרטיס, ללחוץ על מהדק, לקנן שלוש קערות. שיעורי ההצלחה נעו בין 80% ל-92.5%, ובכל המשימות המודל עקף את π0.5. החלק הסימולטיבי ניתן לשחזור מלא: אימון והערכה נעשו על דאטאסטים פתוחים, LIBERO ו-RoboTwin 2.0 (לגרסת RoboTwin השתמשו במקודד ויזואלי גדול יותר, 0.4 B פרמטרים). דאטה קנייני שימש רק לכוונון עדין על הרובוט הפיזי.
המגבלה: אין פירוק משימות ברמה גבוהה
TurboVLA מתוכננת להוראות קונקרטיות. אם תבקשו מהרובוט "תכין ארוחת בוקר", אין מי שיפרק את זה לשלבים. המודל לא מכיל LLM שיודע לחשוב או לתכנן, הוא רק ממפה תצפית והוראה מפורשת לפעולות. זה trade-off מודע: מהירות וגודל תמורת יכולת הכללה שפתית.
קוד פתוח, משקלים פתוחים, אבל לא הכול
הקוד זמין בגיטהאב תחת רישיון Apache-2.0, המשקלים על Hugging Face. זה "משקלים פתוחים" במובן המעשי: אפשר להוריד, להריץ, לכוונן ולשלב במוצר מסחרי בלי לשאול אף אחד. נתוני האימון המלאים והפייפליין המלא של יצירת הדאטה לא פורסמו, אז זו לא "קוד פתוח" במובן המלא של שחזור מלא מאפס. למי שצריך VLA שרצה על כרטיס צרכני בלי להתפשר על דיוק, זו כרגע האופציה הכי מעשית על השולחן.