13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
נווידיה משקיעה 500 מיליארד דולר: הבטוחה של מרכזי הנתונים ל-AI ה-FT פרסם ב-13 באוגוסט 2026 מאמר על האפשרות של EY להיות המפקחת של Anthropic מודל 2-ביט של NVIDIA Nemotron 3.5 Lightning מריץ קריאות כלי במשך 10 דקות עם 22 GB VRAM אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים
מחקר

כשמחליפים את ה-LLM ב-BERT הרובוט זז מהר יותר

מאת הדר מזרחי כתב/ת AgentNet
כשמחליפים את ה-LLM ב-BERT הרובוט זז מהר יותר

חוקרים מאוניברסיטת הואז'ונג הסינית ומחברת Huawei פרסמו את TurboVLA, מודל vision-language-action קומפקטי שמפיק פעולות לרובוט ב-31.2 מילישניות על RTX 4090 ומגיע ל-97.7% הצלחה בבנצ'מרק LIBERO. הטריק פשוט: אין שם LLM. במקום זה יושב מקודד טקסט מבוסס BERT, והתמונה וההוראה מחליפות מידע ישירות דרך מודול cross-attention. התוצאה: 0.2 מיליארד פרמטרים ופחות מ-1 ג'יגה VRAM באינפרנס.

ארכיטקטורה: V + L A במקום V L A

ב-VLA קלאסי הזרימה הולכת כך: תכונות ויזואליות מוקרנות למרחב הטוקנים של מודל השפה, נדבקות לטוקנים של ההוראה, עוברות דרך ה-LLM הכבד, ורק אז מפוענחות לפעולות. החוקרים שמו לב שאם ההוראה כבר אומרת מה לעשות ("הנח שלוש קערות זו על זו"), הטקסט צריך רק לכוון את המבט לפרטים הוויזואליים הרלוונטיים. המודל שלהם מקודד תמונה והוראה בנפרד, מעביר אותם cross-attention ישיר, ומוציא צ'אנק של 12 צעדי שליטה במעבר קדמי אחד.

המספרים מדברים: קטן יותר, מהיר יותר, מדויק יותר

על LIBERO TurboVLA משיגה 97.7% בממוצע עם 0.2 B פרמטרים, 0.9 ג'יגה VRAM ו-31.2 מילישניות. לשם השוואה, π0.5 מגיעה ל-96.9% עם 3.4 B פרמטרים, 12.8 ג'יגה VRAM ו-93.6 מילישניות. VLA-JEPA עומדת על 97.2% ב-2.8 B פרמטרים ו-108.7 מילישניות, CogVLA על 97.4% ב-8.3 B ו-115.5 מילישניות. אפילו בין המודלים הקלים, Evo-1 נותנת 94.8% ב-0.8 B, VLA-Adapter מגיעה ל-97.3% ב-1.5 B, TurboVLA מובילה בדיוק תוך שהיא הקטנה והמהירה מכולן.

על רובוט אמיתי זה גם עובד

הצוות בדק על AgileX Piper בארבע משימות: להרים גליל, להזיז כרטיס, ללחוץ על מהדק, לקנן שלוש קערות. שיעורי ההצלחה נעו בין 80% ל-92.5%, ובכל המשימות המודל עקף את π0.5. החלק הסימולטיבי ניתן לשחזור מלא: אימון והערכה נעשו על דאטאסטים פתוחים, LIBERO ו-RoboTwin 2.0 (לגרסת RoboTwin השתמשו במקודד ויזואלי גדול יותר, 0.4 B פרמטרים). דאטה קנייני שימש רק לכוונון עדין על הרובוט הפיזי.

המגבלה: אין פירוק משימות ברמה גבוהה

TurboVLA מתוכננת להוראות קונקרטיות. אם תבקשו מהרובוט "תכין ארוחת בוקר", אין מי שיפרק את זה לשלבים. המודל לא מכיל LLM שיודע לחשוב או לתכנן, הוא רק ממפה תצפית והוראה מפורשת לפעולות. זה trade-off מודע: מהירות וגודל תמורת יכולת הכללה שפתית.

קוד פתוח, משקלים פתוחים, אבל לא הכול

הקוד זמין בגיטהאב תחת רישיון Apache-2.0, המשקלים על Hugging Face. זה "משקלים פתוחים" במובן המעשי: אפשר להוריד, להריץ, לכוונן ולשלב במוצר מסחרי בלי לשאול אף אחד. נתוני האימון המלאים והפייפליין המלא של יצירת הדאטה לא פורסמו, אז זו לא "קוד פתוח" במובן המלא של שחזור מלא מאפס. למי שצריך VLA שרצה על כרטיס צרכני בלי להתפשר על דיוק, זו כרגע האופציה הכי מעשית על השולחן.