רמי פאבר (Remi Fabre) משחרר פרק שלישי בסדרת לייב-אקשן עם רובוטים אמיתיים

וחושף במקביל את המוח שמפעיל את הברווזון שלו ## הברווז שגנב את ההצגה
פאבר, חוקר רובוטיקה שמתמקד באינטראקציה טבעית, העלה לרשת את הפרק השלישי בסדרה שמצולמת כולה עם רובוטים פיזיים, בלי אנימציה, בלי עריכה שמסתירה תקלות. בטייק הראשון כמעט הכל השתבש, והוא כבר עמד לעצור את הצילומים. רק כשצפה בחומר הגלם הבין שה-Microduck, הרובוט הקטן במרכז הסצנה, סיפק מה שהוא מכנה "הופעה ברמת אוסקר" דווקא מתוך הכאוס. העובדה שהרגעים הכי משכנעים יצאו דווקא כשהכל הלך עקום אומרת משהו על הפער בין הדגמות מלוטשות לבין התנהגות בשטח.
דאטה-סט רגשות בקוד פתוח
לצד הסרטון שחרר פאבר מאגר נתונים (dataset) ב-Hugging Face שמכיל את "הרגשות" שייצר עבור המערכון, סדרה של מצבים התנהגותיים שמאפשרים לברווז להגיב בסקרנות, תסכול, שמחה וכן הלאה. המאגר פתוח לשימוש חופשי, והקריאה המפורשת היא לא רק לצרוך אלא ליצור חדשים ולהחזיר לקהילה. זו גישה שמזכירה את המודל של ספריות תנועה ברובוטיקה, רק שבמקום מסלולי הליכה מדובר בדפוסי התנהגות אקספרסיביים, והרישיון מאפשר הטמעה מסחרית בלי מגבלות מיוחדות.
קוואקד: מוח שפה טבעית לברווז
ההכרזה המשמעותית יותר היא קוואקד (quackd), שכבת תכנון שיושבת מעל המיומנויות הקיימות של הרובוט. המשתמש כותב מטרה בשפה חופשית, "מצא את הכדור ובעט בו", ומודל שפה גדול (LLM) מפרק אותה לרצף פעולות שהברווז כבר יודע לבצע: זיהוי, ניווט, מניפולציה. המערכת תומכת גם במודלים מקומיים, כך שאין תלות בענן או במפתח API. המטרות נשמרות בקבצי `.duck`, פורמט טקסטואלי פשוט שמקביל לרעיון של קבצי הגדרה דקלרטיביים, הגדרת "מה" בלי לפרט "איך".
ארכיטקטורה מודולרית במקום מונוליט
הבחירה להפריד בין שכבת התכנון (קוואקד) לבין שכבת הביצוע (הסקילים הקיימים) מאפשרת להחליף מודל שפה בלי לכתוב מחדש את בקרת המנועים, ולהיפך. זה דפוס מוכר ברובוטיקה מודרנית, הפרדה בין task planning ל-motion planning, אבל היישום כאן מינימליסטי במכוון: קובץ טקסט אחד למטרה, סט מיומנויות סגור, ומתווך LLM שמתרגם ביניהם. היתרון הוא שקיפות ואפשרות דיבאוג; החיסרון הוא שהמערכת מוגבלת למה שהסקילים מכסים, ואין לה יכולת ללמוד תנועות חדשות מההנחיה.
מה חסר בתמונה
פאבר לא פרסם מדדי ביצועים (benchmarks), לא אחוזי הצלחה במשימות, לא זמני תגובה, לא השוואה מול תכנון קלאסי או מול מודלי VLA (Vision-Language-Action) אנד-טו-אנד. גם לא ברור איזה LLM שימש ברירת מחדל בהדגמה, ואיך המערכת מתמודדת עם כישלון של מיומנות בודדת באמצע רצף. המאגר ב-Hugging Face זמין, הקוד של קוואקד פתוח, וכל מי שיש לו ברווז תואם (או פלטפורמה דומה) יכול להריץ בעצמו. זו נקודת התחלה טובה, לא תוצר מוגמר.