NVIDIA משיקה את Cosmos-H-Dreams, סימולטור גנרטיבי בזמן אמת לרובוטיקה כירורגית

NVIDIA הכריזה על Cosmos-H-Dreams, סימולטור גנרטיבי מותנה-פעולה בזמן אמת לרובוטיקה כירורגית, שרץ על GPU בודד מסוג RTX PRO 6000. המערכת מזקקת את יכולותיו של Cosmos-H-Surgical-Simulator למודל תלמיד סיבתי (causal) בן צעדים ספורים, ומוגשת דרך FlashDreams, ספריית האינפרנס המואצת של NVIDIA להזרמה. התוצאה: סביבה אינטראקטיבית שאדם או מדיניות נלמדת יכולים לשלוט בה בלולאה סגורה.
מהסימולטור האופליין לזמן אמת
Cosmos-H-Surgical-Simulator, שעליו מבוסס הפיתוח החדש, הוא מודל יסוד עולמי (world foundation model) מותנה-פעולה שנבנה על גבי Cosmos-Predict2.5-2B ועבר פוסט-טריינינג על סט הנתונים Open-H-Embodiment. בהינתן פריים הקשר כירורגי ומסלול רובוט עתידי, הוא מייצר וידאו שמראה את ההשלכות החזותיות הצפויות של אותן פעולות, שימושי להערכת מדיניות אופליין וליצירת נתונים סינתטיים. Cosmos-H-Dreams לוקח את היכולת הזו למשטר זמן-אמת: החל מהפריורים הכירורגיים מרובי-הגופים שלמד המודל המקורי, הוא מתמחה בתפירת שולחן (tabletop suturing) עם ערכת המחקר da Vinci Research Kit (dVRK), ומזקק אותו למודל תלמיד סיבתי שמייצר את הסצנה אוטורגרסיבית. המודל המשוחרר מקבל פריים RGB התחלתי וזרם חי של קינמטיקת רובוט, ואז מייצר את מקטע הפריימים הבא לפני שהוא ממשיך עם בלוק הפעולה הבא.
שיתוף פעולה עם CMR Surgical ו-Cambridge Consultants
הגמישות של Cosmos-H-Dreams הודגמה בשיתוף פעולה עם CMR Surgical ו-Cambridge Consultants, ששילבו אותו עם בקר המנתח Versius, ובכך אפשרו הפעלה בזמן אמת על פלטפורמת Versius. זהו צעד מעבר למערכת dVRK האקדמית אל פלטפורמה מסחרית פעילה.
צינור מורה-תלמיד לרולאאוטים ארוכים
האתגר המרכזי הוא שמירה על דינמיקה כירורגית שימושית תוך הפחתת עלות הייצור. Cosmos-H-Dreams משתמש בצינור אימון מורה-תלמיד שתוכנן לרולאאוטים (rollouts) אוטורגרסיביים ארוכים. המורה הדו-כיווני מתחיל מה-checkpoint הפתוח של Cosmos-H-Surgical-Simulator על Open-H, שמשתמש בייצוג פעולה מאוחד בן 44 ממדים. עבור מודל dVRK השולחני ששוחרר, תוכן הפעולה הדו-זרועית, תרגום יחסי של ה-end-effector, סיבוב ומצב הגריפר, ממופה לייצוג המשותף הזה.
אימון על הדגמות כושלות לשיפור יציבות
המורה עובר כוונון עדין (fine-tuning) על תערובת dVRK שולחנית של JHU (אוניברסיטת ג'ונס הופקינס), הכוללת הדגמות מוצלחות לצד פרקי כישלון ו-out-of-distribution כמו נפילת מחט, זריקות מוחטאות, וקשירות קשר לא מוצלחות. הכישלונות האלה חשובים: סימולטור שנועד להעריך מדיניות חייב לשחזר את ההשלכות של פעולות גרועות, לא רק הדגמות אידיאליות. לשיפור היציבות ברולאאוטים ארוכים, תהליך האימון מגדיל בהדרגה את אופק הזמן של המורה, מתחילים ב-12 פריימים ומעלים עד 72 פריימים, כשבכל קפיצה מאתחלים את המודל המחומם עם משקולות מאומנות-מראש.
ייצוב התלמיד הסיבתי
מסלולי הדנוייזינג (denoising) של המורה מחושבים מראש ונשמרים במטמון. תלמיד סיבתי מאותחל מהמורה ומאומן לחקות את המסלולים השמורים. שלב החימום הזה מלמד את התלמיד לפעול עם קשב סיבתי ומטמון מפתח/ערך בזרימה (streaming key/value cache) לפני שהוא מתחיל ללמוד מההיסטוריה שהוא עצמו מייצר, פתרון לבעיה המוכרת של מודלים אוטורגרסיביים, שבזמן אימון רואים הקשר נקי של ground-truth, ובזמן הסקה נאלצים להתמודד עם שגיאות מצטברות משל עצמם.