אתגר AI City ב-ECCV 2026: מודלי עולם של NVIDIA שולטים בחיזוי וידאו, גישה גיאומטרית פותרת Sim2Real

חיזוי וידאו: קוסמוס של NVIDIA מככב
ארבעה מתוך חמשת הפתרונות המובילים במסלול חיזוי הווידאו הגנרטיבי (Track 5) התבססו על מודלי היסוד Cosmos של NVIDIA. הזוכה בדירוג הציבורי, צוות Qyn, בנה את CosmosAlign באמצעות כוונון עדין של Cosmos3-Nano, הגרסה הקלה במשפחה, כדי לחזות תרחישי תנועה ריאליסטיים מהיסטוריה ויזואלית קצרה ומתיאורי תנועה של כלי רכב והולכי רגל. המסלול דרש מהמערכות לחזות מה יקרה בהמשך הסצנה, לא רק לזהות מה מופיע בפריימרים הקיימים.
תפיסה תלת-ממדית מרובת מצלמות: כיול מצלמה במקום אימון מחדש
במסלול 1, שהתמקד בזיהוי ומעקב אובייקטים על פני מצלמות מסונכרנות והצבתם במערכת קואורדינטות תלת-ממדית משותפת, זכתה קבוצת EVA עם GaugeAlign. הצוות זיהה שהכשל במעבר מסימולציה לעולם האמיתי (Sim2Real) הוא גיאומטרי במהותו, ולא רק הבדל במראה החזותי. הפתרון משתמש בכיול מצלמה כדי להעביר את הסצנה למוסכמת הקואורדינטות שמצפה לה נקודת הבדיקה (checkpoint) הקפואה של Sparse4D של NVIDIA, ואז ממפה את התחזיות בחזרה, בלי לאמן מחדש את המודל.
הבנת בטיחות: פיגום ראיות במקום הסקה ישירה
מסלול 2 בחן הבנת אירועי בטיחות תחבורתיים: המודלים אומנו על סרטוני תאום-דיגיטלי סינתטיים ונבחנו על תיעוד תנועה אמיתי מרובה זוויות. הזוכה, Latent Painter - UTE, הציג את Traffic-JEPA, מערכת דו-שלבית שנותנת למודל השפה פיגום ראיות (evidence scaffold) במקום לדרוש ממנו להסיק ולתאר את האירוע כולו בצעד אחד. הרעיון המרכזי: להבין את אירוע התנועה תחילה, לוודא עקביות של ההבנה, ורק אז לכתוב את הכיתוב.
זיהוי חריגות: שני מומחים ושופט קפוא
במסלול 3, שעסק בהסקת חריגות תנועה, האם אירע אירוע, מה קרה, מה גרם לו, ואיך לסכם את הסצנה, ניצחה Stellarview AI עם Reason or Recite. המערכת מפעילה שני מודלים מומחים: אחד שלמד מעקבות אימון משוכתבות שהפרידו סצנה, שאלה, ראיות עם חותמות זמן, הסקנה ומסקנה; השני שלמד את סגנון התשובות שבהערות. שניהם מייצרים תשובה מועמדת לכל שאלה, ומודל שפה קפוא משמש כשופט ובוחר ביניהן.
מחוץ לתחום: עין-דג וצומת
טבלת ה-out-of-domain הראשונה של מסלול 3 התמקדה בווידאו צומת בעדשת עין-דג (fisheye). המערכות נדרשו לזהות הפרה, את משתמש הדרך המעורב, תנועה בסצנה, נתיב, תנאים ותזמון, ולהחזיר דוח מובנה ותיאור. את הדירוג הזה הובילה קבוצת UWIPL_ETRI, שהדגימה יכולת הסתגלות לסוג מצלמה וסביבה שלא נראו באימון.