21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

אתגר AI City ב-ECCV 2026: מודלי עולם של NVIDIA שולטים בחיזוי וידאו, גישה גיאומטרית פותרת Sim2Real

אתגר AI City ב-ECCV 2026: מודלי עולם של NVIDIA שולטים בחיזוי וידאו, גישה גיאומטרית פותרת Sim2Real

חיזוי וידאו: קוסמוס של NVIDIA מככב

ארבעה מתוך חמשת הפתרונות המובילים במסלול חיזוי הווידאו הגנרטיבי (Track 5) התבססו על מודלי היסוד Cosmos של NVIDIA. הזוכה בדירוג הציבורי, צוות Qyn, בנה את CosmosAlign באמצעות כוונון עדין של Cosmos3-Nano, הגרסה הקלה במשפחה, כדי לחזות תרחישי תנועה ריאליסטיים מהיסטוריה ויזואלית קצרה ומתיאורי תנועה של כלי רכב והולכי רגל. המסלול דרש מהמערכות לחזות מה יקרה בהמשך הסצנה, לא רק לזהות מה מופיע בפריימרים הקיימים.

תפיסה תלת-ממדית מרובת מצלמות: כיול מצלמה במקום אימון מחדש

במסלול 1, שהתמקד בזיהוי ומעקב אובייקטים על פני מצלמות מסונכרנות והצבתם במערכת קואורדינטות תלת-ממדית משותפת, זכתה קבוצת EVA עם GaugeAlign. הצוות זיהה שהכשל במעבר מסימולציה לעולם האמיתי (Sim2Real) הוא גיאומטרי במהותו, ולא רק הבדל במראה החזותי. הפתרון משתמש בכיול מצלמה כדי להעביר את הסצנה למוסכמת הקואורדינטות שמצפה לה נקודת הבדיקה (checkpoint) הקפואה של Sparse4D של NVIDIA, ואז ממפה את התחזיות בחזרה, בלי לאמן מחדש את המודל.

הבנת בטיחות: פיגום ראיות במקום הסקה ישירה

מסלול 2 בחן הבנת אירועי בטיחות תחבורתיים: המודלים אומנו על סרטוני תאום-דיגיטלי סינתטיים ונבחנו על תיעוד תנועה אמיתי מרובה זוויות. הזוכה, Latent Painter - UTE, הציג את Traffic-JEPA, מערכת דו-שלבית שנותנת למודל השפה פיגום ראיות (evidence scaffold) במקום לדרוש ממנו להסיק ולתאר את האירוע כולו בצעד אחד. הרעיון המרכזי: להבין את אירוע התנועה תחילה, לוודא עקביות של ההבנה, ורק אז לכתוב את הכיתוב.

זיהוי חריגות: שני מומחים ושופט קפוא

במסלול 3, שעסק בהסקת חריגות תנועה, האם אירע אירוע, מה קרה, מה גרם לו, ואיך לסכם את הסצנה, ניצחה Stellarview AI עם Reason or Recite. המערכת מפעילה שני מודלים מומחים: אחד שלמד מעקבות אימון משוכתבות שהפרידו סצנה, שאלה, ראיות עם חותמות זמן, הסקנה ומסקנה; השני שלמד את סגנון התשובות שבהערות. שניהם מייצרים תשובה מועמדת לכל שאלה, ומודל שפה קפוא משמש כשופט ובוחר ביניהן.

מחוץ לתחום: עין-דג וצומת

טבלת ה-out-of-domain הראשונה של מסלול 3 התמקדה בווידאו צומת בעדשת עין-דג (fisheye). המערכות נדרשו לזהות הפרה, את משתמש הדרך המעורב, תנועה בסצנה, נתיב, תנאים ותזמון, ולהחזיר דוח מובנה ותיאור. את הדירוג הזה הובילה קבוצת UWIPL_ETRI, שהדגימה יכולת הסתגלות לסוג מצלמה וסביבה שלא נראו באימון.