21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

מריגולד V2 הופך טרנספורמרים דיפוזיביים למעריכי עומק חד-עיניים חדים יותר

מריגולד V2 הופך טרנספורמרים דיפוזיביים למעריכי עומק חד-עיניים חדים יותר

ארכיטקטורה ואימון על כרטיס יחיד

החוקרים לקחו את Qwen-Image-Edit-2509, מודל דיפוזיה טרנספורמרי (DiT) שפותח לעריכת תמונות, כיווצו אותו ל-4 ביט, הוסיפו QLoRA בדרגה 128, וכיוונו אותו למשימת הערכת עומק על כרטיס צרכני יחיד של 32 ג'יגה-בייט. האימון מסתיים תוך כמה ימים, והאינפרנס רץ בצעד יחיד (single-step flow-matching) בלי להיתקע בזיכרון גם ברזולוציית 2K. כל המשקולות, הקוד והדמו פתוחים לציבור, והמאמר עתיד להופיע ב-SIGGRAPH Asia 2026.

יישור סמנטי ו-SinkLoss: שני התיקונים המרכזיים

ב-V1 הדחיסו מפות עומק דרך VAE של תמונות, בחירה שנשמעה לא הגיונית ועבדה. ב-V2 החליפו את זה ביישור פנימי: מעבירים את מפת העומק האמיתית דרך DINOv3 ומכריחים את הייצוגים של ה-DiT להתיישר איתם (iREPA-depth). הבעיה השנייה היא ש-Ground Truth סינתטי כמו Hypersim לא מושלם, להבי דשא מקבלים ערכי עומק שבורים. הפתרון הוא SinkLoss: מחלקים את התמונה ל-25 ריבועים (5×5), ומבצעים התאמה רכה (Sinkhorn matching) בין 25 הערכים החזויים ל-25 ערכי ה-GT, במקום התאמה פיקסל-לפיקסל קשיחה. הפונקציה סובלת רעש ב-GT ומייצרת מפות נקיות יותר.

תוצאות: שיפור של 16-26% ב-AbsRel

על KITTI ו-ETH3D מדווח שיפור של 16-26% במדד AbsRel מול המודל הקודם הטוב ביותר שאומן על נתונים דומים. איכותית, המודל פותר קצוות דקים, פרווה, עלווה, שיער, שמודלים קודמים החמיצו. בבנצ'מרקים NYUv2, ScanNet ו-DIODE מריגולד V2 מוביל מול כל מודל שאומן על היקף נתונים מקביל. השיפור עקבי גם במשימות רגרסיה צפופות אחרות: אומדן נורמליים למשטחים ופירוק תמונה פנימית (intrinsic image decomposition).

גמישות למשימות רגרסיה צפופות נוספות

אותם רכיבים, יישור סמנטי ו-SinkLoss, משרתים את כל המודאליות של מריגולד: עומק, נורמליים, אלבדו. החוקרים מציינים שהמתכון מכסה את כל המשימות "פשוט טוב יותר". להבדיל מעומק לרובוטיקה שנעצר בזכוכית, בצילום חישובי נדרש עומק שקוף, והמודל מכוונן גם לזה.