מריגולד V2 הופך טרנספורמרים דיפוזיביים למעריכי עומק חד-עיניים חדים יותר

ארכיטקטורה ואימון על כרטיס יחיד
החוקרים לקחו את Qwen-Image-Edit-2509, מודל דיפוזיה טרנספורמרי (DiT) שפותח לעריכת תמונות, כיווצו אותו ל-4 ביט, הוסיפו QLoRA בדרגה 128, וכיוונו אותו למשימת הערכת עומק על כרטיס צרכני יחיד של 32 ג'יגה-בייט. האימון מסתיים תוך כמה ימים, והאינפרנס רץ בצעד יחיד (single-step flow-matching) בלי להיתקע בזיכרון גם ברזולוציית 2K. כל המשקולות, הקוד והדמו פתוחים לציבור, והמאמר עתיד להופיע ב-SIGGRAPH Asia 2026.
יישור סמנטי ו-SinkLoss: שני התיקונים המרכזיים
ב-V1 הדחיסו מפות עומק דרך VAE של תמונות, בחירה שנשמעה לא הגיונית ועבדה. ב-V2 החליפו את זה ביישור פנימי: מעבירים את מפת העומק האמיתית דרך DINOv3 ומכריחים את הייצוגים של ה-DiT להתיישר איתם (iREPA-depth). הבעיה השנייה היא ש-Ground Truth סינתטי כמו Hypersim לא מושלם, להבי דשא מקבלים ערכי עומק שבורים. הפתרון הוא SinkLoss: מחלקים את התמונה ל-25 ריבועים (5×5), ומבצעים התאמה רכה (Sinkhorn matching) בין 25 הערכים החזויים ל-25 ערכי ה-GT, במקום התאמה פיקסל-לפיקסל קשיחה. הפונקציה סובלת רעש ב-GT ומייצרת מפות נקיות יותר.
תוצאות: שיפור של 16-26% ב-AbsRel
על KITTI ו-ETH3D מדווח שיפור של 16-26% במדד AbsRel מול המודל הקודם הטוב ביותר שאומן על נתונים דומים. איכותית, המודל פותר קצוות דקים, פרווה, עלווה, שיער, שמודלים קודמים החמיצו. בבנצ'מרקים NYUv2, ScanNet ו-DIODE מריגולד V2 מוביל מול כל מודל שאומן על היקף נתונים מקביל. השיפור עקבי גם במשימות רגרסיה צפופות אחרות: אומדן נורמליים למשטחים ופירוק תמונה פנימית (intrinsic image decomposition).
גמישות למשימות רגרסיה צפופות נוספות
אותם רכיבים, יישור סמנטי ו-SinkLoss, משרתים את כל המודאליות של מריגולד: עומק, נורמליים, אלבדו. החוקרים מציינים שהמתכון מכסה את כל המשימות "פשוט טוב יותר". להבדיל מעומק לרובוטיקה שנעצר בזכוכית, בצילום חישובי נדרש עומק שקוף, והמודל מכוונן גם לזה.