29 בספטמבר 2026 האקדמיה ארכיון
מבזקים
FuseReg סוגר את הפער בין שחזור ליצירה בראייה ממוחשבת בלי לגעת באנקודר שומר המקורות: ProvenanceGuard בודק לא רק את העובדה, אלא מאיפה היא באה אופן-איי משיקה את Dots, סוכנים תמיד-פעילים שמכוונים ישר ל-Muse של מטא H Company משיקה את Holo4: מודל אחד לקליקים, קוד ו-API בכל פלטפורמה עליבאבא משיקה את Qwen-Audio-3.1-Realtime, מודל קול דו-כיווני שמחליט מתי לדבר
מוצרים

FuseReg סוגר את הפער בין שחזור ליצירה בראייה ממוחשבת בלי לגעת באנקודר

FuseReg סוגר את הפער בין שחזור ליצירה בראייה ממוחשבת בלי לגעת באנקודר

הבעיה: שתי משימות, מרחב אחד

אוטואנקודרים ייצוגיים (RAEs) משתמשים בפיצ'רים מאנקודר ויזואלי מאומן מראש, במקרה הזה DINOv3-L, כמרחב לטנטי משותף גם לדקודר פיקסלים וגם למודל דיפוזיה (DiT). הבעיה: הדקודר רוצה שכבות רדודות, עשירות בפרטי פיקסל, ואילו ה-DiT מעדיף שכבות עמוקות יותר, סמנטיות. היוריסטיקה קבועה של איחוד שכבות (layer fusion) כופה פשרה אחת על שתי משימות שמרוויחות ממידע שונה.

הפתרון: דגימה אקראית במקום היוריסטיקה קבועה

FuseReg מחליף את הבחירה הקבועה באימון על תת-קבוצות אקראיות של שכבות האנקודר. הרעיון התיאורטי פשוט: דגימת תת-קבוצות מענישה רגישות לאי-הסכמה בין שכבות (cross-layer disagreement). במילים אחרות, המודל לומד לא לבנות על הרכב שכבות מסוים אחד. דקודר אחד של FuseReg מצליח לשחזר מקלט מלא, מקלט דליל, ואפילו משכבה בודדת, בלי אימון מחדש, ומשיג PSNR גבוה יותר מדקודרים שפותחו לכל פיוז'ן בנפרד.

המספרים: שיפור דו-ספרתי ב-gFID

ההשפעה על יצירה מדידה. החלפת הדקודר בלבד, עם אותו מחולל RAEv2 DiT-XL, מורידה unguided gFID מ-3.01 ל-2.21, ירידה של 27%. כשמיישמים את אותה רגולריזציה גם על שלב הדיפוזיה (DiT-Base), unguided gFID צונח מ-13.96 ל-9.93, שיפור של 29%. ב-DiT-XL המספר יורד מ-2.91 ל-2.38. המגמה חוזרת על עצמה גם עם משפחות אנקודר שונות.

מה זה אומר בפועל

במקום לחפש את הפיוז'ן האופטימלי היחיד, FuseReg מאמן את המודלים להיות עמידים מול התפלגות שלמה של הרכבי שכבות. התוצאה: מידע השחזור מתפזר אחיד יותר לאורך עומק האנקודר, התלות בשכבה בודדת יורדת, והייצוגים נשארים יציבים כשהרכב השכבות משתנה. זהו שינוי פרדיגמה, לא אופטימיזציה נקודתית, אלא רובסטיות כעיקרון אימון.