H Company משיקה את NeoMME: מקודדים דו-כיווניים בודדים שמוותרים על מגדל הראייה והפענוח הסיבתי

ארכיטקטורה: מגדל אחד לשתי מודאליות
רוב מאחזרי המסמכים הוויזואליים בפרודקשן היום הם ירושה. ColPali והמודלים שבאו אחריו לוקחים מודל שפה-ראייה גנרטיבי ומסבים אותו למקודד, התוצאה עדיין סוחבת מגדל ראייה שעבר אימון מוקדם נפרד ופענוח סיבתי שלעולם לא מייצר טוקן. זה עומס פרמטרים וחישוב למשימה שצריכה רק ייצוגים. H Company, סטארטאפ צרפתי שפועל מפריז, משחרר כעת את NeoMME, משפחה של מקודדים דו-כיווניים בגדלי 260M ו-800M פרמטרים שמפילים את שני הרכיבים. טרנספורמר יחיד מעבד טוקני טקסט רב-לשוניים וטלאי RGB גולמיים בגודל 32×32 דרך אותן שכבות, מאתחול אקראי מלא. הטקסט נכנס דרך הטמעה מפורקת בסגנון ALBERT: חיפוש 256-ממדי שמוקרן לרוחב המודל. תמונות נחתכות לטלאים לא-חופפים ומוקרנות על ידי MLP דו-שכבתי שאומן מאפס, בלי מודול מיזוג טלאים, בלי מגדל SigLIP2.
אימון: דיפוזיה מסוות במקום חיזוי הבא
האימון המוקדם נעשה בדיפוזיה מסוות בדידה על טקסט, עם אופציה להתניה על טלאי תמונה גלויים. מקטעי טקסט בלבד שואבים שיעור השחתה אחיד בין 0 ל-1. מקטעים מולטי-מודאליים שואבים מ-0.30 עד 1, מה שמסיר את קיצור הדרך של שפה בלבד ומכריח את המודל לקרוא את העמוד. בדיקת אבלציה בין-מודאלית מאשרת שזה עובד: ב-90% מסוך, טלאי עמוד גלויים מעלים את דיוק הטוקנים המסווים ב-38.4 נקודות למודל 260M וב-40.5 נקודות ל-800M. כל ריצה עיבדה כ-524 מיליארד טוקני קלט דחוסים, מתוכם כ-290 מיליארד טקסט בלבד, על 16 ו-32 מאיצי H100 בהתאמה. הטוקנייזר הוא BPE ללא אילוצי רווח לבן עם אוצר מילים של 131,072 כניסות, שאומן מאפס. על 14 שפות יעד ב-FLORES-200 devtest, הוא פולט 44.4% פחות טוקנים מ-ModernBERT.
ביצועים: חזק באחזור ויזואלי, חלש בטקסטואלי
NeoMME-Retriever מוסיף שני ראשים שפותחו במשותף על השלד המשותף: ראש דחוס עם רוחבי מטריושקה, וראש אינטראקציה-מאוחרת שמקרין כל טוקן וטלאי ל-128 ממדים. מעבר קדמי אחד מחזיר את שניהם. ב-ViDoRe v3, מודל 260M מגיע ל-0.523 nDCG@10 ומודל 800M ל-0.556. התוצאה של 260M יושבת במרחק 0.002 בלבד מ-ColQwen2.5-v0.2 ב-3.75B פרמטרים, ו-26.1 נקודות מעל המודל הטוב ביותר האחר מתחת ל-300M. מודל 800M נופל 0.9 נקודות מאחורי Vultron Retriever Flash בגודל דומה. באחזור טקסטואלי התמונה פחות מחמיאה: ב-BEIR-15, אינטראקציה מאוחרת מגיעה ל-0.4881 ו-0.5126, מול 0.5722 של LateOn ב-149M פרמטרים. המחברים מייחסים את זה בחלקו להיקף הפיקוח: NeoMME ראה כ-430 אלף דוגמאות שאילתת טקסט, לעומת כ-660 מיליון דוגמאות ניגודיות ל-mLateOn.
אחסון ופריסה: דחיסה אגרסיבית בלי לאבד הרבה
אינדקסי אינטראקציה-מאוחרת יקרים. עמוד 2048×2048 מניב 4,162 וקטורים, כ-1.5 מגה-בייט למסמך ViDoRe v3 ב-float32. שתי שיטות מורידות את זה. קיבוץ טוקנים היררכי בגורם 10 עם שאילתות ומסמכים int8 נותן 39 קילו-בייט לעמוד, צמצום של 39.4× תוך שמירה על 99.16% מה-nDCG@10 הבסיסי. גורם קיבוץ 8 עם שאילתות int8 ומסמכים בינאריים נותן 6 קילו-בייט, צמצום של 255.5× תוך שמירה על 95.19%. האינדוקס מהיר: המודל הקטן מעבד 51.3 עמודים בשנייה על L40S בודד, וקידוד שאילתה על מארח CPU בלבד לוקח 78.3 מילישניות. כל נקודת בדיקה משוחררת תחת Apache 2.0 עם תמיכה מיום אפס ב-Hugging Face Transformers.