21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

לינקאפ משיקה את SPARSEUP: מקודד דליל של 149 מיליון פרמטרים ברישיון Apache 2.0

לינקאפ משיקה את SPARSEUP: מקודד דליל של 149 מיליון פרמטרים ברישיון Apache 2.0

צוות המחקר של Linkup שחרר את SPARSEUP, מודל הטמעה דליל (sparse embedding) בקוד פתוח שרץ על שלדת ModernBERT של 149 מיליון פרמטרים. המודל זמין ב-Hugging Face ברישיון Apache 2.0 וניטען דרך Transformers או Sentence Transformers עם trust_remote_code=True. לפי כרטיס המודל, SPARSEUP משיג 56.4 nDCG@10 ממוצע על BEIR-13, התוצאה הגבוהה ביותר ש-Linkup מכירה למקודד דליל מבוסס אוצר מילים ציבורי מתחת ל-150 מיליון פרמטרים.

מה שמאחורי המודל

רוב מודלי האחזור הפתוחים כיום הם דחוסים (dense): וקטור אחד לכל טקסט. מודלים דלילים, לעומת זאת, מוציאים משקלים על פני אוצר המילים, כל מימד מתאים לטוקן אמיתי, מה שמאפשר לאנדקס אותם באינדקסים הפוכים (inverted indexes) ולקרוא אותם ידנית. הם גם נוטים להתאים מילים נדירות טוב יותר. הטריגר לפיתוח היה השחרור של LightOn: הם פרסמו נתונים פתוחים, מתכון אימון, מודל דחוס (DenseOn) ומודל אינטראקציה-מאוחרת (LateOn). SPARSEUP ממלא את המשבצת הדלילה החסרה, כשהוא משתמש באותה משפחת שלדות ואותם נתוני כוונון עדין, כך שניתן להשוות את שלושת סגנונות האחזור זה לצד זה.

איך נבנה SPARSEUP

האימון מתחיל מנקודת הביקורת (checkpoint) של LateOn-unsupervised. לנקודה הזו לא היה ראש MLM, אז הצוות השתיל בחזרה את ראש ה-MLM המקורי של ModernBERT. הכוונון העדין השתמש בתערובת הנתונים של LightOn עם למידה ניגודית (contrastive) בלבד: לכל שאילתה נדגמו 7 נגטיבים קשים ממאגר של 50, בתוספת נגטיבים מתוך הבאץ'. אין זיקוק מקודד-צולב (cross-encoder distillation), והאימון כולו נכנס על H100 בודד. SPLADE וניל על השלדה הזו ייצר "שקים" ענקיים מלאי מילות-עצירה (stopwords). Linkup תיקנו את זה בשלושה שינויים: הזזת לוגיטים, המקודד מחשב log(1 + ReLU(x - 15)) כי הלוגיטים של ModernBERT ישבו גבוה מדי וריוו את הלוג באתחול; top-k לכל מיקום, כל טוקן קלט שומר רק את 12 המימדים החזקים ביותר באוצר המילים לפני max pooling, מה שמגביל התרחבות פר טוקן ולא גודל וקטור כולל; וקיפול אותיות רישיות, BPE ברמת בייט שומר heat, Heat, Ġheat ו-ĠHeat כמזהים נפרדים. SPARSEUP מקפל אותם למזהה אחד ושומר את המשקל הגדול ביותר, מה שמוריד את מימדי הפלט מכ-50 אלף לכ-34 אלף. שאילתות ומסמכים מקבלים קידומות [Q] ו-[D], והניקוד הוא מכפלה סקלרית. אורכי מקסימום בהערכה: 128 טוקנים לשאילתה, 512 למסמך.

בנצ'מרקים: התמונה המלאה

מול מקודדים דלילים אחרים על BEIR-13 (nDCG@10, בלי MS MARCO), SPARSEUP מוביל לפי כרטיס המודל. אלא שההשוואה המבוקרת פחות מחמיאה: כשהשלדה והנתונים קבועים, LateOn משיג 58.9, DenseOn מגיע ל-57.9, ו-SPARSEUP עומד על 56.4. חשוב לציין ש-SPARSEUP משתמש בחיפוש Seismic מקורב, בעוד LightOn מדווחים חיפוש מדויק. SPARSEUP מנצח ב-ArguAna וב-Touché ומכה את DenseOn ב-HotpotQA, אבל מפגר בסטים סמנטיים יותר, הפער הגדול ביותר ב-FiQA, ו-DBPedia היא נקודת חולשה נוספת. על BEIR מנוקה-זיהום (decontaminated), הפער מ-DenseOn מצטמצם ל-0.17 נקודות. Linkup מזהירים ש-NQ ו-MS MARCO המנוקים מכילים רק 21 ו-46 שאילתות בהתאמה, כך שהתוצאות שם רועשות.

ביצועים ודלילות

על MS MARCO, SPARSEUP מפיק בממוצע 47 איברים לא-אפסיים לשאילתה ו-190 למסמך. לשם השוואה, SPLADE-v3 מוציא 25 ו-170 בהתאמה. עם אינדקס הפוך של Seismic, המודל מגיע ליותר מ-97% recall מול חיפוש מדויק בכ-380 מיקרו-שניות לשאילתה, חד-נימי (single-threaded). ב-Linkup אומרים שניפוח גודל הווקטור יכול היה להוסיף 1 עד 2 נקודות BEIR, אבל הם בחרו להישאר דלילים.

מקור: marktechpost.com