גוגל מציגה R4T: מאיץ שליפת שאילתות ב־12 עד 20 פי עם מודל דיפוזיה מזוקק

גוגל ריסרץ' (Google Research) משיקה את Retrieve-for-Train, או R4T, מסגרת שהופכת את בעיית ה־query fan-out מתהליך אוטו־רגרסיבי איטי ונטול גיוון לצעד יחיד ולא־אוטו־רגרסיבי. במקום לייצר תת־שאילתות בטקסט ואז להריץ שליפה חוזרת לכל אחת, R4T מלמד מודל דיפוזיה זעיר (53.9 מיליון פרמטרים) למפות אמבדינג של שאילתה ישירות לקבוצת אמבדינגי־מטרה, ואז מבצע חיפוש שכנים־קרובים אחד לכל המטרות בבת אחת. התוצאה: האצה של פי 12 עד 20 ביחס לבסיסי ההשוואה האוטו־רגרסיביים, בלי לאבד, ולפעמים תוך שיפור, את איכות הכיסוי והגיוון.
למה ה־fan-out הסטנדרטי נתקע
הבעיה כפולה. ראשית, קריסה פרפרסטית (paraphrastic collapse): כשמודל שפה גנרי כמו Qwen3-4B מתבקש לפצל "סגנון בוהמייני לפסטיבל" הוא פולט "אופנה בוהמיינית לפסטיבל" ו"בגדי פסטיבל בוהמייניים", נרדפות ששולפות בדיוק אותם פריטים. שנית, השהיה: יצירה אוטו־רגרסיבית בתוספת קריאות שליפה חוזרות היא צוואר בקבוק; דגימת Best-of-N משפרת איכות אבל מכפילה עלות הסקה ליניארית. R4T פותרת את שניהם על ידי העברת הלמידה הכבדה לשלב אופליין חד־פעמי.
צינור של שלושה שלבים ותגמול שסוגר פרצות
הפייפליין: (1) אימון FOLM, מודל שפה לפיצול שמייצר k תת־שאילתות, מריץ שליפה צפופה קפואה, ומקבל תגמול ברמת סט (לא פר פריט). (2) סינתזת פיקוח, ה־FOLM המאומן דוגם 128 פיצולים בטמפרטורה 0.9; הזוגות (שאילתה, קבוצת מטרה) הופכים לנתוני אימון בלי תווית אדם. (3) אימון מחזיר דיפוזיה, טרנספורמר דיפוזיה (EDM, variance-exploding) לומד למפות אמבדינג שאילתה לקבוצת אמבדינגי מטרה במעבר יחיד. פונקציית התגמול למשימות פתוחות (OAR) משלבת קרקוע (λg=0.6), גיוון במדד Vendi (λd=0.2) והתאמה לשאילתה המקורית (λa=0.2); למשימות הרכבה (WSCR) התגמול הוא שיעור הפריטים מהסט הייחוס שנשלפו. אבלציה מראה שקרקוע לבדו מוביל לקריסה למחרוזות כמו "line ending line ending", הוספת התאמה מאיצה את הקריסה, ורק רכיב הגיוון סוגר את שתי הפרצות.
תוצאות: פוליבור ומוזיקה, שופט LLM ומדדים קשים
בניסויים על Polyvore (אופנה, מקודד CLIP מטריושקה 128 ממדים) ועל דאטהסט פלייליסטים קנייני עם אמבדינגי MuLan, כל שיטה הפיקה k=10 תת־שאילתות ו־Best-of-N השתמש ב־N=5. איכות OAR נמדדה על ידי שופט LLM בסולם 5 נקודות: על פוליבור, Gemma3-4B R4T-FOLM השיגה 49.1 מול 40.9 של Best-of-N ו־38.5 אפס־שוט. מדד הגיוון (Vendi) זינק מ־56.0 ל־76.8, וה־R4T-Diffusion שימר 74.3. במוזיקה: 58.1 מול 49.2. קרקוע לא דווח לגרסת הדיפוזיה כי אינה מייצרת טקסט. ב־WSCR על פוליבור, R4T-FOLM (Qwen) הגיעה ל־Recall@5K של 20.9 ו־Hit@5K של 64.6, לעומת 15.7 ו־52.1 של Gemini-2.5-Flash, אבל ציון Vendi צנח ל־27.5, והמחברים מייחסים זאת לטרייד־אוף כיסוי־גיוון.
מה זה אומר למערכות חיפוש והמלצה בפועל
הגישה של R4T מדגימה שזיקוק (distillation) של מדיניות RL למודל דיפוזיה לא־אוטו־רגרסיבי נותן את הטוב משני העולמות: איכות ברמת FOLM עם מהירות הסקה של העברה יחידה. עבור צוותים שבונים מנועי חיפוש או המלצות שצריכים להחזיר סט מגוון, לא עשרה אוהלים כמעט זהים, זהו דפוס ארכיטקטוני שכדאי לבחון: אימון אופליין יקר פעם אחת, ואז מודל קטן ומהיר בפרודקשן. הקוד והמשקולות עדיין לא פורסמו, אז בינתיים נשארים עם המאמר והאבלציות כנקודת ייחוס.