שינוי בתפיסת הדירוג: ממודלים נקודתיים לגנרטיביים ב‑ICML 2026

ב‑ICML שמתקיים כעת בקוריאה הדרומית, אחת מהקונגרסים החשובים ביותר בתחום הלמידה העמוקה, נחשפת מגמה ברורה של חברות הטכנולוגיה הגדולות: החלפת מודלים של דירוג נקודתי, כמו HSTU, במודלים גנרטיביים שמבצעים ריראנקינג של רשימות המועמדים. שלושה מחקרים שהוצגו בכנס מדגימים את הקו הזה. הראשון, Meta GR2, מציג ריראנקר גנרטיבי לשלב הסופי של משפך ההמלצות; הוא פועל אחרי שלב נפרד של בחירת כ‑100 מועמדים, ולאחר מכן מייצר מחדש את סדרם בעזרת מודל שמבוסס על reasoning. כדי לאמן את המערכת, בונים סימולטור שמעריך את הדירוג הסופי, ולאחר מכן משפרים את המודל באמצעות Reinforcement Learning על גבי האותות שמספק הסימולטור – ובכך מדגישים שהחלק של החשיבה של המודל הוא זה שמביא לשיפור משמעותי באיכות. המחקר מדגיש שהפרדת שלב יצירת המועמדים מדירוג הסופי היא בחירה פרגמטית יותר לעומת גישה כמו OneRec, שבה המודל מנסה לייצר עצמים מתוך מרחב עצום של אפשרויות; במקרים של מערכות פרסום, פיתרון זה נראה מציאותי במיוחד. המחקר השני, OneReason, מציג גישה רחבה יותר שבה אין שלב נפרד של יצירת מועמדים – המודל נדרש לעבוד ישירות עם האובייקטים ולייצר המלצות. כאן נחשף שבתחילה הוספת יכולת reasoning פגעה משמעותית באיכות, ולכן חלק ניכר מהמאמץ היה במציאת דרכים לקשור את מזהי האובייקטים לתיאורים המשמעותיים שלהם וללמד את המודל לבצע reasoning בצורה יעילה. שלושה מחקרים אלה מצביעים על שינוי משמעותי בתפיסה של דירוג והמלצות, כאשר במקום לחזות CTR בודד לכל מועמד, המודלים החדשים מייצרים סדר, הסבר או מזהים של האובייקטים באופן ישיר, ולאחר מכן משפרים אותם בעזרת למידת חיזוק על סימולציות המודדות את האפקטיביות של הדירוג הסופי.