חוקרים מציגים שיטת אימון חדשה שמתיימרת לפתור את בעיית ה"סלופ"

הטקסטים הבינוניים שמודלי שפה פולטים כשאין משימה עם תשובה נכונה אחת ## הבעיה: שופטים לא מומחים
מודלי שפה גדולים מגיעים לביצועים על-אנושיים במשימות ניתנות לאימות, קוד, מתמטיקה, לוגיקה, אבל בכתיבה חופשית הם עדיין חלשים. הבעיה מתחילה ב-RLHF הקלאסי: מודלי תגמול (reward models) מאומנים על דירוגים של מתייגים לא-מומחים, ולכן יורשים את התקרה שלהם. האיכות שהכי אכפת לנו ממנה, כתיבה ברמת מומחה, אפילו על-אנושית, היא בדיוק מה שהשופטים האלה הכי פחות מסוגלים לזהות.
הניסוי: כתיבת סקציות אקדמיות
הצוות בנה בנצ'מרק קונקרטי: מודל מקבל מאמר אקדמי אמיתי פחות סקציה אחת, תקציר, מבוא, סקירת ספרות או סיכום, וצריך לכתוב את החסר כך שיתאים לשאר המאמר באורך ובסגנון. הטקסט המקורי של המחברים משמש רפרנס מומחה טבעי, והמשימה ניתנת לשכפול בקנה מידה מהספרות המפורסמת. שני מודלים שימשו גם ככותבים וגם כשופטים: Opus-4.8 ו-GPT-5.6-sol, בהצלבה ביניהם.
הממצא המפתיע: המודל מנצח את המומחה
שופט זוגי ישיר (pairwise judge), זה שמקבל שני מועמדים ושואל "איזה טוב יותר?", העדיף את המודל על פני המומחה האנושי ברוב המקרים, בין 63.5% ל-84.6% תלוי בקונפיגורציה. כשעברו לרובריקות סטנדרטיות, GPT-5.6 בנה מטא-פרומפט שיוצר רובריקות ייעודיות לכל סקציה, התוצאה הקצינה עוד יותר: המודל נבחר כבעל ציון גבוה יותר ב-100% מהמקרים. השופטים, בקיצור, לא זיהו את הפער.
הפתרון: אופטימיזציה מטא של רובריקות
RL-XAR (Reinforcement Learning from eXpert-Aligned Rubrics) הופך את הכיוון. השיטה מייצרת רובריקות, בודקת האם הן מדרגות כתיבת מומחה מעל כתיבת מודל, ואז מעדכנת את הרובריקות עצמן, אופטימיזציה מטא, עד שהפער כבר לא ניתן לזיהוי. רק אז הרובריקות המיושרות משמשות לאימון חיזוק. התהליך חוזר עד שהאופטימיזציה המטא לא מוצאת עוד פער ניכר.
תוצאות ראשוניות ומה שחסר
לפי הפרסום, מדדים מרובים מראים שיפור גדול על אימון סטנדרטי בשלוש משימות: כתיבת סקציות מאמרים, המשכי רומנים זוכי פוליצר, ועמודי ויקיפדיה איכותיים. המאמר לא מפרסם מספרי בנצ'מרק מלאים, לא מפרט את גודל המדגם בכל משימה, ולא מציין האם התוצאות עברו ביקורת עמיתים, זהו פרה-פרינט. ההבטחה גדולה; ההוכחה עדיין חלקית.