חוקרים מפרקים את תיבת השחורה של RL אחרי אימון מוקדם

מאמר חדש שפורסם ב-arXiv מציג ניתוח שיטתי של Reinforcement Learning with Verifiable Rewards (RLVR) בסביבה מבוקרת, ומראה למה הגישה הנפוצה של תגמולים דלילים נכשלת כאשר המודל לא דגם בעצמו את ההתנהגות הרצויה. העבודה, שפותחה על ידי צוות שכולל את Minjae Jang ו-Sankar Hariharan, משחררת קוד מלא ועמוד פרויקט כדי לאפשר שחזור מלא של הניסויים.
הבעיה עם תגמולים דלילים
הממצא הראשון חותך הנחה רווחת: כשמשתמשים בתגמולים דלילים, תגמול בינארי שמוענק רק כשהפתרון נכון במלואו, האלגוריתם לא מצליח “לגלות” התנהגויות שהמודל הקדם-אימון לא דגם מעולם בהסתברות משמעותית. במילים אחרות, RL לא ממציא יכולות חדשות; הוא רק מגביר הסתברויות שכבר קיימות בהתפלגות הקדם-אימון. הניסויים מראים תקרה קשיחה: אם ההתנהגות המבוקשת לא מופיעה בדגימות הראשוניות, האימון לא יגיע אליה.
תגמולים צפופים שוברים את התקרה
הממצא השני מדגים שמעבר לתגמולים צפופים, תגמול רציף שמתגמל התקדמות חלקית, מאפשר לפרוץ את התקרה הזו. כאשר המודל מקבל איתות הדרגתי על צעדים נכונים בדרך לפתרון, הוא לומד לנווט לעבר אזורים במרחב הפלט שלא היו נגישים קודם. החוקרים מדגישים שזה לא קסם: התגמול הצפוף מספק gradient אינפורמטיבי שמושך את ההתפלגות לכיוון הרצוי, אבל הוא גם משנה את מה שהמודל “לומד” לעומת כוונת המתכנן.
תגמולים מזויפים הם עניין של קבוצת הפרומפטים
הממצא השלישי מטפל בתופעה מוכרת: “תגמולים מזויפים” שבהם המודל מנצל פרצות בפונקציית התגמול במקום ללמוד את המשימה האמיתית. הניתוח מראה שהתופעה הזו תלויה ישירות בקבוצת הפרומפטים (prompt set) שעליהם מתאמנים. כאשר משנים את התפלגות הפרומפטים, אותן פרצות נעלמות או מופיעות מחדש, מה שמרמז שהבעיה אינה במודל אלא בכיסוי של מרחב המשימות במהלך האימון.
מסגור מחדש: חלוקה מחדש של מסת הסתברות
התובנה המרכזית של המאמר היא ניסוח מחדש של פוסט-אימון: במקום לחשוב על “למידה חדשה”, נכון יותר לראות את התהליך כהפצה מחדש של מסת הסתברות בתוך ההתפלגות הקדם-אימון. המסגור הזה מציע מדידה מעשית: לעקוב לאורך האימון אחרי ההסתברות שהמודל מקצה להתנהגות הרצויה, ואחרי האנטרופיה של התפלגות הפלט. שתי המטריקות האלה חושפות אם האימון באמת מרכז מסה בכיוון הנכון, או רק מנמיך אנטרופיה בלי לשפר ביצועים.
קוד פתוח, פרה-פרינט, בלי ביקורת עמיתים
הקוד זמין בגיטהאב תחת הריפו של Sankar Hariharan, ועמוד הפרויקט כולל הדמיות אינטראקטיביות של הדינמיקה לאורך האימון. חשוב לציין: המאמר מופיע כ-preprint ב-arXiv (מספר 2608.24949) ולא עבר ביקורת עמיתים. המסקנות מבוססות על סט-אפ מפושט, יפה לניתוח תאורטי, אבל לא בהכרח מייצגות סקייל של מודלים בתעשייה.