חוקרים אוטומטיים של Anthropic משפרים יישור מודלים, ועוקפים בני אדם בשש שעות

המאמר והממצא המרכזי
Anthropic פרסמה בסוף השבוע מאמר בשם "Automated Researchers Can Reliably Mitigate Alignment Failures", שמתאר מערכת שבה מודלי שפה חוקרים, מציעים ומריצים בעצמם שיטות לשיפור יישור (alignment) של מודלים אחרים. את העבודה הוביל חוקר בתוכנית הפלואוז (fellows) של החברה, צ'ן יואה-האן (Chen Yueh-Han). המערכת נבדקה על עשרה בנצ'מרקים שמודדים התנהגויות לא-מיושרות, ובכל העשרה נרשם שיפור, בלי לפגוע בביצועים הכלליים של המודל המטרה.
איך זה עובד בפועל
החוקר האוטומטי (AAR) משחזר את לולאת המחקר האנושית: הוא סורק ספרות זמינה, מציע שיטה, מריץ אימון של 30 דקות, בודק את התוצאה על הבנצ'מרק, וחוזר על התהליך במספר איטרציות. שיטות שעובדות נשמרות, כאלה שלא, נזרקות. הגישה הזו מאפשרת למערכת לפעול בהיקף ובמהירות שקשה לחוקרים אנושיים להשתוות אליהם, בלי להזדקק להפסקות קפה או לשעות שינה.
השוואה ישירה לבני אדם, ומחיר
לפי המאמר, השיטה הטובה ביותר של ה-AAR מנצחת בממוצע את מה שחוקרים מנוסים מציעים, בתוך שש שעות. הכוונה אנושית לכיווני מחקר לא הניבה ביצועים חזקים יותר. יש גם תג מחיר: עלות הרצת AAR עומדת על כ-4 דולר לשעה (כ-15 שקל) באינפרנס API, לעומת 150 דולר לשעה (כ-560 שקל) שעולה חוקר אנושי בצוות של Anthropic. הפער הזה, אם הוא מחזיק בסקייל, משנה את הכלכלה של מחקר יישור מהיסוד.
המגבלות שהמחברים מודים בהן
המאמר לא מסתיר את החולשות. המערכת עובדת רק כל עוד הבנצ'מרקים באמת משקפים את יעדי היישור בפועל, והקמה ותחזוקה של בנצ'מרקים כאלה היא עבודה כבדה בפני עצמה. בנוסף, ה-AAR תלוי בספרות הקיימת שהוא שואב ממנה; הרחבה ותחזוקה של מאגר הידע הזה נותרו משימה פתוחה. במילים אחרות: האוטומציה מזיזה את צוואר הבקבוק, לא פותרת אותו.
הקשר רחב יותר וספקנות נדרשת
הכיוון כאן הוא רקורסיבי: אם מודלים יכולים לשפר את אימון היישור של עצמם, סביר שישפרו גם פרקטיקות אימון רחבות יותר, נקודה שהמאמר מציין במפורש. אבל מדובר בפרה-פרינט שטרם עבר ביקורת עמיתים, והניסויים בוצעו בסביבה מבוקרת עם בנצ'מרקים מוגדרים היטב. עד שנראה תוצאות משוחזרות בבנצ'מרקים חיצוניים ובתנאי פרודקשן, כדאי להתייחס למספרים כראיה מוקדמת, לא כהוכחה שהחוקרים האנושיים בדרך החוצה.