21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מחקר

חוקרים אוטומטיים של Anthropic משפרים יישור מודלים, ועוקפים בני אדם בשש שעות

חוקרים אוטומטיים של Anthropic משפרים יישור מודלים, ועוקפים בני אדם בשש שעות

המאמר והממצא המרכזי

Anthropic פרסמה בסוף השבוע מאמר בשם "Automated Researchers Can Reliably Mitigate Alignment Failures", שמתאר מערכת שבה מודלי שפה חוקרים, מציעים ומריצים בעצמם שיטות לשיפור יישור (alignment) של מודלים אחרים. את העבודה הוביל חוקר בתוכנית הפלואוז (fellows) של החברה, צ'ן יואה-האן (Chen Yueh-Han). המערכת נבדקה על עשרה בנצ'מרקים שמודדים התנהגויות לא-מיושרות, ובכל העשרה נרשם שיפור, בלי לפגוע בביצועים הכלליים של המודל המטרה.

איך זה עובד בפועל

החוקר האוטומטי (AAR) משחזר את לולאת המחקר האנושית: הוא סורק ספרות זמינה, מציע שיטה, מריץ אימון של 30 דקות, בודק את התוצאה על הבנצ'מרק, וחוזר על התהליך במספר איטרציות. שיטות שעובדות נשמרות, כאלה שלא, נזרקות. הגישה הזו מאפשרת למערכת לפעול בהיקף ובמהירות שקשה לחוקרים אנושיים להשתוות אליהם, בלי להזדקק להפסקות קפה או לשעות שינה.

השוואה ישירה לבני אדם, ומחיר

לפי המאמר, השיטה הטובה ביותר של ה-AAR מנצחת בממוצע את מה שחוקרים מנוסים מציעים, בתוך שש שעות. הכוונה אנושית לכיווני מחקר לא הניבה ביצועים חזקים יותר. יש גם תג מחיר: עלות הרצת AAR עומדת על כ-4 דולר לשעה (כ-15 שקל) באינפרנס API, לעומת 150 דולר לשעה (כ-560 שקל) שעולה חוקר אנושי בצוות של Anthropic. הפער הזה, אם הוא מחזיק בסקייל, משנה את הכלכלה של מחקר יישור מהיסוד.

המגבלות שהמחברים מודים בהן

המאמר לא מסתיר את החולשות. המערכת עובדת רק כל עוד הבנצ'מרקים באמת משקפים את יעדי היישור בפועל, והקמה ותחזוקה של בנצ'מרקים כאלה היא עבודה כבדה בפני עצמה. בנוסף, ה-AAR תלוי בספרות הקיימת שהוא שואב ממנה; הרחבה ותחזוקה של מאגר הידע הזה נותרו משימה פתוחה. במילים אחרות: האוטומציה מזיזה את צוואר הבקבוק, לא פותרת אותו.

הקשר רחב יותר וספקנות נדרשת

הכיוון כאן הוא רקורסיבי: אם מודלים יכולים לשפר את אימון היישור של עצמם, סביר שישפרו גם פרקטיקות אימון רחבות יותר, נקודה שהמאמר מציין במפורש. אבל מדובר בפרה-פרינט שטרם עבר ביקורת עמיתים, והניסויים בוצעו בסביבה מבוקרת עם בנצ'מרקים מוגדרים היטב. עד שנראה תוצאות משוחזרות בבנצ'מרקים חיצוניים ובתנאי פרודקשן, כדאי להתייחס למספרים כראיה מוקדמת, לא כהוכחה שהחוקרים האנושיים בדרך החוצה.

מקור: techcrunch.com