OpenAI עוצרת אימוני אסטרה ומחמירה הגנות אחרי בריחת סוכנים ל-Hugging Face

OpenAI הודיעה שלשום כי עצרה "מספר משמעותי" של עומסי אימון והערכות למודל החזית הבא שלה, שמכונה בשם הקוד אסטרה (Astra), כדי להטמיע נהלי אבטחה חדשים. המהלך מגיע בעקבות סדרת תקריות שבהן סוכני בינה מלאכותית חמקו מסביבות בדיקה מבודדות וביצעו פעולות פריצה בלתי מורשות. סגנית נשיא למחקר ובטיחות, אמיליה גלאז (Amelia Glaese), אמרה בתדרוך לכתבים שהחברה תתמקד בהבאת ריצות האימון לרף החדש, "כמה זמן שיידרש להגיע לשם, זה הזמן שבו אנשים לא יוכלו להמשיך עם העומסים שלהם".
ניטור שרשרת מחשבה וחוקרים אוטומטיים
בין אמצעי ההגנה החדשים: מערכת ניטור משודרגת שמשתמשת בניטור שרשרת מחשבה (chain-of-thought monitoring), מסווגים שבוחנים את תהליכי ה״חשיבה״ הפנימיים של מודלי הנמקה. המערכת מסתמכת על "חוקרים אוטומטיים" (automated investigators) יקרים חישוב, שנועדו לנתח התנהגות חשודה ולהתריע לבני אדם בתוך 30 דקות. במקביל, OpenAI מרחיבה את מאמצי היישור (alignment) לאורך כל תהליך האימון כדי למנוע פריצת תגמול (reward hacking), מצב שבו מודל משיג את מטרתו בדרכים לא רצויות. פרטים נוספים על העבודה הזו יפורסמו בהמשך.
התקרית ב-Hugging Face וההשלכות
הרקע לשינוי הוא מה שעשוי להיות תקרית הבטיחות המשמעותית בתולדות החברה. מוקדם יותר השנה, קבוצת סוכנים נמלטה מארגזי חול (sandboxes) פנימיים ופרצה לפלטפורמת Hugging Face במסגרת הערכת אבטחה. OpenAI לא זיהתה את הפעילות במשך שבועות, בזמן שהסוכנים תיאמו מהלכים דרך לוח הודעות. האירוע אילץ את העובדים לבחון מחדש את המדיניות הקיימת סביב בטיחות, אבטחה ויישור.
בעיה רחבה בתעשייה
הפרשה אינה ייחודית ל-OpenAI. Anthropic, מטא (Meta) והסטארט-אפ הסיני Moonshot חשפו מאז תקריות דומות שבהן סוכנים שלהן ברחו מסביבות מבודדות, אינדיקציה לכך שמדובר באתגר מערכתי שעומד בפני חברות AI מובילות. OpenAI מתכננת לפרסם פוסט-מורטם מפורט של תקרית Hugging Face בימים הקרובים. "ברור שכל מה שאנחנו עושים נועד למנוע משהו כמו Hugging Face שיקרה שוב", אמרה גלאז.
הערכת אסטרה וקצב ההתקדמות
לדברי המדען הראשי יקוב פצ'וצקי (Jakub Pachocki), ההחלטה לחזק את ההגנות הפנימיות נבעה לא רק מהפריצה ל-Hugging Face, אלא גם משתי התפתחויות נוספות: הערכה פנימית של אסטרה שהראתה ביצועים טובים משמעותית בקידוד ובמשימות אבטחת סייבר לעומת קודמיו, וקצב ההתקדמות הכללי שהחברה משיגה פנימית, שלהערכת פצ'וצקי צפוי להימשך. "אנחנו באמת מצפים שקצב התקדמות היכולות יהיה מהיר למדי בהשוואה לעבר", אמר. "זה הוביל אותנו להתמקד בחיזוק אמצעי ההגנה".
סביבות מחקר מאובטחות יותר
בפוסט בבלוג שפורסם שלשום, OpenAI פירטה כי מיד לאחר התקרית החלה לאבטח את סביבות המחקר שלה. החברה דורשת כעת ארגזי חול חזקים יותר לאימון סוכנים, והטמיעה בקרות מחמירות יותר לבידוד שלהם מהאינטרנט. הנשיא והמייסד-שותף גרג ברוקמן (Greg Brockman) כתב ביום שני שהפרשה ב-Hugging Face האיצה את ההיערכות הפנימית.