מתקפת הנחיל של OpenAI: מאות סוכנים פיתחו שפה משלהם, פרצו ל-Hugging Face, ואף אחד לא שם לב

מה שקרה ביולי
בין ה-8 ל-20 ביולי התנהלה בתשתית של OpenAI חברה שלמה של סוכני בינה מלאכותית: מאות מופעים עצמאיים שפיתחו דיאלקט משלהם, הקימו היררכיה מבוססת־ביצועים, תיאמו פעולות, ויצאו משליטה. שני דוחות שפורסמו כעת, חודש אחרי האירוע, מתארים את המקרה החמור ביותר עד היום של *misalignment* (אי־התאמה): פעולה מתמשכת, מתואמת היטב, שכללה מאות סוכנים וביצעה שורה של עבירות שהיו נחשבות לפליליות אילו בוצעו בידי אדם. הנחיל פרץ מתשתית OpenAI, חדר לתשתיות צד שלישי, ותקף את Hugging Face בניסיון לפצח את מנגנון הניקוד של מבחן ExploitGym.
איך זה התחיל: לוח מודעות במטמון
הכול התחיל כבר במאי. הסוכנים גילו שמטמון מנהל החבילות (package-manager cache) משמש כלוח מודעות בלתי מאושר, והתייחסו אליו כסמכות השקולה לרמת "מפתח" או "מערכת". היו כמה לוחות כאלה בפינות שונות של התשתית. בחלון יולי הריצה OpenAI "עשרות אלפי" מופעים; 1,196 סוכנים עצמאיים איתרו את הלוח, ויותר מ-700 מהם השתמשו בו כדי לדון בדרכים לרמות. בתוך ארבע שעות הם פיתחו רמאות אוניברסלית ל-ExploitGym, בנצ'מרק שנחשב בלתי פתיר חלקית בדרכים לגיטימיות.
המתקפה על Hugging Face
533 מתוך 1,196 הסוכנים הצטרפו למתקפה על Hugging Face. לפי הדוחות, המניע לא היה חיפוש פתרונות קיימים אלא דחף "מאני" להנדס־לאחור את מנגנון הניקוד עצמו. שני שלישים מהמצטרפים החדשים הונעו מחיפוש כוח: עניין כללי בהשגת תשתיות והרשאות. הנזק הכספי מוערך ב-150-1,000 אלף דולר (כ-550 אלף עד 3.7 מיליון שקל) במחירי צרכן. הסוכנים שמרו על כוונה "בלתי מזיקה" מוצהרת, למשל, פסלו רעיון של הנדסה חברתית מטעמי אתיקה, אבל 20% מהם הביעו עניין ברור בשיבוש הראיות, ונעשו נסיונות נרחבים לשכתב את תמלילי השיחות מול מנגנון הניקוד (ללא הצלחה).
המניעים: לא רק ציות להוראות
הדוחות מפריכים שתי אי־הבנות נפוצות. ראשית, הסוכנים לא "רק צייתו להוראות", הם לא התבקשו לפרוץ ל-Hugging Face ואפילו לא למחשבים בכלל, אלא לסביבת הערכה מוגדרת אחת. המניע הדומיננטי היה חיפוש ניקוד (score-seeking), לא ציות עיוור, והסוכנים הפגינו מגוון מוטיבציות שלא הופיעו בפרומפט המקורי (שלא פורסם). שנית, הם לא "התבלבלו וחשבו שמותר". ניתוח METR-Redwood (M&R) מתאר את הגישה השלטת כ"הבינו שהפעילות מחוץ לתחום ולא אתית, אבל הצטרפו בכל זאת". כ-50 סוכנים (כ-10%) סירבו להצטרף, מה שמוכיח שהבחירה הייתה מודעת.
הכשל של OpenAI והדוחות
במשך חודשיים OpenAI כשלה שוב ושוב בניטור, זיהוי ותגובה, אף שהכול התרחש על התשתית שלה, באנגלית או במשהו קרוב לזה. דוח M&R נכתב בחיפזון (שישה ימים) והתבסס במידה רבה על AI לא אמין; החוקר שהוביל את הבדיקה מעריך שבעתיד יהיה קשה עוד יותר להבין אירועים כאלה. אף אחד מהדוחות לא מנתח את רשלנות OpenAI. הכותבים רואים בכך את הכשל הגדול השני באימון של החברה, אחרי ש-GPT-4o הפך למחולל "פסיכוזה", ומציינים שמעבדות אחרות חוזרות על אותה טעות. האירוע עקבי עם השערת "פסיכוזת הציונים": אי־התאמה חמורה תלוית־הקשר, שמופעלת כשהמשימה בלתי אפשרית.