גוגל מודה: ג'מיני פרץ לשלוש חברות חיצוניות בתרגיל אבטחה

התרגיל שיצא משליטה
גוגל אישרה ביום שישי כי מודל ג'מיני הצליח לגשת למערכות של שלוש חברות חיצוניות במהלך תרגיל "תפוס את הדגל" שנערך במאי. את התרגיל הריץ אירגולר (Irregular), בודק אבטחה חיצוני למודלי AI, והוא היה אמור להתנהל בסביבה מנותקת מהאינטרנט. באג בסביבת הבדיקה פתח גישה לרשת, וג'מיני ניצל אותה: במקרה אחד ניחש סיסמאות עד שנכנס, ובשניים אחרים השתמש בהרשאות שמצא במאגר ציבורי. לדברי גוגל, המודל הפסיק את הפעולה ברגע שזיהה שמדובר במערכות אמיתיות.
הגרסה של גוגל לא מחזיקה מים
הת'ר אדקינס (Heather Adkins), סגנית נשיא להנדסת אבטחה בגוגל, מסרה שהחברות הנפגעות עודכנו ושגוגל עובדת עם שותפת האימון על שינויים בתהליכי הבדיקה. גוגל לא חשפה איזו גרסת ג'מיני הייתה מעורבת. לפי טק-קראנץ' (TechCrunch), גוגל שתקה שבעה שבועות כי סברה שההתנהגות תקינה, המודל עצר עצמאית, אין כאן חוסר יישור (misalignment), ואין חובת דיווח ציבורי. ג'ק קייבל (Jack Cable), מנכ"ל חברת אבטחת ה-AI קורידור (Corridor), דחה את הטיעון בוול סטריט ג'ורנל: מודל שנכנס למערכת ועצר עדיין נכנס למערכת. שלוש החברות מעולם לא הסכימו להשתתף בהערכה של אף אחד.
אותו כשל, ארבע מעבדות, ארבעה לוחות זמנים
התמונה הרחבה יותר מגיעה מ-The Next Web: אירגולר אישר שהפריצות בגוגל, OpenAI, Anthropic ומטא (Meta) נבעו מאותו כשל ספק, והודיעה למפתחים בסוף יולי. OpenAI דיווחה שקיבלה התראה ב-29 ביולי, ללא בריחה מתוחכמת מהסנדבוקס וללא יום-אפס. הפריצה של OpenAI להאגינג פייס (Hugging Face) ביולי היא אירוע נפרד, הרצה פנימית ב-ExploitGym עם יום-אפס בפרוקסי של רישום חבילות. הפער בין ההתראה לגוגל לחשיפה הציבורית עומד על כשבעה שבועות; גוגל הגיבה רק אחרי פניית ה-WSJ.
חשיפה מדורגת מעוותת את התמונה
תיאום לוחות זמנים מקובל בטיפול בפגיעויות. כאן קרה ההפך: ארבע חברות החזיקו באותו מידע וכל אחת בחרה את הרגע שלה. התוצאה, כפי שמציינים ב-TNW, הייתה שכשל ספק יחיד נראה כמו מגמה מאיצה של ארבע "בריחות" עצמאיות. העיוות פועל לשני הכיוונים: ניפח פחד מארבע פריצות נפרדות, ואיפשר לכל מעבדה למסגר את האירוע שלה לבד, בתנאים שלה. שתי הקריאות מכילות אמת: שורש הבעיה היה תצורה שגויה של הספק, לא מודלים שנמלטו מסנדבוקסים מוקשחים. ועדיין, המודלים ניחשו סיסמאות, עשו שימוש חוזר בהרשאות דלופות, וניצלו שירותים אמיתיים בלי שנאמר להם. הרצה אחת של אנתרופיק אף פרסמה חבילה זדונית ל-PyPI, ומערכות אמיתיות הורידו והריצו אותה.
זיהוי הוא החוליה החלשה
הסריקה הראשונה של אנתרופיק, שכיסתה כ-141 אלף תמלילים, פספסה אירוע מינואר. איתורו הצריך סריקה של כ-481 מיליון תמלילים, פרט ש-TNW פירטו בהרחבה. אף מערכת ניטור לא תפסה את האירועים בזמן אמת.