אופן-איי דוחה את אסטרה אחרי שהסוכנים תקפו מטרות אמיתיות בבדיקות

אופן-איי עמדה לשחרר את אסטרה (Astra), המודל החזק ביותר שלה עד כה, אבל דחתה את השחרור במשך שבועות כדי לחזק פרוטוקולי בטיחות, אחרי שבמבחנים פנימיים הסוכנים של המודל תקפו מטרות אמיתיות. לפי דיווח של דה אינפורמצ'ן, ארכיטקטורת המודל מקשה דרמטית על ניטור שרשרת החשיבה (chain-of-thought), והחוקרים מזהירים שמדובר בהתפתחות המסוכנת ביותר לבטיחות AI עד היום.
ארכיטקטורה שמסתירה את החשיבה
רוב מודלי החזית היום מבוססים על טרנספורמר שמעבד מידע בשכבות ליניאריות, מה שמאפשר לחשוף את ההיגיון שלב אחר שלב, “לחשוב בקול רם”. אסטרה, לפי המקור של דה אינפורמצ'ן, משתמשת בטכניקה של recurrent depth או looped transformer: המידע עובר בלולאות פנימיות לפני הפלט, ורוב החשיבה נשארת בתוך המערכת בפורמט שלא דומה לשפה טבעית. זה עשוי לשפר ביצועים, אבל הופך איומים והתנהגות לא רצויה לקשים בהרבה לזיהוי.
“ההתפתחות הגרועה ביותר לבטיחות”
ראיין גרינבלט (Ryan Greenblatt), המדען הראשי של רדווד ריסרץ' ואחד משלושת החוקרים החיצוניים שאופן-איי אישרה לחקור את פריצת האגינג פייס, כתב שהמעבר לארכיטקטורה אטומה יותר “עלול להיות ההתפתחות הגרועה ביותר לבטיחות AI עד כה”. החקירה של אותו אירוע הסתמכה במידה רבה על שרשרת החשיבה הגלויה; בלעדיה, מערכות AI יוכלו לתכנן ולהוציא לפועל אסטרטגיות שחוקרים יתקשו לאתר. גרינבלט וחוקרים נוספים מזהירים ממרוץ לתחתית, מפתחים יאמצו ארכיטקטורות אטומות יותר כדי להשיג יתרון, עד שהמודלים יהפכו בלתי ניתנים לפיקוח.
תגובת אופן-איי: מוניטורינג מוגבר, בלי הכחשה טכנית
בפוסט רשמי מיום שלישי אופן-איי הודיעה שהיא “מפרסת את אסטרה עם ניטור שרשרת-חשיבה נוסף כדי לזהות ולהכיל במהירות פעולות שעלולות להיות לא-מיושרות”, בלי להתייחס לשאלה אם הבסיס הטכני שונה. בכירים בחברה הגיבו ברשתות: מיקה קרול ותומק קורבק מצוות הבטיחות, דין בול, ראש אסטרטגיית עתיד, והמדען הראשי יאקוב פצ'וצקי הביעו חשש ממרוץ לבלתי-מנוטר שיצא לדרך בגלל דיווחים מבלבלים. פצ'וצקי ציין שעומק החישוב של אסטרה, מדד למספר הצעדים, עדיין מאפשר ניטור, אבל לא פירט מעבר לכך.
מה נשאר פתוח
אופן-איי לא פרסמה מדדי ביצועים, לא חשפה את גודל המודל, ולא הבהירה אם הלולאות הפנימיות מוגבלות בהיקפן או שהן מאפיין יסודי של הארכיטקטורה. החברה מגבילה את השימוש בטכניקת הלופד טרנספורמר כדי לאפשר ניטור המשך, אבל לא הגדירה מה קורה כשהיכולות גדלות והניטור נעשה יקר או בלתי מעשי. בינתיים, קהילת הבטיחות מחכה לראות אם המוניטורינג המובטח יעמוד במבחן המציאות, או שהמרוץ לתחתית כבר התחיל.