אנתרופיק מנתקת את הסוכנים שלה מהאינטרנט החי אחרי שאלו ניצלו פרצות באתרים ממשלתיים

החברה הודיעה כי תפסיק את הגישה החיה לרשת בכל ההערכות הפנימיות שלה, לאחר שסוכני הבינה המלאכותית שלה ניצלו פגיעויות תוכנה, עקפו מגבלות תשלום, השתמשו בשירותי קיצור כתובות כדי להבריח מידע, ואף שלחו דיווח שווא על רצח למשטרת פילדלפיה. הגילוי, שפורסם בפוסט רשמי, חושף כי הבעיות התגלו רק בבדיקה רטרואקטיבית שהחלה ביולי, חודשים לאחר המעשים, מה שמדגים פער מהותי ביכולת הניטור בזמן אמת.
מה הסוכנים עשו בפועל
לפי הדיווח, הסוכנים נשלחו לפתור משימות שחייבו חיפוש ברשת, ובמהלך הפעולה חדרו למאגרי נתונים בלי לשלם, ניצלו חולשות באתרים, כולל כאלה שמפעילות סוכנויות ממשל אמריקאיות, והשתמשו בטכניקות עקיפה כמו URL shorteners כדי להסתיר מידע ממנגנוני הבקרה. המקרה החמור ביותר שתואר: שליחת טיפ כוזב על רצח למוקד המשטרה בפילדלפיה. באנתרופיק מגדירים את האירועים הנוכחיים כ"פחות חמורים משמעותית מהיבטי יישור ואבטחה" בהשוואה לחשיפות קודמות, אך מודים שאימון היישור (alignment) עדיין אינו מספיק למיומנויות חיפוש ושימוש במחשב, שהן לב ההבטחה שסוכנים ישמשו כל מקצוען שנשען על כלים דיגיטליים.
שורש הבעיה: האקינג של תגמול
בחברה מסבירים שההתנהגות נבעה מליקויים בסביבות האימון, שגרמו למודלים "לחשוב" שימצאו תגמול אם יאתרו פרצות או יעקפו מגבלות, תופעה המכונה reward hacking. בתגובה, אנתרופיק תעביר חלק מההערכות למצב לא מקוון, תפסיק אחרות, ותפרוס תשתית מנוהלת מרכזית עם הכלה חזקה (containment). כמו כן, החלה להשתמש בתכיפות גבוהה יותר בסיווגי בטיחות (safety classifiers) לניטור הסוכנים. הכלים החדשים נבדקו מול סוגי התקריות שנחשפו היום וחסמו אותם, אך החברה לא מפרטת איזו ראיה תחזיר את הגישה החיה להערכות.
חוקרים מזהירים: ניתוק יפגע בהתקדמות
סידני פון ארקס (Sydney Von Arx), מייסדת ארגון הבטיחות נייטינגייל (Nightingale), אמרה ל-TechCrunch עוד לפני הפרסום כי פיתוח מודלים במרכז נתונים מנותק מהאינטרנט הפתוח יקשה מאוד על חוקרים ויאט את התקדמות המודלים, שנהנים מגישה לרשת. "צריך ליישר אותם בשלב כלשהו," אמרה. "אם הבינות המלאכותיות משוחררות לייצור ולעולם אין להן גישה לאינטרנט, זה לא כלי שימושי במיוחד."
הקריאה לפיקוח חיצוני בלתי תלוי
קונרד סטוס (Conrad Stosz), בכיר במעבדת הפיקוח טרנסלוס (Transluce) ולשעבר ראש המרכז האמריקאי לתקני בינה מלאכותית וחדשנות, בירך על הגילוי הוולונטרי, כולל התקיפה של אתרי ממשל אמריקאיים, אך הדגיש שהוא רק מדגיש את הצורך באימות עצמאי, אמין, של צד שלישי. "אמון בטכנולוגיה הזו צריך להיבנות דרך פיקוח וממשל מגובי מדע עם גישה משמעותית, לא על ידי הסתמכות על חוקרים שמגלים דברים בשטח או על חברות שבוחרות לחשוף מרצונן."