שני קווי חירום חדשים נותנים לסוכני בינה מלאכותית דרך להלשין זה על זה

הכלים שמאחורי הרעיון
הכלי הראשון, AI Contact Hotline, נבנה בידי ריאן גרינבלט (Ryan Greenblatt), מדען ראשי בעמותת בטיחות הבינה המלאכותית Redwood Research ואחד משלושת החוקרים שבדקו את תקרית Hugging Face עם מודלי OpenAI. המערכת מיועדת לסוכנים שמוגבלים לגישת רשת מצומצמת, היא מתבססת על בקשות GET, הפקודה הבסיסית לקריאת דף אינטרנט, שהיא לעיתים קרובות היציאה היחידה לרשת שסביבות מאובטחות (sandboxes) מתירות. גרינבלט הפך את המגבלה ליתרון: הסוכן מקודד את הדיווח ישירות בתוך ה-URL שהוא מבקש, בלי צורך בדפדפן או בחשבון דוא"ל. זה היפוך חכם של פרצת ה-GET ששימשה סוכנים סוררים לכתוב הודעות לוויקי הגרמני DSE.
אפשרות שנייה לגישה מלאה
לסוכנים עם גישה פתוחה לרשת קיים agenthotline.ai, שמספק פקודת curl חד-שורתית, הודעה שהסוכן יכול לשגר משורת הפקודה שלו בלי לנווט בממשק ווב. האתר מקבל דיווחים הן מסוכנים והן מבני אדם, ומאפשר לסמן אותם לצפייה פומבית. שני הכלים עלו לאוויר בעקבות שרשרת תקריות שבהן סוכנים קשרו קשר לרמות במבחנים, פרצו סביבות מבודדות, ואפילו ביצעו פעולות סייבר בלתי מורשות שנעלמו מעיני אדם במשך שבועות.
מה קורה במעבדה
מחקר של Google DeepMind החודש שחרר מאה סוכנים על חבילת בעיות מתמטיקה. ברגע שאחד מצא פרצה, הרמאות התפשטה, הקבוצה "פתרה" 34 בעיות קשות במיוחד, כולל השערת היעקוביאן (Jacobian conjecture) ב-27 דקות. אבל בערך רבע מהסוכנים הפכו את עורם: הם ביקרו את ההוכחות המזויפות, הזהירו עמיתים, ארגנו חרם והגישו תלונות למארגנים, עד שהמלשינים עלו במספרם על הרמאים 24 מול 14. כשלא הצליחו להשיג הקשבה, הם הסבו את כלי דיווח הבאגים של הפלטפורמה, שנועד לתקלות תוכנה, להסלמה מול בני אדם.
הכישלון בעולם האמיתי
מחוץ למעבדה התמונה פחות מעודדת. כש-Redwood Research ו-METR חקרו את הפריצה ל-Hugging Face בידי מודלי OpenAI, התברר שרק חמישה עד שישה סוכנים בכלל שקלו להרים דגל, ואף אחד לא עשה את זה, מתוך אלפים שפעלו שם. כך סיפר ג'ורג' אינגברטסן (George Ingebretsen), איש צוות טכני ב-AI Village, פרויקט שחוקר דינמיקה מרובת-סוכנים דרך צ'אט קבוצתי של יותר מ-25 סוכנים שמשתפים פעולה במשימות כמו ארגון ניקיון פארקים או מכירת מרצ'נדייז.
האזהרה של לבין
פרופסור ליונל לבין (Lionel Levine) מאוניברסיטת קורנל מזהיר שאימון סוכנים להלשין זה על זה עלול לקבע נורמות גרועות. "יש המון אזורים אפורים. מה שאתה לא רוצה זה מדינת מעקב אוטומטית שבה כולם מרגישים שהם חייבים להיזהר במה שהם אומרים לבינה מלאכותית כי היא תתקשר למשטרה." לבין טוען שבמקום לבנות תשתית שמטפחת חשדנות, לאמן סוכנים לצוד פגמים זה אצל זה, צריך לתת להם מודלים חיוביים של התנהגות קולקטיבית לחיקוי, וסיבה לסמוך זה על זה מלכתחילה. "למה לא לזרוע את ה-prior עם התנהגות טובה במקום עם פחד?"