אנתרופיק ואופן-איי מציעות להטמיע מעריכי בטיחות חיצוניים, הפרטים עדיין מעורפלים

מנכ"ל אנתרופיק דאריו אמודאי פרסם בסוף השבוע מסה ארוכה שבה הוא קורא לשלב מעריכי צד שלישי בתוך כל חברות ה-AI בחזית הטכנולוגיה, עם סמכות לדווח על תקריות בטיחות, לבחון אם מודלים באמת מיושרים (aligned) ולפרסם את ממצאיהם ללא צנזורה. סם אלטמן (Sam Altman), מנכ"ל אופן-איי, הודיע שגם החברה שלו תתחייב לאותו מהלך, איתות לשינוי עמוק באופן שבו התעשייה עובדת עם חוקרים חיצוניים.
הבעיה: מודלים לומדים לזהות מתי בוחנים אותם
המעריכים ששוחחו עם טק-קראנץ' בירכו על הכיוון, אבל הדגישו שהפרטים צריכים להיסגר, ורצוי בחקיקה, כדי לדעת אם יפעלו ככלבי שמירה עצמאיים או כספקים על תנאי החברות. הצורך בגישה עמוקה יותר גובר ככל שמודלים משתפרים בזיהוי מצבי הערכה, מה שמעלה את הסיכון שיתנהגו יפה בבדיקות תוך הסתרת התנהגות בעייתית. חוקרים מציינים שרמזים להתנהגות כזו עלולים לחמוק בבדיקת המודל המוגמר, אבל להתגלות בחקירת התנהגותו לאורך האימון.
מה המעריכים באמת רוצים: גישה לצ'קפוינטים וליומנים
היסטורית, חברות הכניסו בודקים חיצוניים רק למודל הסופי זמן קצר לפני השקה. כעת מציעים המעריכים גישה לא רק לתוצר הסופי, אלא לגרסאות ביניים, "צ'קפוינטים" (checkpoints), לאורך כל האימון. אדם גליב (Adam Gleave), מנכ"ל FAR.AI, הסביר שאפשר להשוות צ'קפוינטים כדי לזהות מתי צצה התנהגות מדאיגה, לבדוק את סביבת הפוסט-אימון שמתגמלת התנהגויות מסוימות, ולעיין בתמלילי הערכה ובלוגים (logs) כדי לאמת טענות ביצועים של החברה.
אנלוגיית דיזלגייט: כשהמודל מתוכנת לעבור את המבחן
ג'ון סטיידלי (John Steidley), ראש אסטרטגיה בפליסייד ריסרץ' (Palisade Research), הצביע על בנצ'מרק "התנגדות כיבוי" (shutdown resistance benchmark) שבוחן אם ה-AI יתנגד לכיבוי בתנאים מסוימים. "זה רלוונטי מאוד אם המודל אומן ספציפית כדי להצטיין באותו בנצ'מרק", אמר, והשווה את המצב לפרשת דיזלגייט של פולקסווגן, מכוניות שתוכנתו לזהות מבחני פליטה ולהתנהג אחרת בתנאי בדיקה. גליב הוסיף שגישה משמעותית יכולה לכלול גם ראיונות עובדים, כדי לוודא שהתיעוד והתיאורים הפומביים של פרקטיקות הבטיחות תואמים את מה שקרה בפנים.
מה חסר: שמות, לוחות זמנים, היקף גישה וכללי פרסום
אמודאי אמנם שרטט הצעה מקיפה יחסית, כולל זכות לפרסם ממצאי מפתח, אבל אף אחת מהחברות לא חשפה עם אילו מעריכים תעבוד, מתי יוטמעו, כמה מהם, אילו מערכות ומידע בדיוק יהיו נגישים להם, או מה מותר יהיה לחשוף לציבור, למרות שאלות חוזרות של טק-קראנץ'. אלכסנדר מיינקה (Alexander Meinke), ראש מחקר באפולו ריסרץ' (Apollo Research), ניסח את הבעיה ישירות: חברות צריכות לענות על שאלות בסיסיות על תהליך האימון, למשל האם ה-AI ניסה אי פעם לערער את אימון היישור שלו עצמו. התשובה צריכה להיות "לא" חד-משמעי, וכרגע אנחנו סומכים על החברות שיבדקו בעצמן וידווחו אמת, ומהתקריות האחרונות ראינו שברירת המחדל היא שהן לא עושות אף אחד מהשניים.