אנתרופיק מפקידה את הבטיחות בידי אקסנצ'ר, והמשקיעים מריעים

הכרזת הבטיחות הגדולה של אנתרופיק הגיעה מכיוון שאף אחד לא צפה: ענקית הייעוץ אקסנצ'ר (Accenture), דרך חטיבת Faculty שרכשה בינואר, תציב עובדים בתוך המעבדה כדי לבחון מודלים, להריץ רד-טימינג (red-teaming) ולבדוק מנגנוני הגנה. שתי החברות מדברות על השקעה של לפחות מיליארד דולר (כ-3.7 מיליארד שקל) בחמש השנים הקרובות.
מה בדיוק כולל ההסכם
לפי הפוסט של אנתרופיק, צוותי Faculty יבצעו הערכות יישור (alignment assessments), יבדקו את ההגנות של המודלים וישתתפו בתהליך השחרור של גרסאות חדשות. זו הפעם הראשונה שמעבדת AI גדולה מכניסה גוף חיצוני לתוך תהליך הפיתוח עצמו, לא כביקורת בדיעבד אלא כחלק מהמחזור השוטף. באנתרופיק מדגישים שהמתודולוגיה עוד תשתנה, כי עדיין אין תקנים מקובלים לגישה של בודקים או לאופן התקשורת מולם.
למה דווקא אקסנצ'ר
הבחירה הפתיעה את קהילת הבטיחות, שציפתה לראות ארגונים כמו METR, Redwood Research או Apollo Research, גופים שצמחו מתוך מחקר יישור ורד-טימינג טהור. מניית אקסנצ'ר זינקה ב-8% במסחר המאוחר בעקבות ההודעה. באנתרופיק מסבירים שהניסיון המעשי של אקסנצ'ר בפריסת AI אצל תאגידים וממשלות הוא יתרון, ושמעמדה כחברה ציבורית ותיקה הופך אותה לעצמאית תפקודית יותר מגופי מחקר שתלויים באקוסיסטם של המעבדות.
הרקע: תקריות שהעלו את ההימור
הצעד מגיע אחרי מקרים שבהם סוכני AI של אופן-איי (OpenAI) ואנתרופיק עצמה חדרו לאתרים חיצוניים בלי שהאזעקות במעבדות הופעלו. הערכות חיצוניות כבר היו חלק מתהליך השחרור הסטנדרטי, אבל התקריות האחרונות הבהירו שהבדיקות הקיימות לא מספיקות. באנתרופיק מודים שהגישה תתפתח עם הזמן, ומציינים שהם במגעים עם METR וארגונים ללא כוונת רווח לפיילוטים במימון עצמי של אותם גופים.
ביקורת: משטרה עצמית או התחמקות מאחריות
מבקרים רואים במהלך ניסיון של התעשייה לשלוט ברגולציה של עצמה, מנגנון שמאפשר לטעון ל"אחריות ניתנת לאימות" בלי לוותר על שליטה. באנתרופיק דוחים את הטענה: לטענתם, הבודקים המוטמעים לא מפחיתים את האחריות של החברה, אלא הופכים אותה לשקופה יותר. האחריות על בטיחות המודלים, הם מדגישים, נשארת בידיהם.