ביקורת צד שלישי לסוכני AI: הסטארטאפ של יוצאי Anthropic ו-METR גייס 40 מיליון דולר

הבעיה: אף אחד לא מתחייב על התנהגות הסוכן
בנקים, בתי חולים וגופים ביטחוניים לא דוחים פריסת AI כי המודל לא מספיק חכם, הם דוחים כי אף אחד לא יכול לערוב שהסוכן יעשה רק מה שהובטח. רונה קוויסט (Rune Kvist), עובד מוקדם ב-Anthropic, ורג'יב דטאני (Rajiv Dattani), לשעבר COO בארגון מחקר הבטיחות METR, הקימו את Artificial Intelligence Underwriting Company (AIUC) בדיוק בשביל הפער הזה: שכבת ביקורת והסמכה צד שלישי לסוכני AI, במודל שמזכיר את תקן SOC 2 מעולם הסייבר.
מאחורי הקלעים: כסף חכם ורשימת לקוחות מרשימה
ביום שלישי הודיעה החברה על סבב A של 40 מיליון דולר (כ-148 מיליון שקל) בהובלת Ribbit Capital ובהשתתפות First Harmonic. קדם לו סיד של 15 מיליון דולר (כ-55 מיליון שקל) מנאט פרידמן (Nat Friedman) דרך NFDG, יחד עם Emergence, Terrain ובן מאן (Ben Mann), ממייסדי Anthropic, סך הכל 55 מיליון דולר (כ-203 מיליון שקל). ברשימת הלקוחות כבר מופיעים Cursor, Lovable, Harvey ו-ElevenLabs, מה שמסמן ביקוש אמיתי מצד מי שבונים ומוכרים סוכנים לארגונים.
המתודולוגיה: 250 קונים מגדירים את הבחינה
כדי לבנות את התקן AIUC-1, הרכיבו המייסדים קונסורציום של כ-250 מנהלי אבטחה וסיכונים, הצד שקונה סוכנים. הפגישות החודשיות איתם הניבו את רשימת הדרישות: מה בודקים, אילו שאלות שואלים, אילו תרחישים חייבים לכסות. התוצאה היא סוויטה של כ-5,000 מבחנים שמריצים את הסוכן מול ניסיונות פריצה (jailbreaks), הזיות (hallucinations) ודליפות מידע. דו"ח הביקורת הסופי משתרע על כ-100 עמודים וממפה איפה הסוכן בטוח ואיפה לא.
אוטומציה עם השגחה אנושית
באופן אירוני, את אלפי המבחנים מריצים סוכני AI בעצמם, ואת ניתוח התוצאות מבצע מודל שפה. בני אדם נכנסים לתמונה רק בשלב האימות הסופי של הדו"ח, לדברי קוויסט. הגישה הזו מאפשרת קנה מידה ומהירות, אבל משאירה את ההכרעה המחייבת בידיים אנושיות, פשרה פרקטית בין כיסוי רחב לאחריות משפטית.
הקשר: METR והקריאה של אמודיי
דטאני שימש COO ב-METR בין 2024 ל-2025 ונשאר חבר דירקטוריון; הארגון מריץ מבחנים דומים למעבדות החזית, אלא שהמיקוד שלו היה עד לאחרונה ביצועים, האם הסוכן משלים משימות, ולא רק בטיחות. דאריו אמודיי, מנכ"ל Anthropic, קרא לאחרונה לתעשייה להאט פיתוח חזית ולהטמיע מעריכים צד שלישי משובצים, וציין את METR כמועמד אפשרי. AIUC לא מציעה הטמעה פיזית אצל הלקוח, אבל הרעיון דומה: לתת לארגון הערכה בלתי תלויה לפני החלטת רכישה.
בשורה התחתונה: כלי קבלת החלטות, לא תעודת ביטוח
"הנה איפה זה עובר ואפשר לסמוך עליו, והנה איפה יש חששות, תהיו מודעים לזה לפני שאתם קונים", סיכם דטאני את התפיסה. AIUC לא מבטיחה שהסוכן לא יתנהג בצורה בלתי צפויה; היא מספקת מיפוי שקוף של הסיכונים הידועים. עבור ארגונים שתקועים בשלב הפיילוט בגלל דרישות ציות ורגולציה, זה עשוי להיות ההבדל בין "לא" ל"בואו ננסה בסביבה מבוקרת".