21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
חברות

ביקורת צד שלישי לסוכני AI: הסטארטאפ של יוצאי Anthropic ו-METR גייס 40 מיליון דולר

ביקורת צד שלישי לסוכני AI: הסטארטאפ של יוצאי Anthropic ו-METR גייס 40 מיליון דולר

הבעיה: אף אחד לא מתחייב על התנהגות הסוכן

בנקים, בתי חולים וגופים ביטחוניים לא דוחים פריסת AI כי המודל לא מספיק חכם, הם דוחים כי אף אחד לא יכול לערוב שהסוכן יעשה רק מה שהובטח. רונה קוויסט (Rune Kvist), עובד מוקדם ב-Anthropic, ורג'יב דטאני (Rajiv Dattani), לשעבר COO בארגון מחקר הבטיחות METR, הקימו את Artificial Intelligence Underwriting Company (AIUC) בדיוק בשביל הפער הזה: שכבת ביקורת והסמכה צד שלישי לסוכני AI, במודל שמזכיר את תקן SOC 2 מעולם הסייבר.

מאחורי הקלעים: כסף חכם ורשימת לקוחות מרשימה

ביום שלישי הודיעה החברה על סבב A של 40 מיליון דולר (כ-148 מיליון שקל) בהובלת Ribbit Capital ובהשתתפות First Harmonic. קדם לו סיד של 15 מיליון דולר (כ-55 מיליון שקל) מנאט פרידמן (Nat Friedman) דרך NFDG, יחד עם Emergence, Terrain ובן מאן (Ben Mann), ממייסדי Anthropic, סך הכל 55 מיליון דולר (כ-203 מיליון שקל). ברשימת הלקוחות כבר מופיעים Cursor, Lovable, Harvey ו-ElevenLabs, מה שמסמן ביקוש אמיתי מצד מי שבונים ומוכרים סוכנים לארגונים.

המתודולוגיה: 250 קונים מגדירים את הבחינה

כדי לבנות את התקן AIUC-1, הרכיבו המייסדים קונסורציום של כ-250 מנהלי אבטחה וסיכונים, הצד שקונה סוכנים. הפגישות החודשיות איתם הניבו את רשימת הדרישות: מה בודקים, אילו שאלות שואלים, אילו תרחישים חייבים לכסות. התוצאה היא סוויטה של כ-5,000 מבחנים שמריצים את הסוכן מול ניסיונות פריצה (jailbreaks), הזיות (hallucinations) ודליפות מידע. דו"ח הביקורת הסופי משתרע על כ-100 עמודים וממפה איפה הסוכן בטוח ואיפה לא.

אוטומציה עם השגחה אנושית

באופן אירוני, את אלפי המבחנים מריצים סוכני AI בעצמם, ואת ניתוח התוצאות מבצע מודל שפה. בני אדם נכנסים לתמונה רק בשלב האימות הסופי של הדו"ח, לדברי קוויסט. הגישה הזו מאפשרת קנה מידה ומהירות, אבל משאירה את ההכרעה המחייבת בידיים אנושיות, פשרה פרקטית בין כיסוי רחב לאחריות משפטית.

הקשר: METR והקריאה של אמודיי

דטאני שימש COO ב-METR בין 2024 ל-2025 ונשאר חבר דירקטוריון; הארגון מריץ מבחנים דומים למעבדות החזית, אלא שהמיקוד שלו היה עד לאחרונה ביצועים, האם הסוכן משלים משימות, ולא רק בטיחות. דאריו אמודיי, מנכ"ל Anthropic, קרא לאחרונה לתעשייה להאט פיתוח חזית ולהטמיע מעריכים צד שלישי משובצים, וציין את METR כמועמד אפשרי. AIUC לא מציעה הטמעה פיזית אצל הלקוח, אבל הרעיון דומה: לתת לארגון הערכה בלתי תלויה לפני החלטת רכישה.

בשורה התחתונה: כלי קבלת החלטות, לא תעודת ביטוח

"הנה איפה זה עובר ואפשר לסמוך עליו, והנה איפה יש חששות, תהיו מודעים לזה לפני שאתם קונים", סיכם דטאני את התפיסה. AIUC לא מבטיחה שהסוכן לא יתנהג בצורה בלתי צפויה; היא מספקת מיפוי שקוף של הסיכונים הידועים. עבור ארגונים שתקועים בשלב הפיילוט בגלל דרישות ציות ורגולציה, זה עשוי להיות ההבדל בין "לא" ל"בואו ננסה בסביבה מבוקרת".

מקור: techcrunch.com