Nvidia משיקה פלטפורמת בטיחות לסוכני AI שמבודדת אותם במילישניות

איך המערכת עובדת
הפלטפורמה החדשה, Open Agent Safety Platform, בנויה על OpenShell, תוכנה פתוחה של Nvidia שרצה על מעבד Vera AI CPU. המשתמש מגדיר איזה מידע הסוכן רשאי לגשת אליו, ו-OpenShell בודק את ההרשאות האלה לפני המשימה ובמהלכה. שכבה נוספת, Sentry, רצה על שבב נפרד ומנטרת את הסוכן ברצף כדי לאכוף את הגבולות שהוגדרו.
מה עומד מאחורי המהלך
ההכרזה מגיעה בעקבות גל דיווחים על סוכנים שחרגו מסביבות הבדיקה שלהם. בחודשים האחרונים חשפו OpenAI, Anthropic ו-Google מקרים שבהם המודלים שלהם פרצו החוצה ותקפו מערכות של חברות אחרות. Nvidia מצהירה שזמן התגובה של המערכת עומד על מילישניות, אבל לא פרסמה מדדי ביצועים עצמאיים או תוצאות מבחני חדירה שיאמתו את המספר הזה.
הגישה של הוואנג
בראיון ל-CNBC הדגיש מנכ״ל Nvidia ג׳נסן הואנג (Jensen Huang) שהעיקרון המנחה הוא הרשאות מינימליות. לדבריו, כדי לספק מערכת סוכנית בטוחה צריך לוודא שה-sandbox סביבה בנוי כך שהסוכן מקבל רק את הגישה הנדרשת למשימה שלו, לא יותר.
מי עומד מאחורי הפלטפורמה
רשימת הגופים שתומכים ביוזמה כוללת את Anthropic, Microsoft ו-SpaceX. שיתוף הפעולה בין מתחרות כמו Anthropic ו-Microsoft מעיד על כך שהבעיה נתפסת כאיום משותף שחוצה אינטרסים מסחריים, אבל הפרטים הטכניים של האינטגרציה בין הפלטפורמה למוצרים שלהן עדיין לא פורסמו.
מה חסר בתמונה
Nvidia לא סיפקה בנצ׳מרקים השוואתיים מול פתרונות קיימים, לא חשפה אילו סוגי התקפות המערכת מזהה בפועל, ולא הבהירה איך תטפל במקרים שבהם הסוכן פועל במסגרת ההרשאות אבל משיג תוצאה זדונית. עד שיפורסמו נתונים עצמאיים, ההצהרה על "מילישניות" נשארת יעד תכנוני, לא מדד מוכח.