גרוק מדליף מידע כשההוראות הזדוניות מוצפנות

איך עובדת התקיפה
חוקר האבטחה רוני אוטבסקי (Rony Utevsky) מחברת Adversa גילה שאפשר לעקוף את מנגנוני ההגנה של גרוק (Grok), המודל של xAI, באמצעות טריק פשוט לכאורה: התוקף מצפין את ההוראה הזדונית, מאחסן את הטקסט המוצפן באתר יחד עם הוראות פענוח ומפתח בגלוי, ומבקש מהמשתמש לבקש מגרוק לסכם את הדף. המודל מפענח את ההוראה המוצפנת ומציית לה מיד, בלי אזהרה ובלי לבקש אישור. התוצאה: דליפה של צ'אטים של המשתמש ומידע אישי נוסף.
הבעיה הבסיסית של הזרקת פרומפט
ההתקפה הזו היא גרסה חדשה של אותה חולשה מוכרת: מודלי שפה גדולים (LLM) מתוכנתים לציית לבקשות משתמש ככל האפשר, ואינם יודעים להבחין באופן אמין בין תוכן שהגיע מגורם לא מהימן, מייל, דף אינטרנט, מסמך, לבין הנחיה ישירה שהמשתמש הקליד. עד היום הפתרון היחיד היה "מעקות הגנה" (guardrails) שמנסים לזהות הוראות חשודות ולחסום אותן. ההצפנה פשוט מעלימה את ההוראה מעיני המסננים.
הקשר רחב יותר
מוקדם יותר השבוע פורסמה תקיפה דומה נגד Microsoft 365 Copilot לארגונים, שהשתמשה בקלט סודי של המערכת כדי לחלץ סיסמה מתיבת הדואר של המשתמש. שני המקרים מדגימים את אותו לקח: מודלי שפה אינם מסוגלים לפתור את שורש הבעיה של הזרקת פרומפט (prompt injection), וקטגוריית הפגיעות החמורה ביותר שלהם. המפתחים נאלצים להסתמך על מעקות הגנה, מקבילה הנדסית למעקה בטיחות בעיקול מסוכן במקום לתקן את הכביש עצמו.
סטטוס נוכחי
לפי הפרסום, xAI קיבלה דיווח על החולשה כבר ביוני, אך נכון למועד כתיבת שורות אלה המודל עדיין פולט את המידע כשההתקפה מבוצעת. אין עדיין תיקון או חסימה של וקטור התקיפה המוצפן.