טכניקת תקיפה של מודלי שפה עוברת לספאם המוני

טכניקה שפותחה כדי להחדיר הוראות זדוניות למודלי שפה בלי שהמשתמש יבחין בהן, מאומצת כעת בידי מפיצי ספאם כדי לחמוק ממסנני דואר אלקטרוני. השיטה, המכונה ASCII smuggling, עושה שימוש בתווי יוניקוד בלתי נראים לעין אנושית אך קריאים למכונה, וכעת היא משמשת להסתרת מילות מפתח ספאם ממנועי זיהוי, בדיוק כפי ששימשה להסתרת הנחיות (prompts) ממפתחי מודלים.
איך זה עובד
בלוק של 128 תווי תג (tag characters) ביוניקוד מחקה כמעט במדויק חלק מטבלת ASCII הסטנדרטית. התו U+E0041 מייצג "A", התו U+E0061 מייצג "a", וכן הלאה. ההבדל המהותי: תווים אלה נועדו להיות בלתי נראים לבני אדם, בעוד מערכות עיבוד טקסט קוראות אותם כרגיל. כשההוראות הזדוניות נכתבות בתווים אלה, המודל מזהה אותן, אך הקורא האנושי רואה טקסט תמים למראה.
הזינוק שזיהתה מיקרוסופט
לדברי מיקרוסופט, בתחילת פברואר נרשם זינוק חד בהודעות ספאם המשתמשות בטכניקה. חתימות זיהוי של ASCII smuggling ב-Microsoft Defender for Office קפצו מכ-21 אלף ביום ליותר מ-1.3 מיליון, ותוך ארבעה ימים טיפסו ל-2.5 מיליון. הגל נמשך חודשים ודעך בחדות באמצע מאי.
למה זה עובד גם לספאם
לדברי החברה, התכונה שהופכת את התווים שימושיים להברחת הנחיות למודל, נראות ברמת עיבוד הטקסט והיעלמות ברמת התצוגה, מאפשרת גם לטשטש מילות מפתח לפני שמנוע הסינון בוחן אותן. הכוונה הפוכה, אך המנגנון דומה, והחשד של המשתמש אינו מתעורר.
מה זה אומר בפועל
המעבר של טכניקת התקפה מעולם ה-prompt injection לעולם הספאם מדגים איך כלי עקיפה שפותח למטרה אחת משוכפל במהירות למטרה אחרת, כשהתשתית הטכנית זהה. מסנני דואר שמסתמכים על התאמת מחרוזות גלויות ימשיכו לפספס הודעות כאלה, אלא אם יוסיפו שכבת נרמול (normalization) שמסירה תווי תג לפני הבדיקה.