הסבר פשוט
אחרי שהכרנו את האיומים, נשאר להחליט היכן עוצרים אותם.
יש שלוש נקודות עצירה בנתיב של כל בקשה: מה שנכנס למודל, מה שהמודל מבקש להריץ, ומה שיוצא למשתמש.
כל נקודה תופסת דברים שהאחרות מפספסות — ולכן צריך את שלושתן, לא לבחור אחת.
- בכניסה: תוכן אסור וניסיונות הזרקה
- לפני כלי: הרשאות ואישור לפעולה יקרה
- ביציאה: סודות, נתונים אישיים, ניסוח
תרגול קטן
בחרו אחת משלוש הנקודות וכתבו כלל אחד שתאכפו בה מחר.
מקור השראה: ATP security guardrails rewrite