מודלים לא רק מדווחים ביטחון, הם משתמשים בו כדי להחליט אם לענות

מאמר חדש ב-Nature Machine Intelligence של חוקרים מגוגל דיפמיינד (Google DeepMind) ופרינסטון (Princeton) מראה שלראשונה יש ראיות סיבתיות: מודלי שפה גדולים לא רק פולטים ציון ביטחון, הם מפעילים סף פנימי על הייצוג הזה כדי להכריע אם להשיב או להימנע (abstention). הניסוי כלל ארבעה שלבים, ובשלב המכריע החוקרים ביצעו activation steering, הגברה או דיכוי של כיוון הביטחון במרחב הייצוג, וראו שינוי ישיר ומכוון בשיעור ההימנעות, עם ניתוח תיווך (mediation) שמאשר שהביטחון הוא המנגנון המרכזי.
פרדיגמה בת ארבעה שלבים, ממדידה לסיבתיות
הפרוטוקול נבנה בהשראת ניסויי פסיכופיזיקה ונוירוביולוגיה על קבלת החלטות בבעלי חיים. שלב 1 מדד ביטחון בסיסי בלי אפשרות הימנעות. שלב 2 הראה שהמודלים מיישמים סף משתמע (implicit threshold) על הביטחון הפנימי כשניתנת להם אופציית הימנעות, ואפקט הביטחון היה גדול בסדר גודל ממנגנונים חלופיים. שלב 3 סיפק את ההוכחה הסיבתית דרך הסטת אקטיבציות. שלב 4 הורה למודלים להימנע ברמות ביטחון שונות, והם כיוונו את ההתנהגות בהתאם, עדות לכך שהם "קוראים" את הייצוג הפנימי וקובעים מדיניות הימנעות על פיו.
ביטחון מילולי מול ייצוג פנימי, שתי קריאות חלקיות
ביטחון מילולי (verbal confidence), הערכה עצמית מפורשת במעבר נפרד (forward pass), ניבא הימנעות בכל המודלים בנפרד מהלוג־הסתברויות של הטוקנים, אף שהיה פחות מבחין בין תשובות נכונות לשגויות. פענוח אקטיבציות (activation decoding) הראה ששני המדדים הם קריאות חלקיות (lossy read-outs) של ייצוג פנימי עשיר יותר, רב־ממדי. המסקנה: ההימנעות נשלטת על ידי פעולה משותפת של ייצוג ביטחון רב־ממדי ומדיניות מבוססת סף, דפוס שתואם בקרה מטה־קוגניטיבית מובנית.
למה זה משנה לאג'נטים אוטונומיים
כשמודלים הופכים לאג'נטים שפועלים ברצף בלי השגחה אנושית צמודה, היכולת לזהות אי־ודאות פנימית ולהימנע מתשובה מסוכנת, למשל בשאלה רפואית או משפטית, הופכת לרכיב בטיחות קריטי. המחקר מראה שהמנגנון הזה כבר קיים במודל, לא רק כפלט מילולי אלא כבקרה פנימית שניתנת לכוונון. זה פותח פתח לאימון או הכוונה (steering) של סף ההימנעות בלי לשנות משקלים, כלי שעשוי להיות שימושי במוצרים שדורשים אמינות גבוהה.
סייגים ומבט קדימה
המאמר עבר שיפוט עמיתים ופורסם בגישה פתוחה, אבל הניסויים נערכו על מודלים ספציפיים ובתנאי מעבדה, לא בהכרח מייצגים התנהגות בפרודקשן עם פרומפטים ארוכים, הקשר מרובה־שיחות או RAG. החוקרים מציינים במפורש שהביטחון המילולי והלוג־הסתברויות הם קריאות חלקיות; הייצוג הפנימי המלא עדיין לא מפוענח. השלב הבא יהיה לבדוק אם אפשר ללמוד מדיניות הימנעות אדפטיבית ישירות מהאקטיבציות, ואיך זה משתלב עם טכניקות כמו selective prediction או conformal prediction במערכות אמיתיות.