זיכרון סוכנים אמין דורש סף שונה לכל סוג טענה

הבעיה: לא כל זיכרון נולד שווה
מודלים שמפעילים זיכרון מתמשך (persistent memory) נוטים לאחסן טענות חלשות כאילו היו עובדות מבוססות. חוקרים זיהו אסימטריה חדה: מתוך 4,715 טענות מועמדות שנבדקו, רק 77.9% מהטענות על ערכים ואמונות (values and beliefs) נתמכות במקור שלהן, לעומת 96.2% בכל שאר הקטגוריות. סף ביטחון גלובלי אחד לא מצליח להפריד בין השניים: הוא או מכניס טענות ערכים לא מגובות, או זורק טענות מבוססות היטב.
הפתרון: סף מותנה קטגוריה
במקום סף אחיד, הצוות מציע להתאים את רף הקבלה לסוג הטענה. בקטגוריות שבהן ההיסק אמין, עובדות, אירועים, תכונות, מורידים את הסף ושומרים יותר. בקטגוריות שמועדות להזיות, ערכים, אמונות, שיפוטים סובייקטיביים, מעלים את הסף ונמנעים מכתיבה (abstain) כשהראיות חלשות. הגישה נבדקה בפייפליין קר (cold-start) שנפרס על 100 פרסונות סינתטיות, עם הערכה חוזרת על נתונים שמורים (held-out) בכל קיפול.
המספרים: הפחתה עקבית בטענות לא מגובות
התוצאות מראות שהסף המחמיר על ערכים לבדו מוריד את שיעור השמירות הלא-מגובות מ-6.2% ל-4.0%, צמצום יחסי של כ-36%, עקבי בכל הקיפולים. כראיה משלימה, הגישה שומרת על כ-13 נקודות אחוז יותר כיסוי (coverage) בהשוואה לסף גלובלי ברמת שמירה דומה (רווח בר-סמך 95%: 9.8-16.0). במילים אחרות: לא מאבדים עובדות טובות כדי לחסום זבל ערכי.
המשמעות: חיזוי סלקטיבי בגבול הכתיבה
המסקנה המרכזית היא שאמינות השמירה תלויה בסוג הטענה, לא רק בביטחון המודל. סף מותנה-קטגוריה מתפקד כחיזוי סלקטיבי (selective prediction) פשוט ואפקטיבי בדיוק בנקודת הכתיבה לזיכרון, בלי להוסיף רכיבי דירוג מורכבים או שלבי סינון נפרדים. זהו שינוי ארכיטקטוני מינימלי עם השפעה מדידה על ניקיון הזיכרון.
סייגים והקשר
הניסוי רץ על פרסונות סינתטיות ובסביבה מבוקרת; ביצועים בפרודקשן עם משתמשים אמיתיים עשויים להשתנות. המאמר מופיע כפרה-פרינט (pre-print) ב-arXiv ועדיין לא עבר שיפוט עמיתים, כך שהמספרים הם מה שהמחברים מדווחים, לא תוצאה מאומתת חיצונית. ובכל זאת, הכיוון ברור: כשהזיכרון כותב את עצמו, כדאי שהוא יידע מתי לשתוק.