שומר המקורות: ProvenanceGuard בודק לא רק את העובדה, אלא מאיפה היא באה

מאמר חדש מציג שכבת אימות שמתיישבת מעל סוכני MCP ולא מוכנה לקבל "העובדה קיימת איפשהו בקונטקסט" כתשובה מספקת. הבעיה שהחוקרים מכנים cross-source conflation פשוטה להבנה וקשה לזיהוי: הטענה נכונה, המקור שאליו מייחסים אותה, לא. סוכן תמיכה שמצטט "לפי רישום החשבון" כשמדיניות ההחזרים בכלל במסמך מדיניות, או סוכן קליני שמציג פרט מהיסטוריית המטופל כאילו הגיע מהספרות הרפואית, בשני המקרים העובדה אמיתית, הייחוס שגוי, ובסביבה רגישה זה מסוכן לא פחות מהזיהוי השגוי עצמו.
איך זה עובד מתחת למכסה המנוע
ProvenanceGuard לא מאמן מחדש את הסוכן. הוא רץ אחרי שהתשובה כבר נוצרה, קורא את ה-trace המלא של קריאות הכלים וה-source IDs, ומשמר את זהות המקור לאורך כל הצנרת. התהליך מחולק לחמישה שלבים רציפים: פירוק התשובה לטענות אטומיות, ניתוב כל טענה למקור הרלוונטי ביותר, בדיקת NLI האם אותו מקור אכן תומך בטענה, השוואה בין המקור התומך למקור שהתשובה מציינת או מרמזת אליו, ולבסוף, פסק דין ברמת הטענה הבודדת והחלטה גלובלית allow/block ברמת התשובה כולה. תשובות שנחסמו יכולות לעבור תיקון בסגנון RARR ולהיבדק שוב.
סט אקספרימנטלי שמרני בכוונה
בניסויים המתוארים במאמר השתמשו במודלים מקומיים בלבד כדי לשמור על סביבה נשלטת אופליין: MiniLM לאיתור המקור הרלוונטי, DeBERTa NLI לבדיקת התמיכה, ו-LLM מקומי לפירוק הטענות. ה-verifier בודק ערכים מילוליים, מספרים, תאריכים, מזהים, ולא מסתפק בכך שהמשפט "נשמע סביר". שלב החלטה מכויל משלב את האותות הללו. המדיניות השמרנית מכוונת לסקירה רגישת-נתונים: עדיף לחסום תשובה מלאשר ייחוס שגוי, גם אם זה אומר latency גבוה יותר.
לא דרישה, נקודת מוצא
המודלים הנקובים הם הקונפיגורציה שנבדקה, לא דרישת חובה של הארכיטקטורה. אותו שלד, טענה, מקור, החלטה, ניתן להתאמה למודלים מנוהלים בענן, אבל כל סט-אפ חדש יצטרך כיול ובדיקות משלו. התוצאות המדווחות במאמר מגיעות מהקונפיגורציה המקומית בלבד, והחוקרים מדגישים זאת במפורש.
נבדק על סוכן רפואי עם רשומות מטופלים
ההערכה בוצעה על תשובות שסוכן רפואי הפיק תוך שימוש ברשומות מטופלים, והמאמר זמין כבר עכשיו ב-Hugging Face וב-arXiv כ-preprint שטרם עבר שיפוט עמיתים. עבור צוותים שבונים סוכנים בסביבות בהן ייחוס שגוי הוא סיכון רגולטורי או בטיחותי, ProvenanceGuard מציע שכבת הגנה שאינה תלויה בארכיטקטורת הסוכן עצמו, וזה כשלעצמו יתרון ארכיטקטוני לא מבוטל.