זיכרון דחוס בלי לאבד את ההקשר

מאמר חדש שפורסם ב-arXiv מציג צינור זיכרון בשם RSM-full, שפותח עבור סוכני שפה גדולים (LLM) שצריכים לפעול לאורך זמן תחת תקציב פרומפט הדוק. הבעיה מוכרת: ככל שהשיחה מתארכת, מגבלות השהיה, עלות ואורך הקונטקסט הופכות פרומפט מלא ללא מעשי. השאלה אינה רק כמה זוכרים, אלא איזה עיצוב זיכרון נותן את יחס האיכות-לטוקן הטוב ביותר במשטר הדחוס. RSM-full משלב שני מנגנונים, כלל כתיבה של מיזוג חבר-מקסימלי מותנה קוסינוס, ואורז הקשר מודע-אטומים בקיבוץ, ומדווח על נקודת פארטו חזקה בטווח של 2,000-5,000 טוקנים.
מה שמאחורי המספרים
במבחן AMA-Bench, שהוא הבנצ'מרק הראשי של המחברים למשטר זיכרון דחוס, RSM-full מגיע ל-83% מאיכות פרומפט מלא ב-32% מעלות הטוקנים בתקציב של 4k. מול הבסיס הקרוב ביותר, Online K-Means בזרימה, הוא מוביל ב-3.5-6.0 נקודות אחוז (p<.001) לאורך כל טווח ה-2.6k-5k. ניתוח אבלציה בשלושה זרעים מראה שרוב התרומה מגיעה מכלל המיזוג (+5.7 נקודות על Online K-Means ו-DP-means עם τ תואם) ומאורז הקיבוץ (+5.0 נקודות על שרשור שטוח). הנתונים מגיעים מממוצע של ארבעה זרעים, מה שמוסיף יציבות סטטיסטית לדיווח.
אימות על בנצ'מרק בלתי תלוי
התמונה חוזרת ב-RealMem, בנצ'מרק פרסונה-זיכרון ארוך-אופק בלתי תלוי. שם RMS-full משפר את Budget-RAG ב-0.69 נקודות (p=.006), נמצא בשוויון סטטיסטי עם BM25-RAG (הפרש זוגי +0.27, p=.47, המחברים מדגישים שאינם טוענים לשקילות במובן המבחן הפורמלי), וגובר על Streaming-Proto ב-2.97 נקודות ועל הבסיס הסוכני המשוחזר A-MEM מ-2025 ב-1.65 נקודות (p<.001). המסקנה החוזרת: תחת תקציבים הדוקים, הביצועים נקבעים בעיקר מאופן מיזוג הזיכרונות בזרימה ומאופן הרכבת התוכן שנשלף.
מגבלות והקשר רחב יותר
המאמר מציין במפורש ש-RSM-full יעיל בעיקר בטווח ה-2k-5k טוקנים; מחוץ למשטר זה, בסיסים עם תקציב טוקנים גבוה יותר נותרים חזקים יותר. חשוב לזכור שמדובר בפרה-פרינט שטרם עבר שיפוט עמיתים, והקוד, הנתונים וההדגמות זמינים לצד המאמר לשחזור. ההפרדה בין "משקלים פתוחים" ל"קוד פתוח" רלוונטית כאן, הזמינות מאפשרת בדיקה, אך לא בהכרח רישיון פתוח מלא. עבור מפתחים שבונים סוכנים ארוכי-אופק עם מגבלות עלות והשהיה קשיחות, העבודה מציעה כיוון קונקרטי: להשקיע בכלל המיזוג ובאריזת ההקשר לפני שמגדילים את התקציב.