21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מחקר

שדרוג מודל שובר את זיכרון הסוכן, מחקר מבוקר חושף את הבעיה

שדרוג מודל שובר את זיכרון הסוכן, מחקר מבוקר חושף את הבעיה

הזיכרון לא שורד שדרוג

סוכן יכול לשמור את אותו מאגר זיכרון בדיוק ועדיין לשכוח הכול כשהמודל שמאחוריו מתחלף. מאמר חדש ב-arXiv בודק את התופעה בצורה שיטתית: ארבע שיטות ייצוג זיכרון, קריאה בהקשר ארוך (LC-RAW), אחזור מוגבר יצירה (RAG), הערות דחוסות בשפה טבעית (NOTES) וגרף ידע בסכמה קבועה (KG-fixed), נמדדו על 48 היסטוריות סינתטיות עם קודי תשובה אקראיים, ניקוד מדויק ושני מודלים פתוחי-משקלים מתחת ל-10 מיליארד פרמטרים. המסקנה המרכזית: רק מבנה בסכמה קבועה שורד החלפת כותב בלי לאבד דיוק.

גרף ידע בסכמה קבועה, העוגן היציב

KG-fixed הציג שינוי דיוק של +0.0004 ± 0.0020 בלבד אחרי החלפת המודל הכותב. במילים אחרות, המבנה הנורמלי והמוגדר מראש לא תלוי בפרשנות של מודל ספציפי. זהו הבסיס היחיד מבין הארבעה שמאפשר ניידות זיכרון אמיתית בין גרסאות, בלי צורך בשחזור או בתיקון יקר.

הערות דחוסות, קשורות למודל שיצר אותן

NOTES, לעומת זאת, הפגין תלות חריפה במודל היוצר. דיוק המערכת זז א-סימטרית: +9.91 או −13.28 נקודות אחוז, תלוי בכיוון ההגירה. פירוק דיאגנוסטי הראה ש-80% (0.467 ± 0.014) מהגירעון נובע ממידע שאבד כבר בשלב הבנייה הראשוני, הדחיסה עצמה זורקת הקשר שהמודל החדש לא יודע לשחזר. תיקון מבוסס-מאגר בלבד לא הגיע ליעד התאוששות של 90% באף אחד מ-48 מקרי המבחן; שמירת ההיסטוריה הגולמית אפשרה החלמה ב-34 מתוך 48 מקרים בכיוון אחד שנבדק.

RAG, הגירה חלקית של אמבדינגס לא מספיקה

במערכות RAG, אינדקס מעורב 50/50 (חצי אמבדינגס ישנים, חצי חדשים) הניב שיפור של 4.96 נקודות בלבד, בעוד הגירה מלאה (re-embedding) נתנה 11.90 נקודות. 81% (0.364 ± 0.012) מהגירעון נבע מכשלי אחזור, האמבדינגס הישנים פשוט לא מתאימים למרחב החיפוש של המודל החדש. המסקנה המעשית: בידוד מרחבי אמבדינגס והרצה מחדש מלאה הם תנאי הכרחי, לא המלצה.

מה זה אומר לפרודקשן

המחקר מדגיש שלושה עקרונות תפעוליים: בדיקת הגירה ספציפית לכיוון (לא מספיק לבדוק "שדרוג", צריך לבדוק ממודל A ל-B ומ-B ל-A בנפרד), הפרדה קשיחה בין מרחבי אמבדינגס של גרסאות שונות, ושמירת ההיסטוריה הגולמית כפוליסת ביטוח לתיקון זיכרון. בלי שלושתם, שדרוג שגרתי הופך לאירוע אובדן נתונים שקט.