21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

זיכרון סוכנים אינו מתג, הוא מינון שמכוילים למודל

זיכרון סוכנים אינו מתג, הוא מינון שמכוילים למודל

הזיכרון לא נדלק, הוא מכויל

חוקרים בדקו שמונה מודלים, ממודל דחוס של 30 מיליארד פרמטרים ועד מערכות קנייניות בחזית, וגילו שזיכרון סוכני (agentic memory) לא משפר ביצועים באופן אחיד. השיטה, שנקראת ALTK-Evolve, מאפשרת לסוכן ללמוד ממסלולי עבודה קודמים שלו: היא מזקקת קווים מנחים לשימוש חוזר ומזריקה אותם בזמן הסקה, בלי לעדכן משקולות ובלי תיוג אנושי. המסקנה המרכזית: המינון הנכון תלוי בדרגת היכולת של המודל, ולא בגודל הפרמטרים בלבד.

שלושה דפוסים, לא גודל אחד

הניסויים חשפו שלושה דפוסים חוזרים. מודלים חזקים עם מרווח שיפור (headroom) רוצים את סט הקווים המנחים המלא, כולל לקחי קצה נדירים, כי יש להם הקיבולת לספוג וליישם את כולם; DeepSeek-V3.2 (671B MoE) טיפס ב-9.5 נקודות אחוז בהשלמת משימות כשהוא מקבל את הסט המלא. מודלים קטנים או חלשים יותר טובעים בסט גדול; עבורם עובדת הכי טוב ליבה הדוקה ובטוחה בתוספת שליפה ממוקדת למשימה, gpt-oss-120b (117B MoE) הרוויח 16.1 נקודות אחוז בגישה הסלקטיבית, בעוד הסט המלא הניב פחות שיפור ועלה בכ-50% יותר טוקנים. מודלים רוויים כבר לא מראים שיפור מדיד; GLM-5 (745B MoE) נפל לקטגוריה הזו. החוקרים מדגישים שהסיווג מתאר תצפית, לא סיבה מוכחת, ייתכן שהמודל כבר קרוב לתקרה, שהקווים לא פגעו בכשלים שנותרו, או שהוא לא יישם את ההנחיות ביעילות.

איך הלולאה עובדת בלי עדכון משקולות

"זיכרון" כאן אינו השמעה חוזרת של תמליל עבר, אלא סט קווים מנחים, אסטרטגיות שהצליחו, טעויות להימנע מהן, מקרי קצה, שזוקק ממסלולי הסוכן עצמו. הלולאה פשוטה: הסוכן מנסה משימות ומייצר מסלולים; ALTK-Evolve שולף קווים מנחים הן מהריצות המוצלחות והן מהכושלות; מאחד אותם לסט לשימוש חוזר; ובזמן הסקה הסוכן מקבל או את הסט המלא או מבחר רלוונטי למשימה. מכיוון שאין עדכון משקולות, הלמידה משנה רק את ההנחיות הזמינות לסוכן, מה שהופך את האימוץ לזול ונייד בין המודלים שנבדקו.

המספרים מאחורי AppWorld

ההערכה נערכה על AppWorld, 585 משימות מרובות-שלבים (168 test_normal ועוד 417 test_challenge) על פני 9 אפליקציות מדומות (לוחות שנה, הודעות, תשלומים וכן הלאה). נמדדו שני מדדים: TGC, האם הסוכן משלים כל משימה במלואה, ו-SGC, האם כל וריאציה של תרחיש עוברת, רף מחמיר יותר של "הכול או כלום". שתי תצורות הזיכרון שואבות מאותו סט קווים שנכרה פעם אחת מפיצול האימון של AppWorld בלבד; מה שמשתנה הוא רק אופן ההזרקה בזמן הסקה. שליפה אוצרת (curated retrieval) התגלתה כמדויקת וגם הזולה ביותר: gpt-oss-120b השיג את הקפיצה של 16.1 נקודות אחוז בתוספת של 5% טוקנים בלבד, ו-prompt caching שומר אפילו את הסט המלא בר-השגה בייצור.

מקור: huggingface.co