21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מחקר

זיכרון סוכנים עם בדיקת סביבה: שיפור ביצועים בלי לאמן מחדש

זיכרון סוכנים עם בדיקת סביבה: שיפור ביצועים בלי לאמן מחדש

חוקרים מציגים שיטה שמוסיפה לסוכן אוצר (curator) גישה לקריאה בלבד לכלי עולם, וחותכת עלויות בחצי תוך הכפלת שיעור ההצלחה. המאמר, שפורסם כפרה-פרינט ב-arXiv ועדיין לא עבר שיפוט עמיתים, מתמקד בבעיה מוכרת בפלטפורמות סוכנים ארגוניות: זיכרון מתמשך שנצבר בסוף כל משימה נוטה לשמר שגיאות, להכליל יתר על המידה מראיות חלקיות, או לשמור ידע שהתיישן.

איך זה עובד

הפתרון המוצע, "אוצרות בודקת-סביבה" (environment-probing curation), נותן לסוכן האוצר הקיים, שרץ אסינכרונית ולא חוסם את סוכן המשימה, הרשאות מינימליות לקריאה בלבד (least-privilege, read-only) לכלי הסביבה. הסוכן יכול כעת לבדוק, לתחום ולרענן זיכרונות מועמדים מול המצב הנוכחי של העולם, בלי לשנות את סוכן המשימה, את המחזיר (retriever), את ייצוג הזיכרון או את סמכות הכתיבה לפרודקשן. אין צורך בריטריינינג של המודל.

סביבת הניסוי

הבדיקה נערכה בסביבה דמוית-פרודקשן של GitHub Copilot (GHCP) שנבנתה על ה-SDK שלו. ארבע תצורות הושוו: ביצוע ללא מצב (stateless), למידה בהקשר מלא (full in-context learning), GHCP עם זיכרון (GHCP + Mem), ו-GHCP עם זיכרון ובדיקת סביבה (GHCP + Mem w/ Env Probing). שני בנצ'מרקים שימשו: CLBench לחקירת מסדי נתונים, ו-90 משימות ייעוץ ניהולי מותאמות של APEX על פני שישה "עולמות" שונים.

תוצאות CLBench

ב-CLBench, הוספת בדיקת הסביבה הקפיצה את שיעור המעבר (pass rate) מ-39% ל-73%, ואת התגמול המוזל-מעבר (pass-discounted reward) מ-8.60 ל-22.60. במקביל, מספר השאילתות לכל שאלה ירד מ-8.8 ל-4.7, ועלות סוכן המשימה צנחה מ-3.38 דולר (כ-12.5 שקל) ל-1.68 דולר (כ-6.2 שקל). המספרים מצביעים על כך שהבדיקה מאפשרת לסוכן המשימה לעבוד עם זיכרון נקי ורלוונטי יותר, ולכן נדרשות פחות קריאות כלי כדי להגיע לתשובה נכונה.

תוצאות APEX והשוואת מודלים

ב-APEX, כל 18 ההשוואות הממוצעות בין זיכרון לבסיס (baseline) הראו שיפור בתגמול. קריאות הכלי של סוכן המשימה ירדו ב-16% עד 75% תלוי בעולם. בחמישה מתוך ששת העולמות, בדיקת הסביבה הניבה את התשואה הטובה ביותר לתגמול סוכן המשימה פר דולר. בנוסף, התצורה עם בדיקה השיגה תגמול ממוצע גבוה יותר מ-GHCP + Mem הן על Sonnet 4.6 והן על Opus 4.7, בלי תופעת סחף סכמה (schema drift), כלומר בלי שמבנה הזיכרון יתעוות לאורך זמן.

מגבלות ושאלות פתוחות

כפרה-פרינט, הממצאים טרם עברו ביקורת עמיתים רשמית. הסביבה מתוארת כ"דמוית-פרודקשן", לא פרודקשן ממשי, והקוד והנתונים זמינים לצד המאמר לשחזור. לא פורסמו מדדי השהיה (latency) של סוכן האוצר עצמו, ולא ברור איך השיטה מתנהגת כשכלי הסביבה מחזירים שגיאות או מידע חלקי. ובכל זאת, הגישה מדגימה שאפשר לשדרג אוצרות זיכרון קיימת לתהליך מודע-סביבה וניתן לביקורת (auditable), בלי לגעת בממשק הצר של זמן-משימה.