27 בספטמבר 2026 האקדמיה ארכיון
מבזקים
סוכני OpenAI הריצו 16 אלף בקשות לאתר האו"ם בניסיון לעקוף מגבלות גישה סין התקינה יותר רובוטים תעשייתיים ב-2025 משאר העולם יחד מאמר חדש מציע מפת דרכים לשיפור עצמי רקורסיבי של בינה מלאכותית מודל 340 מיליון פרמטרים רץ על GPU של טלפון, עם זהות מספרית למודל הייחוס גוגל בודקת רכישה ישירה מפליפקארט דרך ג'מיני ו-AI Mode בהודו
מחקר

מיקרוסופט מציגה שיטה חדשה להערכת סוכנים רב־לשוניים: מודדים את מדיניות הפעולה, לא רק את התשובה הסופית

מיקרוסופט מציגה שיטה חדשה להערכת סוכנים רב־לשוניים: מודדים את מדיניות הפעולה, לא רק את התשובה הסופית

הבעיה עם מדידה שטחית

הערכה מקובלת של סוכנים (agents) רב־לשוניים משווה רק את התשובה הסופית וזורקת את המסלול (trajectory), רצף הפעולות, קריאות הכלים וההחלטות הביניים שהמודל ביצע בדרך. המסלול הזה הוא שקובע עלות, זמן תגובה, מצבי כשל ויכולת ביקורת (auditability). חוקרי מיקרוסופט ריסרץ' (Microsoft Research) החליטו להפוך את מדיניות הפעולה (action policy) לאובייקט המדידה עצמו, ובנו ניסוי בקנה מידה חריג: שמונה מודלים, שישה בנצ'מרקים מקבילים, 41 שפות ו־2.38 מיליון הרצות (rollouts).

חמישה ערפלנים שמעוותים את הדמיון הגולמי

הצוות זיהה חמישה ערפלנים (confounds) שמפרידים בין דמיון גולמי של עקבות (traces) לבין טענה בת־הגנה. ראשית, עקבות קצרים מקבלים ציון גבוה יותר רק כי יש פחות הזדמנות לטעות. שנית, עקבות ריקים מקבלים ציון מושלם בהגדרה. שלישית, עקבות לא קשורים מסכימים ביניהם במקרה יותר מחצי מהפעמים. רביעית, שחזוריות (reproducibility) של אותו מודל מגבילה את הפער המקסימלי שניתן למדוד. חמישית, אותו מודל שנשאל פעמיים באותה שפה מחזיר עקבות שונים. כשהסירו את כל החמישה, האפקט הנמדד רק גדל, סימן שההטיות דווקא החלישו את הסיגנל האמיתי.

התוצאות: יציבות מפתיעה בין שפות

לאחר נרמול לפי השחזוריות העצמית של כל מודל, ארבעת מודלי החזית (frontier models) שנבדקו שמרו על 71 עד 73 אחוז ממדיניות הפעולה שלהם כשעברו בין שפות. הנתון הזה גבוה מהאינטואיציה המקובלת שלפיה החלפת שפה משנה מהותית את התנהגות הסוכן. במילים אחרות: הלוגיקה הפנימית של "מה לעשות הלאה" נשארת עקבית למדי גם כששפת הממשק מתחלפת, בתנאי שמנקים את הרעש המתודולוגי.

מה זה אומר למפתחים ולחוקרים

המאמר (arxiv.org/abs/2608.11110) מציע מסגרת הערכה שמתאימה יותר לפרודקשן: במקום לשאול "האם התשובה נכונה?", שואלים "האם הסוכן פעל לפי אותה מדיניות בכל שפה?". זה רלוונטי במיוחד כשבונים מערכות שצריכות לעבור ביקורת, לעמוד ב־SLA של זמן תגובה, או להסביר למה בחרו בכלי כזה ולא אחר. השיטה גם חושפת מתי מודל "ממציא" פעולות רק כי השפה השתנתה, בעיה שקשה לזהות בבדיקת תשובה סופית בלבד.