21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מחקר

סקיל-גלו מארגן מיומנויות במשפחות פרוצדורליות

סקיל-גלו מארגן מיומנויות במשפחות פרוצדורליות

חוקרים הציגו שיטה חדשה לארגון הידע שצוברים סוכני שפה גדולים לאורך זמן. במקום לשמור כל משימה בנפרד או לדחוס הכול למסמך יחיד, המערכת מזהה את התהליך המשותף לקבוצת משימות דומות, שומרת רק את השלד שלו, ומשחזרת את הפרטים הספציפיים בכל הרצה מחדש.

איך זה עובד בפועל

הבעיה המוכרת: כשסוכן כותב מיומנות (skill) טקסטואלית אחרי כל משימה, הספרייה או מתנפחת לאלפי פריטים שכל אחד תקוע בהקשר המקורי שלו, או נדחסת למסמך כללי מדי שלא עוזר במשימות קונקרטיות. סקיל-גלו (SkillGLoW) פותר את זה בשני שלבים, המקומי והגלובלי. ברמה המקומית הסוכן כותב מיומנות מההרצה הנוכחית; ברמה הגלובלית מיומנויות ששייכות לאותה "משפחה פרוצדורלית" מאוחדות ל-Prior מופשט, נקי מפרטי מופע (de-instantiated). את הפרטים החסרים המערכת מייצרת מחדש בזמן אמת לכל משימה חדשה. שער קבלה (commit gate) מכניס Prior לספרייה רק אם הרצה אמיתית מראה שהוא לא מוריד ביצועים.

תוצאות על ארבעה בנצ'מרקים

הניסויים הקיפו ארבעה תחומים, חשיבה מתמטית, אוטומציית טרמינל, תיקון תוכנה ושליטה גופנית (embodied control), על שלושה מודלים שונים. מול בסיס ללא מיומנויות, ה-Priors הוסיפו 17.2 נקודות בממוצע על משימות קשות, עם שיפור חיובי בכל 12 הרצות השיפור-המתמשך. כשהפעילו גם שחזור מקומי קפץ הפער ל-18.0 נקודות. הספרייה נשארה רזה: Prior אחד לכל משפחה פרוצדורלית, פי 3.6 יותר קומפקטית ממאגר פר-משימה שטוח.

השוואה למתחרה קיים

באותו פרוטוקול בדיקה, גלו ניצח אופטימייזר מסמך-יחיד שפורסם קודם ב-15 מתוך 21 תאי השוואה. המבחן המשכנע ביותר הגיע מחוץ להתפלגות האימון: בלי שום התאמה, הספרייה הקפיצה הצלחה במשימות ALFWorld שלא נראו קודם מ-73.9% ל-83.9%. זה ראיה חזקה לכך שמה שעובר הלאה הוא התהליך הפותר, לא זיכרון המשימה הספציפית.

הערות וסייגים

המאמר מופיע כפרה-פרינט ב-arXiv ועדיין לא עבר שיפוט עמיתים. הקוד והנתונים זמינים, מה שמאפשר שחזור, אבל המדדים נמדדו בסביבות סימולציה ולא בפרודקשן אמיתי. עדיין לא ברור איך השיטה תתנהג כשמספר המשפחות הפרוצדורליות יגדל לסדרי גודל של אלפים, או כשהמודל הבסיסי יוחלף בגרסה חדשה לגמרי.