4 באוקטובר 2026 האקדמיה ארכיון
מבזקים
מוז בונה פרופילים מפורטים לכל אדם בחייכם, בלי לשאול רשות חוקרים מציעים ארכיטקטורת הסתעפות שמאפשרת לרתמות סוכנים להשתפר בלי להיתקע באופטימום מקומי הסדק בשליטה: סין אוגרת מכונות DUVi בקצב שמאיים למחוק את היתרון האמריקאי קאפקום מכינה את ה-RE Engine לעידן שבו AI כותב קוד לצד המפתחים מנכ״לית Splice: מיילים של AI הורגים את השיחה היצירתית
מחקר

חוקרים מציעים ארכיטקטורת הסתעפות שמאפשרת לרתמות סוכנים להשתפר בלי להיתקע באופטימום מקומי

חוקרים מציעים ארכיטקטורת הסתעפות שמאפשרת לרתמות סוכנים להשתפר בלי להיתקע באופטימום מקומי

מאמר חדש ב-arXiv מציג שיטה בשם Mixture of Self-Improving Branches, שהופכת את תהליך השיפור העצמי של רתמות (harnesses) לאדפטיבי: במקום מסלול חיפוש יחיד עם קבוצת פיתוח ומדיניות הצעה קבועות, כפי שעושה Meta-Harness, המערכת פותחת ענפים מקבילים, שלכל אחד תת-קבוצת פיתוח משתנה ומדיניות הצעה שמתעדכנת מהיסטוריית החיפוש שלו עצמו. התוצאה היא סט רתמות משלימות שראוטר בוחר ביניהן בזמן ריצה, בלי גישה לתוצאות המבחן.

הבעיה עם מסלול יחיד

Meta-Harness מיישמת שיפור עצמי רקורסיבי (RSI) דרך דורות עוקבים של יצירת קוד והערכה, אבל משאירה את קבוצת הפיתוח ואת מדיניות ההצעה סטטיות. המגבלה הזו מכריחה את האבולוציה לנוע לאורך נתיב בודד, מה שמגדיל את הסיכון להתכנסות לאופטימום מקומי, בדיוק הבעיה שהחוקרים מבקשים לפתור.

איך הענפים עובדים

כל ענף שומר מקרים שנפתרו על ידי יותר רתמות מובילות שלו מאשר של ענפים אחרים, משליך מקרים שכל הרתמות המובילות בכל הענפים פתרו, ומעדכן את מדיניות ההצעה שלו על סמך היסטוריית החיפוש הפנימית. המנגנון הזה מייצר מגוון כיווני אופטימיזציה במקום דחיפה אחת צרה.

ראוטר בלי הצצה למבחן

כדי לפרוס את הרתמות המשלימות, החוקרים מציעים ראוטר שבוחר ראש ענף אחד לכל קלט חדש, לפני הרצה, כאשר הבחירה ותצורת הראוטר מתבססות אך ורק על נתוני פיתוח. אין כאן למידה מהמבחן (test-time leakage), נקודה שהמחברים מדגישים במפורש.

תוצאות: שיפור יחסי על שלושה בנצ'מרקים

על חשיבה מתמטית ברמת אולימפיאדה המערכת משיגה שיפור יחסי של 34.8% מול Meta-Harness; על Terminal-Bench 2.0, 11.6%; ועל SWE-bench Lite, 3.8%. המספרים מגיעים מהשוואה ישירה באותו סט־אפ, כשבחירת הרתמות וכיול הראוטר נעשו רק על דאטת פיתוח.

סייגים: פרה-פרינט, לא ביקורת עמיתים

המאמר מופיע כ-pre-print ב-arXiv ועדיין לא עבר שיפוט עמיתים. הקוד והנתונים זמינים, אבל המדדים נמדדו בתנאי מעבדה ועל מדגמים מוגדרים; אין עדיין אינדיקציה לאיך הגישה מתנהגת בפרודקשן או בסביבות הטרוגניות יותר.