21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מחקר

חוקרים מציגים אב-טיפוס לשיפור עצמי רקורסיבי דרך אימון-לאחר סוכני עם ניתוב חכם

חוקרים מציגים אב-טיפוס לשיפור עצמי רקורסיבי דרך אימון-לאחר סוכני עם ניתוב חכם

מאמר חדש שפורסם כפרה-פרינט (arXiv:2609.08183) מתאר את NeoHorse-1, משפחת מודלים שפותחה כדי לבחון איך מערכת יכולה לצפות ביכולות שלה עצמה ולתרגם את התצפית לסבב הלמידה הבא. הרעיון המרכזי: לולאת הערכה-בחירה-עדכון שבה מה שהמודל לומד לעשות קובע ממה הוא ילמד הלאה.

מנגנון הניתוב והרישום

המערכת משליכה בריכה הטרוגנית של מודלים עם מנגנון ניתוב חכם. לכל תור משתמש נרשמים הביקוש החזוי ליכולת, דרגת השירות שנבחרה, והאינטראקציה שבאה בעקבותיה. הרשומות האלה הופכות לדוגמאות אימון ששומרות חשיבה משולבת (interleaved reasoning), קריאות כלי, והקשר של ה-harness, סביבת ההרצה שמתווכת בין המודל לכלים חיצוניים.

צינור האימון: תיקוף, הערכה, תיוג

הדוגמאות עוברות שלושה מסננים לפני כניסה לאימון: תיקוף מבני, הערכה סמנטית בשישה ממדים, ותיוג ברמת תת-סצנה. אותות הניתוב מארגנים את ה-SFT (כוונון עדין מפוקח) לתוכנית לימודים בת שלושה שלבים, ומתרחבים גם לזיקוק מונחה-ניתוב על-מדיניות (on-policy distillation), שבו מודל מורה מפקח על תשובות שמייצר תלמיד תחת אותה התקדמות.

לולאת המשוב: הקצאה מונחית-יכולת

השלב הסוגר את הלולאה הוא הקצאה מונחית-יכולת: משוב ההערכה מתורגם לתמהיל האימון הבא. בכך נוצר מנגנון קונקרטי ל-RSI, שיפור עצמי רקורסיבי, שבו היכולת הנצפית מכתיבה את נתוני האימון העתידיים, ולא להפך.

תוצאות בנצ'מרק: צמצום פערים משמעותי

על אחד-עשר בנצ'מרקים המכסים סוכני harness, שימוש בכלים, קוד, ומעקב הוראות, האימון-לאחר מקפיץ את הממוצע המקרו מ-58.94 ל-64.87 במודל 4B, ומ-65.60 ל-69.04 במודל 9B. במילים אחרות: המודל הקטן אחרי אימון-לאחר סוגר חלק ניכר מהפער מול המודל הגדול בבסיסו, אינדיקציה חזקה ליעילות המתודה.

זמינות והקשר

המאמר זמין לקריאה דרך `hf papers read 2609.08183`; נכון לעכשיו מצוטט על ידי 10 מודלים ואפס דאטהסטים. מדובר בפרה-פרינט שטרם עבר שיפוט עמיתים, והמחברים מגדירים את NeoHorse-1 כ"אב-טיפוס ראשוני", לא מוצר מוגמר. ובכל זאת, ההדגמה של לולאה סגורה בין הערכה לנתוני אימון היא צעד מתודי ששווה לעקוב אחריו בסוטא של מחקר סוכנים.