21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

מודל 4B הגיע ל-61.5% ב-SWE-bench Verified בלי זיקוק ממודל חזק יותר

מודל 4B הגיע ל-61.5% ב-SWE-bench Verified בלי זיקוק ממודל חזק יותר

חוקרים הצליחו לדחוף מודל שפה של 4 מיליארד פרמטרים להישג שרק לפני שנה היה שמור למודלים גדולים פי עשרה: 61.5% על הבנצ'מרק SWE-bench Verified, בלי להשתמש בזיקוק (distillation) ממודל פרונטיר. המודל, שנקרא FrogNano, מתבסס על Qwen3.5-4B ועבר אימון חיזוק (RL) על כ-1,500 משימות הנדסת תוכנה סינתטיות, אבל הסיפור האמיתי הוא לא כמות הנתונים, אלא הדרך שבה הם נבחרו.

תוכנית לימודים שמתעדכנת בזמן אמת

במקום להאכיל את המודל בסט קבוע של בעיות, המערכת מייצרת משימות חדשות בכל סבב אימון: קשות מספיק כדי ללמד משהו, אבל לא בלתי פתירות. כשהמודל משתפר, רף הקושי עולה איתו, מה שהחוקרים מכנים "online task synthesis". התוצאה היא תוכנית לימודים (curriculum) שמתאימה את עצמה ליכולת הנוכחית של הסוכן, במקום לאלץ אותו להיתקע על משימות קלות מדי או להתייאש מכאלה שרחוקות מהישג ידו.

ממשק כלים מצומצם הקפיץ את הבסיס ב-29 נקודות אחוז

החידוש השני, ולא פחות משמעותי, הוא פישוט ממשק הכלים. המעבר למערך של חמישה כלים בלבד הזניק את ביצועי מודל הבסיס מ-8.3% ל-37.2% על אותו בנצ'מרק, עוד לפני אימון החיזוק. המשמעות ברורה: חלק ניכר מהכשל של מודלים קטנים במשימות קוד נובע מסיבוך יתר של סביבת הפעולה, לא ממחסור בידע. כשהסביבה נקייה, המודל הקטן יודע לממש הרבה יותר ממה שהנחנו.

חמישה סבבי RL הביאו את התוצאה הסופית

אחרי הקפיצה הראשונית מהממשק הפשוט, הריצו החוקרים חמישה סבבי אימון חיזוק עם סינתזת המשימות המתעדכנת. כל סבב הוסיף עוד כמה נקודות אחוז, עד שהגיעו ל-61.5% הסופיים. לשם השוואה, מודלים גדולים בהרבה נדרשו עד לא מזמן למאמצי הנדסה מסיביים כדי לחצות את רף ה-60% על אותו מבחן.

מאמר זמין ב-arXiv

העבודה פורסמה כפרה-פרינט בכתובת arxiv.org/abs/2609.07925 תחת הכותרת "FrogNano: Training a 4B Coding Agent via Online Task Synthesis". מאחר שמדובר בפרה-פרינט, התוצאות טרם עברו ביקורת עמיתים רשמית, אבל המתודולוגיה מפורטת דיה כדי שקבוצות אחרות יוכלו לשחזר ולבדוק את הטענות.