3 באוקטובר 2026 האקדמיה ארכיון
מבזקים
פרוג-ננו מגיע ל-61.5% בסוויבנץ' וריפייד עם ארבעה מיליארד פרמטרים בלבד פי 1.0 נוחת עם פי דורבל: סוכן מינימליסטי שמסרב להתנפח קלוד סונט 5.5 מקפיץ את אנתרופיק לראש טבלת Agent Arena מטא משחררת קוד פתוח לבניית גאדג'טים מבוססי Muse הונאת ChatGPT חדשה מנצלת מודעות גוגל כדי להדביק בתוכנה זדונית
מודלים

פרוג-ננו מגיע ל-61.5% בסוויבנץ' וריפייד עם ארבעה מיליארד פרמטרים בלבד

פרוג-ננו מגיע ל-61.5% בסוויבנץ' וריפייד עם ארבעה מיליארד פרמטרים בלבד

מודל קטן, הישג גדול

החוקרת מינסון קים (Minseon Kim) חשפה בטוויטר את פרוג-ננו (FrogNano), מודל של ארבעה מיליארד פרמטרים שמגיע ל-61.5% בסוויבנץ' וריפייד (SWE-bench Verified) בלי שום זיקוק (distillation) ממודל גדול יותר. הבסיס הוא קוון 3.5-4B (Qwen3.5-4B) שעבר אימון מחזק (RL) טהור על משימות סינתטיות שנוצרו על ידי צינור בשם טאסק-פיילוט (TaskPilot). כל התהליך הסתכם בחמש איטרציות בלבד, בכל אחת 300 משימות, היקף קטן באופן מפתיע לתוצאה שמתחרה במודלים גדולים פי שישה עד שמונה.

איך טאסק-פיילוט מייצר תוכנית לימודים מותאמת

טאסק-פיילוט אינו מאגר סטטי אלא מנגנון שמייצר משימות "אונליין" לכל צ'קפוינט של המודל. בכל איטרציה המערכת דוגמת משימות בתוך "אזור הלמידות" (learnability zone) של אותו צ'קפוינט, כלומר משימות שהמודל כבר מסוגל להתקדם בהן אבל עדיין לא פותר במלואן. כשהשיפור נעצר, הצינור חוזר על התהליך עם צ'קפוינט מעודכן. הגישה הזו מחליפה את הצורך במאות אלפי דוגמאות אנושיות בלולאה קצרה וממוקדת שמייצרת בדיוק את מה שהמודל צריך כרגע.

רתמת LEAF משנה את נקודת הפתיחה

החוקרים זיהו שבמודלים בקנה מידה של 4B פרמטרים, סביבת ההרצה (harness) קריטית. הם בנו את ליף (LEAF), רתמה קלה שהעלתה את שיעור הפתרון של קוון 3.5-4B הבסיסי מ-8.3% עם רתמת R2E-Gym ל-37.2% בסוויבנץ' וריפייד. הקפיצה הזו אינה שיפור של המודל עצמו אלא הנגשה טובה יותר של סביבת העבודה, פחות חיכוך טכני, יותר מרחב ללמידה. בלי ליף, המודל היה מתחיל מנקודה נמוכה מדי מכדי שהאימון המחזק יוכל למשוך אותו למעלה.

סקיילינג של RL חושף פער עקבי

הניסויים מראים פער עקבי בין pass@1 ל-pass@8 אצל פרוג-ננו לעומת קוון הבסיסי, עדות לכך שהאימון המחזק מרחיב את הת