21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

אורנית' 1.5 מציגה לולאת שיפור עצמי מלאה ומשיגה תוצאות תחרותיות מול קלאוד אופוס 4.8

אורנית' 1.5 מציגה לולאת שיפור עצמי מלאה ומשיגה תוצאות תחרותיות מול קלאוד אופוס 4.8

המודל שמייצר לעצמו את התרגילים

חוקרי אורנית' (Ornith) משחררים היום את הגרסה 1.5 של משפחת המודלים, ומציגים התקדמות משמעותית בכיוון של מודלי בסיס שמשפרים את עצמם מקצה לקצה. בניגוד לגישה המקובלת של אימון על דאטה סטטי שנאצר בידי אדם, אורנית' 1.5 מרחיבה את מסגרת ה-self-scaffolding שהוצגה בגרסה 1.0 ללולאה סגורה שלמה: המודל מציע משימות חדשות, בונה עבורן סקאפולדינג (scaffolding) ייעודי, כלומר הוראות, כלי עבודה, אסטרטגיית פירוק ותזמור, ומייצר פתרונות (rollouts) שמהם הוא לומד באמצעות למידת חיזוק (reinforcement learning). התהליך חוזר על עצמו, וכל סיבוב מייצר חוויות למידה חדשות שדוחפות את הגבול הלאה.

ספינת הדגל: 397 מיליארד פרמטרים, תוצאות ברמה של קלאוד אופוס 4.8

בגודל הדגל, אורנית'-1.5-397B (ארכיטקטורת MoE) משיגה 86.1 בבנצ'מרק Terminal-Bench 2.1 ו-56.0 ב-DeepSWE, ציונים שמציבים אותה ראש בראש עם קלאוד אופוס 4.8 (85.0 ו-59.0 בהתאמה), ולפני מודלים פתוחים מקבילים כמו GLM-5.2 (82.7 ו-46.2) ו-DeepSeek-V4-Flash-0731 (82.7 ו-54.4). הדיווח הטכני מציין שהמודל תוכנן לאינטליגנציה כללית חזקה במשימות חשיבה, סוכניות (agentic) וקוד, והמספרים אכן מראים כיסוי רחב של בנצ'מרקים, אבל מדובר בדוח טכני של היצרן, לא בפרסום שעבר ביקורת עמיתים, וההשוואה לקלאוד אופוס 4.8 נעשית על שני בנצ'מרקים בלבד.

יעילות ב-MoE: 35B שמפעיל רק 3B פר טוקן, ו-9B שרץ במובייל

הגרסה הבינונית, אורנית'-1.5-35B (גם היא MoE), מפעילה רק 3 מיליארד פרמטרים לטוקן ועדיין עוקפת בפער ניכר את Qwen 3.6-35B בכל הבנצ'מרקים של קוד וסוכניות, וגם את המודלים הצפופים Gemma 4-31B ו-Muse Glimmer-30B של מטא. ב-Terminal-Bench 2.1 היא מגיעה ל-68.5 מול 43.4 של ג'מה ו-51.7 של מיוז, וב-SWE-Bench Verified ל-79.0 מול 52.0 ו-76.0 בהתאמה. בקצה הקטן, אורנית'-1.5-9B הצפופה מגיעה ל-47.0 ב-Terminal-Bench 2.1 ו-70.6 ב-SWE-Bench Verified, תוצאות שמשתוות או עולות על מודלים גדולים בהרבה, וגרסת ה-9B-Mobile המכווצת (quantized) ניתנת לפריסה ישירה על אייפון ואנדרואיד.

איך הלולאה עובדת: שלושה שלבים, פרס אחד

כל מחזור אימון מתנהל בשלושה שלבים: ראשית, המערכת מקבלת סביבה או קודבייס, הוראות ברמה גבוהה על סוג המשימה, וגישה להיסטוריית הפתרונות הקודמת, ומציעה משימות קשות יותר שחושפות פערי יכולת. שנית, לכל משימה המודל מייצר או משפר סקאפולדינג ייעודי. שלישית, בהינתן המשימה והסקאפולדינג, המדיניות (policy) מייצרת פתרון. התגמול (reward) מהפתרון מוזרם אחורה לכל שלושת השלבים, כך שהמערכת לומדת לא רק לייצר פתרונות טובים יותר, אלא גם לייצר משימות אימון מועילות יותר ולבנות סקאפולדינג אפקטיבי יותר. בלולאה סגורה, מדיניות חזקה יותר מאפשרת משימות קשות יותר, סקאפולדינג מתפתח חושף יכולות טוב יותר, ו-rollouts איכותיים יותר מספקים אותות למידה חזקים יותר, בלי תלות בהתפלגות אימון סטטית או בעיצוב סוכן ידני.

מה חסר בדוח ומה זה אומר בפועל

הדוח הטכני לא מפרט את נפח הדאטה, את עלות האימון, את משך הזמן או את החומרה ששימשה, פרמטרים שמקשים על הערכה עצמאית של היעילות האמיתית. גם לא פורסמו מדדי ביצועים על בנצ'מרקים כלליים יותר (כמו MMLU או GPQA) שיאפשרו השוואה רחבה מעבר לקוד וסוכניות. העובדה שהמודלים זמינים ב-Hugging Face עם משקלים פתוחים (open weights) היא צעד חשוב לשחזור, אבל קוד האימון והפייפליין של הלולאה העצמית טרם שוחררו. בשורה התחתונה: אורנית' 1.5 מדגימה שה-self-improvement loop עובד ברמה שמתקרבת למודלים סגורים מובילים, לפחות בצוואר הבקבוק של קוד וסוכניות, והשאלה המעניינת עכשיו היא האם הגישה תתרחב לתחומים אחרים בלי לאבד יציבות.