21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

Miles v0.1 יוצא לדרך: פריימוורק RL בקוד פתוח למודלי שפה ומולטימודל

Miles v0.1 יוצא לדרך: פריימוורק RL בקוד פתוח למודלי שפה ומולטימודל

רדיקס ארק (RadixArk) משיקה את Miles גרסה 0.1, פריימוורק למידת חיזוק (RL) בקוד פתוח שמיועד לאימון מודלי שפה גדולים ומודלים מולטימודליים. הבעיה שהכלי מנסה לפתור מוכרת היטב לצוותים שעובדים עם RL: להתחיל ריצה זה קל, אבל לדבג אותה כשמשהו משתבש, זה כבר סיפור אחר. Miles נבנה כדי לוודא שהריצה תקינה, לנצל חומרה ביעילות, ולשמור על האימון יציב גם בקנה מידה גדול.

תשעה חודשים, 72 תורמים, אלפי קומיטים

הפיתוח נמשך תשעה חודשים וכלל 72 תורמים שהנחיתו 1,326 קומיטים ו-85 בדיקות CI מקצה לקצה על GPU. הפריימוורק עבר מבחני שטח על מודלים מתקדמים בקוד פתוח, ובהם Kimi K3, DeepSeek V4, Qwen 3.8, GLM 5.2, Inkling ו-MiniMax H3. רשימת הארגונים שכבר מריצים עליו עומסי ייצור ומחקר כוללת את Humansand, Periodic Labs, Modal, DecagonAI, Eigent.AI, Nebius AI ו-IBM, על חומרה של NVIDIA ו-AMD כאחד.

שיפורי ביצועים של סדרי גודל אצל המאמצים המוקדמים

Periodic Labs בונה על גבי Miles אימון של מודלים בני טריליון פרמטרים על אלפי GPU, עם רולאאוטים (rollouts) באופק ארוך במיוחד ל-RL מדעי. לפי החברה, השילוב הניב שיפור של פי 3 בתפוקת הרולאאוט, פי 10 בסנכרון משקולות, ופי 30 בהמרת משקולות. Humansand משתמשת בפריימוורק כתשתית ליבה למחקר RL אסינכרוני מרובה-סוכנים באופק ארוך, והתאימה אותו לאורקסטרציה משלה עם מתכוני RL בדיוק נמוך מסוג MXFP8 ו-NVFP4. Eigent.AI מנצלת את ניהול הטרייקטוריות ותשתית הרולאאוט לאימון סוכנים על פני מודלים, משימות וסביבות שונות. DecagonAI מעבירה דרך Miles פוסט-אימון של סוכני AI למעקב הוראות והפעלת כלים, לטובת חוויית לקוח בזמן תגובה נמוך ודיוק גבוה.

שכבת רולאאוט אחידה לעשרות סביבות

Miles מגיע עם מחברים (connectors) בשכבת הרולאאוט למגוון סביבות אימון: Harbor, HUD, NeMo Gym של NVIDIA, OpenEnv של Hugging Face, ו-Verifiers של Prime Intellect. ארגזי החול (sandboxes) רצים על AgentENV. המשמעות היא שצוות יכול להחליף סביבת אימון בלי לכתוב מחדש את תשתית האיסוף והסנכרון, נקודת כאב מוכרת בפרויקטים שמשלבים מספר בנצ'מרקים או סימולטורים.

מה זה משנה בפועל

ההשקה מסמנת התבגרות של שכבת התשתית סביב RL למודלים גדולים: פחות קוד דבק (glue code) שכל צוות כותב לבד, יותר רכיבים משותפים שעברו בדיקות CI על ברזל אמיתי. הגרסה עדיין מסומנת 0.1, כלומר API לא יציב ושינויים שוברים צפויים, אבל רשימת המאמצים והמספרים שהם מדווחים מצביעה על כך שהכיוון נכון. עבור צוותים שמתלבטים אם לבנות בעצמם או לאמץ, Miles מציעה נקודת התחלה שנבדקה בקנה מידה שהרבה מעבדות לא מגיעות אליו לבד.