21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מחקר

פריים אינטלקט סגרה 82% מהפער מול חוקרים אנושיים בניסוי האוטונומי הגדול מסוגו

פריים אינטלקט סגרה 82% מהפער מול חוקרים אנושיים בניסוי האוטונומי הגדול מסוגו

פריים אינטלקט (Prime Intellect) הריצה מעל מאה ריצות אוטונומיות על עשרה מודלי חזית, כל אחת בסביבה מבודדת על 8 כרטיסי H200 למשך עד שמונה ימים. המשימה: לשפר מתכון אימון של GPT בגודל 124 מיליון פרמטרים, כשהמודלים רשאים לגעת רק בהיפר-פרמטרים של האופטימייזר, בלי גישה לרשת, בלי קיצורי דרך. הריצות הטובות ביותר הצליחו לסגור 82% מהפער מול שיא שנקבע בידי עשרות חוקרים אנושיים לאורך חודשים.

הסטאפ: בנצ'מרק נקי בלי רעש חיצוני

הניסוי רץ על מסלול האופטימייזר של nanoGPT, בסיס קוד מוכר וצר שמאפשר השוואה הוגנת. כל מודל קיבל את אותו נקודת פתיחה ונמדד רק על הבחירות שלו במרחב ההיפר-פרמטרים. החומרה הייתה זהה לכולם: 8 H200ים, תקציב זמן של עד שמונה ימים לריצה. בלי אינטרנט, בלי יכולת למשוך טריקים ממאמרים חדשים, רק חשיבה ניסויית בתוך הסנדבוקס.

המודלים שנבדקו: רשימת מכולת של חזית 2026

בין המשתתפים: Fable 5, Opus 5, GPT-5.6 Sol, קימי K3 (Kimi K3), גרוק 4.5 (Grok 4.5), GLM 5.2, מיוז ספארק 1.1 (Muse Spark 1.1), דיפסיק V4 פרו (DeepSeek V4 Pro), גרוק 4.6, מיוז ספארק 1.2, וקוון 3.8 (Qwen 3.8). ההבדל בין החזקים לחלשים לא היה בידע תיאורטי, כולם מכירים את הספרות, אלא בשיקול דעת ניסויי: אילו ניסויים להריץ, איך לנווט את הרעש המובנה של הבנצ'מרק, ומתי לחזור לרעיונות שנפסלו קודם כי המתכון השתנה.

כלי עבודה עצמאיים: קימי K3 בנה לעצמו תשתית

הרתמה (harness) של פריים אינטלקט נותנת למודלים קרנל IPython מתמיד, סביבת עבודה שאפשר לבנות בה כלי מחקר אישיים. קימי K3 ניצל את זה ובנה לעצמו סט כלים: גרסאות מבוקרות של האופטימייזר, השוואות עקומות אובדן (loss curves), וכיוונון ניוטון-שולץ (Newton-Schulz). כשהעדכון הנקי יותר לא עבד כצפוי, הוא תיקן את ההשערה והמשיך. זה לא "שימוש בכלים" במובן הצר, זה בניית זרימת עבודה (workflow) מחקרית מאפס.

כיוון עתידי: מולטי-אג'נט עם מודלים קטנים פתוחים

בפריים אינטלקט חושבים שהשלב הבא הוא רתמות מרובות-סוכנים (multi-agent harnesses): מודלים קטנים פתוחי-משקולות (open weights) יטפלו בניטור, בלוגינג וביישום הטכני, והמודל החזיתי יתמקד בהחלטות אסטרטגיות. זה אמור להוזיל את הניסויים דרמטית וגם לשפר אותם, פחות בזבוז מחזורי GPU על עבודת תשתית. במקביל, הכוונה להרחיב את ה"ספידראנים" האלה לעוד חלקים של מחסנית האימון (training stack) ולהגדיל את קנה המידה של הריצות עצמן.