21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

Z.ai משיקה את GLM-5.3-Flash: MoE מולטי-מודאלי ראשון בסדרה עם מיליון טוקן

Z.ai משיקה את GLM-5.3-Flash: MoE מולטי-מודאלי ראשון בסדרה עם מיליון טוקן

Z.ai שחררה את GLM-5.3-Flash, המודל הראשון בסדרת GLM-5 שתוכנן מלכתחילה כמולטי-מודאלי, וגם הזול ביותר שהמעבדה הוציאה לקוד. מדובר בארכיטקטורת Mixture-of-Experts עם 320 מיליארד פרמטרים סך הכל ו-18 מיליארד פעילים לכל טוקן, חלון הקשר של 1,048,576 טוקנים, ותמיכה בקלט תמונה ווידאו. המשקלים זמינים ב-Hugging Face תחת רישיון MIT, והמודל בילה את השבוע הראשון שלו רץ באנונימיות כ-"Ox Alpha" על OpenCode ו-OpenRouter, כשהוא מוגש כולו על שבבי AI סיניים מתוצרת מקומית.

ארכיטקטורה: תשומת לב היברידית ודחיסת אינדקס

את היעילות משיגה הארכיטקטורה בשלושה מהלכים עיקריים. לראשונה בסדרה, Z.ai משלבת תשומת לב ליניארית (KDA) עם תשומת לב דלילה (NoPE sparse MLA) ב-45 שכבות, כל טוקן מנותב דרך 8 מתוך 288 מומחים, עם משקולות FP8 טבעיות ושכבת MTP אחת לדראפט. IndexPool דוחס קבוצות וקטורי מפתח של האינדקס דרך pooling משוקלל, מה שלדברי החברה חותך פי 3 את חישובי התשומת לב ומקטין את מטמון KV פי 4.4 מול GLM-5.3. מנגנון mHC (Manifold-Constrained Hyper-Connections) מאפשר, מול GLM-4.5 בספירת פרמטרים דומה, לקצץ בחצי הן את הפרמטרים הפעילים והן את מספר השכבות.

פריסה: מי יכול להריץ לבד ומי יישאר ב-API

הצ'קפוינט הדיפולטי ב-FP8 שוקל כ-306 GiB לפני מטמון KV, והנתיב הנוכחי ב-vLLM תומך רק ב-Hopper של NVIDIA ומעלה. זה מציב פריסה עצמית בהישג יד של ארגונים בינוניים וגדולים עם לפחות צומת 8-GPU (או מגש GB200 ב-TP4), ועוד סטארטאפים AI-native ששוכרים קיבולת GPU. כל השאר יצרכו את המודל דרך API, שם הכלכלה, לא החומרה, היא הסיפור. התמחור הסטנדרטי עומד על 0.15 דולר למיליון טוקני קלט (כ-0.55 ש"ח), 0.03 דולר לקלט במטמון (כ-0.11 ש"ח) ו-0.50 דולר לפלט (כ-1.85 ש"ח).

בנצ'מרקים: חזק בקוד, חלש בראייה

לפי דיווחי Z.ai, המודל מכה את GLM-5.2 בכל הבנצ'מרקים ועומסי העבודה האמיתיים בעשירית המחיר, ונמצא חצי נקודה בלבד מ-Claude Opus 4.8 בבנצ'מרק הקידוד הפנימי. Artificial Analysis מדרגת אותו ב-57 במדד האינטליגנציה v4.1.1, עם 48.7 טוקני פלט לשנייה ו-TTFT של 1.52 שניות ב-API של Z.ai, יחס אינטליגנציה-לדולר חזק, אבל איטי ומאריך במילים. החוליה החלשה היא ראייה: המודל מפגר אחרי Gemini 3.7 Flash ב-BabyVision וב-MVbench.

סיפור ההגשה: המנוע שמאחורי ההדגמה

החלק הפחות מדווח הוא מנוע ההגשה: כל הרצת Ox Alpha בוצעה על שבבים סיניים מקומיים, באמצעות מנוע מבוסס SGLang מותאם שמפריד קידוד, פריפיל ופענוח. Z.ai מדווחת על שיפור של פי 3 מקצה-לקצה בהגשה על פני עשרות אלפי מאיצים. התאמה מיידית נראית בסוכני קוד בקנה מידה של ריפו, סוכני טרמינל ודפדפן, ניתוח לוגים וחוזים במיליון טוקן, בדיקת רגרסיית UI מצילומי מסך, וחשיבה על גיליונות/מצגות/דשבורדים שהייתה דורשת צנרת OCR-לטקסט.

מקור: marktechpost.com