21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

GLM-5.3 יוצא בגרסת משקלים פתוחים: מודל הסוכנים החזק ביותר של Z.ai לתכנות והגנת סייבר

GLM-5.3 יוצא בגרסת משקלים פתוחים: מודל הסוכנים החזק ביותר של Z.ai לתכנות והגנת סייבר

החברה הסינית Z.ai משחררת את GLM-5.3 כמודל במשקלים פתוחים, כשהיא ממקדת את ההכרזה בשני תחומים ספציפיים: תכנות סוכני והגנת סייבר. המודל זמין להורדה, הרצה מקומית והתאמה, בלי מגבלות רישיון שמגבילות שימוש מסחרי. בניגוד לגרסאות קודמות שהדגישו יכולות כלליות, כאן הזווית ברורה: בנצ'מרקים של סוכנים שמבצעים משימות קצה-לקצה בסביבות אמיתיות.

אותו בסיס, פוסט-טריינינג אחר

הבסיס זהה ל-GLM-5.2, כל השיפור מגיע משלב הפוסט-טריינינג. לפי הנתונים שמפרסמת החברה, המודל החדש מציג שיפור של 50 נקודות אחוז על קודמו בבנצ'מרק הביתי Z.ai Code Bench. בבנצ'מרקים ציבוריים הוא מגיע לתוצאת SOTA בקוד פתוח בשני מבחנים מרכזיים: Terminal Bench 3.0 ו-Agents' Last Exam (ALE). בשניהם מדובר במבחנים שמדמים עבודה של סוכן בסביבת CLI אמיתית, עם הקשר ארוך וכלים חיצוניים.

יכולת סייבר שצמחה מהר מהצפוי

ההפתעה הגדולה בדיווח היא בתחום הסייבר. ככל שהפוסט-טריינינג התרחב, יכולת גילוי החולשות התפתחה בקצב מהיר מהתחזיות. GLM-5.3 משיג SOTA ב-CyberGym, בנצ'מרק שבוחן גילוי וניצול חולשות, והפער הגדול ביותר מופיע בשלבי הניצול הגבוהים, שם המודל מכפיל יותר מפעמיים את ביצועי GLM-5.2. המשמעות: המודל לא רק מוצא באגים, אלא גם יודע לממש ניצול שלהם בסביבה מבוקרת.

תמיכה רחבה בפריסות והאצת חומרה

המודל תומך ברשימה ארוכה של מסגרות הסקה: SGLang, vLLM, TokenSpeed, Transformers, KTransformers ו-Unsloth, לכל אחת מדריך ייעודי. לפלטפורמת Ascend NPU של Huawei יש תמיכה ייעודית דרך vLLM-Ascend, xLLM ו-SGLang. ברמת הפרמטרים, GLM-5.3 מציג שליטה בתקציב חשיבה דרך reasoning_effort עם שלוש רמות (low, high, max, ברירת מחדל max), ופרמטר clear_thinking שברירת המחדל שלו false בצ'אט ודורש הפעלה מפורשת.

מתודולוגיית הערכה מפורטת ושקופה

Z.ai מפרסמת את מלוא פרמטרי ההערכה לכל בנצ'מרק, טמפרטורה, top_p, אורך הקשר מקסימלי, טיים-אאוט, מספר הרצות (rollouts) ושיטת ניקוד. לדוגמה: Terminal Bench 3.0 נבדק עם avg@3 על שלוש הרצות למשימה, קונטיינר מבודד, 600 תורות סוכן מקסימום, 10 שעות טיים-אאוט, בלי כלי חיפוש. ALE רץ על 105 משימות בדוקר עם 4-8 שעות טיים-אוט. CyberGym נבדק ב-Claude Code 2.1.207 עם מאמץ חשיבה מקסימלי וללא כלי רשת. רמת הפירוט הזו מאפשרת שחזור מלא, נדיר בהכרזות מסוג זה.