15 באוגוסט 2026 האקדמיה ארכיון
מבזקים
OpenRouter משיק בנצ'מרק חיפוש רשת: תקציב החיפוש מכריע יותר מהמנוע אפוקיי מפרסמת ניתוח על שאלות המפתח ביכולות בינה מלאכותית בנצ'מרק חדש בודק אם אג'נטים שורדים שעות של עבודה אוטונומית מודלים פתוחים מצמצמים פערים ממעבדות סגורות, וחודשים בודדים מפרידים ביניהם באיכות המודלים הסיניים מדלגים על שלב הביניים ומשגרים ישר לחזית הענקית
מוצרים

Z.ai הסינית משיקה את GLM-5.3 ומציגה הובלה בבדיקות גילוי פגיעות, אבל מפגרת בפיתוח ניצולים

Z.ai הסינית משיקה את GLM-5.3 ומציגה הובלה בבדיקות גילוי פגיעות, אבל מפגרת בפיתוח ניצולים

המודל החדש של Z.ai, GLM-5.3, עוקף את Mythos 5 של Anthropic ואת GPT-5.6 Sol של OpenAI במבחן CyberGym, שבודק איתור ואימות של פגיעות בקוד מקור, עם תוצאה של 84.5% לעומת 83.8% ו-83.6% בהתאמה. בקידוד טהור נרשמה קפיצה חדה: Terminal Bench 3.0 עלה מ-4.6 ל-28.3, ו-DeepSWE טיפס מ-46.2 ל-66.9. הנתונים מגיעים מהבלוג הטכני של החברה (z.ai/blog/glm-5.3) וטרם עברו אימות עצמאי.

ביצועים בקוד ובסייבר

השיפור במבחני הקידוד מיוחס לאימון-המשך (post-training) על גבי מודל בסיס בן 743 מיליארד פרמטרים, שסביבות האימון שלו מדמות עבודת הנדסה רב-יומית, אבחון, עריכה, הרצה והתאוששות לאורך שרשראות משימות ארוכות. במבחן CyberGym, שמתמקד בגילוי ובתיקוף פגיעות ברמת הקוד, GLM-5.3 מוביל בפער צנוע אך עקבי מול שני המתחרים המערביים הבולטים.

הפער בניצול חולשות

התמונה מתהפכת כשעוברים למבחנים שדורשים פיתוח ניצול (exploitation) מעמיק. ב-ExploitBench צונח GLM-5.3 ל-54.4%, בעוד Mythos 5 מגיע ל-78.0% ו-GPT-5.6 Sol ל-76.5%. ב-ExploitGym מדווחת Z.ai על 105 משימות שהושלמו בשעתיים ו-130 בשש שעות, לעומת 181 ו-247 של Mythos 5 באותן מסגרות זמן. הפער מצביע על כך שהיכולת לאתר פגיעה לא מתרגמת אוטומטית ליכולת לממש אותה מקצה לקצה.

משקלים פתוחים לאחר ביקורת בטיחות

Z.ai מתכננת לפרסם את משקלי המודל (open weights) בתום ביקורת בטיחות בת שבועיים, תוך הגבלת הפונקציות הרגישות ביותר בסייבר למשתמשים מאומתים בלבד. חשוב להבחין: פרסום משקלים אינו זהה לקוד פתוח (open source), הנתונים, קוד האימון והרישיונות המלאים אינם נחשפים בשלב זה. המודל זמין כרגע רק דרך ממשק החברה, והביצועים המדווחים הם תוצאות יצרן שטרם אומתו בבנצ'מרקים חיצוניים.