Z.ai הסינית משיקה את GLM-5.3 ומציגה הובלה בבדיקות גילוי פגיעות, אבל מפגרת בפיתוח ניצולים

המודל החדש של Z.ai, GLM-5.3, עוקף את Mythos 5 של Anthropic ואת GPT-5.6 Sol של OpenAI במבחן CyberGym, שבודק איתור ואימות של פגיעות בקוד מקור, עם תוצאה של 84.5% לעומת 83.8% ו-83.6% בהתאמה. בקידוד טהור נרשמה קפיצה חדה: Terminal Bench 3.0 עלה מ-4.6 ל-28.3, ו-DeepSWE טיפס מ-46.2 ל-66.9. הנתונים מגיעים מהבלוג הטכני של החברה (z.ai/blog/glm-5.3) וטרם עברו אימות עצמאי.
ביצועים בקוד ובסייבר
השיפור במבחני הקידוד מיוחס לאימון-המשך (post-training) על גבי מודל בסיס בן 743 מיליארד פרמטרים, שסביבות האימון שלו מדמות עבודת הנדסה רב-יומית, אבחון, עריכה, הרצה והתאוששות לאורך שרשראות משימות ארוכות. במבחן CyberGym, שמתמקד בגילוי ובתיקוף פגיעות ברמת הקוד, GLM-5.3 מוביל בפער צנוע אך עקבי מול שני המתחרים המערביים הבולטים.
הפער בניצול חולשות
התמונה מתהפכת כשעוברים למבחנים שדורשים פיתוח ניצול (exploitation) מעמיק. ב-ExploitBench צונח GLM-5.3 ל-54.4%, בעוד Mythos 5 מגיע ל-78.0% ו-GPT-5.6 Sol ל-76.5%. ב-ExploitGym מדווחת Z.ai על 105 משימות שהושלמו בשעתיים ו-130 בשש שעות, לעומת 181 ו-247 של Mythos 5 באותן מסגרות זמן. הפער מצביע על כך שהיכולת לאתר פגיעה לא מתרגמת אוטומטית ליכולת לממש אותה מקצה לקצה.
משקלים פתוחים לאחר ביקורת בטיחות
Z.ai מתכננת לפרסם את משקלי המודל (open weights) בתום ביקורת בטיחות בת שבועיים, תוך הגבלת הפונקציות הרגישות ביותר בסייבר למשתמשים מאומתים בלבד. חשוב להבחין: פרסום משקלים אינו זהה לקוד פתוח (open source), הנתונים, קוד האימון והרישיונות המלאים אינם נחשפים בשלב זה. המודל זמין כרגע רק דרך ממשק החברה, והביצועים המדווחים הם תוצאות יצרן שטרם אומתו בבנצ'מרקים חיצוניים.