Z.ai משיקה את GLM-5.3 ב-OpenRouter עם קפיצה חדה בבנצ'מרקים שמקורה רק בפוסט-טריינינג

המודל החדש של Z.ai עלה לאוויר ב-OpenRouter ב-18 באוגוסט, והוא חולק את אותו בסיס אימון כמו GLM-5.2, כל השיפור מגיע משלב הפוסט-טריינינג. לפי הנתונים שמפרסמת הפלטפורמה, Terminal-Bench 3.0 קפץ מ-4.6 ל-28.3, ו-DeepSWE v1.1 טיפס מ-46.2 ל-66.9. שני המבחנים בודקים יכולת הנדסת תוכנה סבוכה ומשימות סוכן ארוכות-טווח, כך שהזינוק מצביע על שינוי מהותי בהתנהגות המודל בלי להחליף את המשקולות הבסיסיות.
בנצ'מרקים שמספרים את הסיפור
Terminal-Bench 3.0 מודד ביצוע משימות טרמינל מרובות-שלבים בסביבה מדומה, ו-DeepSWE v1.1 בוחן פתרון בעיות הנדסה אמיתיות מתוך מאגרי קוד פתוח. הקפיצה מ-4.6 ל-28.3 בראשון ומ-46.2 ל-66.9 בשני אינה תיקון קל, היא מעבירה את המודל מרמה שבקושי מגרדת את הסף לרמה שמתקרבת למודלים המובילים בקטגוריה. Z.ai מגדירה את GLM-5.3 כמודל חשיבה (reasoning) בקנה מידה גדול, שפותח במיוחד להנדסת תוכנה מורכבת ולמשימות סוכן ארוכות-אופק.
מפרט טכני ותמחור
המודל תומך בכניסה ויציאה של טקסט בלבד, עם חלון קונטקסט של מיליון טוקנים. הריזנינג מופעל תמידית ואי אפשר לכבות אותו; שלוש רמות מאמץ זמינות, low, high ו-max, כש-max היא ברירת המחדל. התמחור ב-OpenRouter עומד על 1.40 דולר (כ-5.2 שקל) למיליון טוקני קלט ו-4.40 דולר (כ-16.3 שקל) למיליון טוקני פלט. הת'רופוט המדווח הוא 24 טוקנים לשנייה (P50, מיטבי בין ספקים), והלטנסי החציוני עומד על 6.32 שניות.
איזון בין ביצועים ליעילות טוקנים
לדברי Z.ai, השיפור ב-GLM-5.3 מתבטא לא רק בציונים גולמיים אלא גם באיזון בין ביצועים ליעילות טוקנים, נקודה קריטית כשהריזנינג תמיד דולק וצורך תקציב טוקנים פנימי. שלוש רמות המאמץ מאפשרות למפתחים לכוון את הטרייד-אוף: low למשימות פשוטות שחוסכות טוקנים, max למשימות קשות שבהן האיכות קודמת לעלות. העובדה שהבסיס זהה ל-5.2 מדגימה כמה רחוק אפשר לדחוף מודל קיים רק באמצעות אימון המשך ממוקד.
זמינות ויציבות דרך OpenRouter
OpenRouter מדווחת על זמינות של 99.85% ו-99.60% במדדים השונים, עם מנגנון ניתוב אוטומטי לספק בריא כשמתרחשת שגיאה אצל ספק עליון, בתנאי שהפילטרים של הבקשה מאפשרים זאת. נתוני זמינות פר-ספק נגישים דרך ה-Endpoints API. המשמעות המעשית: מפתחים שבונים על GLM-5.3 מקבלים גישה יציבה יחסית בלי לנהל בעצמם fallback בין ספקי תשתית שונים.