פבל 5.1 תופס את המקום הראשון בבנצ'מרק הדיבייט עם יתרון של 11 נקודות על קודמו

מה הבנצ'מרק בכלל בודק
דיבייט בנצ'מרק (Debate Benchmark) לא מודד ידע כללי או יכולת קידוד, הוא בוחן כמה טוב מודל מגן על עמדה לאורך עשרות סבבי התנגשות מול יריב אקטיבי, על מאות נושאים שונים. כל התמודדות רצה פעמיים עם החלפת צדדים (PRO ו-CON) כדי לנטרל הטיית צד, ושלושה שופטים ממשפחות מודלים שונות קובעים מנצח ומרווח. התוצאה היא ציון יחיד שמשקף עקביות טיעונית, דיוק עובדתי תחת לחץ, ויכולת לשמור על קוהרנטיות לאורך דיאלוג ממושך.
הקפיצה הגדולה שייכת ל-Hy4 Preview
הסיפור המעניין ביותר לא נמצא בראש הטבלה אלא במרכזה: Hy4 Preview רושם את הזינוק הבין-דורי הגדול ביותר, 195 נקודות, מ-1,395 ל-1,590. זה לא שיפור שולי; זה פער שממקם את הגרסה החדשה בליגה אחרת לגמרי מהקודמת. לשם השוואה, ג'מיני 3.8 פלאש (Gemini 3.8 Flash) מתקדם ב-60 נקודות בלבד (1,464 1,524), וגם זה נחשב התקדמות יפה. הקפיצה של Hy4 מרמזת על שינוי ארכיטקטוני או על נתוני אימון שונים מהותית, לא רק על כוונון עדין.
GLM-5.3 נכנס לרביעייה הפותחת
המודל הסיני GLM-5.3 (high) עורך בכורה במקום הרביעי בין המודלים הנוכחיים, עם 1,653 נקודות, שיפור של 80 נקודות על GLM-5.2 מקס שעמד על 1,573. הכניסה לטופ-4 מצביעה על כך שהסדרה מצליחה לצמצם פערים מול המובילים המערביים דווקא בזירה שדורשת חשיבה טיעונית מתמשכת, לא רק שליפת עובדות. עדיין לא ברור אם הגרסה הרגילה (ללא הסיומת high) תשחזר את ההישג.
הפתעות בתחתית הצמרת
לא כולם מתקדמים. GPT-6 אסטרה (GPT-6 Astra) נוחת מתחת ל-GPT-5.6 סול (Sol) בפער של 39 נקודות, תזכורה שמספר גרסה גבוה יותר לא מבטיח ביצועים טובים יותר בבנצ'מרק ספציפי. מוז ספארק (Muse Spark) 1.3 מאבד 46 נקודות מול גרסה 1.1, רגרסיה שמעלה שאלות על כיוון הפיתוח שם. שני המקרים מדגימים למה בנצ'מרק שבודד יכולת ספציפית (דיבייט מתמשך) חושף דברים שמדדים כלליים מפספסים.
מה זה אומר בפועל
הבנצ'מרק עדיין בגדר כלי מחקרי, הקוד פתוח בגיטהאב (github.com/lechmazur/deba…) ואפשר להריץ אותו עצמאית, אבל הוא מספק תמונה נקייה יותר של "יכולת טיעון" מכל מבחן רב-ברירה סטנדרטי. פבל 5.1 מוביל כרגע, אבל הפערים בצמרת צמודים מספיק שגרסה הבאה של כל אחד מהמתחרים יכולה להפוך את התמונה.