GPT-6 אַסְטְרָה מוביל במדד הכללי, אבל בהנדסת תוכנה קְלוֹד פֵייבְּל 5.1 עדיין מקדים

מה שמאחורי המספרים
אֶפּוֹק אַיי (Epoch AI) פרסמה אתמול עדכון למדד היכולות שלה (ECI), וגִ'יפִי-6 אַסְטְרָה (GPT-6 Astra) תופס את המקום הראשון עם ציון 166. אלא שהמספר הזה כבר לא מה שהיה בהשקה: על סמך הערכות מוקדמות קיבל המודל 169, אבל אז נוספו שלוש תוצאות נוספות בבנצ'מרקים של הנדסת תוכנה, מלבד מִירוֹר-קוֹד (MirrorCode) שהיה היחיד בזמן ההשקה, והציון הכללי ירד בשלוש נקודות.
הנדסת תוכנה נשארת אצל אנתרופיק
בתחום ה-SWE, פֵייבְּל 5.1 (Fable 5.1) של Anthropic שומר על הבכורה עם SWE-ECI של 167, לעומת 164 של אַסְטְרָה. אלא שמדובר בטווחי ביטחון רחבים, 90% CI של 162 עד 179 לפייבְּל, ו-160 עד 170 לאַסְטְרָה, כך שהפער אינו מובהק סטטיסטית. כל ציון תחומי מחושב משלושה עד שישה בנצ'מרקים בלבד, מה שמותיר מרווח אי-ודאות לא קטן.
מתמטיקה זה הסיפור של אַסְטְרָה
היתרון הברור של אַסְטְרָה נמצא ב-Math-ECI, שם הוא קובע שיא חדש. המדד התחומי הזה, כמו מקבילו בהנדסת תוכנה, מחושב בנפרד מהציון הכללי ומתבסס אך ורק על בנצ'מרקים מתמטיים, כך שהוא משקף יכולת ספציפית ולא ביצוע ממוצע.
שאר הטבלה
לשם השוואה, GPT-5.6 סוֹל (Sol) מקבל ECI כללי של 162, וקִימִי קיי-3 (Kimi K3) סוגר את הרביעייה עם 158. הנתונים זמינים ב-Domain-specific ECI Explorer של אפוק, שמאפשר לצפות בציוני המתמטיקה וההנדסה בנפרד או להרכיב וריאציות מותאמות.
איך קוראים את זה
השיטה של אפוק מפרידה בין יכולות תחומיות לבין הציון הכולל, ומזכירה שכל תת-מדד נשען על מעט נקודות נתונים. כשטווחי הביטחון חופפים, הכרזה על "מוביל" בהנדסת תוכנה היא יותר עניין של נראות טבלה מאשר הבדל מוכח.