אנתרופיק מובילה את AA Benchmark עם שלושת המקומות הראשונים, כולל מודל ביניים

הדיווחים מהרשת מצביעים על כך ש־Anthropic תופסת כרגע את שלושת המקומות הראשונים ב-AA Benchmark, כשאפילו המודל הבינוני שלה, לא הדגל, מצליח להתברג לצמרת. הפרטים מגיעים מסדרת פוסטים של המשתמש Chubby ב-X, שחוזר על הטענה שלוש פעמים ברצף; אין עדיין פרסום רשמי של תוצאות מלאות, מתודולוגיה או גרסאות מדויקות של המודלים שנבדקו.
מה זה AA Benchmark ולמה זה משנה
AA Benchmark הוא מבחן השוואתי שבודק יכולות חשיבה, קידוד ומעקב הוראות במודלי שפה גדולים (LLM). העובדה שמודל ביניים, להבדיל מגרסת הדגל היקרה, מגיע למקום גבוה מרמזת על יעילות אימון וארכיטקטורה שמנצלות טוב יותר את משאבי החישוב (compute). מצד שני, בלי שקיפות של סט הנתונים, פרומפטים ומדדי שונות, קשה להעריך אם ההובלה יציבה או תלויה בהתאמה ספציפית למבחן.
יום המפתחים של OpenAI ברקע
מחר צפוי להתקיים DevDay של OpenAI, אירוע שנתי שבו החברה נוהגת לחשוף יכולות חדשות, מודלים או כלי מפתחים. הפוסט ממסגר את האירוע כרגע הכרעה: אם OpenAI תציג מודל שעוקף את ההובלה הנוכחית, האירוע ייחשב הצלחה; אם לא, הכנס עלול להיראות בצל של אנתרופיק. ההשוואה שמציע הכותב, "כמו כל המשחקים שממהרים לצאת לפני GTA 6", מתארת תחושה של תעשייה שמחכה למהלך הגדול הבא.
יתרון חישובי ותחזית לשנה הקרובה
לדברי הכותב, ל-OpenAI יתרון משאבי חישוב משמעותי, והוא צופה שהיא "תעקוף את אנתרופיק השנה". במקביל הוא מעריך שללא המעורבות של אילון מאסק (Elon Musk), קרי xAI ומודל Grok, אנתרופיק לא תצליח לסגור את הפער בחומרה. זו הערכה ספקולטיבית שמבוססת על הנחות לגבי תקציבי אימון וגישה לשבבים, לא על נתונים פומביים.
מה חסר בתמונה
אין במקור ציונים מספריים, גודל מדגם, או אישור מצד שלישי. לא פורסמו מדדי ביצועים נפרדים למשימות קידוד, חשיבה מתמטית או ריבוי שפות. עד שיתפרסמו תוצאות מלאות ובדיקות עצמאיות, ההובלה ב-AA Benchmark נשארת אינדיקציה מעניינת, לא הוכחה לעליונות כללית.