קלוד סונט 5.5 מקפיץ את אנתרופיק לראש טבלת Agent Arena

שליטה מלאה בפסגה
קלוד סונט 5.5 (Max) של Anthropic נכנס היישר למקום השלישי ב-Agent Arena עם שיפור נטו של 12.5%, והחברה תופסת כעת את שלושת המקומות הראשונים בדירוג. הקפיצה הזו מייצגת פער של 8.1 נקודות אחוז מול הגרסה הקודמת, סונט 5 (High), שיושבת במקום ה-13 עם 4.4% שיפור נטו בלבד.
מוביל בקטגוריית צ'אט, משלם ביוקר
בקטגוריית הצ'אט סונט 5.5 תופס את המקום הראשון עם 15.6% שיפור, כשהוא מקדים את פייבל 5.1 (11.49%) ואת אופוס 5.5 (10.29%). התמורה מגיעה עם תג מחיר כבד: עלות חציונית של 2.74 דולר למשימה (כ-10 שקלים), גבוהה ב-73% מהמתחרה הקרוב, אופוס 5.5 (High) שעומד על 1.58 דולר למשימה. במונחי עלות־תועלת, זה פער שארגונים יצטרכו לחשב היטב לפני פריסה בייצור.
חזית הקוד: מרחק נגיעה מ-GPT-6 אסטרה
ב-Code Arena: WebDev הגרסה עם חשיבת xHigh השיגה 1,786 נקודות והתמקמה במקום השלישי, רק שתי נקודות מ-GPT-6 אסטרה שבמקום השני. בתמחור משולב של 8 דולר למיליון טוקנים (כ-29 שקל) המודל נשאר על חזית פארטו (Pareto frontier), כלומר, אין כרגע מודל אחר שנותן יותר ביצועים בפחות עלות, או אותה תפוקה בפחות כסף, כשהחשיבה המוגברת מופעלת.
מה זה אומר בפועל
הדומיננטיות של אנתרופיק בשלישייה הפותחת של Agent Arena מצביעה על כך שהארכיטקטורה הנוכחית שלהם מכוילת היטב למשימות סוכן (agentic tasks), תכנון, שימוש בכלים, ולולאות תיקון עצמי. מצד שני, פער העלויות מול אופוס 5.5 (High) מזכיר שהקפיצה בביצועים לא חינמית, וצוותי הנדסה יצטרכו להחליט אם ה-12.5% הנוספים מצדיקים הכפלה כמעט של תקציב ההרצה.