3 באוקטובר 2026 האקדמיה ארכיון
מבזקים
פרוג-ננו מגיע ל-61.5% בסוויבנץ' וריפייד עם ארבעה מיליארד פרמטרים בלבד פי 1.0 נוחת עם פי דורבל: סוכן מינימליסטי שמסרב להתנפח קלוד סונט 5.5 מקפיץ את אנתרופיק לראש טבלת Agent Arena מטא משחררת קוד פתוח לבניית גאדג'טים מבוססי Muse הונאת ChatGPT חדשה מנצלת מודעות גוגל כדי להדביק בתוכנה זדונית
חברות

קלוד סונט 5.5 מקפיץ את אנתרופיק לראש טבלת Agent Arena

קלוד סונט 5.5 מקפיץ את אנתרופיק לראש טבלת Agent Arena

שליטה מלאה בפסגה

קלוד סונט 5.5 (Max) של Anthropic נכנס היישר למקום השלישי ב-Agent Arena עם שיפור נטו של 12.5%, והחברה תופסת כעת את שלושת המקומות הראשונים בדירוג. הקפיצה הזו מייצגת פער של 8.1 נקודות אחוז מול הגרסה הקודמת, סונט 5 (High), שיושבת במקום ה-13 עם 4.4% שיפור נטו בלבד.

מוביל בקטגוריית צ'אט, משלם ביוקר

בקטגוריית הצ'אט סונט 5.5 תופס את המקום הראשון עם 15.6% שיפור, כשהוא מקדים את פייבל 5.1 (11.49%) ואת אופוס 5.5 (10.29%). התמורה מגיעה עם תג מחיר כבד: עלות חציונית של 2.74 דולר למשימה (כ-10 שקלים), גבוהה ב-73% מהמתחרה הקרוב, אופוס 5.5 (High) שעומד על 1.58 דולר למשימה. במונחי עלות־תועלת, זה פער שארגונים יצטרכו לחשב היטב לפני פריסה בייצור.

חזית הקוד: מרחק נגיעה מ-GPT-6 אסטרה

ב-Code Arena: WebDev הגרסה עם חשיבת xHigh השיגה 1,786 נקודות והתמקמה במקום השלישי, רק שתי נקודות מ-GPT-6 אסטרה שבמקום השני. בתמחור משולב של 8 דולר למיליון טוקנים (כ-29 שקל) המודל נשאר על חזית פארטו (Pareto frontier), כלומר, אין כרגע מודל אחר שנותן יותר ביצועים בפחות עלות, או אותה תפוקה בפחות כסף, כשהחשיבה המוגברת מופעלת.

מה זה אומר בפועל

הדומיננטיות של אנתרופיק בשלישייה הפותחת של Agent Arena מצביעה על כך שהארכיטקטורה הנוכחית שלהם מכוילת היטב למשימות סוכן (agentic tasks), תכנון, שימוש בכלים, ולולאות תיקון עצמי. מצד שני, פער העלויות מול אופוס 5.5 (High) מזכיר שהקפיצה בביצועים לא חינמית, וצוותי הנדסה יצטרכו להחליט אם ה-12.5% הנוספים מצדיקים הכפלה כמעט של תקציב ההרצה.