אנתרופיק משיקה משפחת מודלים חדשה עם חמש גרסאות בטווח ביצועים ומחיר רחב

החברה חשפה את Claude Haiku 5.5, סדרה של חמישה מודלים שנבדלים זה מזה באינטליגנציה, מהירות ותמחור, ומאפשרים בחירה לפי סדר עדיפויות שונה לכל משימה. הפער בין הגרסה הזולה ליקרה מגיע לפי 8.7 בעלות למשימה, והפריסה נועדה לכסות תרחישים החל מתשובות מיידיות בעלות נמוכה ועד עומק חשיבה מרבי.
חלוקה לפי יעד ותקציב
הגרסה החזקה ביותר, Haiku 5.5 (Max), משיגה ציון 43 במדד האינטליגנציה הפנימי של אנתרופיק ומספקת קצב פלט של 243 טוקנים לשנייה. בקצה השני, Haiku 5.5 (Low) מציעה זמן המתנה של 13.58 שניות לטוקן ראשון ועלות של 0.02 דולר למשימה (כ-0.07 שקל). שלוש הגרסאות הנוספות ממלאות את המרווח בין שתי הקצוות, כשכל אחת מכוונת לאיזון אחר בין עומק, מהירות ומחיר.
מתודולוגיית השוואה מובנית
אנתרופיק מגדירה ארבע קטגוריות השוואה נפרדות: מודלים ללא חשיבה (reasoning) נמדדים רק מול מקביליהם; מודלי חשיבה נמדדים מול שתי הקבוצות; מודלי משקולות פתוחות (open weights) מושווים רק בתוך אותה מחלקת גודל, Tiny (עד 4 מיליארד פרמטרים), Small (4-40 מיליארד), Medium (40-150 מיליארד), Large (מעל 150 מיליארד); ומודלים קנייניים (proprietary) נמדדים מול מודלים קנייניים ופתוחים בטווח מחיר זהה, לפי יחס משוקלל 3:1 בין קלט לפלט בשלוש רצועות, מתחת ל-0.15 דולר למיליון טוקנים, 0.15-1 דולר, ומעל 1 דולר.
מדדי יכולת מבוססי מבחנים מרובים
ארבעה אינדקסים שונים מדווחים, כל אחד משקלל 6-7 הערכות: AA-Omniscience, GDPval-AA v2.1, AA-Briefcase v1.1, Humanity's Last Exam, AutomationBench-AA, AA-LCR v1.1, GDP.pdf ו-MLCR-AA. השילוב משתנה בין האינדקסים, כך שכל מדד מדגיש היבט אחר, ידע כללי, קידוד, תכנון, או התמודדות עם משימות אוטומציה מורכבות. החברה לא פרסמה תוצאות מספריות מלאות לכל גרסה בנפרד, אלא רק את הציון המרבי (43) ואת קצוות המהירות והעלות.