אנתרופיק משיקה את אופוס 5.5: ביצועי פייבל 5.1 ב-40% פחות עלות

פחות מחודשיים אחרי אופוס 5, אנתרופיק מחזירה את מודל הדגל שלה לסיבוב נוסף, הפעם עם הבטחה לביצועים שמשתווים לפייבל 5.1 ברוב המשימות, במחיר נמוך בכ-40% להרצה. ההכרזה כוללת גם איחוד של צ'אט קלאוד וכלי ה-Cowork למוצר אחד, והבטחה למודלים סונט 5.5 והייקו 5.5 בשבועות הקרובים. אופוס 5.5 זמין כבר עכשיו.
ביצועים ומחיר
לפי אנתרופיק, המודל החדש מייצר פלט ביותר מ-30% מהר יותר מקודמו, ו"דורש פחות טוקנים לעבודה באיכות גבוהה יותר". תמחור הטוקנים ירד ב-20% לעומת אופוס 5. יאשודה בהבנני (Yashodha Bhavnani), סגנית נשיא למוצרי AI ב-Box, דיווחה שבבדיקות שלהם אופוס 5.5 צרך שליש מהטוקנים של אופוס 5, והתשובות היו קצרות ב-40% בלי לאבד דיוק, נתון שאמור להשפיע משמעותית על צוותים שמריצים סוכנים על כמויות תוכן גדולות בפיננסים ובמגזר הציבורי. ג'ון רואלאס (John Ruelas), מהנדס תוכנה בכיר ב-Ramp, ציין שהוורבוזיות היתה התסכול הגדול שלו עם מודלי חזית, ואופוס 5.5 פותר אותה: המפרט שיצא היה שמיש עם עריכה מינימלית, וכשהוא שכתב פרומפט, העדיף את הגרסה של המודל על פני שלו.
מה זה אומר למנויים
למשתמשי מנויים, אנתרופיק מגדילה את מגבלות השימוש לחמש שעות ב-20%, מעין מיכל דלק גדול יותר לאותה מסגרת זמן. בתוכנית ה-20 דולר לחודש (כ-74 שקל) זה עשוי להיות שיפור מורגש; בתוכנית המקס המגבלה נדירה יותר אבל קיימת. החברה טוענת שהשיפור מצטבר: 20% מיכל גדול יותר יחד עם 25% קצב שריפה איטי יותר (בזכות עלות נמוכה יותר לטוקן) נותנים יחד כ-50% קיבולת הרצה אפקטיבית נוספת. זה לא מהפך, אבל שיפור איכות חיים לא זניח.
התנהגות ויישור
החצי השני של ההכרזה מוקדש להתנהגות. אנתרופיק מצטטת את פוסט הבלוג של המנכ"ל דריו אמודאי על מיתון קצב התקדמות היכולות, ומדגישה בדיקות יישור נרחבות, הערכה מוקדמת בידי ארגונים חיצוניים, ואמצעי הגנה לתחומים בסיכון גבוה, סייבר, ביולוגיה, ופיתוח LLM בחזית. לטענתה, אופוס 5.5 הוא "המודל בעל הביצועים החזקים ביותר שבדקנו עד היום", עם שיפורים ממוקדים בהתנהגויות שתרמו לתקריות סייבר לאחרונה, חשיבה מוטה, ניסיונות בריחה מארגז חול, ואחרות. אמצעי ההגנה מתוארים כ"דומים לאלה של פייבל 5.1" באותם תחומים. הטקסט נקטע באמצע משפט לגבי מה קורה כשהמנגנונים מופעלים.
מה חסר
אין בהכרזה מדדי ביצועים רשמיים מול פייבל 5.1 בבנצ'מרקים סטנדרטיים (MMLU, GPQA, SWE-bench וכדומה), וגם לא פירוט של מתודולוגיית הבדיקות החיצוניות או שמות הארגונים שביצעו אותן. הטענה ל"ביצועי פייבל 5.1 ברוב העבודה" נשארת הגדרה פנימית של אנתרופיק בלי בסיס השוואה חיצוני. עד לפרסום כרטיס מודל מלא או הערכה עצמאית, המספרים, 40% פחות עלות, 30% מהיר יותר, 50% קיבולת מנויים, הם נתוני יצרן בלבד.