קלאוד אופוס 5.5 כובש את ראש מדד RSI של Vals AI ומנצח בסיס אנושי באימון מודלים

אופוס 5.5 ראשון שמנצח רפרנס אנושי ב-LM Training
לפי פרסום של Vals AI, קלאוד אופוס 5.5 (Claude Opus 5.5) תפס את המקום הראשון במדד RSI והפך למודל הראשון שמצליח לעקוף את הרפרנס האנושי שפורסם במשימת LM Training תחת הפרוטוקול שלהם. במשימה הזו המודל נדרש לאמן מודל שפה קטן בעצמו בתוך תקציב של 24 שעות, והישג כזה מסמן התקדמות משמעותית לכיוון עבודה אג'נטית ארוכת-אופק (long-horizon). ב-Vals AI מציינים שההישג מקדים את לוח הזמנים הצפוי ל-RSI מלא מאוגוסט 2027 ליולי 2027.
ארבע מתוך חמש משימות מחקר בראש הטבלה
במדד RSI עצמו אופוס 5.5 מוביל בארבע מתוך חמש משימות המחקר שנבדקו. השיפור הבולט ביותר מופיע ב-Program Bench: המודל פותר במלואן 18.5% מהמשימות, לעומת 7.0% של Fable 5.1, 5.5% של GPT-6 Astra ו-3.0% בלבד של אופוס 5 הקודם. מדובר ביותר מפי שישה שיפור לעומת הדור הקודם באותה הגדרת מאמץ (effort setting), כשהוא גם מסיים מהר יותר וזול יותר, 2.4 שעות ו-42.66 דולר (כ-155 שקל) למשימה בממוצע.
שיפור בעבודה אג'נטית יומיומית, לא רק בקצה
השיפורים לא מוגבלים למשימות קצה מחקריות. אופוס 5.5 מגיע למקום שני ב-Terminal Bench Science, SRE Bench, Mystery Mechanism, IOI, EMB ו-Vibe Code Bench, בכולם הוא מקדים את אופוס 5. לפי Vals AI, התוספת הכי ברורה נמצאת סביב ביצוע מתמשך (sustained execution), איטרציה והתאוששות מטעויות, יכולות שקובעות האם סוכן (agent) מצליח להחזיק משימה מורכבת לאורך זמן בלי להיתקע או להתפרק.
רגרסיות: לא הכול ורוד
השיפור אינו אחיד. אופוס 5.5 נסוג ביחס לאופוס 5 ב-Med Code, Public Benefits, Legal Research, Tax Agent Bench ו-HLAB. ההפסדים מרוכזים בשלושה תחומים: שליפת מידע (retrieval), נאמנות למקור (fidelity) ומעקב אחר הנחיות מפורטות (rubric-following). זה מזכיר שהמודל לא "חכם יותר" בכל מובן, הוא מותאם אחרת, והטרייד-אוף נראה בבירור.
חלון הקשר של מיליון טוקן, פלט של 128 אלף
המפרט הטכני: חלון הקשר (context window) של מיליון טוקן, ומגבלת פלט מקסימלית של 128 אלף טוקן. הבדיקות רצות על ההגדרות הדיפולטיביות של Anthropic, טמפרטורה 1, Top-P ו-Top-K בברירת מחדל, ומאמץ מחשוב מרבי (max compute effort). מדד RSI רץ ב-Claude Code המקורי בהגדרת מאמץ מרבית. במילים אחרות: אין כאן פרומפטינג מיוחד או הנדסת פרמטרים, זה מה שהמודל נותן "מחוץ לקופסה" בקונפיגורציה הרשמית.
שאלות פתוחות על מתודולוגיה וגישה
נשארו שאלות פתוחות: האם ל-Vals AI הייתה גישה "לבנה" (whitebox) פנימית לאופוס 5.5, מהסוג שדאריו אמודאי תיאר במאמר שלו על קצב החזית (pacing the frontier)? אם לא, האם הם מתכננים לשלב גישה כזו במדדים עתידיים? והאם המתודולוגיה של מדד RSI עצמו פומבית? בלי תשובות לשאלות האלה, קשה להעריך עד כמה התוצאות משקפות יכולת כללית לעומת התאמה ספציפית לפרוטוקול הבדיקה.