Grok 4.6 מגיע עם תוצאות סוכנים חזקות ומחיר נמוך מהמתחרים הישירים

Grok 4.6 יוצא והפעם הסיפור הוא לא גודל המודל אלא העבודה האגנטית המקצועית. המודל מוביל על GPT-5.6 Sol Max ועל Fable 5 Max בשני מדדים שבודקים משימות סוכן מהעולם האמיתי, ומתחרה בהם גם במחיר לטוקן.
המספרים מול המתחרים
במדד Artificial Analysis, שמשקלל יכולות כלליות, Grok 4.6 מגיע לניקוד 61, בדיוק כמו GPT-5.6 Sol Max. ההבדל הוא במחיר: 2 דולר למיליון טוקנים קלט ו-6 דולר למיליון טוקנים פלט. מול Fable 5 Max, שמתיימר להיות מודל הדגל בשוק, Grok 4.6 משיג 98.4% מהניקוד שלו במדד ה-Intelligence Index שלו, אבל במחיר זול פי 5 בקלט ופי 8 בפלט. זה אומר שמבחינת יחס בין ביצועים לעלות, המודל החדש משבש את הפינה היקרה של השוק.
עבודת סוכנים וקידוד
היתרון הברור ביותר של Grok 4.6 הוא במשימות סוכן מקצועיות. ב-GDPVal-AA v2 הוא מגיע ל-1753, וב-AA-Briefcase ל-1577, שניהם לפני Sol Max ו-Fable 5 Max. המדדים האלה לא בודקים שאלות סגורות אלא עבודת ידע אגנטית, כמו מחקר, ניתוח והפקת קבצים מרובים, מה שהופך את התוצאות לרלוונטיות יותר לשימוש מעבדה מאשר למבחן טריוויה. בקידוד התמונה מעורבת: 69.9% ב-CursorBench v3.2 מקדימים את ה-67.2% של Sol, אבל ב-DeepSWE וב-Terminal-Bench, Grok 4.6 נשאר מאחורי שני המתחרים.
מה שמאחורי השיפור
SpaceXAI מייחסת את הקפיצה למספר שינויים בתהליך האימון. הריצה הייתה ארוכה יותר, ובנוסף חברת האימון עברה על ערימת נתונים מחדש: נתיבי SFT (Supervised Fine-Tuning) נוצרו מחדש, נעשה סינון עקבות מבוסס מודל, ובוצע RL (Reinforcement Learning) אגנטי על פני קידוד, פיתוח ווב, CAD ואופטימיזציית קרנל. החברה מדווחת גם על בדיקות עצמיות רבות יותר על עקבות ארוכות, כאשר המודל בודק את עבודתו לפני שהוא ממשיך הלאה. המטרה המוצהרת היא לטפל בבעיית צבירת השגיאות שנוצרת לאורך שרשראות סוכן מרובות צעדים. כל הנתונים מגיעים מדיווח החברה וטרם נבדקו באופן עצמאי.