גרוק 4.7 מוביל במבחן Frontier v4, אך מורגן מתלונן על סגנון הפלט

מורגן (Morgan) דיווח ברשת X שגרוק 4.7 של xAI השיג את הציון הגבוה ביותר במבחן Frontier v4, כשהוא מקדים את GPT-6.1 Sol, אופוס 5.5 ו-GPT-6 אסטרה בכל רמות המאמץ שנבדקו. ההישג מגיע לאחר שהחוקר הודה כי זלזל ביכולות המודל בגרסתו הקודמת.
מה שמלמד הבנצ'מרק
Frontier v4 בוחן יכולות תכנון וביצוע משימות מורכבות ברמות קושי שונות, והתוצאה מצביעה על כך שגרוק 4.7 מצליח להתמודד עם העומס הקוגניטיבי טוב יותר מהמתחרים המובילים של OpenAI ו־Anthropic. מורגן ציין כי היתרון נשמר לאורך כל מדרג המאמץ, מהמשימות הקלות ועד לתובעניות ביותר, מה שמרמז על עקביות ולא על התמחות צרה.
הבעיה שמסתתרת מאחורי המספרים
למרות הניצחון המספרי, מורגן תיאר את חוויית השימוש כבלתי נסבלת. לטענתו, המודל מקצר כל הסבר כאילו היה מצייץ ברשת חברתית, ומסיים משימות מוקדם מדי בלי לוודא שהן הושלמו במלואן. מודלים אחרים, לדבריו, מתעקשים להמשיך ולבדוק את העבודה עד לסגירה מלאה.
פער בין ביצועי מעבדה לשימוש יומיומי
הפער בין הציון בבנצ'מרק לאיכות הפלט האנושי מדגים מגמה מוכרת: אופטימיזציה למדדים סטנדרטיים לא בהכרח מייצרת מודל שנעים לעבוד איתו. גרוק 4.7 עשוי להיות "חכם" יותר במובן הצר, אך סגנון התקשורת שלו, דחוס, מקוצר, חסר סבלנות, הופך אותו לכלי קשה למעקב ולבקרה.
מה חסר בתמונה
לא פורסמו מדדי ביצועים מלאים, לא נמסר גודל החלון הקונטקסטואלי, ואין מידע על זמינות מסחרית או על תמחור. כמו כן, לא ברור אם הגרסה שנבדקה זהה לזו שתגיע למשתמשים, או שמדובר בגרסת ניסוי פנימית. עד שישוחררו פרטים נוספים, ההישג נותר נקודת ציון מעניינת, לא יותר.