GPT-6 אסטרא יקר יותר ומציג תוצאות מעורבות מול קודמו

המחיר קפץ, התמורה לא בהכרח
לפי ניתוח חדש של Artificial Analysis, GPT-6 אסטרא (Astra) עולה 75% יותר מ-GPT-5.6 סול (Sol) בהגדרת מאמץ מרבי (max effort), ונמצא ברובו מאחורי קודמו בגבול היעילות של מדד האינטליגנציה (Intelligence Index) מול עלות למשימה. הפער נובע מהכפלת מחיר פי 2.5, שמקוזזת רק חלקית בזכות ירידה בצריכת טוקנים. במילים פשוטות: משלמים הרבה יותר, ומקבלים ביצוע דומה או נמוך יותר פר דולר במדד הכללי.
קידוד דווקא משתלם
התמונה משתנה כשבוחנים את מדד סוכן הקידוד (Coding Agent Index). שם אסטרא רושם קפיצה משמעותית ומשתווה לציון של Fable 5, בעלות נמוכה יותר. בהגדרת מאמץ מרבי, המודל החדש יושב על גבול פארטו (Pareto frontier) של מדד הקידוד מול עלות למשימה: מחירו דומה לזה של GPT-5.6 סול במאמץ מרבי, אבל הציון גבוה בשתי נקודות. בנוסף, אסטרא מגדיר גבול פארטו חדש במדד האינטליגנציה מול טוקני פלט למשימה, עם הפחתה של כ-10% בטוקני פלט בהשוואה לקודמו.
הזיות ירדו בחצי
השיפור הבולט ביותר מופיע במדד AA-Omniscience: שיעור ההזיות (hallucination rate) צנח מ-92% ל-51% במאמץ מרבי, לצד עלייה מתונה בדיוק. הירידה החדה בהזיות היא זו שדוחפת את הציון הכולל במדד הזה כלפי מעלה, ומצביעה על שינוי מהותי בהתנהגות המודל, פחות המצאות, יותר היצמדות לעובדות.
עבודת ידע סוכנית: צעד קדימה, צעד אחורה
במבחני עבודת ידע סוכנית (agentic knowledge work) התוצאות מעורבות. ב-AA-Briefcase נרשם שיפור של כ-80 נקודות, עם עלייה משמעותית הן בציוני הרובריקה (rubric scores) והן באיכות אנליטית (Analytical Quality Elo), אבל ציון המצגת (Presentation) ירד. מנגד, ב-GDPval-AA v2 נרשמה נסיגה דומה בהיקפה. המשמעות: המודל משתפר בניתוח ובאנליזה, אבל נחלש בהצגה ובביצוע כולל של משימות מורכבות ארוכות-טווח.
שורה תחתונה
GPT-6 אסטרא אינו שדרוג אחיד. הוא יקר משמעותית, מוביל בקידוד ובהפחתת הזיות, אך מפגר ביעילות עלות כללית ובחלק ממדדי הסוכנות. למפתחים שבונים סוכני קוד, ייתכן שהמחיר מוצדק. למשימות ידע כלליות, GPT-5.6 סול עדיין נותן יותר תמורה לשקל.