אופן-איי משיקה את GPT-6.1 סול: ביצועי אסטרה בקידוד סוכני בחמישית המחיר

המודל שסוגר את הפער מול אסטרה
אופן-איי (OpenAI) שחררה השבוע את GPT-6.1 סול, עדכון למודל הביניים במשפחת GPT-6, וטוענת שהוא מגיע לתוצאות קרובות לאלה של גרסת הדגל אסטרה (Astra) במשימות קידוד סוכני, שימוש במחשב ועבודה מקצועית, בעלות של חמישית ממחיר הטוקנים של אסטרה. התמחור החדש עומד על 2 דולר (כ-7.4 שקל) למיליון טוקני קלט, 10 דולר (כ-37 שקל) למיליון טוקני פלט, ו-10 סנט (כ-37 אגורות) למיליון טוקני קלט במטמון. לשם השוואה, אסטרה גובה 10 דולר, 50 דולר ודולר אחד בהתאמה, והדגם הקטן לונה (Luna) מתומחר ב-10 סנט, 50 סנט וסנט בודד.
מטמון זול משנה את המשחק לסוכנים
ההוזלה בקלט השמור (cached input) משמעותית במיוחד עבור סוכנים (agents), ששולחים מחדש את אותו פרומפט מערכת, סכמות כלים והיסטוריה בכל צעד. בגרסה החדשה קריאת מטמון עולה 5% ממחיר קלט רגיל, לעומת 10% ב-GPT-6 סול הקודם. המודל זמין כבר עכשיו ב-API תחת המזהה gpt-6.1-sol, בצ'אט GPT Work ובקודקס (Codex), עם חלון הקשר של 1,050,000 טוקנים, מגבלת פלט של 128,000 טוקנים, וחיתוך ידע ב-30 באפריל 2026.
בנצ'מרקים: קרוב לאסטרה, זול מאופוס
לפי הנתונים שאופן-איי פרסמה, ב-DeepSWE v1.1 סול משתווה לאסטרה בחמישית העלות, ומשפר ב-6.4 נקודות אחוז את הציון הטוב ביותר של GPT-6 סול במאמץ חשיבה (reasoning effort) נמוך יותר. ב-GDP.pdf, שבוחן תשובות על מסמכי PDF מקצועיים מורכבים, סול עוקף את קלאוד אופוס 5.5 (Claude Opus 5.5) עם מנגנוני נפילה (fallbacks) בפחות מחצי עלות למשימה. ב-AutomationBench 1.0.6 הוא מוביל ב-2.2 נקודות על אופוס 5.5 במאמץ בינוני, בעלות של כשליש. ב-OSWorld 2.0 אופליין הפער מאסטרה מצטמצם ל-2.1 נקודות במאמץ מרבי, בעלות של כשביעית למשימה.
מדע ועובדתיות: עדיין יש לאן לשאוף
ב-Terminal-Bench Science 0.1 סול מכפיל יותר מפי שניים את הציון של GPT-6 סול במאמץ מרבי, עם עלות ממוצעת של 5.47 דולר (כ-20 שקל) למשימה לעומת 23.21 דולר לאופוס 5.5 ו-23.80 דולר לאסטרה, אלא שאסטרה עדיין מובילה ב-68.1%, ואופן-איי עצמה ממליצה עליה למחקר הקשה ביותר. במדד עובדתיות (factuality) במאמץ נמוך, שיעור התשובות עם שגיאה עובדתית ירד מ-11.4% ל-7.7%, צמצום של כ-32%, כשהבדיקה נערכה על שיחות קשות במיוחד שמשתמשים סימנו כבעייתיות.
פרטי API ומגבלות שכדאי להכיר
ה-API תומך בקלט טקסט ותמונה ובפלט טקסט בלבד, עם חמש רמות מאמץ חשיבה, low, medium (ברירת מחדל), high, xhigh ו-max, כשהרמות none ו-minimal אינן נתמכות. קריאות כלים דורשות את ה-Responses API, בעוד Chat Completions עובדת בלעדיהן. פרומפטים מעל 272,000 טוקנים מכפילים את תעריפי הקלט והמטמון ומכפילים פי 1.5 את תעריף הפלט לכל הבקשה. מצבי Batch ו-Flex זולים ב-50%, מצב Fast יקר פי שניים, ותושבות נתונים (data residency) בארה"ב ובאיחוד האירופי נתמכות, אלא ש-Fast לא זמין עם תושבות אירופית. כוונון עדין (fine-tuning) אינו נתמך, ובקודקס צפויה גרסת Ultrafast עם עד פי 8 מהירות ייצור טוקנים בימים הקרובים.
ההשוואה למתחרים: לא תמיד תפוחים לתפוחים
בטבלת המחירים הרשמית קלאוד סונט 5.5 (Sonnet 5.5) משתווה לסול ב-2 ו-10 דולר, אבל הקלט השמור של סול זול בחצי. הבנצ'מרקים של אופן-איי משווים מול אופוס 5.5 היקר יותר, לא מול סונט. ג'מיני 3.1 פרו (Gemini 3.1 Pro) תואם במחיר הקלט אך גובה 12 דולר לפלט ונמצא עדיין בתצוגה מקדימה. Anthropic מציינת שהטוקנייזר החדש שלה מייצר כ-30% יותר טוקנים לאותו טקסט, כך שהשוואת מחירי רשימה אינה השוואת עלות אמיתית.