OpenAI ו-AWS מדווחות על צניחה של 82% בעלות למשימה עם GPT-5.6 Terra

ההכרזה והמספרים
OpenAI Developers הודיעו על שיתוף פעולה עם AWS לאופטימיזציה של המודל GPT-5.6 בגרסת Terra ושל סביבת הפיתוח Kiro, כשהמטרה המוצהרת היא יחס מחיר-ביצועים משופר. הנתון הבולט: הפחתה של כ-82% בעלות לכל משימה שהושלמה בהצלחה, שנמדדה על גבי Terminal-Bench 2.1.
מאחורי הבנצ׳מרק
הבנצ׳מרק Terminal-Bench 2.1 בודק יכולות קידוד וסביבת טרמינל, והמדד שנבחר, עלות למשימה מוצלחת, משקף יעילות כלכלית ולא רק דיוק גולמי. הריצה בוצעה בתוך Kiro, סביבת הפיתוח מונחית-המפרט של AWS, מה שמרמז שמבנה העבודה המובנה מאפשר למודל לפעול בפחות איטרציות ובפחות טוקנים.
מה חסר בתמונה
השקת גרסת Terra של GPT-5.6 מסמנת כיוון ברור: לא רק מודל גדול יותר, אלא מודל מכוון-עלות למשימות הנדסה. OpenAI לא פרסמו ציוני דיוק מוחלטים, זמני השהיה או השוואה לגרסה הקודמת של המודל עצמו, כך שהנתון מתייחס אך ורק ליחס העלות-תועלת בתצורה הספציפית הזו.
הסייגים שחשוב לזכור
בהודעה חסרים פרטים קריטיים: האם Terra זמין כבר ב-API, מה מגבלות הקונטקסט, ואיך הוא מתפקד מחוץ ל-Kiro. בלי נתונים משלימים, ה-82% נותר טענת יצרן בתנאים מבוקרים, לא מדד עצמאי שאפשר להסתמך עליו לפרודקשן.
הערת אגב על התגובה
בתגובה להודעה הופיעה פנייה נפרדת למודל Grok לבצע רד-טימינג אבטחתי, כולל הזרקת פרומפט ועקרונות Zero-Trust, אך מדובר בבקשה חיצונית שאינה חלק מההכרזה הרשמית של OpenAI או AWS.