GPT-6 אסטרה: טענות ליעילות עלות חסרת תקדים וציוני שיא ב-ARC-AGI

משתמש X המכונה cheaty פרסם סדרת ציוצים הטוענת כי GPT-6 אסטרה של OpenAI מגדיר מחדש את גבול הפארטו של יעילות עלות, הודות ליעילות טוקנים קיצונית שהופכת אותו לזול יותר למשימה מג'מיני 3.8 פלאש, מודל שעלותו 13 פעמים נמוכה יותר. לדברי המקור, אסטרה מציג הפחתה של כ-10% בטוקני פלט במאמץ מרבי בהשוואה ל-GPT-5.6 סול, תוך שמירה על אינדקס אינטליגנציה גבוה יותר.
עקומת עלות שמתעקלת לאחור
הנקודה המעניינת ביותר בדיווח נוגעת להתנהגות עקומת העלות במבחן ARC-AGI. לטענת cheaty, רמת ההנמקה המקסימלית (max reasoning level) פותרת בעיות במהירות כזו שהעלות הכוללת נמוכה יותר מאשר ניסיון לפתור אותן ברמת הנמקה נמוכה יותר, תופעה שגורמת לעקומת העלות "להתעקם לאחור". אם הדבר נכון, המשמעות היא שהשקעת מחשוב נוספת בשלב ההסקה (inference) מחזירה את עצמה בצמצום דרמטי של אורך התשובה.
הישגים במבחן ARC-AGI-3
לפי הניתוח שצורף לציוצים, אסטרה משיג 63% ב-ARC-AGI-3 בגרסה הסטנדרטית, ו-99% באמצעות רתמת מתאם ספק (provider adapter harness) חדשה. המבחן, שפותח על ידי פרנסואה שולה (François Chollet), בוחן יכולת הכללה לבעיות חדשות לחלוטין ללא אימון מוקדם עליהן. המקור מוסיף כי המודל עולה על ביצועי אדם ב-96% מהרמות במבחן, ובונה את המודל הסמלי המדויק ביותר של סביבות חדשות שנצפה עד כה.
ספקנות נדרשת: מקור יחיד, ללא אימות חיצוני
כל הנתונים מגיעים ממקור יחיד ברשת חברתית, ללא פרסום רשמי של OpenAI, ללא דוח טכני וללא אימות עצמאי של חוקרים חיצוניים. המונח "פארטו-פרונטיר" (Pareto frontier) מתאר מצב שבו לא ניתן לשפר מדד אחד בלי לפגוע באחר, טענה חזקה שדורשת ראיות כמותיות מפורטות. גם ההשוואה לג'מיני 3.8 פלאש, מודל שפרטיו המלאים אינם פומביים, מקשה על הערכה ביקורתית. עד לפרסום בנצ'מרקים פתוחים או דוח רשמי, המספרים נותרים בגדר טענות לא מאומתות.