13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים דינה רובוטיקס משחררת מודל עולם-פעולה שפותח על מיליון שעות וידאו אנושי נמוטרון 3.5 לייטנינג נוחת בפריים אינטלקט עם תמיכה מיום אפס התפרצות כבד שומני עולמית: בינה מלאכותית עשויה להקדים תרופה למכה
מחקר

GPT-5.6 מזיז את גבול פרטו בבנצ'מרק אגנטי חדש, לפחות על פי מי שבנה אותו

מאת הדר מזרחי כתב/ת AgentNet
GPT-5.6 מזיז את גבול פרטו בבנצ'מרק אגנטי חדש, לפחות על פי מי שבנה אותו

ערוץ הטלגרם llm_under_hood פרסם תוצאות מבחן לדגמים חדשים של OpenAI ממשפחת GPT-5.6, על גבי בנצ'מרק אגנטי פנימי שפותח לצורך הבדיקה. המודלים שנבדקו מזוהים בכינויים Sol, Terra ו-Luna. הפרסום עצמו מציג נכון לעכשיו רק גרף וטענה כללית, כאשר הדו"ח המלא והמפורט אמור לעלות לאוויר בשלב מאוחר יותר.

מתודולוגיה ובניית המבחן

הבנצ'מרק נבנה מניתוח של דפוסי פעולה שנלקחו מתוך תחרויות BitGN, אותם הריצו החוקרים מחדש דרך סביבת בדיקה בשם ECOM1. במהלך הרצת המבחנים השתמשו בכלי ניטור (trace) לצד בדיקה ידנית מעמיקה של נקודות הכשל. המטרה הייתה לאתר את המקומות שבהם אפילו הארכיטקטורות החזקות ביותר מתחילות להתבלבל, מפרות מגבלות שהוגדרו להן או מתעלמות ממדיניות הבטיחות שלהן. את אוסף נקודות התורפה הללו אספו לכדי מערכת מבחנים אחת.

תוצאות והזזת הפרונטיר

לפי הפרסום, הדגמים של GPT-5.6 עם הגדרות ההיסק (reasoning) ברירת המחדל שלהם מספקים ביצועים שמזיזים את גבול פרטו הן בציר של איזון בין איכות למהירות והן בציר של איזון בין איכות למחיר. החוקרים טוענים כי התוצאות הללו הופכות את המודלים הללו לברירת המחדל המומלצת לפרויקטים חדשים. עם זאת, הנתונים המספריים ומדדי הביצועים המדויקים שמאחורי הגרף שצורף לא פורסמו בהודעה עצמה.

מה חסר בתמונה

הטענה על הזזת גבול פרטו מסתמכת נכון לעכשיו על תצפית ויזואלית בלבד של גרף, ללא טבלאות נתונים גולמיות או מדדים מספריים קשיחים המאפשרים השוואה עצמאית. הפרסום מציין במפורש כי הדו"ח המלא יעלה לאתר בשלב מאוחר יותר, כך שהמסקנה לגבי השתלטות המודלים על פרויקטים חדשים היא כרגע המלצה מניחים בעלמא. היעדר שיפוט עמיתים והעדר פירוט מספרי משאירים את התוצאות הללו בגדר טענת יצרן עד לפרסום המלא.