ארטיפישל אנליסיס מוסיפה את GPT-6 Sol ו-Luna למדד העצמאי שלה

פלטפורמת ההערכה העצמאית Artificial Analysis עדכנה את לוחות ההשוואה שלה וכללה לראשונה את GPT-6 Sol ואת Luna, שני המודלים החדשים של OpenAI, לצד המתחרים המובילים בשוק. האתר, שמתמקד בבדיקות בלתי תלויות במקום להסתמך על נתוני יצרן, מציע כעת תמונת מצב מקיפה יותר לכל מי שצריך לבחור מודל וספק לייצור.
מדד אינטליגנציה מול עלות למשימה
הבסיס להשוואה הוא Artificial Analysis Intelligence Index, שמדרג מודלים לפי ביצועים במבחנים מגוונים ומצליב אותם מול העלות הממוצעת לכל משימה במדד. הגרף מאפשר לראות בבת אחת איזה מודל נותן יותר "אינטליגנציה לדולר", ומפריד בין מודלים בקוד פתוח (Open Weights) למודלים קנייניים. לצד זה מתפרסם מעקב היסטורי שמראה איך התקדמה חזית המודלים לאורך זמן.
בנצ'מרקים סוכניים: תכנון ארוך טווח ואנליזה כמותית
שני מבחנים חדשים יחסית תופסים מקום מרכזי: AA-Briefcase v1.1 בודק סוכנים (agents) במשימות ידע ארוכות טווח, יצירת גיליונות אלקטרוניים, מצגות ומזכרים עסקיים ריאליסטיים. AA-AnalystAgent מודד ביצוע אנליזה כמותית מקצה לקצה על גיליונות ומסמכים אמיתיים, מהסוג שאנליסטים עסקיים ונתונים מבצעים ביומיום. שני המבחנים מדווחים בציון Elo וב-pass^5 בהתאמה, מה שמאפשר השוואה סטטיסטית יציבה.
הזיות וידע עובדתי: AA-Omniscience וערך כלכלי
AA-Omniscience מתמקד בבעיית ההזיות: המבחן מתגמל דיוק, מעניש ניחושים רעים, ונותן תמונה רחבה על אמינות עובדתית בדומיינים שונים. GDPval-AA v2.1 לוקח כיוון אחר, הוא בוחן מודלים על משימות בעלות ערך כלכלי ממשי במגוון רחב של מקצועות. שני המדדים מתעדכנים בגרסאות חדשות (v2.1 ל-GDPval, v1.1 ל-Briefcase), מה שמצביע על איטרציה מהירה של מתודולוגיית הבדיקה.
פתיחות, מהירות ותפוקת טוקנים
מדד הפתיחות (Openness Index) של הפלטפורמה מדרג מודלים לפי זמינות ושקיפות של רכיבים שונים, משקלים, קוד, נתוני אימון ורישיונות, ומצליב אותו מול מדד האינטליגנציה. במקביל מתפרסמים נתוני מהירות (latency, time to first token), תפוקת טוקנים בפועל למשימת אינטליגנציה, ופירוט תמחור מלא: מחיר לקלט, לפלט ול-cache hit. כל המדידות נעשות דרך ה-API הרשמי של הספקים, לא דרך ממשקי צ'אט.
מה זה אומר בפועל
למפתחים ולחברות שבוחרים מודל לייצור, העדכון נותן בסיס השוואה רחב יותר מבעבר: לא רק ציון כללי, אלא פירוק לפי סוג משימה (קוד, אנליזה, כתיבה עסקית, ידע עובדתי), לפי עלות שולית, לפי מהירות תגובה ולפי מידת הפתיחה. GPT-6 Sol ו-Luna נכנסים כעת למערך הבדיקות הזה, והתוצאות הראשוניות שלהם יתפרסמו בלוחות בימים הקרובים.