מתודולוגיה חדשה למדד האינטליגנציה של ארטיפישל אנליסיס

ארטיפישל אנליסיס (Artificial Analysis) פרסמה את המתודולוגיה המלאה מאחורי גרסה 4.2 של מדד האינטליגנציה שלה, חבילת הערכה שמאגדת עשרה מבחנים נפרדים לציון יחיד. המדד מכסה חשיבה, ידע, מתמטיקה ותכנות, ומשקלל ארבע קטגוריות: סוכנים (30%), קידוד (20%), חשיבה מדעית (20%) וכללי (30%). הדגש על משימות סוכניות משקף את הכיוון שאליו הולך השוק: פחות שאלות טריוויה, יותר ביצוע משימות מרובות שלבים.
עשרה מבחנים, ציון אחד
רשימת המבחנים כוללת את AA-Briefcase, GDPval-AA בגרסה 2, τ³-Banking, Terminal-Bench v2.1, SciCode, AA-LCR v1.1, AA-Omniscience, Humanity's Last Exam, GDP.pdf ו-CritPt. כל מודל נבדק באותם תנאים: פרומפטים זהים, טמפרטורה 0 למודלים רגילים ו-0.6 למודלי חשיבה (Reasoning), ומגבלת טוקנים של 16,384 לפלט במודלים רגילים, או המקסימום שהמעבדה מצהירה עליו במודלי חשיבה. כשקריאה ל-API נכשלת, המערכת מנסה מחדש עד 30 פעמים לפני שהיא מוותרת על השאלה.
רמת ודאות סטטיסטית מוצהרת
לדברי הצוות, רווח הסמך של 95% למדד הכולל עומד על פחות מ-±1%, בהתבסס על יותר מעשר הרצות חוזרות לכל מודל בכל אחד מהמבחנים. זה נתון מרשים יחסית לנהוג בתחום, אבל החברה מסייגת שתוצאות של מבחנים בודדים עשויות להציג רווח סמך רחב יותר. ניתוח סטטיסטי מפורט יותר צפוי להתפרסם בהמשך.
מדד רב-לשוני נפרד
היכולת הרב-לשונית לא נכללת בציון הראשי. עבורה קיים מדד נפרד, Artificial Analysis Multilingual Index, שמבוסס על Global-MMLU-Lite וכולל 16 שפות: אנגלית, סינית, הינדי, ספרדית, צרפתית, ערבית, בנגלית, פורטוגזית, אינדונזית, יפנית, סוואהילית, גרמנית, קוריאנית, איטלקית, יורובה ובורמזית. גם יכולות ראייה ודיבור נמדדות בנפרד ולא משוקללות באינדקס המרכזי.
ארבעה עקרונות מנחים
המתודולוגיה נשענת על ארבעה עקרונות: סטנדרטיזציה מלאה של תנאי הבדיקה, הימנעות מענישה לא הוגנת על תשובות שעוקבות נכון אחרי ההוראות, הערכת Zero-Shot בלבד (בלי דוגמאות בפרומפט), ושקיפות, כולל פרסום תבניות הפרומפט, קריטריוני ההערכה והמגבלות. הגישה הזו מיושרת עם האופן שבו מודלי צ'אט מודרניים נועדו לעבוד: הוראות ברורות, בלי few-shot.
מה זה משנה בפועל
המשמעות המעשית היא שיש עכשיו בסיס השוואה שיטתי ומתועד היטב בין מודלים, משהו שחסר כשרק מסתכלים על טבלאות בנצ'מרקים בודדים. המשקל הגבוה לסוכנות ולקידוד דוחף את היצרנים לכוון לשם, והפרדת היכולות הרב-לשוניות והחזותיות מונעת ערבוב של יכולות שונות בציון אחד. השאלה שנותרת פתוחה היא עד כמה הציון הזה מתאם עם תועלת אמיתית בייצור, וזה כבר מבחן שהזמן והמפתחים יתנו לו תשובה.