21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מחקר

מתודולוגיה חדשה למדד האינטליגנציה של ארטיפישל אנליסיס

מתודולוגיה חדשה למדד האינטליגנציה של ארטיפישל אנליסיס

ארטיפישל אנליסיס (Artificial Analysis) פרסמה את המתודולוגיה המלאה מאחורי גרסה 4.2 של מדד האינטליגנציה שלה, חבילת הערכה שמאגדת עשרה מבחנים נפרדים לציון יחיד. המדד מכסה חשיבה, ידע, מתמטיקה ותכנות, ומשקלל ארבע קטגוריות: סוכנים (30%), קידוד (20%), חשיבה מדעית (20%) וכללי (30%). הדגש על משימות סוכניות משקף את הכיוון שאליו הולך השוק: פחות שאלות טריוויה, יותר ביצוע משימות מרובות שלבים.

עשרה מבחנים, ציון אחד

רשימת המבחנים כוללת את AA-Briefcase, GDPval-AA בגרסה 2, τ³-Banking, Terminal-Bench v2.1, SciCode, AA-LCR v1.1, AA-Omniscience, Humanity's Last Exam, GDP.pdf ו-CritPt. כל מודל נבדק באותם תנאים: פרומפטים זהים, טמפרטורה 0 למודלים רגילים ו-0.6 למודלי חשיבה (Reasoning), ומגבלת טוקנים של 16,384 לפלט במודלים רגילים, או המקסימום שהמעבדה מצהירה עליו במודלי חשיבה. כשקריאה ל-API נכשלת, המערכת מנסה מחדש עד 30 פעמים לפני שהיא מוותרת על השאלה.

רמת ודאות סטטיסטית מוצהרת

לדברי הצוות, רווח הסמך של 95% למדד הכולל עומד על פחות מ-±1%, בהתבסס על יותר מעשר הרצות חוזרות לכל מודל בכל אחד מהמבחנים. זה נתון מרשים יחסית לנהוג בתחום, אבל החברה מסייגת שתוצאות של מבחנים בודדים עשויות להציג רווח סמך רחב יותר. ניתוח סטטיסטי מפורט יותר צפוי להתפרסם בהמשך.

מדד רב-לשוני נפרד

היכולת הרב-לשונית לא נכללת בציון הראשי. עבורה קיים מדד נפרד, Artificial Analysis Multilingual Index, שמבוסס על Global-MMLU-Lite וכולל 16 שפות: אנגלית, סינית, הינדי, ספרדית, צרפתית, ערבית, בנגלית, פורטוגזית, אינדונזית, יפנית, סוואהילית, גרמנית, קוריאנית, איטלקית, יורובה ובורמזית. גם יכולות ראייה ודיבור נמדדות בנפרד ולא משוקללות באינדקס המרכזי.

ארבעה עקרונות מנחים

המתודולוגיה נשענת על ארבעה עקרונות: סטנדרטיזציה מלאה של תנאי הבדיקה, הימנעות מענישה לא הוגנת על תשובות שעוקבות נכון אחרי ההוראות, הערכת Zero-Shot בלבד (בלי דוגמאות בפרומפט), ושקיפות, כולל פרסום תבניות הפרומפט, קריטריוני ההערכה והמגבלות. הגישה הזו מיושרת עם האופן שבו מודלי צ'אט מודרניים נועדו לעבוד: הוראות ברורות, בלי few-shot.

מה זה משנה בפועל

המשמעות המעשית היא שיש עכשיו בסיס השוואה שיטתי ומתועד היטב בין מודלים, משהו שחסר כשרק מסתכלים על טבלאות בנצ'מרקים בודדים. המשקל הגבוה לסוכנות ולקידוד דוחף את היצרנים לכוון לשם, והפרדת היכולות הרב-לשוניות והחזותיות מונעת ערבוב של יכולות שונות בציון אחד. השאלה שנותרת פתוחה היא עד כמה הציון הזה מתאם עם תועלת אמיתית בייצור, וזה כבר מבחן שהזמן והמפתחים יתנו לו תשובה.