21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מוצרים

ארטיפישל אנליסיס משיקה לידרבורד חדש ל-MLCR של וייזדוקס, קלאוד פייבל 5 מוביל עם 64.4%

ארטיפישל אנליסיס משיקה לידרבורד חדש ל-MLCR של וייזדוקס, קלאוד פייבל 5 מוביל עם 64.4%

מה נמדד כאן בדיוק

ארטיפישל אנליסיס (Artificial Analysis) פרסמה את MLCR-AA, מימוש משלה לבנצ'מרק MLCR (Medical Long Context Reasoning) של וייזדוקס (Wisedocs). הבדיקה רצה רק את השכבות הפרטיות Expert ו-Compound, טקסט בלבד וללא מסמכי רעש, כלומר מודל נטו מול תיק רפואי ארוך. הציון מורכב משלושה ממדים: שלמות (completeness), דיוק (accuracy) ותמציתיות (concision). לדברי החוקרים, דיוק הוא הממד הקל יותר, ואילו שלמות היא המקום שבו המודלים נופלים.

התוצאות בראש הטבלה

קלאוד פייבל 5 (Claude Fable 5) של Anthropic השיג את הציון הגבוה ביותר, 64.4%. שאר דגמי קלאוד החדשים מצטופפים מאחוריו, אבל הפער במחיר משמעותי: עלות למשימה נעה בין 0.30 דולר ל-1 דולר (כ-1.1 עד 3.7 שקל), תלוי בדגם. זה פער של עד פי שישה לעומת קימי K3 (Kimi K3), שיושב ממש מאחורי קלאוד בחזית פארטו של ציון מול עלות.

ג'יפיטי 5.6, דיוק גבוה, שלמות נמוכה

משפחת GPT-5.6 של OpenAI לא מגיעה לציוני השיא בגלל שלמות נמוכה, אבל מציגה דיוק חזק בעלות נמוכה יחסית. שני הדגמים במשפחה, Terra ו-Luna, יושבים על חזית פארטו, כלומר אין דגם אחר שנותן יותר דיוק בפחות כסף בלי לוותר על שלמות. זה ממצא מעניין למי שצריך תשובות מדויקות ומוכן להשלים ידנית את מה שחסר.

מה חסר בבנצ'מרק הזה

ארטיפישל אנליסיס מציינת במפורש שהיא לא מרפדת את תיקי המקרה במסמכי מילוי, כך שהבדיקה מודדת חשיבה על קונטקסט ארוך "נקי", לא התמודדות עם רעש בעולם האמיתי. גם לא פורסמו מדדי ביצועים על מודלים פתוחים או על הרצה מקומית. השורה התחתונה: אם אתם בונים מוצר שצריך לחלץ פרטים מתיקים רפואיים ארוכים, קלאוד פייבל 5 נותן את התוצאה הכי שלמה היום, אבל במחיר שיכול להצטבר מהר בפרודקשן.