מארטיאן חושפת מדד אמינות חדש: Qwen3.7 Max מוביל עם 96.1%, משאיר את Claude Opus 4.6 ו-GPT-5.5 מאחור

מה מודדים באמת
החברה השיקה את AI Frontier, דשבורד שבוחן עקביות של מודלים על פני 16 בנצ'מרקים נפוצים, עם עשר הרצות לכל נקודת נתונים. התוצאה: Qwen3.7 Max מגיע ל-96.1% אמינות, Claude Opus 4.6 עומד על 94.4%, ו-GPT-5.5 מסתפק ב-93.5%. חשוב להבהיר: אמינות כאן אינה דיוק גולמי, אלא עקביות, היכולת לחזור על אותה תשובה, נכונה או שגויה, שוב ושוב. בפלואו של סוכן (agent), צעד אחד לא יציב מספיק כדי להפיל את כל השרשרת שאחריו.
מאחורי המספרים
המחקר שעומד בבסיס הדשבורד מצא שהפעלת ניתוב אורקל (oracle routing) בין מודלים מפחיתה שגיאות ב-54% בעלות זהה, בהשוואה למודל הטוב ביותר בכל בנצ'מרק בנפרד. בפועל, המערכת בחרה דינמית את המודל המתאים לכל משימה, במקום להינעל על אחד. זה לא קסם, זה ניצול של העובדה שכל בנצ'מרק מפספס את רוב היכולות של המודלים, ושאף מודל אינו דומיננטי בכל החזיתות.
התוצאה המעשית
בבדיקה על 16 הבנצ'מרקים המובילים, בהם TerminalBench ו-LiveCodeBench, הניתוב האורקלי הניב 46% פחות שגיאות מהמודל הבודד הטוב ביותר. המשמעות: גם אם יש לכם גישה למודל חזק, אתם משאירים ביצועים על השולחן אם אתם לא מנתבים חכם. הדשבורד אינטראקטיבי ומאפשר לראות מה כל מודל מסוגל להשיג כשהוא מופעל בנקודה האופטימלית שלו.
למה זה משנה בפרודקשן
עקביות היא לא מותרות כשבונים מערכות אוטונומיות. מודל שמחזיר תשובה שונה בכל הרצה על אותו פרומפט מכניס אי-ודאות שקשה מאוד לנהל בקוד. המדד של מארטיאן נותן לראשונה תמונה כמותית של התופעה הזו, ולא רק של "כמה המודל חכם". זה הבדל בין דמו שעובד פעם אחת לבין מוצר שרץ בלילה בלי השגחה.
מה חסר בתמונה
הנתונים מגיעים ממארטיאן עצמה, והמתודולוגיה, עשר הרצות לנקודה, סבירה אבל לא תחליף להערכה עצמאית. אין עדיין פירוט מלא של הגדרת "אמינות" בכל בנצ'מרק, ואין השוואה למודלים בקוד פתוח (open weights) מול סגורים. עד שמישהו ישחזר את הבדיקה, המספרים הם אינדיקציה, לא פסק דין סופי.