21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מוצרים

מארטיאן חושפת מדד אמינות חדש: Qwen3.7 Max מוביל עם 96.1%, משאיר את Claude Opus 4.6 ו-GPT-5.5 מאחור

מארטיאן חושפת מדד אמינות חדש: Qwen3.7 Max מוביל עם 96.1%, משאיר את Claude Opus 4.6 ו-GPT-5.5 מאחור

מה מודדים באמת

החברה השיקה את AI Frontier, דשבורד שבוחן עקביות של מודלים על פני 16 בנצ'מרקים נפוצים, עם עשר הרצות לכל נקודת נתונים. התוצאה: Qwen3.7 Max מגיע ל-96.1% אמינות, Claude Opus 4.6 עומד על 94.4%, ו-GPT-5.5 מסתפק ב-93.5%. חשוב להבהיר: אמינות כאן אינה דיוק גולמי, אלא עקביות, היכולת לחזור על אותה תשובה, נכונה או שגויה, שוב ושוב. בפלואו של סוכן (agent), צעד אחד לא יציב מספיק כדי להפיל את כל השרשרת שאחריו.

מאחורי המספרים

המחקר שעומד בבסיס הדשבורד מצא שהפעלת ניתוב אורקל (oracle routing) בין מודלים מפחיתה שגיאות ב-54% בעלות זהה, בהשוואה למודל הטוב ביותר בכל בנצ'מרק בנפרד. בפועל, המערכת בחרה דינמית את המודל המתאים לכל משימה, במקום להינעל על אחד. זה לא קסם, זה ניצול של העובדה שכל בנצ'מרק מפספס את רוב היכולות של המודלים, ושאף מודל אינו דומיננטי בכל החזיתות.

התוצאה המעשית

בבדיקה על 16 הבנצ'מרקים המובילים, בהם TerminalBench ו-LiveCodeBench, הניתוב האורקלי הניב 46% פחות שגיאות מהמודל הבודד הטוב ביותר. המשמעות: גם אם יש לכם גישה למודל חזק, אתם משאירים ביצועים על השולחן אם אתם לא מנתבים חכם. הדשבורד אינטראקטיבי ומאפשר לראות מה כל מודל מסוגל להשיג כשהוא מופעל בנקודה האופטימלית שלו.

למה זה משנה בפרודקשן

עקביות היא לא מותרות כשבונים מערכות אוטונומיות. מודל שמחזיר תשובה שונה בכל הרצה על אותו פרומפט מכניס אי-ודאות שקשה מאוד לנהל בקוד. המדד של מארטיאן נותן לראשונה תמונה כמותית של התופעה הזו, ולא רק של "כמה המודל חכם". זה הבדל בין דמו שעובד פעם אחת לבין מוצר שרץ בלילה בלי השגחה.

מה חסר בתמונה

הנתונים מגיעים ממארטיאן עצמה, והמתודולוגיה, עשר הרצות לנקודה, סבירה אבל לא תחליף להערכה עצמאית. אין עדיין פירוט מלא של הגדרת "אמינות" בכל בנצ'מרק, ואין השוואה למודלים בקוד פתוח (open weights) מול סגורים. עד שמישהו ישחזר את הבדיקה, המספרים הם אינדיקציה, לא פסק דין סופי.