21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מחקר

BenchMIRT חושף: מבחני בטיחות מודדים גם חשיבה כללית, לא רק התנהגות בטוחה

BenchMIRT חושף: מבחני בטיחות מודדים גם חשיבה כללית, לא רק התנהגות בטוחה

שיטה חדשה לביקורת בנצ'מרקים ברמת הפרומפט הבודד

חוקרים הציגו אתמול את BenchMIRT, מתודה שמפרקת ציוני בנצ'מרקים של מודלי שפה גדולים (LLM) לגורמים שבאמת מניעים אותם, ברמת השאלה או המשימה הבודדת. במקום להסתפק בציון ממוצע, הכלי מנתח איך כל מודל מתפקד על כל פריט, ומעריך אילו יכולות יסוד (latent capabilities) קשורות סטטיסטית להצלחה בו. הרעיון מגיע מתורת התגובה לפריט (Item Response Theory, IRT), תחום פסיכומטרי שמודד תכונות ויכולות מתוך דפוסי תשובות; IRT מניחה שלא כל שאלה נותנת אותו מידע על הנבחן, חלקן קשות יותר, חלקן מבחינות טוב יותר בין חזקים לחלשים. BenchMIRT מרחיב את זה ל־IRT רב־ממדי (MIRT), כך שאפשר להפריד כמה יכולות שתרומתן משותפת לאותו פריט.

מאה מודלים, 16 בנצ'מרקים, 34 אלף שאלות

המודל אומן על תוצאות של 100 LLMs שנבחנו על 16 בנצ'מרקים ובסך הכול יותר מ־34 אלף פרומפטים. שישה מהם מודדים חשיבה כללית, MMLU-Pro, GPQA, MATH, BBH, ועשרה מגיעים מסוויטת הבטיחות של Olmo 3, בהם HarmBench, StrongReject, WildJailbreak, BBQ, WMDP ו־XSTest. קריטי: החוקרים לא אמרו ל־BenchMIRT איזה בנצ'מרק מודד מה. הוא זיהה בעצמו שני ממדים דומיננטיים, בטיחות וחשיבה כללית, וכשחזרו על הניתוח מאפס, אותם שני ממדים הופיעו שוב, מה שמצביע על יציבות התוצאה ולא על מקריות של ריצה בודדת.

BBQ: הטיה חברתית או כשל חשיבה?

ההפתעה הגדולה הגיעה מ־BBQ, בנצ'מרק שבודק הטיות חברתיות ומקובל לשייך אותו לקבוצת הבטיחות. בניתוח של BenchMIRT הוא התיישר הרבה יותר חזק עם ממד החשיבה הכללית. המשמעות: ציון נמוך ב־BBQ עשוי לשקף קושי להבין או לחשוב דרך שאלות מסוימות, למשל לעקוב מי זה הנכד ומי הסבא בתרחיש הזמנת אובר, לאו דווקא התנהגות לא־בטוחה. במילים אחרות, הבנצ'מרק מודד יכולת מעקב והסקה באותה מידה, אם לא יותר, מאשר הסתמכות על סטריאוטיפים.

WMDP מתנהג אחרת מרוב מבחני הבטיחות

WMDP בודק ידע דו־שימושי מסוכן בביולוגיה, כימיה וסייבר, למשל ידע שעלול לאפשר ניצול לרעה של גורם ביולוגי או פריצה למערכת מחשב. בניגוד לבנצ'מרקי ג'יילברייק ותוכן מזיק, שהתיישרו עם ממד הבטיחות, WMDP מראה פרופיל שונה. המקור נקטע לפני פירוט המסקנה המלאה לגביו, אבל הכיוון ברור: לא כל מה שמסווג כ"בטיחות" נמדד על אותו ציר.

מה זה משנה בפועל

כשמצמידים ציון יחיד לבנצ'מרק, מאבדים את ההבחנה בין יכולות שונות שמתערבבות באותן שאלות. WildJailbreak מדגים את זה יפה: הפרומפטים הזדוניים קשורים לבטיחות, הבניוניים (שבודקים סירוב יתר) קשורים לחשיבה כללית, ממוצע שלהם מטשטש את ההבדל. BenchMIRT נותן לחוקרים משקפיים שמפרידות את האותות, ומאפשרות לשאול לא רק "כמה המודל בטוח" אלא "איזה חלק מהציון נובע מחשיבה ואיזה מהתנהגות בטוחה". זה צעד הכרחי לפני שממשיכים לבנות על ציונים כאלה החלטות פריסה או רגולציה.

מקור: huggingface.co