אופן-ראוטר משיק את ממיבנץ', בנצ'מרק מם למודלי שפה

אופן-ראוטר (OpenRouter) השיקה אתמול את ממיבנץ' (Memebench), מסגרת הערכה חדשה שבוחנת יכולת של מודלי שפה גדולים לייצר וריאציות מם על פי הנחיה זהה. בניגוד לבנצ'מרקים סטנדרטיים שמודדים ידע עובדתי או חשיבה לוגית, המבחן הזה דורש מהמודלים להבין הקשר תרבותי, הומור ומבנה ויזואלי-טקסטואלי של מם אינטרנטי, ולשלב בו שתי דמויות ספציפיות מקהילת ה-AI בטוויטר.
מה זה ממיבנץ'
הפורמט פשוט: שמונה מודלים קיבלו את אותה תבנית מם והתבקשו להכניס לתוכה את פינגטובן (pingToven) ואת אודרי סייג' (Audrey_Sage_), שני חשבונות מוכרים בסצנת חוקרי ומפתחי המודלים. התוצאות חולקו לשתי קבוצות, קבוצה א' שפורסמה ראשונה, וקבוצה ב' שעלתה יום לאחר מכן. אופן-ראוטר לא חשפה בשלב זה איזה מודל עומד מאחורי כל אות (א, ב, ג, ד), והעבירה את ההכרעה לקהילה באמצעות סקר פתוח.
איך זה עובד
ההנחיה לכל מודל הייתה זהה: לקחת את המם המקורי, להבין את הפאנץ' שלו, ולשכתב אותו כך ששתי הדמויות יופיעו בו באופן אורגני. זה דורש מהמודל לא רק יכולת כתיבה אלא גם הבנה של דינמיקה חברתית, רפרנסים פנימיים ומבנה קומי, דברים שבנצ'מרקים קלאסיים כמו MMLU או GSM8K לא בודקים. אופן-ראוטר לא פרסמה מדדי ביצועים כמותיים, ציוני הערכה אוטומטיים או פרומפטים מדויקים; הכלי בשלב זה נשען על שיפוט אנושי בלבד.
המודלים וההצבעה
זהות שמונת המודלים המשתתפים לא נחשפה. הקהילה מתבקשת להצביע איזו אות בכל קבוצה "בישלה חזק יותר" (cooked harder), סלנג מקובל בקהילה לתיאור מודל שהפיק תוצאה מוצלחת במיוחד. ההצבעה פתוחה לכולם, והתוצאות צפויות להתפרסם לאחר סגירת הסקרים. בהיעדר שקיפות על זהות המודלים, קשה להסיק מסקנות על חוזקות יחסיות של ארכיטקטורות או גרסאות ספציפיות.
למה זה מעניין
ממיבנץ' מצטרף לגל של בנצ'מרקים "רכים" שבוחנים התנהגות יצירתית וחברתית של מודלים, לצד דברים כמו EvalGen ליצירת קוד או Arena להעדפות אנושיות בצ'אט. היתרון: הוא בודק יכולת שבנצ'מרקים אקדמיים מפספסים. החיסרון: בלי מתודולוגיה סגורה, בלי בסיס השוואה קבוע ובלי חשיפת המודלים, קשה להתייחס לתוצאות כמדד מחקרי תקף. זה יותר אירוע קהילתי מכלי הערכה רציני.
מה הלאה
אופן-ראוטר רמזה שמדובר בסבב ראשון בלבד. אם הפורמט יתפוס, סביר שנראה גרסאות עתידיות עם יותר מודלים, קטגוריות מם שונות, ואולי גם מדידה כמותית כלשהי, למשל דירוג אנושי על סולם או השוואה מול בסיס אנושי. בינתיים, הקהילה מצביעה, מצייצת תוצאות משעשעות, ומחכה לקבוצה ב'.