מודלים גדולים מצטיינים בבנצ'מרקים אבל נכשלים במבנה הידע

מחקר חדש שפורסם כפרה-פרינט ב-arXiv מראה שמודלי שפה גדולים, פתוחים וסגורים כאחד, לא מארגנים ידע מתמטי בצורה שמזכירה לומדים אנושיים. החוקרים השתמשו בתיאוריית מרחבי ידע (Knowledge Space Theory, KST) כמסגרת נורמטיבית: לפי התיאוריה, שליטה במושג מחייבת שליטה מוקדמת בקדם-התנאים שלו, וכל סטייה מהסדר הזה מעידה על מבנה ידע לא קוהרנטי. התוצאה: המודלים מפרים תלויות ידע בתדירות גבוהה, ולא מנצלים ידע קשור שמוזן להם בקונטקסט כדי לשפר ביצועים בשאלות תלויות.
המסגרת: תיאוריית מרחבי ידע כמשקפיים
KST נוסחה במקור כדי למפות ידע אנושי בתחומים כמו מתמטיקה, והיא מגדירה "מרחב ידע" כאוסף של מצבי ידע אפשריים שכל אחד מהם סגור תחת יחסי קדם-הכרחיות. החוקרים בנו על זה פרוטוקול הערכה שבודק האם תשובות המודל עקביות עם המבנה הזה, לא רק האם התשובה נכונה, אלא האם דפוס הנכונות והכישלון על פני סדרת שאלות תואם את היררכיית התלות. זה הבדל מהותי מבנצ'מרקים סטנדרטיים שסופרים רק דיוק סופי.
הניסוי: שמונה מודלים מול לומדים אמיתיים
הצוות הריץ את הפרוטוקול על שמונה מודלים, חלקם בקוד פתוח, חלקם סגורים, והשווה את ההתפלגויות שהתקבלו לאלה של לומדים אנושיים באותן משימות. הממצא הבולט הראשון: אין חפיפה גבוהה בין ההתפלגויות של המודלים השונים. כל מודל "ממציא" לעצמו מבנה ידע פנימי משלו, ואין קונצנזוס ביניהם על מה תלוי במה. במילים אחרות, לא רק שהם לא דומים לבני אדם, הם גם לא דומים זה לזה.
הפרת תלויות וכשל במינוף קונטקסט
כשהחוקרים הזינו למודלים ידע רלוונטי בקונטקסט, למשל, תזכורת של הגדרה או משפט קדם, המודלים לא תרגמו את זה לשיפור עקבי בשאלות שתלויות באותו ידע. בני אדם, לעומת זאת, מנצלים תזכורות כאלה באופן שיטתי. ההפרה של תלויות ידע מופיעה גם כשהמודל יודע את התשובה לשאלה הבסיסית אבל נכשל בנגזרת שלה, תופעה ש-KST מגדירה כבלתי אפשרית במרחב ידע קוהרנטי.
נקודת העיוורון של מדדי הדיוק והשיפוט האוטומטי
החלק המטריד יותר: גם הערכה מבוססת דיוק (accuracy) וגם הערכה בשיטת LLM-as-judge לא מזהות את הכשל המבני. מודל יכול להשיג ציון גבוה בבנצ'מרק סטנדרטי ועדיין להחזיק במבנה ידע שבור לחלוטין. השופטים האוטומטיים, שמתאמנים על העדפות אנושיות, נוטים לתגמל תשובות שנשמעות סבירות בלי לבדוק עקביות מבנית. הפער הזה מסביר למה התופעה נותרה בלתי נראית עד עכשיו.
מה זה אומר הלאה
המסקנה המעשית: ביצועים גבוהים במשימות חשיבה לא מעידים על הבנה מבנית. אם רוצים מודלים שמתנהגים כמו מומחים, לא רק עונים כמו מומחים, צריך מדדים שבוחנים קוהרנטיות של ידע, לא רק נכונות נקודתית. המחקר עדיין בשלב פרה-פרינט ולא עבר שיפוט עמיתים, והמדגם מוגבל לשמונה מודלים ולתחום מתמטי אחד, אבל המסגרת שהציעו ניתנת להרחבה ונותנת כיוון ברור לאן להסתכל בבדיקות הבאות.