מודלים מאבדים את המקום במשימות ארוכות

מאמר חדש של NVIDIA מראה שמודלי שפה פתוחים מאבדים אמינות ככל שהמשימה מתארכת, גם כשכל ההקשר נכנס לחלון הקונטקסט. החוקרים בדקו שבעה מודלים על מטלות פשוטות וחזרתיות כמו חיבור מספרים ומיון רשימות, וגילו ירידה ממוצעת של 62.8% בדיוק כשעברו ממשימות של 4,000 טוקנים ל-128,000 טוקנים. אפילו המודל הטוב ביותר הצליח להשלים כל פריט ללא טעות רק ב-17.1% מהמקרים הארוכים ביותר.
הבעיה לא בגודל, במעקב
לדברי החוקרים, גודל המודל לא ערב לאמינות במשימות ארוכות וחזרתיות. המודלים "הבינו" את המשימה, הם ידעו מה נדרש לעשות, אבל איבדו את המיקום שלהם ברשימה, במיוחד כשהפריטים לא נשאו מזהים ייחודיים. התופעה מזכירה עובד שמקבל קובץ חשבונית ענק ומדלג על שורה או מעדכן את הרשומה הלא נכונה, למרות שהוא יכול לקרוא את כל הקובץ בבת אחת.
פרוטוקול הבדיקה והמספרים
הניסוי כלל שבעה מודלים פתוחים (open-weight) שנבחנו על משימות סינתטיות פשוטות בכוונה, חיבור מספרים, מיון רשימות, עדכון שדות, כדי לבודד את בעיית המעקב הארוך מהמורכבות הסמנטית. הפער בין 4K ל-128K טוקנים עקבי בכל המודלים, והנתון הבולט ביותר הוא אותו 17.1% הצלחה מלאה במודל המוביל: כלומר, ברוב המוחלט של הריצות הארוכות, לפחות פריט אחד נפל בין הכיסאות.
מה זה אומר למפתחי סוכנים
ההמלצה המעשית מהמאמר ברורה: אם הסוכן (agent) שלכם מעבד רשימות ארוכות, תנו לכל פריט מזהה ייחודי, חלקו את העבודה למנות קטנות, ובדקו כל שורת פלט. זה לא עניין של "המודל לא חכם מספיק", זה כשל מבני במעקב מצב לאורך הקשר ארוך, והוא לא נפתר על ידי הגדלת חלון הקונטקסט לבדו. המאמר זמין ב-arXiv תחת המספר 2609.38712.