מאמר חדש מראה איך להעריך סוכן בפרודקשן בשבריר מהעלות

השורה התחתונה: 200 שאלות במקום הבנצ'מרק המלא
חוקרים הצליחו לשחזר את הציון המלא של בנצ'מרק הערכה לסוכן אנליטיקה פעיל, שמשרת עשרות אלפי משתמשים בחודש, באמצעות 38.5% בלבד מהשאלות, עם סטייה של 1.03 נקודות בלבד. המאמר, שפורסם כפרה-פרינט ב-arXiv (מספר 2609.21267) ועדיין לא עבר שיפוט עמיתים, מתאר תהליך שנבנה על 574 הרצות היסטוריות שחולקו לחלונות קאליברציה והולד-אאוט לפי תאריך.
מה בדקו ואיך
הצוות השווה ארבע גישות: דגימה אקראית, שימוש בתוצאות מקושמטות (cached), תת-קבוצות קבועות מייצגות, ובדיקה אדפטיבית המבוססת על תיאוריית התגובה לפריט (IRT). הגישה האדפטיבית הרב-ממדית במודל 2PL הניבה את הנאמנות הגבוהה ביותר לציון המלא, אבל בפרודקשן בחרו דווקא בתת-קבוצות קבועות מרובדות קושי, כי הן פשוטות יותר להרצה ותחזוקה.
יציבות והעברה בין משפחות סוכנים
ההפתעה הגדולה: אותן תת-קבוצות קבועות עברו העברה (transfer) לחמש משפחות סוכנים אחרות בלי צורך בקאליברציה מחדש, ונשארו יציבות גם כשחלון הקאליברציה הצטמצם ליום בודד. זה אומר שאפשר לבנות סט הערכה מצומצם פעם אחת, ולהשתמש בו לאורך זמן ועבור ארכיטקטורות שונות, חיסכון משמעותי בעלויות חישוב ובזמן מפתחים.
מה זה אומר בפועל לצוותי הנדסה
למי שמריץ הערכות ליליות או שבועיות על סוכנים בפרודקשן, הממצא מציע נתיב מעשי: לבנות סט מרובד קושי של כ-200 פריטים, לכייל אותו על היסטוריה קצרה, ולהריץ רק אותו. המאמר זמין לקריאה וגם לצ'אט אינטראקטיבי ב-academy.dair.ai/papers/efficie, שווה לעבור על המתודולוגיה לפני שמאמצים, כי עדיין מדובר בפרה-פרינט ולא במחקר שעבר ביקורת עמיתים מלאה.