21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מחקר

הארנס של הסוכן נעשה המבחן האמיתי, לא המשימה

הארנס של הסוכן נעשה המבחן האמיתי, לא המשימה

מה נבדק כאן בעצם

HarnessDev הופך את כיוון ההערכה המקובל: במקום למדוד כמה משימות הסוכן פותר, הוא מודד כמה טוב המודל בונה את התשתית שמאפשרת לו לפתור אותן. הארנס, אותה שכבת הרצה, כלי עזר, לולאות תיקון ומנגנוני זיכרון שעוטפים את המודל, קובע בפועל את הביצועים לא פחות מהמשקלים עצמם. המאמר (arXiv 2609.01437) מגדיר שני שלבים: Creation, שבו המודל מקבל זרע מינימלי וכמה דוגמאות ובונה מערכת הרצה שלמה, ו-Evolution, שבו הוא משפר את מה שבנה בעזרת פידבק מהרצה על בנצ'מרקים במורד הזרם. המדדים הם יכולת (הצלחה על משימות שמורות) ויעילות (עלות בטוקני הרצה).

שישה מודלים, ארבעה תחומים, 2,207 מקרים

הניסוי הקיף שישה מודלים יוצרים, ארבעה דומיינים, קוד, חיפוש ומחקר, כתיבה, ניסויים בלמידת מכונה, וחמישה בנצ'מרקים במורד הזרם, בסך הכול 2,207 אינסטנסים ייחודיים עם משימות הערכה מוסתרות שלא נחשפו בפיתוח. התוצאות לא אחידות: בקוד ובחיפוש/מחקר הארנסים שנוצרו עדיין מפגרים משמעותית אחרי רפרנסים אנושיים בשלים, ואילו בכתיבה ובניסויי ML הם משתווים או עוברים את אותם רפרנסים. הפיזור בעלות ההרצה גדול, חלק מהארנסים שורפים טוקנים בלי פרופורציה לתועלת.

אבולוציה לא יציבה ולא ניידת

שלב ה-Evolution הניב שיפורים מסוימים, אבל הם לא יציבים ולא עוברים היטב למשימות שמורות. כשהחוקרים קיבעו את מודל ההרצה ובדקו ארנסים שנבנו על ידי מודלים אחרים, התברר שהרווחים תלויים חזק בזהות המודל שמריץ אותם, כלומר, ארנס שפותח על ידי מודל א' לא בהכרח יועיל למודל ב'. המסקנה: האופטימיזציה צמודה למודל הספציפי, והכללה בין ארכיטקטורות מוגבלת.

הקשר רחב יותר: גל של בנצ'מרקים דומים

HarnessDev לא לבד. הרשימה שמצורפת למאמר כוללת את HarnessOpt-Bench, Evo-Bench, DarwinX, MemoHarness, StarHarness, OneDayAgent ו-TTHE, כולם מ-2026. התחום מתכנס להכרה שהארנס הוא פרמטר קריטי שראוי להערכה נפרדת, ושאופטימיזציה שלו בזמן ריצה (test-time harness evolution) עשויה להיות זולה יותר מאימון מחדש. המאמר הנוכחי מוסיף את ההפרדה הברורה בין בנייה ראשונית לשיפור איטרטיבי, ואת המדידה הכפולה של יכולת מול עלות.

מה זה אומר בפועל

למי שבונה סוכנים בפרודקשן: אל תסתפקו בבנצ'מרק של המשימה הסופית. תמדדו כמה מאמץ הנדסי הארנס שלכם דורש, כמה טוקנים הוא שורף, והאם הוא עובר בין מודלים כשאתם מחליפים ספק או גרסה. HarnessDev נותן מסגרת ראשונית להשוואה כזו, אבל הפערים מול הנדסה אנושית בקוד ובחיפוש מזכירים שהדרך לאוטומציה מלאה של התשתית עוד ארוכה.