ההארנס שמציל סוכנים מקריסה במשימות ארוכות

מודל שפה שמפעיל כלים בלולאה עובד יפה למשימות קצרות. תן לו משימה שרצה שעה ומאתיים קריאות כלי, והוא נשבר בשתי דרכים צפויות: גלישת קונטקסט ואובדן מטרה. מדריך התכנון של AWS לסוכני קידוד ענן אוטונומיים קורא לבעיות בשמן, סוכנים רדודים סובלים מהצפת קונטקסט, מוסחים, ולא שומרים מצב לאורך זמן. השכבה שמתקנת את זה אינה המודל, אלא ההארנס, ש־AWS מגדיר כמנהל הכל חוץ מהמודל.
למה חלון גדול יותר לא פותר את הבעיה
הפתרון האינטואיטיבי הוא להגדיל את חלון הקונטקסט. הראיות מראות שזה עוזר פחות מהצפוי. דוח Context Rot של Chroma בחן 18 מודלים, בהם GPT-4.1, Claude 4, Gemini 2.5 ו־Qwen3, ומצא שהביצועים נעשים פחות אמינים ככל שאורך הקלט גדל, אפילו במשימות שליפה פשוטות. המדריך של Anthropic להנדסת קונטקסט מסביר את המנגנון: תשומת לב יוצרת יחסים זוגיים בריבוע n² עבור n טוקנים, כך שכל טוקן נוסף מרוקן "תקציב תשומת לב" סופי. קונטקסט הוא משאב עם תשואה פוחתת, לא דלי.
עבור לולאת סוכן זה גרוע יותר. Manus מדווחת שמשימה טיפוסית דורשת כ־50 קריאות כלי, והיחס בין טוקני קלט לפלט עומד על כ־100:1. כל תצפית נוחתת בקונטקסט ונשארת שם. ההוראה המקורית נודדת למרכז החלון, בדיוק היכן שההיזכרות נפגעת. אובדן מטרה אינו רק באג של המודל; זו התוצאה הצפויה של קונטקסט לא מנוהל במשימה ארוכה מספיק.
תקצוב קונטקסט והורדה לדיסק
התפקיד הראשון של הארנס הוא להחליט מה לעולם לא נכנס לחלון. Deep Agents מגיע עם שני כללי הורדה עם מספרים קשיחים: כשהתגובה של כלי עוברת 20,000 טוקנים, היא נכתבת למערכת הקבצים ומוחלפת בנתיב קובץ בתוספת תצוגה מקדימה של 10 השורות הראשונות. כשהקונטקסט של הסשן חוצה 85% מהחלון של המודל, קריאות כתיבה ועריכה ישנות, שתוכנן המלא כבר יושב על הדיסק, נחתכות למצביע בלבד. רק כשההורדה ממצה את עצמה ההארנס נופל לסיכום.
Claude Code מיישם את אותו תקצוב על מה שנטען לפני הפרומפט הראשון. זיכרון אוטומטי מוגבל ל־200 השורות הראשונות או 25KB. סכמות כלי MCP נשארות נדחות כברירת מחדל, עם שמות כלים בלבד, והסכמות המלאות נטענות לפי דרישה דרך חיפוש כלי. אחרי דחיסה, כל קריאה חוזרת של קובץ מעל 5,000 טוקנים חוזרת כהפניית נתיב במקום תוכן. סימולציית החלון במסמכי Claude Code מדגימה את התמורה: תת־סוכן מחקר קורא 6,100 טוקנים של קבצים ומחזיר תוצאה של 420 טוקנים להורה.
דפוס תת־הסוכנים כתקצוב ארכיטקטוני
דפוס תת־הסוכנים הוא תקצוב ברמת הארכיטקטורה. המדריך של Anthropic מציין שכל תת־סוכן עשוי לשרוף עשרות אלפי טוקנים בחקירה, אבל מחזיר סיכום מזוקק, לרוב 1,000 עד 2,000 טוקנים. ההדרכה של AWS AgentCore בונה בדיוק את זה: מתאם מוליד שלושה תת־סוכני דפדפן במקביל, כל אחד ב־MicroVM משלו, ותת־סוכן אנליסט מקבל רק את הממצאים המבניים שלהם. AWS מדווחת על זמן ריצה צפוי של 4 עד 6 דקות, ומציינת שעיבוד סדרתי היה לוקח עד פי 3 יותר.
דחיסה: המקום שבו המטרה הולכת לאיבוד
כשהורדה לא מספיקה, ההארנס מסכם. דחיסה היא הנוהג לקחת שיחה שמתקרבת לגבול החלון, לסכם אותה, ולהתחיל קונטקסט חדש עם הסיכום. זה גם המקום שבו אובדן מטרה קורה הכי הרבה, כי סיכום מאבד (lossy) עלול להפיל את האילוץ היחיד שחשוב. המימושים שונים במה שהם מבטיחים לשמור.