לנגצ'יין: רוב הדיווחים על סוכנים "שבורים" הם בעצם בעיות הקשר

מה שהטרייס חשף
ב-LangChain מדווחים שמקרה שבחן ווקר וורד, מהנדס תוכנה ראשי בפודיום, הדגים תופעה חוזרת: סוכן שנראה שבור פעל למעשה בדיוק לפי ההקשר שקיבל. כלי המעקב ל-LangSmith איפשר לעקוב אחר שרשרת החשיבה של הסוכן מקצה לקצה, והראה שההחלטות היו רציונליות ביחס לקלט, לא כשל של המודל או של ההנחיה.
הקשר עדיף על הנחיה
לדברי הצוות, רוב התלונות על סוכנים "לא עובדים" מסתיימות בזיהוי בעיית הקשר: הקלט היה חסר, דו-משמעי או מטעה, והסוכן ביצע את מה שהקלט הכתיב. המסקנה המעשית היא שתיקון הקלט, הוספת מידע, הבהרת הוראות וניקוי רעש, יעילים יותר מכתיבה מחדש של ההנחיה או החלפת מודל.
כלי המעקב כמנגנון אבחון
ל-LangSmith משמש כאן לא ככלי ניטור פסיבי אלא כמנגנון אבחון פעיל: הטרייס חושף את הנתיב המדויק שהסוכן עבר, אילו כלים הופעלו, איזה מידע נשלף ומה היה המצב בכל צעד. כאשר התמונה המלאה פרושה, הפער בין "הסוכן שבור" ל"הסוכן עשה מה שביקשנו" נסגר מייד.
לקח חוזר בפיתוח סוכנים
הדפוס שוורד מדגים אינו נקודתי. בפיתוח סוכנים מבוססי מודלים גדולים חוזרת אותה טעות: מניחים שהבעיה בלוגיקה או במודל, כשלמעשה הבעיה בנתונים שמזינים את הלוגיקה. מעקב מלא אחר ההקשר, לא רק אחר הפלט הסופי, הופך לתנאי בסיסי לאמינות בייצור.