חוקרים של MIT ו-Sakana AI מראים שסוכני קוד שמשפרים את עצמם עובדים, ועולים עשירית מהמתחרה

השיטה: חיפוש עץ מהיר עם שופט LLM
המאמר מציג את SIFT, Self-Improvement via Fast Tree-search, גישה שמאפשרת למודל לכתוב שינויים בקוד שלו עצמו, לדרג אותם בעזרת מודל שיפוט (LLM judge), ולשלוח להערכת בנצ'מרק מלאה רק את המועמדים המבטיחים. צוואר הבקבוק בריצה הוא הערכת הבנצ'מרק עצמה, ולכן הסינון המוקדם חותך את זמן המחשוב דרמטית: פחות מ-50 שעות CPU ופחות מחמש שעות קיר (wall clock) לקונפיגורציה המובילה עם o3-mini.
המספרים על Polyglot ומול DGM
על בנצ'מרק Polyglot הגיעה הקונפיגורציה עם o3-mini ל-35.1% אחרי 30 הרחבות (expansions) של עץ החיפוש. לשם השוואה, DGM, השיטה הקודמת שהציגה שיפור עצמי דומה, הגיעה ל-30.7% רק אחרי 80 צמתים. הפער לא רק באחוזים: SIFT עשתה את זה בעשירית משעות ה-CPU שנדרשו ל-DGM.
קונפיגורציית Qwen3-30B: 224 שעות CPU ו-34 דולר
כשרצו את החיפוש המלא עם Qwen3-30B, העלות עמדה על 224 שעות CPU והוצאת API של 34 דולר (כ-125 שקל), שוב, בערך עשירית מהבסיס של DGM. החיסכון מגיע מאותו עיקרון: השופט מסנן החוצה את הרוב המוחלט של המוטציות לפני שהן מגיעות להרצה יקרה על הבנצ'מרק.
איכות השופט קובעת את התוצאה
על TerminalBench הדגימו החוקרים עד כמה בחירת השופט קריטית. עם gpt-5.4-high כשופט זוגי (pairwise) נמצא סוכן שהגיע ל-36.7%, מול 29.2% בנקודת ההתחלה. gpt-5 (ללא הסיומת high) הניב 34.5%, והמועמד שדירג במקום הראשון לא היה הסוכן הטוב ביותר שהחיפוש ייצר, הוכחה שהדירוג אינו מושלם ושאיכות השיפוט מגבילה את התקרה.
מה זה משנה בפועל
התוצאה המעשית היא שהוכח כי שיפור עצמי איטרטיבי של סוכני קוד אפשרי בתקציב מחשוב שפוי, בלי להזדקק לאשכולות GPU של אלפי כרטיסים. המגבלה הנוכחית אינה האלגוריתם אלא איכות מודל השיפוט, וכאן כבר ברור שהדור הבא של מודלי השיפוט ירים את התקרה עוד יותר. המאמר זמין ב-academy.dair.ai/papers/self-improvement-via-fast-tree-search.