21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מחקר

חוקרים של MIT ו-Sakana AI מראים שסוכני קוד שמשפרים את עצמם עובדים, ועולים עשירית מהמתחרה

חוקרים של MIT ו-Sakana AI מראים שסוכני קוד שמשפרים את עצמם עובדים, ועולים עשירית מהמתחרה

השיטה: חיפוש עץ מהיר עם שופט LLM

המאמר מציג את SIFT, Self-Improvement via Fast Tree-search, גישה שמאפשרת למודל לכתוב שינויים בקוד שלו עצמו, לדרג אותם בעזרת מודל שיפוט (LLM judge), ולשלוח להערכת בנצ'מרק מלאה רק את המועמדים המבטיחים. צוואר הבקבוק בריצה הוא הערכת הבנצ'מרק עצמה, ולכן הסינון המוקדם חותך את זמן המחשוב דרמטית: פחות מ-50 שעות CPU ופחות מחמש שעות קיר (wall clock) לקונפיגורציה המובילה עם o3-mini.

המספרים על Polyglot ומול DGM

על בנצ'מרק Polyglot הגיעה הקונפיגורציה עם o3-mini ל-35.1% אחרי 30 הרחבות (expansions) של עץ החיפוש. לשם השוואה, DGM, השיטה הקודמת שהציגה שיפור עצמי דומה, הגיעה ל-30.7% רק אחרי 80 צמתים. הפער לא רק באחוזים: SIFT עשתה את זה בעשירית משעות ה-CPU שנדרשו ל-DGM.

קונפיגורציית Qwen3-30B: 224 שעות CPU ו-34 דולר

כשרצו את החיפוש המלא עם Qwen3-30B, העלות עמדה על 224 שעות CPU והוצאת API של 34 דולר (כ-125 שקל), שוב, בערך עשירית מהבסיס של DGM. החיסכון מגיע מאותו עיקרון: השופט מסנן החוצה את הרוב המוחלט של המוטציות לפני שהן מגיעות להרצה יקרה על הבנצ'מרק.

איכות השופט קובעת את התוצאה

על TerminalBench הדגימו החוקרים עד כמה בחירת השופט קריטית. עם gpt-5.4-high כשופט זוגי (pairwise) נמצא סוכן שהגיע ל-36.7%, מול 29.2% בנקודת ההתחלה. gpt-5 (ללא הסיומת high) הניב 34.5%, והמועמד שדירג במקום הראשון לא היה הסוכן הטוב ביותר שהחיפוש ייצר, הוכחה שהדירוג אינו מושלם ושאיכות השיפוט מגבילה את התקרה.

מה זה משנה בפועל

התוצאה המעשית היא שהוכח כי שיפור עצמי איטרטיבי של סוכני קוד אפשרי בתקציב מחשוב שפוי, בלי להזדקק לאשכולות GPU של אלפי כרטיסים. המגבלה הנוכחית אינה האלגוריתם אלא איכות מודל השיפוט, וכאן כבר ברור שהדור הבא של מודלי השיפוט ירים את התקרה עוד יותר. המאמר זמין ב-academy.dair.ai/papers/self-improvement-via-fast-tree-search.