הסוכן שלומד מהקוד הפתוח

סוכן מחקר בשם DisCo מצליח לשפר ביצועים בבנצ'מרקים של ML בלי להחליף את המודל שמאחוריו, רק על ידי הוספת שכבת ידע תפעולי שזוקקה ממאגרי קוד פתוח. הבעיה ש-DisCo פותר מוכרת לכל מי שניסה להריץ סוכן אוטונומי על משימת ML אמיתית: המודל יודע את השיטה, אבל לא את ה"טריקים" שגורמים לה לעבוד בפועל, פרמטרים נסתרים, תלויות גרסאות, דפוסי דיבאגינג. הידע הזה קיים ברפוזיטוריות ובמאמרים, אבל כתוב לבני אדם וגדול מדי לטעינה בזמן ריצה.
שתי צורות זיקוק
DisCo פועל בשני מסלולים משלימים. המסלול הראשון, task-agnostic, סורק את האקוסיסטם הפתוח ומזקק רפוזיטוריות נפוצות לכישורים (skills) קומפקטיים ומאומתים. המסלול השני, task-oriented, מייצר כישורים ייעודיים למשימה ספציפית. התוצר של המסלול הראשון הוא ספריית AREX-Skill, יותר מ-5,000 כישורים מאומתים שזוקקו מ-1,000 רפוזיטוריות ML פופולריות, מאורגנים ב-20 תחומים ו-178 משפחות יכולת.
המספרים עם הבסיס קבוע
כשהבקבון (GPT-5.5), רתמת המחקר ותקציב ההרצה נשארים זהים, הסוכן המצויד בכישורים משיג 134.3% יותר ב-MLE-bench, 34.4% יותר ב-PaperBench, 9.2% יותר ב-FrontierCS ו-14.0% יותר ב-PassNet לעומת אותו סוכן בלי הכישורים. הפערים ב-MLE-bench וב-PaperBench גדולים במיוחד, שני בנצ'מרקים שבודקים יכולת לבצע משימות הנדסת ML שלמות מקצה לקצה, ולא רק לענות על שאלות ידע.
ספרייה בלי ציטוטים, בינתיים
המאמר (arXiv:2609.02749) עדיין בגדר פרה-פרינט בלי ביקורת עמיתים, ולפי Semantic Scholar אין עדיין מודלים או דאטה-סטים שמצטטים אותו. רשימת המאמרים הדומים שהבוט של הספרייה ממליץ עליהם, כולם מ-2026, מראה שהתחום זז מהר: Repo2Skill-Evo על התיישנות כישורים, Demystifying Agent Skills על מגבלות הגישה, ועוד עבודות על אבולוציה עצמית ובטיחות. זה הקשר חשוב: DisCo לא פועל בחלל ריק, אלא בתוך שיח מחקרי צפוף שבוחן את אותן שאלות מכיוונים שונים.
זמין להרצה מקומית
הקוד זמין ב-GitHub, ויש גם CLI בשם DisCo CLI להתקנה מהירה (`curl -LsSf | bash`). מי שמעדיף לשמוע במקום לקרוא יכול להשתמש ב-tensorbrife שהופך מאמרים של Hugging Face לפודקאסטים יומיים. המזהה לקריאה ישירה בסוכן: `hf papers read 2609.02749`.