22 בספטמבר 2026 האקדמיה ארכיון
מבזקים
White Circle משיקה את Halo, פריימוורק אימון בקוד פתוח שמבטיח 2.8x תפוקה על B300 vLLM מעבירה פענוח וידאו ל-NVDEC ומכפילה תפוקה ב-8×H100 מונשוט משיקה את קימי K3 על בדרוק עם חלון הקשר של מיליון טוקן מצרים עוברת משלב הפוטנציאל לייצור בפועל: אירוע אקוסיסטם במוזיאון המצרי הגדול סימן קפיצת מדרגה NVIDIA חותכת את תעבורת הטוקנים של סוכני קוד בחצי עם SoL-Pi
מחקר

NVIDIA חותכת את תעבורת הטוקנים של סוכני קוד בחצי עם SoL-Pi

NVIDIA חותכת את תעבורת הטוקנים של סוכני קוד בחצי עם SoL-Pi

צוות חוקרים של NVIDIA, אוניברסיטת NTU ו-MIT שחרר את SoL-Pi, הרחבה ברישיון MIT לסוכן הקוד הפתוח Pi שמקצצת 44.7% עד 49% מתעבורת הטוקנים ו-33% מעלות ה-API, תוך שמירה על 93%-94% מהביצועים המקוריים. המנגנונים התגלו על ידי AI שהריץ לולאות מחקר אוטומטיות בשכבת ה-harness, ולא על ידי אופטימיזציה ידנית.

למה ה-harness ולא המודל

רוב עבודות היעילות מתמקדות בהוזלת עלות לטוקן, קרנלים מהירים יותר, קוונטיזציה, מודלים זולים יותר. SoL-Pi הולכת בכיוון ההפוך: היא מקטינה את כמות הטוקנים שמשימה צורכת מלכתחילה. ה-harness הוא השכבה שמנהלת קריאות כלים, קונטקסט, תצפיות והאצלה; תיקון ידני שלה איטי והחלקים שלה מצומדים, תיקון במקום אחד עלול לדחוף עלות לשלבים מאוחרים יותר. מערכות כמו Meta-Harness כבר אוטומטו את החיפוש הזה, אבל מחקר עדכני הראה שהן נוטות ל-overfit על משימות החיפוש ומניבות רווחים שוליים על משימות שלא נראו.

איך החיפוש עבד בפועל

AI חוקר צפה בעקבות הרצה של סוכן Pi בסיסי, הציע שינויים ב-harness ובדק אותם. החיפוש כיסה 152 כיוונים מוצעים ב-6 משפחות (קונטקסט, התקדמות, כלים, האצלה, פרומפט ומדיניות, שיפור והערכה), 535 סביבות הרצה, 495 שנבנו מזוגות issue-PR של GitHub ו-40 משימות סינתטיות עם מאמתים ניתנים להרצה, ולמעלה מ-3,000 הרצות עם 60,000+ אינטראקציות סוכן-סביבה. כל חיפוש הוא לולאה מבודדת וחד-פעמית שעוקבת אחרי מחזור אוטו-מחקר מורחב עם שלב יישום Ralph Loop ומבקר בלתי תלוי. כללי הקבלה נקבעו מראש והאופטימייזר לא יכול לשנות אותם; כל מדד יכולת חייב להישאר בטווח סובלנות מוצהר, והמועמד חייב לשפר לפחות מדד יעילות אחד. EdgeBench נשאר מוחזק בחוץ: 11 משימות לקבלה חד-כיוונית של מועמדים קפואים, 40 להערכה סופית. תוצאות מוחזקות לא חוזרות לתוך החיפוש.

ארבעת המנגנונים ששרדו את הסינון

Action Fusion ממזג עריכת קובץ והרצת בדיקה/בנייה לבקשת כלי אחת ומחזיר את שתי התוצאות בתצפית אחת, חוסך סיבוב מודל שלם. Online Context Compact עוקב אחרי שלבי תוכנית דרך update_plan; כששלב מסתיים, ה-harness מעריך כמה בקשות נותרות, משווה את החיסכון הצפוי בקלט מול העלות הנוספת של שכתוב מטמון הפרומפט, ומפעיל את הדחיסה הטבעית של Pi כשהשער עובר או כשהקונטקסט מתקרב למגבלת החלון. ObservationPack מארכב מקומית פלטי כלים מעל 10 KiB ושולח אותם במלואם לשתי הבקשות הבאות לספק; מהבקשה השלישית ואילך המודל רואה ידית יציבה, גודל מקורי וקטע קצר של שורות ראש וזנב, דפים מדויקים נשארים נגישים דרך הידית. Evidence-Preserving Reducer שולח לוגי בנייה ובדיקות של 4 KiB ומעלה למודל זול יותר, GPT-5.6 Luna ב-high, שכותב קבלה דחוסה; מאמת דטרמיניסטי בודק סכימה, hash מקור, סטטוס יציאה, ציטוטים מדויקים וגודל. ה-harness נופל חזרה ללוג המקורי בשלושה מקרים: כשהאימות נכשל, כשיש חשד להדלפת אישורים, או כשהקבלה לא קטנה יותר.

תוצאות על EdgeBench והמשך הדרך

הסטאק המלא נבנה על GPT-5.6 Sol והועבר ל-Opus 5 בלי חיפוש נוסף. על Opus 5 נשמרים 94.3% מהציון של Pi עם 44.7% פחות טוקנים ו-33.5% פחות עלות; על GPT-5.6 Sol נשמרים 93.7% עם 49% פחות טוקנים ו-33.2% פחות עלות. הקוד זמין ב-GitHub תחת NVlabs, רץ על Pi 0.85.1 ללא שינויים ודורש Node.js 22.19 ומעלה.

מקור: marktechpost.com