21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מחקר

בייטדאנס וטסינגואה סוגרים את פער הביצועים בייצור קרנלים

בייטדאנס וטסינגואה סוגרים את פער הביצועים בייצור קרנלים

ביטדאנס סיד (ByteDance Seed) ומעבדת AIR של אוניברסיטת טסינגואה שחררו את CUDA Agent, מערכת חיזוק סוכנותית (agentic RL) שמאמנת מודל שפה גדול לכתוב קרנלי GPU שעוקפים את המהדר. הבעיה שהם תוקפים צרה אבל עיקשת: מודלי חזית כבר מייצרים קוד CUDA תקין, הם פשוט מייצרים קוד איטי. על בנצ'מארק KernelBench, מודל הבסיס Seed1.6 עובר 74% מהמשימות אבל מצליח להיות מהיר יותר מ-torch.compile רק ב-27.2% מהן, עם האצה גיאומטרית ממוצעת של 0.69×, כלומר, הקרנלים שלו איטיים יותר משל המהדר כברירת מחדל.

מה שהמספרים מראים

CUDA Agent סוגר את הפער הזה באמצעות הכנסת המודל לסביבת פיתוח CUDA אמיתית עם פרופיילינג, בדיקות נכונות וארגז חול נעול הרשאות, ואימון ב-PPO לאורך 150 צעדים בקונטקסט של 131,072 טוקנים. התוצאה: 98.8% מעבר, 96.8% מהקרנלים מהירים יותר מ-torch.compile, והאצה גיאומטרית של 2.11×, בערך 40 נקודות אחוז מעל Claude Opus 4.5 ו-Gemini 3 Pro בחלוקה הקשה ביותר (Level-3). בחלוקת Level-2 (רצפי אופרטורים) המערכת מגיעה ל-100% מעבר ו-100% קצב האצה עם 2.80× מעל המהדר; ב-Level-3 היא עומדת על 94% מעבר, 90% קצב האצה ו-1.52×.

מצב פריסה: לא לגמרי שם

הסוכן המאומן לא משוחרר. הוא בנוי על Seed1.6, מודל MoE קנייני עם 23 מיליארד פרמטרים פעילים ו-230 מיליארד סך הכול, והמאמר לא מפרסם משקולות. מה שכן ציבורי: סט הנתונים CUDA-Agent-Ops-6K, מפרט SKILL.md ומתכוני התגמול והחימום. ארגז החול לפרופיילינג לבדו צרך 128 מעבדי NVIDIA H20, מה שממקם שחזור מלא במעבדות חזית, ענני GPU וצוותי תשתית גדולים. צוותים בינוניים עדיין יכולים לאמץ את החלקים, הדאטה, תגמול אבני דרך, אילוצים נגד ניצול תגמול ומפרט המיומנות, מעל מודל בסיס פתוח.

איך זה עובד מתחת למכסה המנוע

צוות המחקר זחל אופרטורי ייחוס מספריות torch ו-transformers. מודל שפה דגם עד חמש מחלקות אופרטורים והערים אותן לשכבה מאוחדת אחת; פילטר השאיר רק אופרטורים שרצים גם במצב eager וגם במצב compile, הם דטרמיניסטיים, מייצרים פלט לא קבוע, ורצים בין 1 ל-100 מילישניות במצב eager. דגימות עם דמיון AST מעל 0.9 למשימות KernelBench הוסרו. התוצאה: 6,000 דגימות, 83.77% מהן הרכבות של שני אופרטורים. לולאת הסוכן משקפת את הכלים של OpenHands, Bash, קריאה/כתיבה, עריכה, Glob, Grep, NotebookEdit, פלט Bash, KillBash, תחת דפוס ReAct. הוראות CUDA מגיעות בפורמט Agent Skills; SKILL.md מנחה את המודל לפרופל את מודל ה-PyTorch, לשכתב את model_new.py עם קרנלים מותאמים, לקמפל בארגז חול GPU, ולהמשיך עד שהקרנל מהיר לפחות ב-5% מ-torch.compile ב-atol=1e-2 ו-rtol=1e-2.

הגנות נגד ניצול תגמול ותוצאות מפורטות

ניצול תגמול מקבל חמש שכבות הגנה: סקריפטי אימות ופרופיילינג נעולי הרשאה, מנהלי הקשר שאוסרים נפילה ל-torch.nn.functional, בדיקות מול חמש קלטים אקראיים, פרופיילינג עם סנכרון התקן וחימום, והיעדר כלי חיפוש רשת. התגמול בדיד ולא יחס האצה גולמי: r ∈ {−1, 1, 2, 3}, מינוס 1 בכישלון נכונות, 3 אם הקרנל עובר גם eager וגם torch.compile ביותר מ-5%, 2 אם עובר רק eager, 1 אחרת. טבלה 1 מציגה 98.8% מעבר, 98.4% מהירים מ-eager, 96.8% מהירים מ-torch.compile, ב-2.60× ו-2.11× גיאומטרי בהתאמה. אי-התאמה אחת: התקציר והמבוא מציינים 100% / 100% / 92% קצב האצה, נתון שלא תואם את הטבלה המלאה.

לאן זה הולך מכאן

התעשיות הרלוונטיות הן תשתית AI והגשת הסקה, ענני GPU, נהיגה אוטונומית, מסחר כמותי, הדמיה רפואית ומערכות המלצה, בכל מקום שבו קרנלים מאוחדים יושבים על נתיב קריטי של השהיה. מקרי שימוש כוללים איחוד רצפי אופרטורים ש-torch.compile מתקשה בהם, הורדת עלות לטוקן, וכיול מחדש של קרנלים בין דורות GPU. עבור רוב הצוותים, הערך המיידי נמצא ברכיבים הפתוחים: הדאטה, מבנה התגמול והמפרט הטכני, לא במודל הסגור שדורש חוות H20 כדי לשחזר.

מקור: marktechpost.com