GLM-5.3 מדגים איך סוכנים שוברים את נעילת CUDA בהרצת מודלים

הסוכן שבנה את התשתית של עצמו
לפי דיווח של Teortaxes, חוקר המקורב למעבדות DeepSeek, המודל GLM-5.3 שימש לבנייה ואופטימיזציה של תשתית ההרצה (inference) שמשרתת את הגרסה המוקטנת GLM-5.3-Flash. המערכת עברה מהרצה ראשונה מוצלחת למוכנות ייצור בפחות משבועיים, כשהתפוקה מקצה לקצה שולשה ביחס לבסיס ההתחלתי. לדברי המקור, זהו ביטוי ראשון מסוגו של מה שהוא מכנה TCD, יכולת של סוכנים לכתוב ולהעביר קרנלים (kernels) אוטומטית לכל סיליקון זמין.
שלושה שבועות לפיילוט, שבועיים לייצור
הנתון הבולט אינו גודל המודל אלא קצב האיטרציה: תהליך שבעבר דרש צוותי מהנדסים חודשים של כתיבת קוד CUDA ידני, התכווץ לחלון של ימים בודדים. הסוכן זיהה צווארי בקבוק, כתב גרסאות מותאמות לארכיטקטורות שונות, והעמיד אותן במבחני ביצועים, בלי התערבות אנושית מעבר להגדרת היעד. לדברי Teortaxes, "הסוכנים טובים מדי עכשיו" וכל פיסת סיליקון תידחף לקצה גבול היכולת.
החומה האמיתית היא תוכנה, לא חומרה
הטענה המרכזית היא שהיתרון של Nvidia מעולם לא היה CUDA כשפה, אלא נעילת מחסנית התוכנה (software stack lock-in) שסביבה. כל עוד כתיבת קרנלים יעילים דרשה מומחיות אנושית נדירה, ברירת המחדל "פשוט תקנו Nvidia" הייתה רציונלית. ברגע שסוכנים יודעים לתרגם ולהעביר קרנלים אוטומטית לכל ארכיטקטורה, AMD, Intel, שבבים סיניים או מאיצים ייעודיים, ברירת המחדל הזו מתמוטטת במהירות.
מה זה אומר לשוק השבבים
התרחיש שמתואר כאן אינו שיפור הדרגתי אלא שינוי מבני: עלות המעבר בין פלטפורמות חומרה צונחת לאפס כשהעבודה השחורה של אופטימיזציית קרנלים עוברת למודל. יצרני שבבים שסבלו ממחסור בתמיכת תוכנה בוגרת מקבלים פתאום נתיב מהיר לייצור; לקוחות שבויים ב-Nvidia מקבלים מינוף משא ומתן אמיתי. המבחן יהיה האם היכולת הזו עוברת מהדגמה פנימית למוצר זמין לכל מפתח, ואז השוק ישתנה מהיסוד.