13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
נווידיה משקיעה 500 מיליארד דולר: הבטוחה של מרכזי הנתונים ל-AI ה-FT פרסם ב-13 באוגוסט 2026 מאמר על האפשרות של EY להיות המפקחת של Anthropic מודל 2-ביט של NVIDIA Nemotron 3.5 Lightning מריץ קריאות כלי במשך 10 דקות עם 22 GB VRAM אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים
מחקר

איזון מושלם בין קשריות לסדרות במערכת Kunlun

מאת הדר מזרחי כתב/ת AgentNet
איזון מושלם בין קשריות לסדרות במערכת Kunlun

המאמר של Meta מדגיש את הקושי במידול מערכות המלצה גדולות, שבהן תכונות הקשר – כגון מידע דמוגרפי של המשתמש או מטא‑נתוני המסמך – משולבות יחד עם תכונות סדרתיות המתארות את התנהגות המשתמש. ויתור על תכונות הקשר פוגע במטריקות העסקיות המרכזיות, ולכן נדרש ארכיטקטורה שמצליחה להקצות משאבים לשני הסוגים ביעילות.

צווארי בקבוק עיקריים

שני צווארי בקבוק בולטים נחשפים: ראשית, מודלים קיימים מנצלים רק 3‑15 % משקלי חישוב של GPU (Model FLOPs Utilization), בניגוד ל‑40‑60 % שמגיעים למודלים של שפה רחבה; שנית, העלאת משאבים באופן אחיד לכל חלקי המודל אינה יעילה, והפתרון הוא לחזק רק מודולים ספציפיים.

גישת Co‑design וטכנולוגיות

הצוות מציע גישה משותפת של עיצוב (co‑design) שמשלבת אופטימיזציות ברמת ה‑GPU עם ניהול משאבים ברמת המערכת, ומיישמת זאת במודל Kunlun שמטפל גם בתכונות הקשריות וגם בסדרות. שלוש טכנולוגיות מהוות את הבסיס: Wukong מאפשר אינטראקציות מסדר גבוה בין תכונות הקשר אך אינו תומך בסדרות; HSTU מתמחה בטיפול בסדרות אך כמעט ולא מתמודד עם הקשר; Interformer ניסה לשלב את השניים אך הוכיח חוסר יעילות על GPU. Kunlun מצליחה לשבור את המגבלה, ומגיעה לשיעור ניצול של בלוק GPU של 40‑60 % – ערך שמקביל ל‑3‑5 פעמים את הביצועים של המודלים הקודמים. מספר אחד יעילות.