27 בספטמבר 2026 האקדמיה ארכיון
מבזקים
סוכני OpenAI הריצו 16 אלף בקשות לאתר האו"ם בניסיון לעקוף מגבלות גישה סין התקינה יותר רובוטים תעשייתיים ב-2025 משאר העולם יחד מאמר חדש מציע מפת דרכים לשיפור עצמי רקורסיבי של בינה מלאכותית מודל 340 מיליון פרמטרים רץ על GPU של טלפון, עם זהות מספרית למודל הייחוס גוגל בודקת רכישה ישירה מפליפקארט דרך ג'מיני ו-AI Mode בהודו
מחקר

איזון מושלם בין קשריות לסדרות במערכת Kunlun

איזון מושלם בין קשריות לסדרות במערכת Kunlun

המאמר של Meta מדגיש את הקושי במידול מערכות המלצה גדולות, שבהן תכונות הקשר – כגון מידע דמוגרפי של המשתמש או מטא‑נתוני המסמך – משולבות יחד עם תכונות סדרתיות המתארות את התנהגות המשתמש. ויתור על תכונות הקשר פוגע במטריקות העסקיות המרכזיות, ולכן נדרש ארכיטקטורה שמצליחה להקצות משאבים לשני הסוגים ביעילות.

צווארי בקבוק עיקריים

שני צווארי בקבוק בולטים נחשפים: ראשית, מודלים קיימים מנצלים רק 3‑15 % משקלי חישוב של GPU (Model FLOPs Utilization), בניגוד ל‑40‑60 % שמגיעים למודלים של שפה רחבה; שנית, העלאת משאבים באופן אחיד לכל חלקי המודל אינה יעילה, והפתרון הוא לחזק רק מודולים ספציפיים.

גישת Co‑design וטכנולוגיות

הצוות מציע גישה משותפת של עיצוב (co‑design) שמשלבת אופטימיזציות ברמת ה‑GPU עם ניהול משאבים ברמת המערכת, ומיישמת זאת במודל Kunlun שמטפל גם בתכונות הקשריות וגם בסדרות. שלוש טכנולוגיות מהוות את הבסיס: Wukong מאפשר אינטראקציות מסדר גבוה בין תכונות הקשר אך אינו תומך בסדרות; HSTU מתמחה בטיפול בסדרות אך כמעט ולא מתמודד עם הקשר; Interformer ניסה לשלב את השניים אך הוכיח חוסר יעילות על GPU. Kunlun מצליחה לשבור את המגבלה, ומגיעה לשיעור ניצול של בלוק GPU של 40‑60 % – ערך שמקביל ל‑3‑5 פעמים את הביצועים של המודלים הקודמים. מספר אחד יעילות.