21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

מודלי שפה לומדים לדלג על רוב הקונטקסט בלי לאבד הרבה דיוק

מודלי שפה לומדים לדלג על רוב הקונטקסט בלי לאבד הרבה דיוק

חוקרים מציגים פרוטוקול בשם Declarative Attention שמאפשר למודל להצהיר בעצמו לאן הוא צריך להקשיב, ומקצץ בחצי את כמות הטוקנים שנקראים בזמן פענוח, עם פגיעה זניחה בביצועים.

הבעיה: קריאה מלאה של מטמון המפתח-ערך בכל צעד

מודלי שפה גדולים מקדישים את רוב הקשב שלהם לחלק זעיר מההקשר, אבל מנגנון הקשב הגלובלי עדיין סורק את כל מטמון ה-KV (Key-Value) כדי למצוא את הטוקנים הרלוונטיים. כשמשתמש שואל על פרט שהופיע בתחילת שיחה של מיליון טוקנים, המודל נאלץ לקרוא את כל המטמון עבור כל טוקן שהוא מייצר בתשובה. גישות קיימות מנסות לפתור את זה באמצעות ציוני פרוקסי קלים שמזהים מראש טוקנים חשובים, אבל גם השיטה החיצונית הזו עולה O(N) בכל צעד פענוח.

הגישה הפנימית: המודל מצהיר לאן ללכת

העבודה החדשה, שפורסמה כ-preprint ב-arXiv, שואלת שאלה פשוטה: האם המודל עצמו כבר יודע אילו חלקים של ההקשר רלוונטיים? התשובה מתממשת ב-Declarative Attention (DA), פרוטוקול שמפצל את הגנרציה לשלושה מצבים שהמודל מכריז עליהם בתוך שרשרת החשיבה שלו: `<global>` לקשב מלא, `<focus>` לאזור ספציפי, ו-`<local>` לפלט האחרון בלבד. מנוע האינפרנס מפרש את ההכרזות האלה כמו קריאות כלי (tool calls) ומדלג על קריאת רוב מטמון ה-KV.

תוצאות: חיסכון של 30-52% בטוקנים שנקראו

בניסוי zero-shot על 15 משימות הקשר-ארוך עם מודלים קיימים מהמדף, Gemma-4-31B ו-Qwen-3.6-27B, DA הפחית את סך הטוקנים שנקראו בזמן פענוח ב-52.0% וב-31.1% בהתאמה. הירידה בדיוק עמדה על 1.27 ו-2.75 נקודות אחוז בלבד, והפער הצטמצם ככל שהמודל גדול יותר. המספרים מגיעים ישירות מההערכה שמתוארת בתקציר; לא פורסמו מדדי ביצועים נוספים או פרטים על חומרת הרצה.

מה זה אומר בפועל: ציר חדש של קשב דליל

המשמעות היא שאפשר לקבל קשב דליל בלי לאמן מחדש ובלי להוסיף רכיבי דירוג חיצוניים, המודל עצמו מנווט. הכותבים מציינים ש-DA פותח ציר אופטימיזציה חדש, וששיטות מבוססות אימון (training-based) יוכלו לשפר עוד את התוצאות בעבודות המשך. כרגע מדובר בהוכחת היתכנות על מודלים סגורים-משקלים בגדלים בינוניים; לא נבדקו מודלים גדולים יותר ולא פורסם קוד ריצה.