21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

טכניקת ריסירקולשן מורידה פרפלקסיטי ב-23% במודלי ג'מה 3 בלי אימון נוסף

טכניקת ריסירקולשן מורידה פרפלקסיטי ב-23% במודלי ג'מה 3 בלי אימון נוסף

חוקרים הציגו שיטה בשם Recirculation שמוסיפה רקורסיה למודלי טרנספורמר קיימים בזמן הסקה בלבד, בלי לגעת במשקלים, בלי אימון מחדש, ובלי תוספת לטנסי ביצירת טוקנים. הרעיון פשוט: מזריקים אקטיבציות מהשכבות העליונות חזרה לתחתונות בצעד הבא, וכך מאפשרים למודל לתפקד כמערכת דינמית שעוקבת אחרי מצבי אמונה (belief states) במקום להיות מוגבל לעומק הקבוע של הרשת.

איך זה עובד מתחת למכסה

במקום להסתמך רק על העברה קדימה חד-כיוונית, ריסירקולשן יוצרת לולאת משוב בין השכבות הגבוהות לנמוכות בכל צעד הסקה. זה לא Chain-of-Thought, המחברים מדגישים ש-CoT מיועד להסקות מורכבות, בעוד ריסירקולשן מטפלת במעקב מצב בסיסי. זה גם לא "לופינג" קלאסי שחוזר על אותן שכבות שוב ושוב, ולא טרנספורמר רקורסיבי שדורש אימון יקר. המחיר היחיד: שלב הפרי-פיל (prefill) הופך סדרתי במקום מקבילי, אבל שלב ה-decode נשאר באותה מהירות.

המספרים על ג'מה 3

הגרסה האדפטיבית (שדורשת רק כוונון קל של היפר-פרמטרים תוך הקפאת המשקלים המקוריים) השיגה הפחתה של 23% בפרפלקסיטי על סוויטת דאטהסטים, ועלייה של 21% בדיוק על GSM8K. שיפורים אמינים נרשמו גם במשימות מורדות (downstream tasks) נוספות. כל זה על משפחת Gemma3 כמודל בסיס, כשהשיטה מוגדרת training-free לחלוטין.

פרה-פרינט, לא מאמר שעבר ביקורת עמיתים

העבודה מופיעה ב-arXiv בקטגוריית Computer Science > Machine Learning, כלומר מדובר בפרה-פרינט שטרם עבר שיפוט עמיתים (peer review). הקוד והדאטה זמינים, ויש דמואים להרצה, אבל המדדים מגיעים מהמחברים עצמם בלי אימות חיצוני. שווה לחכות לשחזור עצמאי לפני שמסיקים מסקנות גורפות.

אבולוציה ארכיטקטונית מונחית-מודל

הכיוון המעניין כאן רעיוני: במקום לתכנן ארכיטקטורות שרירותית ולאמן אותן מאפס, השיטה משתמשת במודל המאומן עצמו כדי להנחות שינויים ארכיטקטוניים. אם זה עובד בקנה מידה רחב, זה פותח נתיב ל"אבולוציה ארכיטקטונית" שבה הרשת מלמדת אותנו איך לשפר את המבנה שלה, בלי סבב אימון נוסף.