חוקר פרינסטון מציע ארכיטקטורה שסוגרת את לולאת הדקודר בין טוקנים עוקבים

מה מציע הדוח
יאפאן ג'אנג (Yifan Zhang) מפרינסטון פרסם דוח טכני שמתאר את Recurrent Looped Transformer, ארכיטקטורה שמעבירה את המצב המלא של הדקודר מטוקן לטוקן, כולל הפלט הסופי ומטמון הקשב בחלון הזזה (SWA) בכל שכבה. הדוח מגדיר מפרט ארכיטקטוני, לוחות זמנים לביצוע וחוזה חזרה ללמידת חיזוק, ומדגיש במפורש שאין בו מדדי יעילות, איכות חשיבה או סקיילינג שנמדדו בפועל. מדובר בהצעת תכנון, לא במודל מאומן עם תוצאות.
איך הארכיטקטורה עובדת
RLT מחבר מקודד סיבתי שרץ במקביל עם דקודד רקורסיבי ששומר מצב מלא Ht = (st, CtD), הפלט הסופי ומטמוני המפתח-ערך בכל שכבות הדקודר. לכל טוקן מתבצע מיזוג מגודר בין ייצוג המקודד et לפלט הקודם s{t-1}, ואז כל בלוק דקודר מריץ SWA סיבתי על הפעלות הדקודר, קשב-צולב לזיכרון המקודד ו-FFN. החלון W כולל את הטוקן הנוכחי, כך שלכל היותר W-1 כניסות היסטוריות נשמרות בכל שכבה. התצורה המקושרת משתמשת ב-48 שכבות מקודד ו-48 שכבות דקודר עם משקולות קשב ו-FFN משותפות, כך שכל טוקן מבצע 96 בלוקים לוגיים, אם כי בלוקי הדקודר מוסיפים קשב-צולב ולכן ה-FLOPs לבלוק אינם שווים. ג'אנג מכנה זאת שימוש חוזר בפרמטרים, לא העתקת אקטיבציות.
שלושה עקרונות תכנון
העיקרון הראשון מציע עומק זמני בלתי מוגבל: אחרי t טוקנים, נתיב המצב מ-s0 חוצה t·LD בלוקי דקודר (48t בתצורת הייחוס), כשהעבודה לטוקן נשארת קבועה. הדוח מזהיר ששערים וכיווץ עשויים לדכא נתיבים ארוכים, ועומק מבני אינו ערובה לחשיבה. העיקרון השני עוסק בתכנון משותף מודל-חומרה: תכונות המקודד והטלות זיכרון לטוקנים ידועים משתמשות בגרעינים מקבילי-טוקן, מעברי הדקודר נשארים סדרתיים בתוך רצף, אבל עדכונים מוכנים מרצפים בלתי תלויים יכולים לחלוק גרעין מאוחסן אחד. הדוח קובע בבירור שאין הנחה לסריקה מקבילה מדויקת לדקודר הלא-ליניארי, אין טענה להאצת פרה-פיל, ומעבר דקודר SWA מקבילי סטנדרטי אינו שקול לרקורסיה. אצווה, היתוך גרעינים וצ'קפוינטינג רשומים כיעדי מימוש, לא כגרעינים מוכנים. העיקרון השלישי קושר אימון מוקדם, כוונון מונחה, דגימה ולמידה מחזקת למעבר מצב יחיד, הסמפלר רושם לוג-הסתברות התנהגות לכל פעולה תחת התפלגות הדגימה בפועל, והמאמן בונה מחדש את זיכרון המקודד, הפלט הרקורסיבי וכל מטמוני ה-SWA מתחילת הרצף תחת הפרמטרים הנוכחיים לפני ניקוד כל פעולה; מצבי גלגול קודמים לעולם אינם משומשים מחדש. טענה 3.1 ממסגרת את התמורה: הזזת נקודת החלוקה בין פרומפט לתשובה משאירה את ההתפלגות המותנית ללא שינוי בהיסטוריית טוקנים קבועה.
אימון והגשה, בלי תוצאות מדודות
אימון מוקדם מתבצע כחיזוי הטוקן הבא על רצף מלא עם חזרה לאחור דרך זמן מלאה. כוונון מונחה ממסך את האובדן למטרות העוזר בלבד, אבל לעולם לא ממסך עדכוני מצב, כך שהאובדן של העוזר עובר חזרה דרך טוקני משתמש וכלים. נספח ב' מראה שניתוק חלקי מסוכן: היעקוביאן מצב-למצב. הדוח אינו מדווח על ניסויים, בנצ'מרקים או השוואות למודלים קיימים.