21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
רגולציה

חוקרי סאקאנה מציגים אלגוריתם אימון שמאפשר רשתות בנות 1,000 שכבות בלי בקפרופגיישן

חוקרי סאקאנה מציגים אלגוריתם אימון שמאפשר רשתות בנות 1,000 שכבות בלי בקפרופגיישן

הבעיה עם פרדיקשן קודינג קלאסי

פרדיקשן קודינג (PC) מתייחס לכל אקטיבציה נסתרת כמשתנה אופטימיזציה ומטיל קנס על הפער בריבוע בין האקטיבציה של כל שכבה לתחזית שמגיעה מהשכבה שמתחתיה. האינפרנס הוא גרדיאנט דיסנט על האנרגיה הזו, והלמידה היא צעד משקולות בסגנון הביאני. הבעיה: הסופרוויז'ן נכנס בפלט וחייב להתפשט דרך שרשרת של פשרות מקומיות. ברשתות עמוקות וצרות אות הקרדיט דועך הרבה לפני שהוא מגיע לקלט. אינוצ'נטי ועמיתיו אפיינו את הפער בין PC לבקפרופ כפונקציה של רוחב ועומק, והראו שהוא חמור במיוחד כשהרוחב קטן מהעומק.

מה PC-ALM משנה

PC-ALM מתחיל מהניסוח המוגבל של האימון: למזער את הלוס המפוקח בכפוף לאילוץ בכל שכבה. PC הוא הרפיה עם קנס ריבועי של הבעיה הזו. PC-ALM משתמש בלגרנז'יאן המוגדל במקום, ומוסיף מולטיפלייר לגראנז' לכל אילוץ שכבה תוך שמירה על הקנס של PC. כשמגדירים λ = 0 מקבלים בדיוק את PC. האינפרנס מחליף בין שני צעדים מקומיים: צעד גרדיאנט פרימלי על האקטיבציות, וצעד דואלי שצובר את שגיאת התחזית של השכבה. השלמה לריבוע מראה שכל צעד פרימלי הוא צעד PC סטנדרטי עם יעד תחזית שמוסט על ידי המולטיפלייר. אחרי T צעדים עדכון המשקולות פועל על האות המורכב. החוקרים קוראים לזה בקר PI לכל שכבה: שגיאת התחזית היא האיבר הפרופורציונלי והמולטיפלייר הוא האיבר האינטגרלי. α = 0 נותן PC; α = ρ עם פתרון מדויק של הבעיה הפנימית נותן את שיטת המולטיפליירים הקלאסית.

גרדיאנטים מדויקים של בקפרופ במקרה הליניארי

לקון ציין ב-1988 שהמולטיפליירים של רשת מוגבלת שווים לאדג'וינטים של בקפרופ בנקודת KKT. הצוות מוכיח שברשתות PC ליניאריות, תחת תנאי יציבות של רדיוס ספקטרלי, PC-ALM מתכנס לאותה נקודת KKT: האקטיבציות חוזרות לערכי הפורוורד-פאס שלהן בזמן שכל מולטיפלייר משתלב לאדג'וינט המדויק של בקפרופ. חסימת היציבות לכל מוד היא, שמצטמצמת לתנאי של PC כש-α = 0. בניגוד לזרימת הגרדיאנט המונוטונית של PC, מטריצת האיטרציה של PC-ALM מכילה ערכים עצמיים מרוכבים שיוצרים תנודות מדוכאות; α קובע את התדר אבל לא את קצב הדעיכה.

תוצאות: סגירת הפער בעומקים קיצוניים

הצוות סרק RMLP ברוחב ועומק 8 עד 128 על פאשן-MNIST ו-MNIST תחת הפרמטריזציה של אינוצ'נטי, עם אפוקה אחת. בתקציב אינפרנס של T = 2L, PC-ALM משתווה לבקפרופ בכל רוחב, עומק ופונקציית הפעלה (זהות, tanh, ReLU), בעוד PC צונח בתאים העמוקים והצרים. תא הייחוס בריפו (רוחב 32, עומק 32, ReLU, פאשן-MNIST) מדווח 78.66% דיוק לבקפרופ, 68.13% ל-PC ו-77.75% ל-PC-ALM, עם קוסינוס גרדיאנט לבקפרופ שעולה מ-0.604 ל-0.909. הניסוי נמתח ל-1,000 שכבות על MNIST (רוחב 32, ReLU, 5 אפוקות) ונשאר בטווח של בערך 2 נקודות מבקפרופ. שיפור נרשם גם ב-ResNet-18 על CIFAR-10 ו-Tiny ImageNet.

קוד פתוח, אבל עדיין מחקרי בלבד

המימוש זמין ברישיון MIT ב-JAX ורץ על CPU, משחזר את גריד הרוחב-עומק של המאמר. חשוב להדגיש: זו שיטת אימון, לא מודל, והיא נבדקה רק על בנצ'מרקים קטנים של תמונות. אין מדדי ביצועים על שפה, מולטימודל או סקייל של פרודקשן. התוצאות מרשימות במסגרת הניסויית המוגדרת, אבל הדרך ליישום מעשי עוד ארוכה.

מקור: marktechpost.com