אלן משיקה את Olmo-core 3: סטאק אימון MoE שמגיע לטריליון פרמטרים בלי לקרוס

הסוף של צוואר הבקבוק
מכון אלן לבינה מלאכותית (Allen Institute for AI) משחרר היום את Olmo-core 3, גרסה שלישית למסגרת הפיתוח שמאחורי מודלי Olmo, ובמרכזה מערכת אימון MoE (mixture-of-experts) פתוחה שתוכננה להגיע לטווח הטריליון פרמטרים תוך שמירה על יעילות חישובית. הבעיה ידועה: מודלי MoE מאפשרים להגדיל את קיבולת הפרמטרים בלי להפעיל את כולם לכל טוקן, אבל המודל המלא עדיין צריך לשבת בזיכרון GPU ולהתעדכן באימון, וניתוב הקלט למומחים הנכונים ברחבי אשכול מחשוב יוצר עלויות תקשורת ששוחקות את היתרון היחסי. Olmo-core 3 נבנה כדי לסגור בדיוק את הפער הזה.
המספרים מאחורי הקפיצה
בבנצ'מרק פנימי הגדילו החוקרים את מאגר המומחים מ-8 ל-128 תוך בחירה של ארבעה מומחים בלבד לכל טוקן, יחידות הטקסט הקטנות שהמודל מעבד, כך שמספר הפרמטרים הפעילים לטוקן נשאר יציב סביב 3.2 מיליארד. הקיבולת הכוללת קפצה מ-4.6 מיליארד ל-47 מיליארד פרמטרים, ואילו התפוקה באימון ירדה בפחות מחמישה אחוזים. אותה תשתית כבר נבדקה במעל טריליון פרמטרים כוללים, מה שמסמן כיוון ברור להמשך.
מארכיטקטורת FSDP ל-DDP
השינוי הארכיטקטוני המרכזי הוא מעבר ממקביליות נתונים משורשרת במלואה (FSDP), שאספה ופיזרה מחדש משקולות לכל מיקרו-באץ', למקביליות נתונים מבוזרת (DDP) שמשאירה את המומחים תושבים על ה-GPU ומזרימה אליהם רק את הנתונים הרלוונטיים. מול האלטרנטיבה המסחרית המבוססת, Megatron-Core של NVIDIA, מציעה Olmo-core 3 סטאק משולב בתוך המסגרת של Olmo. במבחן ראשוני על שמונה GPU מסוג B300 של NVIDIA, מודל MoE של 47 מיליארד פרמטרים עיבד 52 אלף טוקנים לשנייה ל-GPU עם הסטאק החדש, לעומת 19,400 בגרסה הקודמת, שיפור של פי 2.7 בתפוקה.
שלוש טכניקות מקביליות
הסטאק החדש משלב שלוש טכניקות לחלוקת המודל ומצב האימון על פני אשכול GPU: מקביליות מומחים (expert parallelism) שמפזרת את המומחים בין כרטיסים כך שכל GPU מחזיק רק חלק מהמאגר; מקביליות צנרת (pipeline parallelism) שמפצלת את שכבות המודל, השלבים העוקבים שמעבדים את הקלט, בין קבוצות GPU ומקטינה את הזיכרון הנדרש מכל כרטיס; ואופטימייזר מבוזר שמפזר את מצב האופטימייזר, הנתונים הנוספים שמשמשים לחישוב ויישום עדכונים, במקום להחזיק עותק מלא על כל GPU. יחד הן מאפשרות להגדיל MoE בלי שכל GPU יידרש להחזיק את המודל המלא ואת מצב האימון בזיכרון.
אבולוציה מקוד פתוח למעשה
הרקע מגיע משתי גרסאות קודמות: OlmoE השתמש בארכיטקטורת MoE עם 64 מומחים מנותבים, ואילו Olmo 3 עבר לארכיטקטורה דחוסה (dense) שבה כמעט כל המודל פעיל לכל טוקן, והסטאק שלו נבנה בהתאם. Olmo-core 3 מחזיר את הפוקוס למודלים דלילים בקנה מידה גדול בהרבה, כחלק מהמחויבות המוצהרת של המכון לפתוח את הכלים והתשתית מאחורי כל דור חדש. עבור חוקרים אקדמיים ומעבדות קטנות יותר, שעלויות החישוב והאנרגיה דחקו אותן החוצה מפיתוח מודלים מתקדמים, זו תשתית שמאפשרת להתנסות באימון מבוזר על החומרה שיש להן, בלי להמציא את הגלגל מחדש.