אנדרו פלדמן מסביר למה ארכיטקטורת הוואפר של סרברס מהירה פי 2,500 מ-GPU באינפרנס

שני שלבים בהרצה
לדברי אנדרו פלדמן (Andrew Feldman), מייסד שותף ומנכ"ל סרברס (Cerebras), הפער הביצועי נובע מהאופן שבו מודלי שפה גדולים רצים בפועל. האינפרנס מתחלק לשני שלבים נפרדים, פרה-פיל (pre-fill), שבו המודל מעכל את הפרומפט של המשתמש, ודיקוד (decode), שבו הוא מייצר את התשובה טוקן אחר טוקן ברצף. השלב השני הוא זה שיוצר את צוואר הבקבוק המשמעותי.
צוואר הבקבוק בזיכרון
בכל צעד של שלב הדיקוד, לפני שחישוב הטוקן הבא מתחיל, משקולות המודל (weights) צריכות לעבור מהזיכרון אל יחידות החישוב. זו תנועה שחוזרת על עצמה עבור כל טוקן וטוקן, ולכן המהירות שבה היא מתבצעת קובעת את קצב הפלט כולו. בגרפיקה רגילה המשקולות יושבות ב-HBM, זיכרון פס רחב שצמוד ל-GPU, אבל הגישה אליו עדיין כרוכה בהעברת נתונים על גבי ממשק חיצוני.
SRAM מול HBM
סרברס נוקטת בגישה שונה: המעבד בקנה מידה ואפר (wafer-scale) פרוס על פרוסת סיליקון שלמה, והמשקולות מאוחסנות ב-SRAM שמפוזר ישירות לצד יחידות החישוב. SRAM מהיר בסדרי גודל מ-HBM, והקרבה הפיזית מבטלת את הצורך להזיז נתונים למרחקים ארוכים על גבי אפיק (bus). לטענת פלדמן, תנועת הזיכרון-לחישוב הזו מהירה פי 2,500 בהשוואה ל-GPU.
המשמעות בפועל
המספר 2,500x מתייחס ספציפית לקצב העברת המשקולות פר טוקן בשלב הדיקוד, לא לביצועי המודל הכוללים, לא לשלב הפרה-פיל, ולא לתרגול (training). זה הבדל חשוב: האצה כזו רלוונטית כשהמודל גדול מכדי להיכנס לזיכרון המטמון של GPU, וכשהאינפרנס מוגבל ברוחב פס זיכרון (memory-bound). בתרחישים אחרים הפער יצטמצם משמעותית.
הקשר ומקור
הדברים נאמרו בפרק של The MAD Podcast עם מאט טורק (Matt Turck) וגם בערוץ היוטיוב של סרברס. כרגיל בהצהרות של יצרן חומרה, המספרים מתארים תנאים אופטימליים וארכיטקטורה תיאורטית, ביצועים בפרודקשן תלויים בגודל המודל, באורך הקונטקסט, בתוכנת הסטאק ובבחירת הבאץ' סייז (batch size). שווה לחכות למדידות עצמאיות לפני שמסיקים מסקנות גורפות.