21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

אנדרו פלדמן מסביר למה ארכיטקטורת הוואפר של סרברס מהירה פי 2,500 מ-GPU באינפרנס

אנדרו פלדמן מסביר למה ארכיטקטורת הוואפר של סרברס מהירה פי 2,500 מ-GPU באינפרנס

שני שלבים בהרצה

לדברי אנדרו פלדמן (Andrew Feldman), מייסד שותף ומנכ"ל סרברס (Cerebras), הפער הביצועי נובע מהאופן שבו מודלי שפה גדולים רצים בפועל. האינפרנס מתחלק לשני שלבים נפרדים, פרה-פיל (pre-fill), שבו המודל מעכל את הפרומפט של המשתמש, ודיקוד (decode), שבו הוא מייצר את התשובה טוקן אחר טוקן ברצף. השלב השני הוא זה שיוצר את צוואר הבקבוק המשמעותי.

צוואר הבקבוק בזיכרון

בכל צעד של שלב הדיקוד, לפני שחישוב הטוקן הבא מתחיל, משקולות המודל (weights) צריכות לעבור מהזיכרון אל יחידות החישוב. זו תנועה שחוזרת על עצמה עבור כל טוקן וטוקן, ולכן המהירות שבה היא מתבצעת קובעת את קצב הפלט כולו. בגרפיקה רגילה המשקולות יושבות ב-HBM, זיכרון פס רחב שצמוד ל-GPU, אבל הגישה אליו עדיין כרוכה בהעברת נתונים על גבי ממשק חיצוני.

SRAM מול HBM

סרברס נוקטת בגישה שונה: המעבד בקנה מידה ואפר (wafer-scale) פרוס על פרוסת סיליקון שלמה, והמשקולות מאוחסנות ב-SRAM שמפוזר ישירות לצד יחידות החישוב. SRAM מהיר בסדרי גודל מ-HBM, והקרבה הפיזית מבטלת את הצורך להזיז נתונים למרחקים ארוכים על גבי אפיק (bus). לטענת פלדמן, תנועת הזיכרון-לחישוב הזו מהירה פי 2,500 בהשוואה ל-GPU.

המשמעות בפועל

המספר 2,500x מתייחס ספציפית לקצב העברת המשקולות פר טוקן בשלב הדיקוד, לא לביצועי המודל הכוללים, לא לשלב הפרה-פיל, ולא לתרגול (training). זה הבדל חשוב: האצה כזו רלוונטית כשהמודל גדול מכדי להיכנס לזיכרון המטמון של GPU, וכשהאינפרנס מוגבל ברוחב פס זיכרון (memory-bound). בתרחישים אחרים הפער יצטמצם משמעותית.

הקשר ומקור

הדברים נאמרו בפרק של The MAD Podcast עם מאט טורק (Matt Turck) וגם בערוץ היוטיוב של סרברס. כרגיל בהצהרות של יצרן חומרה, המספרים מתארים תנאים אופטימליים וארכיטקטורה תיאורטית, ביצועים בפרודקשן תלויים בגודל המודל, באורך הקונטקסט, בתוכנת הסטאק ובבחירת הבאץ' סייז (batch size). שווה לחכות למדידות עצמאיות לפני שמסיקים מסקנות גורפות.