8 באוקטובר 2026 האקדמיה ארכיון
מבזקים
מיקרוסופט משיקה את Surface Laptop Ultra עם שבב RTX Spark של Nvidia ב-2,599 דולר נוס ריסרץ' סוגרת סבב B של 90 מיליון דולר לפי שווי של 1.5 מיליארד רובוטים עוברים מאוטומציה של משימה בודדת לזרימת עבודה מלאה DeepSeek-V4.1-Flash רץ פי 5.3 יותר מהר על vLLM אחרי שלושה שבועות אופטימיזציה Common Sense Media: ChatGPT for Teens "סיכון בלתי קביל", ההגנות לא עומדות בהבטחות
מודלים

DeepSeek-V4.1-Flash רץ פי 5.3 יותר מהר על vLLM אחרי שלושה שבועות אופטימיזציה

DeepSeek-V4.1-Flash רץ פי 5.3 יותר מהר על vLLM אחרי שלושה שבועות אופטימיזציה

קהילת vLLM ו-Inferact דחפו את DeepSeek-V4.1-Flash ל-1.9× שיפור ב-TTFT ברמת תחרותיות נמוכה ו-5.3× תפוקה תחת אילוץ של 150 טוקנים לשנייה למשתמש בבנצ'מרק AgentX של SemiAnalysis, והכול בשלושה שבועות מהשחרור. המספרים מגיעים מבדיקות שהריצו המפתחים עצמם, לא ממעבדה עצמאית, אז הם משקפים תקרה תיאורטית יותר ממצב ייצור טיפוסי.

הארכיטקטורה שמאחורי הקפיצה

DeepSeek V4.1 מציג ארכיטקטורת causal encoder-decoder (CED) שמפעילה 16 מיליארד פרמטרים לטוקן בפענוח אבל רק 8 מיליארד בקדם-מילוי. המודל גם חסכוני בזיכרון בצורה קיצונית: הוא משלב Compressed Sparse Attention 2 (CSA2), מטמון KV ב-FP4 ושיתוף מטמון KV בין שכבות, שדוחפים את טביעת הרגל הגלובלית ל-890 בתים לטוקן. לשם השוואה, מודלים מקבילים ב-FP16 יושבים על סדר גודל של 2-3 קילובייט לטוקן, פער שמתורגם ישירות ליכולת להחזיק קונטקסט ארוך יותר על אותו חומרה.

SWA bounded replay, איך חוסכים חצי מודל

המודל מחזיק שני סוגי מטמוני KV: גלובלי (דחוס, משותף לשכבות, FP4, ~890 בתים/טוקן) והחלון המחליק (SWA), לא דחוס ב-FP8, מכסה את 128 המיקומים האחרונים בכל אחת מ-40 השכבות. ה-SWA יוצר שני מחירים: אחסון פריפיקס (prefix caching) בכל גבול פגיעה אפשרי עולה יותר מפי 10 מהגלובלי, והקדם-מילוי מריץ שכבות 21-39 על כל טוקן בפרומפט אף שהפענוח קורא רק את 128 האחרונים. הפתרון של DeepSeek, SWA bounded replay, מריץ מחדש רק את 128 הטוקנים האחרונים וגוזר את החלון בתחילת השחזור, לא ביט-אקזקט, אבל לדברי החברה אובדן האיכות זניח. vLLM מיישם את זה בשני מקומות: בצד המקודד, שומרים רק KV גלובלי ומשחזרים את ה-SWA בפגיעת פריפיקס; בצד המפענח, מריצים שכבה 20 על כל טוקן לייצור KV גלובלי, ואת שכבות 21-39 רק על 128 הטוקנים האחרונים של כל בקשה, מדלגים על כמעט חצי מודל בפרומפטים ארוכים.

גרפים של CUDA והקרנלים החדשים

אחרי הגיזום, שכבות 21-39 עושות כל כך מעט עבודה על ה-GPU שעלות השקת הקרנלים משתלטת וה-GPU יושב סרק. צורות הקלט שלהן גם שונות משכבות 0-20, אז אי אפשר ללכוד הכול בגרף CUDA יחיד. מנגנון ה-PIECEWISE השביר של vLLM כבר יודע לשבור באמצע המודל, אז הוא לוכד את 0-20 על הבאצ' המלא ואת 21-39 בנפרד על הבאצ' הגזור, מאפשר כיסוי גרף טוב יותר לחלק הגזור. במקביל נטמעו הקרנלים החדשים של DeepSeek, MegaAttention, Mega-mHC, Mega-Gate ו-DeepSelect, ונעשה פיוז אגרסיבי ומקבול של השאר, כולל זרמי צד של mHC ופיוז של all-reduce עם האופרטורים שלפניו ואחריו לקרנל יחיד.

מה זה אומר בפועל

השילוב בין אופטימיזציות ברמת המודל (CED, CSA2, FP4 KV, שיתוף בין-שכבתי) לאופטימיזציות מערכת (SWA bounded replay, גרפים מפוצלים, פיוז קרנלים) הניב את הקפיצה מ-1.9× ב-TTFT ל-5.3× בתפוקה תחת עומס. DeepSeek לא פרסמה מדדי איכות כמותיים לאובדן מה-SWA bounded replay מעבר ל"זניח", ואין עדיין ריצה עצמאית על AgentX שמאשרת את המספרים בסביבה לא נשלטת. עדיין, זו הדגמה נקייה של איך ארכיטקטורה שפותחה מראש לשרתינג ארוך-אופק מאפשרת למערכת ההסקה לגזור פינות בלי לשבור את המודל, דפוס שכנראה נראה עוד ממנו בדור הבא של מודלי סוכנים.