דיפסיק משיקה את V4.1-פלאש: מיליון טוקן קונטקסט עם מטמון KV של 890 בייט בלבד

דיפסיק (DeepSeek) שחררה אתמול את DeepSeek-V4.1-Flash, מודל Mixture-of-Experts מולטי-מודאלי עם 552 מיליארד פרמטרים בשלד (backbone) ועוד 196 מיליארד פרמטרי אנגרם (Engram), שמפעיל 8 מיליארד פרמטרים לטוקן בפריפיל (prefill) ו-16 מיליארד בדיקוד (decode). המספר הבולט אינו הגודל אלא טביעת הרגל של מטמון המפתח-ערך (KV cache): 890 בייט לטוקן בלבד, רבע מזו של V4-פלאש וכ-437 פעמים קטנה יותר מזו של V1. המשקולות הפתוחות מופצות ברישיון MIT עם נתיבי הרצה ל-vLLM, SGLang ו-Transformers בהאגינג פייס (Hugging Face), ולצידן ממשק API ציבורי בשלוש רמות חשיבה, נמוכה, גבוהה ומקסימלית.
ארכיטקטורה שחותכת בחצי את הפריפיל
השלד בן 40 השכבות מחולק למקודד (encoder) סיבתי בן 20 שכבות ולמפענח (decoder) בן 20 שכבות. בהשראת YOCO, המפענח אינו מחשב מטמון KV גלובלי משלו; במקום זאת, משקולות הקרנה בכל שכבה גוזרות אותו מהמצב הנסתר הסופי של המקודד. התוצאה: טוקני הפרומפט נעצרים במקודד, וכמות החישוב בפריפיל נחתכת כמעט בחצי. מנגנון תשומת לב בחלון הזזה (SWA) ברוחב 128 טוקן רץ בכל שכבה, ומצבי ה-SWA של המפענח נבנים מחדש על ידי הרצה חוזרת של 128 הטוקנים האחרונים בלבד, מה שהצוות מכנה Decoder SWA Bounded Replay.
CSA2: דחיסה לאורך ציר השכבות
V4 ערבב CSA עם Heavily Compressed Attention; V4.1-פלאש עובר ל-CSA2 טהור ותוקף את גודל המטמון לאורך ציר השכבות. כל שכבת CSA2 מקבלת מצב סטטי אחד משלושה: Full, מחשבת KV ראשי, מקרינה אינדקסר K ובוחרת 512 אינדקסים טריים; Reindex, משתמשת ב-KV הראשי ובאינדקסר K מהשכבה המלאה האחרונה אך מדרגת אותם עם אינדקסר Q משלה; Reuse, משתמשת הן ב-KV הראשי והן באינדקסים העדכניים, ומדלגת על האינדקסר לחלוטין. 18 שכבות המקודד עובדות ביחס דחיסה 2 בשלוש קבוצות של 6 (אחת Full, חמש Reuse). 20 שכבות המפענח עובדות ביחס 1 בחמש קבוצות של 4: הראשונה Full ועוד שלוש Reuse, השאר Reindex ועוד שלוש Reuse. אינדקסר דליל היררכי (Hierarchical Sparse Indexer) במפענח מאפשר לשכבת ה-Full לבנות מאגר מועמדים של עד 16,384 מיקומים (2,048 בלוקים של 8), כך ששכבות Reindex עוקבות מדרגות קבוצה חסומה במקום את כל ההקשר.
קוונטיזציה ופריסה: FP4 ו-DRAM במקום SSD
מטמון ה-KV הראשי מקוונטז לפורמט E2M1 עם סקייל E4M3 אחד לכל 16 ערוצים, בעקבות NVFP4 אך ללא סקייל גלובלי. הקוונטיזציה מוכנסת דרך אימון מודע-קוונטיזציה (quantization-aware training) בפוסט-טריינינג, וכמעט מחצית את האחסון מול מטמון FP8 של V4. ברמת הפריסה, מטמון SWA כבר לא נכתב ל-SSD; הוא חי במאגר מבוזר שנחצב מ-10% של זיכרון המארח (host DRAM) עם TTL של דקות, בעוד מטמון גלובלי שומר על זמן חיים מובטח של 72 שעות. בהחטאה (miss), Encoder SWA Bounded Replay מחשב מחדש 128 טוקנים בלבד במקום שכבות כפול חלון. שיפורים נוספים כוללים Single-Pass mHC שמזיז מקדמי ערבוב קלט בבלוק אחד כך שקernel מגה-מאוחד (fused Mega-mHC) חותך בחצי את תעבורת זיכרון האקטיבציות, מודול זיכרון מותנה אנגרם בשכבות 1 ו-14, פענוח ספקולטיבי DSpark שאומן לאחר פרה-טריינינג עם שלד קפוא, ו-Muon ברמת ראש (head-wise). פלופס (FLOPs) של דיקוד טוקן בודד עולים רק ברבע כשההקשר גדל מ-4K ל-1M.
אימון ותוצאות: אותו ביצוע בשליש פרמטרים
הפרה-טריינינג כיסה 45 טריליון טוקנים מולטי-מודאליים ביחס 7:1 טקסט למולטי-מודאלי. תשומת הלב הדלילה אומנה מאפס באורך רצף 64K ללא חימום דחוס (dense warmup), וההקשר הוארך ל-1M ב-34 טריליון טוקנים. מודל הבסיס משתווה ל-DeepSeek-V4-Pro-Base בידע עולמי ובקוד תוך שימוש בשליש מסך הפרמטרים וברבע מהפרמטרים המופעלים. הפוסט-טריינינג אינו מציג אלגוריתמים חדשים; השיפורים מגיעים מסינתזה רחבת היקף של משימות סוכן ניתנות לאימות, ולמידת חיזוק (RL) על פיגומים (scaffolds) הטרוגניים, בהם Claude Code, Codex, כשהטקסט נקטע באמצע הרשימה.