עלי באבא משיקה את Qwen3.8-Flash-Next: מודל 125 מיליארד עם 6 מיליארד פרמטרים פעילים בלבד

ארכיטקטורה שמקדימה את Qwen4
צוות Qwen של עלי באבא שחרר את Qwen3.8-Flash-Next, מודל רב-מודאלי במשקל פתוח שפותח במטרה להוריד עלות לטוקן. השלד מכיל 125 מיליארד פרמטרים, אליהם מצטרפת טבלת הטמעת N-gram של 51 מיליארד ומודול חיזוי רב-טוקנים של 4 מיליארד, סך הכול 180 מיליארד על הדיסק. בפועל מופעלים רק 6 מיליארד פרמטרים לכל טוקן, בזכות שכבת MoE עם 512 מומחים שמפעילה 10 מנותבים ומומחה משותף אחד. הצוות מגדיר את הגרסה כתצוגה מקדימה של הארכיטקטורה שתשמש את Qwen4, בדיוק כפי ש-Qwen3-Next הקדים את Qwen3.5.
ארבעה שינויים ארכיטקטוניים
ארבעה רכיבים חדשים מניעים את הגרסה. מנגנון קשב היברידי משלב Gated DeltaNet, שכבת קשב ליניארית שמדחיסה היסטוריה למצב רקורסיבי בגודל קבוע, עם Qwen Sparse Attention (QSA), שבוחר הקשר ברמת מיקרו-בלוקים במקום פר טוקן. הפריסה עומדת על 48 שכבות במבנה 12 × (3 × GDN + 1 × QSA), עם תקציב QSA של 512 בלוקים או 2 048 טוקנים. זרם השארית (residual stream) מתרחב לארבעה ענפים מקבילים עם שער קריאה רכיבי-רכיבי ושער כתיבה סקלרי לכל ענף, בצוואר בקבוק בדרגה 320. טבלת ההטמעות החדשה מכילה 20 מיליון ביגרמים וטריגרמים בשכבה 2, ניתנת להעברה לזיכרון מארח עם טעינה מוקדמת אסינכרונית, כרגע רק על התקני NVIDIA. מתכון האימון מחליף את חימום גודל הלוט (batch-size warmup) בהתאמה מחודשת של חוקי סקיילינג, ומוסיף את האופטימיזר Muon לצד AdamW לקטגוריות משקלים ספציפיות.
בנצ'מרקים: חזק בקוד ובסוכנים, חלש בהנמקה גבוהה
הדיווח העצמי מציג 58.7 ב-DeepSWE 1.1, 62.5 ב-SWE-bench Pro, 81.0 ב-SWE-bench Multilingual ו-91.9 ב-LiveCodeBench v6. במשימות סוכניות (agentic) נרשמו 73.9 ב-CoWorkBench, 55.7 ב-JobBench ו-73.5 ב-Toolathlon Verified. בצד הרב-מודאלי: 84.5 ב-AndroidWorld, 76.6 ב-LVBench, 88.5 ב-RealWorldQA ו-95.7 ב-MathVision עם מפרש קוד. המודל אינו מוביל בכל החזיתות: Claude Opus 4.6 (Max) משיג 40.0 ב-HLE מול 35.9 של Qwen, ו-DeepSeek-V4-Flash-0731 מוביל ב-NL2Repo-Bench עם 54.2 לעומת 48.1. הפער העיקרי נותר בהנמקת חזית (frontier reasoning).
יעילות והגשה: לא לתחנת עבודה
נקודת הביקורת (checkpoint) ב-FP8 שוקלת 172.78 GiB (כ-185 GB) וב-BF16 כ-335.28 GiB (כ-360 GB), מחוץ להישג יד של תחנת עבודה בודדת. לפי מתכוני vLLM, TP2 הוא המינימום המאומת ל-FP8 על GB300, TP4 מומלץ, ועל צומת 8 × H200 נדרש TEP8 כי TP8 רגיל אינו תואם את בלוקי הקוונטיזציה ברוחב 128. הפעלה דלילה חוסכת חישוב, לא אחסון. חלון ההקשר עומד על 262 144 טוקנים באופן טבעי, ניתן להרחבה למיליון עם YaRN. המודל מוגש דרך vLLM, SGLang, TokenSpeed, Transformers Serve ו-llama.cpp לגרסאות GGUF. כוונון עדין (fine-tuning) נתמך ב-Unsloth, Swift ו-LLaMA-Factory. הוא כבר מפעיל את מצב "Standard" ב-QwenWork ועובד עם Qwen Code. מצב חשיבה (thinking) מופעל כברירת מחדל עם reasoning_effort ברמות xhigh, medium או low; ההמלצה לטמפרטורה 1.0 ו-top_p 0.95 במצב חשיבה, ו-0.7 עם 0.80 במצב הוראה (instruct).
עלות אימון והסתייגויות
הצוות מדווח על עלות אימון של בערך תשיעית מזו של Qwen3.7-Plus. בהגשה מצוטטים האצות גרעין (kernel speedups) של עד פי 7.6 בפריפיל (prefill) ופי 4.9 בדיקוד (decode) במיליון טוקנים ל-QSA, בעוד ספרי הבישול של SGLang ומתכוני vLLM נוקבים בפי 10.2 ו-פי 6.6 בהתאמה, טווח שיש להתייחס אליו כמדוד-ספק עד למדידה עצמאית. עוד נטען לפי 8.6 תפוקת פריפיל מול Qwen3.7-Plus בשיעור פגיעה של 90% במטמון קידומת (prefix-cache).