vLLM מוסיף תמיכת Day-0 ל-Intern-S2-397B של שנגחאי AI Lab

המודל החדש של מעבדת הבינה המלאכותית של שנגחאי נוחת ב-vLLM בגרסה 0.22.1 עם הבטחה לסוכנים מדעיים ארוכי-טווח, אבל המפרט חושף שמדובר במכונה שדורשת חומרה רצינית: 397 מיליארד פרמטרים כוללים, 17 מיליארד פעילים בלבד, פרוסים על 512 מומחים בארכיטקטורת MoE של Qwen3.5.
ארכיטקטורה וחומרה
המודל רץ על חלון הקשר של 262 אלף טוקנים עם ראש MTP משותף-משקלים לפענוח ספקולטיבי, ותמיכה מולטימודלית בתמונות ווידאו. נקודת הביקורת הרשמית ב-FP8 (internlm/Intern-S2-397B-FP8) חותכת את טביעת הזיכרון בחצי, והיא הקונפיגורציה שהיצרן מאמת. להרצה ב-FP8 תצטרכו 8 כרטיסי H100 או H200; ל-BF16 נדרשים 8 כרטיסי H200 של 141 ג'יגה-בייט כל אחד, לא בדיוק ציוד שיש בכל מעבדה.
פריסה וגרעיני MoE
מדריך הפריסה הרשמי מכבה את DeepGEMM (VLLM_USE_DEEP_GEMM=0) ובוחר אוטומטית את בקנד FlashInfer TRTLLM MoE על אנבידיה. נדרש trust-remote-code כי המאגר מגיע עם טוקנייזר מותאם (InternS1Tokenizer). הפקודה המומלצת כוללת tensor-parallel-size 8, פארסר חשיבה של qwen3, ופארסר קריאות כלים qwen3_coder, הגדרות שמכוונות ישירות למשימות סוכן וקוד.
חלון הקשר ארוך במיוחד
הקונפיגורציה הבסיסית קובעת max_position_embeddings = 262,144. עם YaRN RoPE override בגורם 4.0 אפשר למתוח את --max-model-len עד 1,010,000 טוקנים. המדריך מזהיר: YaRN סטטי מחזיק את גורם הסקיילינג קבוע בלי קשר לאורך הקלט, אז אל תפעילו אותו אלא אם אתם באמת מגישים פרומפטים ארוכים; לעומס של ~524 אלף טוקנים אפשר להוריד את הגורם ל-2.0.
מגבלות ושימוש מעשי
חשיבה (thinking mode) מופעלת כברירת מחדל, וכרטיס המודל מבקש לא לכבות אותה במשימות סוכניות. פרמטרי הדגימה המומלצים: temperature 0.8, top_p 0.95, top_k 50, min_p 0.0, עם max_tokens עד 32,768. נקודה שחשוב לציין: הסקה על סדרות זמן קיימת כרגע רק ב-LMDeploy, לא ב-vLLM. אם נתקלתם ב-OOM ב-262 אלף טוקנים, ההמלצה היא להוריד max-model-len ל-65,536 או 131,072, או להקטין את gpu-memory-utilization.