21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מוצרים

vLLM מוסיף תמיכת Day-0 ל-Intern-S2-397B של שנגחאי AI Lab

vLLM מוסיף תמיכת Day-0 ל-Intern-S2-397B של שנגחאי AI Lab

המודל החדש של מעבדת הבינה המלאכותית של שנגחאי נוחת ב-vLLM בגרסה 0.22.1 עם הבטחה לסוכנים מדעיים ארוכי-טווח, אבל המפרט חושף שמדובר במכונה שדורשת חומרה רצינית: 397 מיליארד פרמטרים כוללים, 17 מיליארד פעילים בלבד, פרוסים על 512 מומחים בארכיטקטורת MoE של Qwen3.5.

ארכיטקטורה וחומרה

המודל רץ על חלון הקשר של 262 אלף טוקנים עם ראש MTP משותף-משקלים לפענוח ספקולטיבי, ותמיכה מולטימודלית בתמונות ווידאו. נקודת הביקורת הרשמית ב-FP8 (internlm/Intern-S2-397B-FP8) חותכת את טביעת הזיכרון בחצי, והיא הקונפיגורציה שהיצרן מאמת. להרצה ב-FP8 תצטרכו 8 כרטיסי H100 או H200; ל-BF16 נדרשים 8 כרטיסי H200 של 141 ג'יגה-בייט כל אחד, לא בדיוק ציוד שיש בכל מעבדה.

פריסה וגרעיני MoE

מדריך הפריסה הרשמי מכבה את DeepGEMM (VLLM_USE_DEEP_GEMM=0) ובוחר אוטומטית את בקנד FlashInfer TRTLLM MoE על אנבידיה. נדרש trust-remote-code כי המאגר מגיע עם טוקנייזר מותאם (InternS1Tokenizer). הפקודה המומלצת כוללת tensor-parallel-size 8, פארסר חשיבה של qwen3, ופארסר קריאות כלים qwen3_coder, הגדרות שמכוונות ישירות למשימות סוכן וקוד.

חלון הקשר ארוך במיוחד

הקונפיגורציה הבסיסית קובעת max_position_embeddings = 262,144. עם YaRN RoPE override בגורם 4.0 אפשר למתוח את --max-model-len עד 1,010,000 טוקנים. המדריך מזהיר: YaRN סטטי מחזיק את גורם הסקיילינג קבוע בלי קשר לאורך הקלט, אז אל תפעילו אותו אלא אם אתם באמת מגישים פרומפטים ארוכים; לעומס של ~524 אלף טוקנים אפשר להוריד את הגורם ל-2.0.

מגבלות ושימוש מעשי

חשיבה (thinking mode) מופעלת כברירת מחדל, וכרטיס המודל מבקש לא לכבות אותה במשימות סוכניות. פרמטרי הדגימה המומלצים: temperature 0.8, top_p 0.95, top_k 50, min_p 0.0, עם max_tokens עד 32,768. נקודה שחשוב לציין: הסקה על סדרות זמן קיימת כרגע רק ב-LMDeploy, לא ב-vLLM. אם נתקלתם ב-OOM ב-262 אלף טוקנים, ההמלצה היא להוריד max-model-len ל-65,536 או 131,072, או להקטין את gpu-memory-utilization.