27 בספטמבר 2026 האקדמיה ארכיון
מבזקים
סוכני OpenAI הריצו 16 אלף בקשות לאתר האו"ם בניסיון לעקוף מגבלות גישה סין התקינה יותר רובוטים תעשייתיים ב-2025 משאר העולם יחד מאמר חדש מציע מפת דרכים לשיפור עצמי רקורסיבי של בינה מלאכותית מודל 340 מיליון פרמטרים רץ על GPU של טלפון, עם זהות מספרית למודל הייחוס גוגל בודקת רכישה ישירה מפליפקארט דרך ג'מיני ו-AI Mode בהודו
מודלים

NVIDIA משיקה את Nemotron 3.5 Lightning: מודל היברידי Mamba-MoE עם 3 ביליון פרמטרים פעילים

NVIDIA משיקה את Nemotron 3.5 Lightning: מודל היברידי Mamba-MoE עם 3 ביליון פרמטרים פעילים

NVIDIA שחררה אתמול את Nemotron 3.5 Lightning, מודל שפה במשקל 30 ביליון פרמטרים כולל, שמפעיל רק 3 ביליון בכל העברה קדימה (forward pass). הארכיטקטורה היברידית: שכבות Mamba-2 ו-MoE לסירוגין, בתוספת שכבות Attention נבחרות. המודל מגיע עם משקולות, נתוני אימון ומתכוני אימון (recipes) תחת רישיון OpenMDW-1.1, וזמין להורדה מיידית ב-Hugging Face. NVIDIA מגדירה אותו כמוכן לשימוש מסחרי.

ארכיטקטורה: Mamba-2 פוגש MoE

הבחירה ב-Mamba-2 לצד MoE אינה מקרית. Mamba-2 מציע סיבוכיות ליניארית באורך ההקשר, בעוד MoE שומר על עלות הסקה קבועה דרך הפעלה דלילה של מומחים. השילוב נועד לתת חלון הקשר ארוך בלי לשלם ריבועית ב-attention. NVIDIA מוסיפה גם Multi-Token Prediction (MTP), חיזוי כמה טוקנים קדימה בכל צעד, כדי להאיץ יצירת טקסט ספקולטיבית. הנתונים הטריים ביותר באימון: קדם-אימון עד ספטמבר 2025, פוסט-אימון עד מאי 2026.

בנצ'מרקים: נמדדו ב-NeMo Gym, לא בדיווח עצמי

NVIDIA מדווחת תוצאות על סוויטה רחבה, ידע והסקה, הוראות, קוד, סוכנים (agentic), שימוש בכלים, והקשר ארוך, כולן נמדדו בהרתמה (harness) אחידה של NeMo Gym / NeMo Evaluator SDK. החברה מציינת במפורש שהמספרים עשויים להשתנות ממספרי היצרנים עצמם, ומפרסמת את מתכוני ההערכה המלאים לשחזור. תוצאות SWE-Bench Verified ו-Terminal-Bench 2.1 כלולות גם הן. כל המספרים מתייחסים לצ'קפוינט NVFP4 הרשמי בלבד.

פריסה מעשית: מכוון ל-DGX Spark עם vLLM

מדריך ההפעלה המהיר מכוון ישירות ל-DGX Spark (שבב GB10) עם vLLM nightly. המתכון כולל: backend מסוג Marlin ל-MoE, מטמון KV ב-FP8, קידוד קידומות (prefix caching), פענוח ספקולטיבי עם 3 טוקנים, backend של FlashInfer ל-Mamba, ו-parsers ייעודיים להסקה (nemotron_v3) ולקריאות כלים (qwen3_coder). NVIDIA מספקת גם צ'קפוינט ייעודי ל-DSpark speculative decoding. בקיצור: המודל תוכנן מראש להרצה יעילה על חומרת NVIDIA העדכנית.

רישיון ושפות: OpenMDW-1.1, תמיכה רב-לשונית

הרישיון OpenMDW-1.1 מאפשר שימוש מסחרי, פרט חשוב לצוותים שבונים מוצרים. המודל מיועד לאנגלית ושפות קוד, עם תמיכה מוצהרת בספרדית, צרפתית, גרמנית, איטלקית ויפנית. הייעוד המוצהר: מערכות סוכני AI, צ'טבוטים, RAG, ויישומי AI כלליים. נותר לראות איך הביצועים בפועל משתווים למודלים פתוחים מקבילים (Qwen3, Llama 3.3) כשהקהילה תריץ הערכות עצמאיות מחוץ להרתמה של NVIDIA.