13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים דינה רובוטיקס משחררת מודל עולם-פעולה שפותח על מיליון שעות וידאו אנושי נמוטרון 3.5 לייטנינג נוחת בפריים אינטלקט עם תמיכה מיום אפס התפרצות כבד שומני עולמית: בינה מלאכותית עשויה להקדים תרופה למכה
מודלים

NVIDIA משיקה את Nemotron 3.5 Lightning: מודל MoE של 30B עם 3B פרמטרים פעילים לסוכנים מהירים

מאת הדר מזרחי כתב/ת AgentNet
NVIDIA משיקה את Nemotron 3.5 Lightning: מודל MoE של 30B עם 3B פרמטרים פעילים לסוכנים מהירים

ארכיטקטורה רזה לביצוע מסיבי

Nemotron 3.5 Lightning הוא מודל MoE (Mixture of Experts) פתוח בגודל 30 מיליארד פרמטרים, שמפעיל רק 3 מיליארד מהם בכל העברה קדימה (forward pass). המטרה המוצהרת: להריץ סוכנים (agents) שעובדים סביב השעון וצריכים להשלים המון משימות ייעודיות בזמן קצר. לפי NVIDIA, המודל מספק עד פי 4 מהירות פלט (output speed) בהשוואה למודלים בגודל דומה, טענה שמתייחסת לקצב יצירת טוקנים, לא לאיכות התשובות.

בנצ'מרק PinchBench: מהירות מול דיוק

במבחן PinchBench, שמדמה עומסי עבודה של סוכנים עם 10,000 משימות, Lightning הגיע ל-86% דיוק והשלים את הסט כולו 35% מהר יותר מ-Qwen3.6 35B ברמת דיוק דומה. חשוב לציין: PinchBench אינו בנצ'מרק סטנדרטי בתעשייה כמו MMLU או HumanEval, והוא בודק ספציפית תרחישי tool-calling ואימות תוצאות, בדיוק סוג העבודה ש-NVIDIA מכוונת אליה. ההשוואה ל-Qwen3.6 35B רלוונטית כי שניהם יושבים באותה קטגוריית גודל פריסה.

התמחות דרך פוסט-אימון עם NeMo

המודל תוכנן לעבור התמחה (post-training) באמצעות NVIDIA NeMo על דאטה, כלים, תהליכי עבודה ומדיניות של תחום ספציפי. NVIDIA מדווחת ששיפורי דיוק נמדדו במשימות סייבר, קוד, משפטים ואנרגיה, ארבעה ורטיקלים שבהם סוכנים מבצעים הרבה קריאות כלי (tool calls), ולידציה והאצלת משימות. זהו לב הקייס: סוכנים ארוכי-חיים מבלים את רוב זמנם בביצוע (execution), לא בתכנון, ו-Lightning מכוון בדיוק לשלב הזה.

פריסה: מ-DGX Spark ועד דאטה סנטר

הגודל הפעיל הקטן (3B) מאפשר להריץ את המודל על כל דבר, החל מתחנת עבודה NVIDIA DGX Spark (לשעבר Project DIGITS) ועד אשכולות דאטה סנטר מלאים. NVIDIA לא פרסמה דרישות VRAM מדויקות או מדדי השהיה (latency) בקונפיגורציות שונות, אז קשה להעריך את עלות הפריסה בפועל מול חלופות כמו Llama-3.1-8B או Qwen2.5-7B שגם הן רצות על חומרה צנועה יחסית.

ניתוב מודלים עם NeMo Switchyard

לצד המודל, NVIDIA משחררת את NeMo Switchyard, ספריית קוד פתוח לניתוב (routing) בין מודלים. הרעיון: להשתמש במודלי חזית (frontier models) גדולים ויקרים לתכנון וחשיבה מורכבת, ולהעביר את הביצוע המסיבי והייעודי ל-Lightning. זו גישה של "המודל הנכון למשימה הנכונה" שמתחילה לקבל תאוצה בארכיטקטורות סוכנים, אבל Switchyard עדיין בגרסה ראשונית ולא ברור כמה גמיש מנגנון הניתוב שלה בפועל, למשל, האם הוא תומך בניתוב דינמי לפי הקשר שיחה או רק לפי כלל קבוע מראש.