אנבידיה (NVIDIA) שחררה בסוף השבוע את NVIDIA-Nemotron-Labs-Teacher-Competition-Coding

מודל מורה ייעודי לתכנות תחרותי, שפותח כחלק מצבר של יותר מעשרה מודלי מורה שמזינים את שלב ה-Multi-Teacher On-Policy Distillation (MOPD) במתכון של נמוטרון 3 אולטרה. המודל זמין כצ׳קפוינט עצמאי בהאגינג פייס מאז ה-14 באוגוסט, תחת רישיון OpenMDW-1.1 שמאפשר שימוש מסחרי ולא-מסחרי כאחד ## ארכיטקטורת LatentMoE עם Mamba-2 ו-MTP
המודל בנוי על ארכיטקטורת Latent Mixture-of-Experts (LatentMoE) היברידית, שמשלבת שכבות Mamba-2 ו-MoE לסירוגין לצד שכבות Attention נבחרות. במנגנון LatentMoE, הטוקנים מוקרנים לממד לטנטי קטן יותר לניתוב וחישוב בתוך המומחים, מה שמשפר דיוק לכל בייט. סך הפרמטרים עומד על 550 מיליארד, מתוכם 55 מיליארד פעילים בכל העברה קדימה (forward pass). בנוסף, המודל כולל שכבות Multi-Token Prediction (MTP) בעיצוב משקלים משותף בין ראשי החיזוי, שמאפשרות יצירת טוקנים מרובים בצעד הסקה בודד ומשפרות הן מהירות והן איכות.
מתכון אימון NVFP4 ופיינטון ממוקד קוד
הפרה-טריינינג בוצע במתכון NVFP4, גישה מודעת לכימות (quantization-aware) שחולקת עם משפחת נמוטרון 3, כאשר רוב השכבות הלינאריות משתמשות ב-NVFP4 למשקלים, אקטיבציות וגרדיאנטים, בעוד שכבות נבחרות (הקרנות לטנטיות, MTP, הקרנות QKV/Attention ואמבדינג) נשמרות ב-BF16 או MXFP8 ליציבות. נקודת החיתוך של הפרה-טריינינג היא ספטמבר 2025. מעליה הולבש פיינטון מפוקח (SFT) ולמידה חיזוקית (RL) ממוקדי קוד, שהפכו את תלמיד האולטרה הפוסט-מאומן למודל מורה חזק בבנצ׳מרקים של תכנות תחרותי; הפוסט-טריינינג חתוך למאי 2026.
יכולות הנמקה ושימושים מעשיים
בדומה לשאר המשפחה, המודל מגיב על ידי יצירת עקבת הנמקה (reasoning trace) לפני התשובה הסופית, ואת עומק ההנמקה ניתן לכוון דרך דגל בתבנית הצ׳אט. לפי אנבידיה, המודל מתאים במיוחד לפתרון בעיות אלגוריתמיות קשות עם אימות הרצה (execution-verified), לשמש כמורה או כמדרג (grader) בצינור זיקוק ויצירת נתונים עצמאית, ולהפקת פתרונות קוד מאומתים. השפות הנתמכות כוללות אנגלית, צרפתית, ספרדית, איטלקית, גרמנית, יפנית, קוריאנית, הינדי, פורטוגזית ברזילאית וסינית, אם כי הייעוד המרכזי נשאר אנגלית וקוד.