24 בספטמבר 2026 האקדמיה ארכיון
מבזקים
NVIDIA משיקה את Nemotron 3 Diarization, מודל זיהוי דוברים שמוביל את הבנצ'מרק כותרת: ציוץ ויראלי טען שאלטמן ואמודאי מופיעים ראשונים בתודות של "סופר-אינטליגנציה", ארכיון הספר מוכיח אחרת גוגל משיקה את ג'מיני 3.8 פלאש TTS ופלאש-לייט TTS עם עיצוב קול מבוסס פרומפט אנתרופיק מאיצה פי 1.5, לפי מדידה של METR טראמפ ושי מכינים קו חם לבינה מלאכותית, אבל ההסכם עוד רחוק
מוצרים

NVIDIA משיקה את Nemotron 3 Diarization, מודל זיהוי דוברים שמוביל את הבנצ'מרק

NVIDIA משיקה את Nemotron 3 Diarization, מודל זיהוי דוברים שמוביל את הבנצ'מרק

המודל והנתונים הטכניים

NVIDIA שחררה את Nemotron 3 Diarization, מודל זיהוי דוברים (speaker diarization) שמזהה מי דיבר ומתי גם כשקולות חופפים, תומך בעד שמונה דוברים ומגיע עם 100 מיליון פרמטרים בלבד. המודל זמין כבר עכשיו ב-Hugging Face.

תוצאות הבנצ'מרק

בבנצ'מרק Diarization-Bench של voicearena_ai דורג המודל במקום הראשון מתוך 12 מערכות, עם שיעור שגיאה של 14.72%, נמוך בכ-24% מהמקום השני. הפער הזה בולט במיוחד בהתחשב בגודל הקומפקטי של המודל.

למה זה משנה בשטח

זיהוי דוברים בתנאי חפיפה (overlapping speech) נחשב לאתגר קשה בתחום עיבוד הדיבור; רוב המערכות מתפרקות כששניים מדברים יחד. Nemotron 3 מצליח לשמור על עקביות גם בסצנריו של ארבעה דוברים בו-זמנית, כפי שהדגימה ההשוואה שפורסמה בבנצ'מרק.

זמינות ומגבלות

הזמינות ב-Hugging Face מאפשרת למפתחים לשלב את המודל בפייפליינים של תמלול, ניתוח שיחות וכלי נגישות בלי להרים תשתית אימון משלהם. עם 100M פרמטרים הוא קל מספיק לריצה על GPU בודד, מה שמוריד את חסם הכניסה לצוותים קטנים. התוצאות מגיעות מגרסה ראשונית של הבנצ'מרק, ו-NVIDIA לא פרסמה מדדי ביצועים נוספים כמו זמן השהיה או צריכת זיכרון בפריסה מעשית, שווה לעקוב אחרי הרצות עצמאיות לפני שמבססים על זה פרודקשן.