13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים דינה רובוטיקס משחררת מודל עולם-פעולה שפותח על מיליון שעות וידאו אנושי נמוטרון 3.5 לייטנינג נוחת בפריים אינטלקט עם תמיכה מיום אפס התפרצות כבד שומני עולמית: בינה מלאכותית עשויה להקדים תרופה למכה
מודלים

NVIDIA חושפת את Magpie TTS: מודל טקסט-לדיבור עם משקלים פתוחים ושליטה מלאה בתשתית

מאת הדר מזרחי כתב/ת AgentNet
NVIDIA חושפת את Magpie TTS: מודל טקסט-לדיבור עם משקלים פתוחים ושליטה מלאה בתשתית

צינור עיבוד הקול מורכב משלבים רבים, החל מלכידת האודיו, עבורות תעתוק דיבור-לטקסט (ASR), הרצת מודל שפה גדול (LLM), ועד ליצירת תגובה. טקסט-לדיבור (TTS) הוא השלב האחרון בתהליך וזה שהמשתמש מבחין בו מיידית. אם יצירת הדיבור איטית, כל החוויה תיתפס כאיטית. NVIDIA מציעה את Magpie TTS כדי לתת למפתחים שליטה מלאה על תקציב ההשהיה הזה ולאפשר התאמה עדינה של כל רכיב בתשתית עצמית.

ארכיטקטורה מפוצלת מול API אחד

מודלים משולבים לעיבוד קול מציעים פשטות של קריאת API אחת שמקבלת אודיו ומחזירה אודיו, אך הם מתפשרים על יכולת כיוונון עדין של כל רכיב לפי תחום העניין, החלפת מודלים משופרים כשהם מתפרסמים, אכיפת שהיית נתונים מקומית, והבנה מדויקת של מקור ההשהיה. ארכיטקטורה מדורגת (cascaded architecture) מחזיקה ברכיבי ASR, TTS ו-LLM נפרדים שעובדים יחד, ושומרת על כיוונון ופריסה עצמאיים של כל שכבה בתשתית שבבעלות המפתח. המודל החדש מבוסס על משקלים פתוחים, מוכן לייצור עם NVIDIA NIM, ותומך ב-12 שפות.

כיסוי שפות והחלפת קוד

הגרסה הנוכחית מרחיבה את הכיסוי הרב-לשוני עם ערבית תקנית מודרנית, קוריאנית ופורטוגזית ברזילאית. בנוסף, היא משפרת את האיכות בשפות קיימות רבות באמצעות נתוני אימון מעודכנים ושיפורי מודל. Magpie TTS Multilingual הוא מודל בעל 364 מיליון פרמטרים התומך בשפות נוספות כמו אנגלית, ספרדית, צרפתית, גרמנית, איטלקית, וייטנאמית, מנדרינית, הינדית ויפנית. כל שפה כוללת קולות דוברים זכרים ונקבות באמצעות ייצוג דובר רב-לשוני משותף. הגרסה משפרת גם את הגמישות עם תמיכה מורחבת בהחלפת קוד (code-switching) להינדית ויפנית, באמצעות עיבוד פונמות IPA ומילוני הגייה מותאמים אישית, מה שמקל על הגיית שמות, מונחים טכניים ותוכן מעורב בשפות.

השהיה בפריסה מקומית

במערכות AI שיחתיות, ההשהיה עד לאודיו הראשון (TTFA) היא המדד הקריטי ביותר בצינור הקולי. מכיוון שניתן לפרוס את Magpie TTS בתוך הסביבה הפנימית של הארגון, ההשהיית השרת שנמדדת היא זו שבשליטה מלאה של המפתח, ללא זמן תעבורה הלוך ושוב לשירות מנוהל. על פי תיעוד הביצועים של NVIDIA TTS NIM (גרסה 26.07), המבוסס על ממוצע של שלושה ניסויים בסביבה מקומית, המודל משיג TTFA של 32 מילישניות על מעבד B200. המקור לא מציין נתוני השוואה למודלים אחרים או מדדי תפוקה (RTFX) מלאים.

מקור: huggingface.co