24 בספטמבר 2026 האקדמיה ארכיון
מבזקים
NVIDIA משיקה את Nemotron 3 Diarization, מודל זיהוי דוברים שמוביל את הבנצ'מרק כותרת: ציוץ ויראלי טען שאלטמן ואמודאי מופיעים ראשונים בתודות של "סופר-אינטליגנציה", ארכיון הספר מוכיח אחרת גוגל משיקה את ג'מיני 3.8 פלאש TTS ופלאש-לייט TTS עם עיצוב קול מבוסס פרומפט אנתרופיק מאיצה פי 1.5, לפי מדידה של METR טראמפ ושי מכינים קו חם לבינה מלאכותית, אבל ההסכם עוד רחוק
מוצרים

גוגל משיקה את ג'מיני 3.8 פלאש TTS ופלאש-לייט TTS עם עיצוב קול מבוסס פרומפט

גוגל משיקה את ג'מיני 3.8 פלאש TTS ופלאש-לייט TTS עם עיצוב קול מבוסס פרומפט

שני מסלולים, אותה שליטה

גוגל שחררה אמש שני מודלי טקסט-לדיבור חדשים במשפחת ג'מיני אודיו: ג'מיני 3.8 פלאש TTS שמיועד לכיוון קריאייטיבי עמוק ולעיצוב דמויות, וג'מיני 3.8 פלאש-לייט TTS שמכוון לנפח גבוה בעלות נמוכה. שניהם זמינים כבר עכשיו דרך ה-API של ג'מיני ובגוגל AI סטודיו, בגישה API-בלבד, אין משקולות פתוחות להרצה עצמית, וגישה ארגונית דרך ג'מיני אנטרפרייז מסומנת כ"בקרוב". המזהים במגרש המשחקים של AI סטודיו הם gemini-3.8-flash-tts ו-gemini-3.8-flash-lite-tts.

מעיצוב קול ידני לגנרטיבי

עד עכשיו הציעה גוגל 30 קולות מקוריים בלבד. הגרסה החדשה עוברת למערכת גדולה בהרבה: פלאש TTS יודע לייצר קולות חדשים מפרומפט שמתאר תפקיד, מבטא ומאפיינים קוליים, וזה עובד במעל 100 שפות וניבים. הדגמות של החברה כוללות די-ג'יי ממלבורן, רובוט מונוטוני ודרקון יפני. למפתחים זמינה ספרייה של יותר מ-2,000 קולות מוכנים להפקה, עם כיסוי אזורי כמו ספרדית מקסיקנית, צרפתית קוויבקית ואנגלית סקוטית. קולות מותאמים אפשר לשמור ולשחזר עם דריפט מינימלי בין פרויקטים, ויכולת רימיקס, התאמת טימבר, פיץ', קצב ומבטא של קול מהספרייה דרך פרומפט, מסומנת כ"בקרוב".

בימוי ביצוע מתוך התסריט

שני המודלים מקבלים הוראות בימוי שנכתבות ישירות בתוך הטקסט, וג'מיני יודע גם לכוון את ההגשה מרמזים טבעיים בתסריט. האיכות הקולית, הקצב והטימבר נשמרים לאורך שעות של אודיו רציף. יש תמיכה טבעית בשני דוברים: תסריט יחיד מניע שיחה מרובת תורות עם קולות מופרדים ומובחנים. פרצי קול לא-מילוליים כמו <laughs>, <sigh> ו-<gasp> מוסיפים טקסטורה שיחתית, ובקצ'אנלינג, קריאות הקשבה אקטיביות כמו |mhm| ו-|yeah|, שולט על תזמון תגובות וקומדיה.

שכפול קול עם מנגנוני הסכמה

שכפול קול בונה פרופיל ווקאלי עקבי מדגימה של 30 שניות. הדגימה חייבת להיות של הדובר עצמו או קול שיש למבקש זכויות בו, והתהליך דורש הקלטת הסכמה מילולית מבעל הקול, שמותאמת מול הדובר המקורי. כל קטע שיוצא ממודלי ג'מיני אודיו נושא סימן מים SynthID, חותמת בלתי מורגשת שמוטמעת ישירות באודיו. קולות משוכפלים נושאים גם תעודות תוכן C2PA. גוגל מפנה לכרטיס המודל של ג'מיני 3.8 אודיו לגישה הרחבה יותר לבטיחות.

תוצאות בנצ'מרק: מובילים בטבלאות

לפי הנתונים שגוגל מפרסמת, פלאש TTS מדורג ראשון כללי בבנצ'מרק עיצוב קול של יום AI (Hume AI) עם ציון 71.4, ומוביל גם במידול מבטאים עם 60.8. במדד האיכות הכללי של יום AI, פלאש TTS ראשון ופלאש-לייט TTS שני. בזירת ההעדפה העיוורת Voice Arena, שני המודלים תופסים את המקומות הראשונים ביפנית, פורטוגזית ברזילאית, וייטנאמית, ערבית מודרנית תקנית, ספרדית מקסיקנית והינדי.

מקור: marktechpost.com