21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מחקר

גראדיום משיקה את Voice Design: תיאור טקסטואלי הופך לקול סינתטי חדש בשניות

גראדיום משיקה את Voice Design: תיאור טקסטואלי הופך לקול סינתטי חדש בשניות

הסטארט-אפ הפריזאי גראדיום (Gradium), שיצא ממעבדת המחקר קיוטאי (Kyutai), שחרר יכולת שמאפשרת ליצור קולות חדשים לגמרי מתוך פרומפט כתוב, בלי הקלטת רפרנס, בלי דובר אנושי ובלי צורך לנקות זכויות שימוש. הכלי זמין כבר עכשיו ב-API ובסטודיו של החברה, בחינם בכל התוכניות כולל החינמית, וקול שנשמר רץ על אותו נקודת קצה של TTS בסטרימינג כמו כל קול מהקטלוג, באותה השהייה ואותם פורמטים.

איך זה עובד

התיאור הוא הקלט היחיד שהמודל מקבל. התיעוד של גראדיום מפרט את המאפיינים שהוא מגיב אליהם, מגדר, רצועת גיל, מבטא או מוצא, גובה צליל, קצב, אנרגיה, טימבר ורזוננס, רג'יסטר ואופי, והתפקיד שהקול ממלא. הטקסט יכול להיות באורך 1 עד 500 תווים באנגלית, צרפתית, ספרדית, פורטוגזית או גרמנית; בחברה ממליצים לסיים בשימוש המיועד, כי זה מכוון את ההגשה והרג'יסטר ולא רק את "צבע" הקול. בקשה אחת מחזירה 1 עד 5 מועמדים, בדרך כלל תוך 3 עד 5 שניות; הם וריאציות על אותה דמות, אז דמות שונה דורשת תיאור חדש, לא עוד דגימות.

מהמועמד לקול בייצור

הזרימה מורכבת מארבע קריאות: POST ל-/voice-generator/generate מייצר מזהי מועמדים עם ready: false, GET ל-/voice-generator/embeddings בודק עד שהם מתהפכים, כל מועמד נבחן דרך נקודת ה-TTS הרגילה עם המזהה שלו כ-voice_id, ו-POST ל-/voices/from-embedding מקדם את הנבחר. למועמדים יש שלוש מגבלות שאין לקולות מומרים: טקסט אודישן מוגבל ל-100 תווים, הם זמינים רק ב-REST, וה-WebSocket וה-Speech-to-Speech דוחים אותם. מועמדים שלא הומרו נמחקים אחרי 30 יום. ההמרה חינמית, מסירה את התפוגה וצורכת סלוט קול מותאם אישית שמשותף לקלונים, 5 בתוכנית החינמית, 1,000 בתשלום. הדגימה מכוונת להיות לא-דטרמיניסטית: הצוות מרחיב את התיאור קודם, וההרחבה משתנה בין בקשות, כך שאותו פרומפט עם זרע קבוע עדיין יניב קול שונה.

המבחן העיוור והמספרים

גראדיום הריצה מבחן האזנה עיוור בזוגות על פרומפטים של מבטאים מול חמש מערכות Voice Design אחרות נגישות ב-API ציבורי וחמש שפות. דוברי שפת אם שמעו שני קליפים לא מסומנים ובחרו את ההתאמה הקרובה יותר, או תיקו. מתוך 7,627 השוואות, החברה מדווחת על 72.6% ניצחונות מול השדה, 13.6 נקודות מעל ElevenLabs עם eleven_ttv_v3 ב-59.0%, ואחריהן Inworld ב-44.8%, Fish Audio ב-36.7% ו-MiniMax ב-31.7%. שיעור ניצחון מחושב כניצחונות ועוד חצי מהתיקו, כך ש-50% זה קו הבסיס. גראדיום הגיעה ראשונה בכל חמש השפות. הפערים הכי גדולים הופיעו במבטאים אזוריים שרוב הקטלוגים משטיחים: צרפתית קוויבקית 97%, ספרדית ריופלטנסית 86%, גרמנית בווארית 85%, ספרדית קולומביאנית ופורטוגזית אפריקאית 83% כל אחת.

שופט מודל ואמת מידה אקדמית

שופט מבוסס מודל על אותה קבוצת פרומפטים הסכים. Gemini 3.1 Pro דירג קליפים בודדים לא מסומנים מ-1 עד 5 והפיק את אותו דירוג: גראדיום 4.06, ElevenLabs 3.86, Inworld 3.64, Fish Audio 3.51. בנפרד, עמוד המוצר טוען ל-83.4% ציות לפרומפט בפיצול האנגלי של InstructTTSEval, הבנצ'מרק האקדמי למעקב הוראות ב-TTS. הסייג החשוב: כל המספרים האלה תוכננו והורצו על ידי הספק עצמו.

מקור: marktechpost.com