קוון (Qwen) של עליבאבא משתלט על צמרת מודלי הדיבור-לדיבור, אבל GPT-Live-1 של OpenAI עדיין במשחק בדינמיקה שיחתית

Artificial Analysis פרסמה את המדד המקיף הראשון למודלי Speech-to-Speech, וקוון אודיו 3.0 רילטיים פלוס (Qwen Audio 3.0 Realtime Plus) מסיים ראשון בשתי הקטגוריות המרכזיות: חשיבה קולית (Speech Reasoning) ודינמיקה שיחתית (Conversational Dynamics). הבדיקה הקיפה 36 מודלים בבנצ'מרק Big Bench Audio ו-30 מודלים ב-Full Duplex Bench, כשחלק מהתוצאות מתבססות על הרצה בודדת בלבד, מה שמחייב לקרוא את המספרים בזהירות.
מה נבדק ואיך
שני הבנצ'מרקים מודדים דברים שונים בתכלית. Big Bench Audio בודק אם המודל מבין שאלות חשיבה שמוגשות כאודיו ועונה נכון, מעין MMLU לגרסה המדוברת. Full Duplex Bench בוחן התנהגות שיחה אמיתית: מתי לדבר, מתי לשתוק בהפסקות, איך להגיב לקטיעות, ואיך לזהות בק-צ'אנלים כמו "כן" או "המממ". מודל יכול להצטיין באחד ולהיכשל בשני, והמדד החדש חושף בדיוק את הפערים האלה.
טבלת ההיגיון הקולי
בצד החשיבה, קוון אודיו 3.0 רילטיים פלוס מוביל עם 99.2%, ואחריו קוון 3.5 אומני פלוס רילטיים (98.7%) וסטפ-אודיו R1.1 רילטיים (97.6%). גרוק וויס ת'ינק פאסט 2.0 היי (Grok Voice Think Fast 2.0 High) סוגר את החמישייה עם 97.2%. הפערים בצמרת זעירים, פחות משתי נקודות אחוז בין מקום ראשון לחמישי, מה שמרמז שהבנצ'מרק מתקרב לתקרה, או שהמודלים המובילים כבר פותרים את רוב המבחן.
דינמיקה שיחתית וזמן תגובה
כאן התמונה משתנה. קוון אודיו 3.0 רילטיים פלוס עדיין ראשון עם 98.4%, אבל GPT-Live-1 בגרסת סול (Sol, low) נושף בעורפו עם 97.3%, הישג מרשים למודל שנבדק בהרצה בודדת בלבד. קוון אודיו 3.0 רילטיים פלאש (Flash) שלישי עם 96.9%, ואחריו GPT-Realtime-2 מינימל (96.1%) ו-GPT-Realtime-2.1 היי (95.7%). בזמן תגובה ראשוני (Time to First Audio), דיפסלייט אופאל (Deepslate Opal) מוביל עם 0.44 שניות, ג'מיני 2.5 פלאש נייטיב אודיו דיאלוג (Gemini 2.5 Flash Native Audio Dialog) שני עם 0.63 ש', וגרוק וויס ת'ינק פאסט 2.0 היי שלישי עם 0.70 ש'.
מחיר, טריד-אוף והערות אזהרה
בצד העלות, קוון אודיו 3.0 רילטיים פלוס הוא הזול ביותר, 0.0331 דולר לשעת אודיו נכנס (כ-0.12 שקל), ואחריו סטפ-אודיו R1.1 רילטיים ב-0.064 דולר (כ-0.23 שקל) וקוון 3.5 אומני פלאש רילטיים ב-0.162 דולר (כ-0.59 שקל). הגרפים של Artificial Analysis מראים מתאם ברור: המודלים הזולים גם מהירים וגם חזקים בחשיבה, אבל הדינמיקה השיחתית לא בהכרח הולכת יד ביד עם הציון בבנצ'מרק החשיבה. וחשוב לזכור: GPT-Live-1 על שתי גרסאותיו, כמו גם GPT-Realtime-2 ו-2.1, נבדקו בהרצה אחת או שתיים בלבד, מדגם קטן מכדי להסיק מסקנות יציבות.