עליבאבא משיקה את Qwen-Audio-3.1-Realtime, מודל קול דו-כיווני שמחליט מתי לדבר

מה מגיע בענן
צוות Qwen של עליבאבא שחרר חבילה של חמישה מודלי אודיו שמכסים זיהוי דיבור, סינתזה ואינטראקציה בזמן אמת. הדגם המרכזי, Qwen-Audio-3.1-Realtime, בנוי כסוכן קולי שתומך בקריאות פונקציות (function calling) ופועל במודל דו-כיווני מלא (full-duplex), כלומר הוא יכול להקשיב ולדבר בו-זמנית, ולהחליט בעצמו מתי להפסיק להקשיב ומתי להתחיל לענות. השירות זמין כ-API מנוהל על QwenCloud דרך WebSocket, בלי משקולות פתוחות בשלב זה. חלון ההקשר עומד על 262 אלף טוקנים (כ-245 אלף קלט מרבי, 16 אלף פלט), עם מגבלות ברירת מחדל של 60 בקשות ו-100 אלף טוקנים לדקה.
ארכיטקטורה: שני מודלים מאחורי קול אחד
המערכת מריצה שני מודלים שחולקים את אותו מקודד אודיו (Audio Encoder) ועיצוב LLM. מודל החלטה דו-כיווני חוזה אם להמשיך להקשיב, לדבר, לעצור או לחזור להקשיב; מודל דיבור-לטקסט כותב את תוכן התשובה כטקסט; ומרנדר קולי מודע-הקשר הופך את הטקסט הזה לדיבור זורם תוך התחשבות בהיסטוריית השיחה, רמזים קוליים והקשר אקוסטי. לצד הדגם הראשי מושק גם Qwen-Audio-3.1-ASR-Flash-Filetrans, מודל נלווה לתמלול אודיו ארוך במצב לא מקוון, עם תמיכה במילים חמות, הפרדת דוברים, פיסוק וזיהוי ניבים סיניים לצד רב-לשוניות.
אימון בשלוש שכבות
הפיתוח מאורגן בשלוש שכבות: Think, Act, ו-Speak and Coordinate. בשכבת Think מיושמת שיטת M²-OPD, זיקוק מדיניות על-מדיניות (on-policy distillation) שבו מורה טקסט ומודל אודיו קפוא מדרגים כל טוקן של התלמיד, ולא מחקים תשובות כתובות מראש; מומחי תחום לאמפתיה, כוונה פרגמטית וסצנות אקוסטיות מאומנים ב-GRPO ומתמזגים למודל אחד פריס. בשכבת Act כל תחום אימון מגיע עם מאגר כלים, מסד נתונים JSON עם מצב, ומדיניות עסקית בשפה טבעית; המשימות מוגדרות ככתיבה, סירוב מנומק, או בקשה לא נתמכת, והניקוד בודק מצב סופי לפני שפה רהוטה. אימון החיפוש קיצץ את ממוצע השאילתות לקריאה מ-4.37 ל-1.05, במחיר ירידה קלה ב-F1 של ההפעלה (מ-60.87% ל-58.61%).
ביצועים ומחירים
בשכבת Speak and Coordinate נמדדו שיפורים ניכרים: בבנצ'מרק Full-Duplex-Bench v1.5 ירד שיעור התגובות כשהאדם מדבר עם מישהו אחר מ-0.13 ל-0.03, וב-v3.0 צנח קצב מילות המילוי מ-0.759 ל-0.296. יש מחיר: שיעור החזרה לא רצויה אחרי הפרעה עלה מ-0.035 ל-0.130, וזמן העצירה בהפרעה עומד על 1.116 שניות, לעומת 0.383 שניות ב-GPT-Realtime-2. בבנצ'מרקים כלליים: Audio MultiChallenge עלה מ-47.12 ל-52.21, ממוצע BBA ב-14 שפות טיפס מ-81.7% ל-88.1%, ו-WER של FLEURS ירד מ-9.01 ל-3.98. נתוני τ-Voice מבוססים על התאמה חצי-דו-כיוונית ואינם בני-השוואה לתוצאות דו-כיווניות רשמיות; במבחן רד-טים אנושי של 50 סשנים GPT-Realtime-2 עדיין מוביל 96% מול 92%. תמחור: 6.4 דולר למיליון טוקני אודיו קלט (כ-23 שקל), 0.8 דולר למיליון טוקני טקסט קלט (כ-3 שקל), 24 דולר למיליון טוקני פלט (כ-88 שקל), טקסט פלט לא מחויב. מודל התמלול עולה 0.15 דולר קלט ו-0.47 דולר פלט למיליון טוקנים (כ-0.55 ו-1.7 שקל בהתאמה). המחירים נבדקו ב-28 בספטמבר 2026; קצבי טוקניזציה שונים בין ספקים מקשים על השוואה ישירה.