21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

קואן (Qwen) כובש את טבלאות הדיבור-לדיבור: מוביל גם בחשיבה וגם בדינמיקה שיחתית

קואן (Qwen) כובש את טבלאות הדיבור-לדיבור: מוביל גם בחשיבה וגם בדינמיקה שיחתית

המבחן המקיף ביותר עד כה למודלי דיבור-לדיבור (Speech-to-Speech) מציב את קואן (Qwen) של עליבאבא בפסגה כפולה: המקום הראשון בחשיבה קולית (Speech Reasoning) עם 99.2% ב-Big Bench Audio, והמקום הראשון בדינמיקה שיחתית (Conversational Dynamics) עם 98.4% ב-Full Duplex Bench. Artificial Analysis, שפרסמה את המדד, בחנה 33 מודלים על חשיבה ו-27 על דינמיקה, וקואן אודיו 3.0 רילטיים פלוס (Qwen Audio 3.0 Realtime Plus) לוקח את שני התארים בלי להתאמץ.

חשיבה קולית: קואן משאיר אבק למתחרים

ב-Big Bench Audio, שבודק אם מודל מסוגל להבין ולענות על שאלות חשיבה שמוגשות כאודיו, הפער בצמרת זעיר אבל עקבי: קואן 3.5 אומני פלוס רילטיים (Qwen3.5 Omni Plus Realtime) שני עם 98.7%, סטפ-אודיו R1.1 (Step-Audio R1.1 Realtime) שלישי עם 97.6%. גרוק וויס ת'ינק פאסט 2.0 היי (Grok Voice Think Fast 2.0 High) ו-1.0 סוגרים את החמישייה עם 97.2% ו-97.1% בהתאמה. המספרים מלמדים שהמרחק בין המקום הראשון לחמישי עומד על קצת יותר משתי נקודות אחוז, צפוף, אבל קבוע.

דינמיקה שיחתית: מי יודע מתי לשתוק

Full Duplex Bench מודד משהו אחר לגמרי: האם המודל יודע מתי לדבר, מתי לשתוק בהפסקות טבעיות, איך להגיב לקטיעות (Interruptions) ואיך לזהות בק-צ'אנלס (Backchannels) כמו "כן" או "המממ". כאן קואן אודיו 3.0 רילטיים פלאש (Qwen Audio 3.0 Realtime Flash) תופס את המקום השני עם 96.9%, ו-GPT-רילטיים-2 (מינימל) שלישי עם 96.1%. GPT-רילטיים-2.1 היי ו-GPT-רילטיים-1.5 חולקים את המקום הרביעי עם 95.7%. שווה לציין: שני מודלי GPT נבדקו על מספר הרצות מצומצם, אחת בלבד למינימל, שתיים ל-2.1 היי, מה שמכניס מרווח אי-ודאות להשוואה הישירה.

מהירות ועלות: דיפסלייט אופאל (Deepslate Opal) ראשון מהקו, קואן הכי זול

זמן עד האודיו הראשון (Time to First Audio), המדד שקובע כמה מהר המשתמש שומע תגובה, מובל על ידי דיפסלייט אופאל עם 0.44 שניות. ג'מיני 2.5 פלאש נייטיב אודיו דיאלוג (Gemini 2.5 Flash Native Audio Dialog) שני ב-0.63 שניות, וגרוק וויס ת'ינק פאסט 2.0 היי שלישי ב-0.70 שניות. בצד הכספי, קואן אודיו 3.0 רילטיים פלוס שובר את השוק עם 0.0331 דולר לשעת אודיו נכנס (כ-0.12 שקל), סטפ-אודיו R1.1 רילטיים ב-0.064 דולר (כ-0.23 שקל), וקואן 3.5 אומני פלאש רילטיים ב-0.162 דולר (כ-0.59 שקל). פער של כמעט פי חמישה בין הזול ליקר שבחבורת הצמרת.

מה זה אומר בפועל

שיחה בזמן אמת דורשת גם דינמיקה שיחתית חזקה וגם השהיה נמוכה. קואן אודיו 3.0 רילטיים פלוס מוביל בדינמיקה, אבל לא מופיע בשלישיית המהירות. דיפסלייט אופאל מהיר ממנו משמעותית, אבל לא נבדק על דינמיקה באותו היקף. המפתחים יצטרכו להחליט מה קריטי יותר למוצר שלהם: תורנות דיבור טבעית או תגובה ראשונית מהירה, וכמובן, כמה הם מוכנים לשלם לשעת אודיו.