3 באוקטובר 2026 האקדמיה ארכיון
מבזקים
פריים אינטלק משיקה את פריים אינפרנס: הגשת מודלים פתוחים על בלאקוול דוט של OpenAI: תוכנה ארגונית שגם יודעת להזמין בוריטו מיקרוסופט משיקה את MAI-Transcribe-2-Streaming, מודל דיבור-לטקסט בזמן אמת שמדורג ראשון בדיוק קליי דוחפת את מהנדס ה-GTM לקדמת הבמה בדיסראפט 2026 מטא, אופן-איי ואובר דוחפות סוכנים שיוזמים שיחה, הבעיה הקשה עברה ל"מתי לשתוק"
מוצרים

מיקרוסופט משיקה את MAI-Transcribe-2-Streaming, מודל דיבור-לטקסט בזמן אמת שמדורג ראשון בדיוק

מיקרוסופט משיקה את MAI-Transcribe-2-Streaming, מודל דיבור-לטקסט בזמן אמת שמדורג ראשון בדיוק

מודל סטרימינג ראשון עם דיוק מוביל

Microsoft השיקה בראשון באוקטובר את MAI-Transcribe-2-Streaming, מודל הדיבור-לטקסט (STT) הראשון שלה שפועל בסטרימינג רציף. המודל נכנס היישר למקום הראשון מתוך 38 מתמודדים במדד AA-WER Streaming של Artificial Analysis, הן בדיוק התמליל הסופי והן בדיוק התמליל החלקי הראשון. הוא מיועד לסוכני קול (voice agents), כתוביות חיות והכתבה, תרחישים שבהם השהיה (latency) קובעת את חוויית המשתמש.

איך זה עובד מתחת למכסה המנוע

זהו האח התאום בזמן אמת של MAI-Transcribe-2 הבאצ'י (batch) שיצא בספטמבר. המודל תומך ב-60 שפות עם זיהוי שפה אוטומטי ורציף. האודיו זורם פנימה ברצף, והטקסט חוזר החוצה בזמן שהדובר עדיין מדבר. ההשערות הראשונות, המכונות partials, נפלטות קצת יותר מ-100 מילישניות לאחר קבלת האודיו, ומתעדכנות ככל שמגיע הקשר נוסף, עד שנקבע תמליל סופי יציב. כך סוכן יכול להתחיל לחשוב או לקרוא לכלים (tool calling) באמצע משפט. לפי בדיקות פנימיות של מיקרוסופט, מילים מופיעות בקצב כפול מזה של המתחרה הקרוב ביותר.

מה הבנצ'מרק באמת מראה

מדד AA-WER Streaming מבוסס על כ-8 שעות אודיו בתמהיל: AA-AgentTalk (חמישים אחוז), VoxPopuli (עשרים וחמישה אחוז) ו-Earnings22 (עשרים וחמישה אחוז). השהיה נמדדת מסוף הדיבור כפי שזיהה SileroVAD. התוצאה: 2.5% WER (שיעור שגיאת מילה) בתמליל סופי 0.13 שניות אחרי סוף הדיבור, ו-2.5% WER בתמליל חלקי ראשון 0.12 שניות אחרי סוף הדיבור, בשני המקרים מקום ראשון. המתחרים הקרובים: Grok Voice Transcribe 2.0 עם 2.7% WER ב-0.49 שניות, ו-Muse Voice Transcribe עם 3.1% WER ב-0.16 שניות. Cartesia Ink-2 מהיר יותר, 0.07 שניות לתמליל סופי, אבל משלם ב-4.0% WER. הנקודה המעניינת: התמליל החלקי הראשון מדויק כמו הסופי, וזה קריטי לסוכנים שפועלים לפני שהדובר סיים.

מחיר התחלתי גבוה מהמתחרים הישירים

התמחור עומד על 0.54 דולר לשעת אודיו (כ-2 שקלים לשעה) כמחיר היכרות עד סוף 2026. Artificial Analysis מנרמל את זה ל-9 דולר לאלף דקות (כ-33 שקל). לשם השוואה, הגרסה הבאצ'ית MAI-Transcribe-2 עולה 0.10 דולר לשעה (כ-37 אגורות). בסטרימינג מיקרוסופט יקרה יותר מ-xAI ומטא (Meta), ובערך משתווה לתעריף המשוער של Google.

שתי דרכי אינטגרציה ואקוסיסטם מתרחב

למפתחים יש שני נתיבים: Realtime API שמתאים לאפליקציות שכבר משתמשות ב-WebSocket תואם OpenAI Realtime, ו-Azure Speech SDK שמטפל בניהול חיבור, ניסיונות חוזרים (retries) וסטרימינג אודיו. שניהם מחזירים תוצאות ביניים וסופיות. המודל זמין גם ב-MAI Playground, דרך Vercel ו-Azure Voice Live; תמיכת LiveKit מסומנת כ-"coming soon". מיקרוסופט מצוותת אותו עם MAI-Voice-2.1-Flash ללולאות קול מלאות: Flash מייצר 45 שניות אודיו ב-150 מילישניות השהיה מקצה לקצה תמורת 15 דולר למיליון תווים (כ-55 שקל), בעוד MAI-Voice-2.1 מכסה 23 שפות ו-26 לוקיילים ב-22 דולר למיליון תווים (כ-81 שקל).

תצוגה מקדימה בלי SLA ובלי משקולות פתוחות

חשוב לציין: המודל נמצא בתצוגה מקדימה ציבורית (public preview) ללא התחייבות רמת שירות (SLA) וללא משקולות פתוחות (open weights), כלומר אי אפשר להריץ אותו לוקאלית או לבדוק את הארכיטקטורה. מי שצריך יציבות פרודקשן או שליטה מלאה במודל יצטרך לחכות או לחפש חלופות.

מקור: marktechpost.com