מתודולוגיה חדשה למדידת זיהוי דיבור בסטרימינג

Artificial Analysis פרסמה את המתודולוגיה שמאחורי לוח התוצאות (Leaderboard) החדש שלה למודלי Speech-to-Text בסטרימינג. המדד המרכזי, AA-WER Streaming, משלב שלושה מערכי נתונים: AA-AgentTalk במשקל 50%, VoxPopuli ב-25% ו-Earnings22 ב-25%. הציון מחושב כאחוז המילים שתומללו בצורה שגויה, ככל שהמספר נמוך יותר, הביצועים טובים יותר.
שני שלבי תמלול ושני מדדי השהיה
המבחן בודק שתי נקודות זמן נפרדות: התמלול החלקי הראשון (First Partial) שמופיע מיד אחרי זיהוי סוף הדיבור, והתמלול הסופי (Final Transcription) שמגיע לאחר עיבוד נוסף. לכל שלב מחושב WER משלו וזמן השהיה משלו בשניות. הגרפים מציגים את יחס העלות-תועלת (Pareto frontier) בין דיוק להשהיה, כך שניתן לראות אילו מודלים נמצאים ברביע האטרקטיבי ביותר, דיוק גבוה עם השהיה נמוכה.
תמחור לפי דקות שמע
מימד שלישי בלוח התוצאות הוא מחיר: עלות התמלול בדולרים לאלף דקות שמע (USD per 1000 minutes). המדד מאפשר השוואה ישירה בין מודלים שמציעים trade-offs שונים בין מהירות, דיוק ועלות, פרמטרים קריטיים ליישומי זמן אמת כמו בוטים קוליים, תמלול שיחות live וכתוביות אוטומטיות.
מה חסר בפרסום הנוכחי
הדף המתודולוגי מפרט את אופן החישוב ואת מבנה הגרפים, אך אינו כולל את תוצאות הבנצ'מרק עצמן, לא שמות המודלים שנבדקו, לא הציונים המספריים שלהם, ולא מיקומם על עקומת פארטו. Artificial Analysis טרם פרסמה את הטבלה המלאה עם הנתונים הגולמיים.