פאן-רילטיים מקדים את השוק עם 1.7% שגיאה, מודלים פתוחים סוגרים פערים

הבנצ'מרק החדש של Artificial Analysis ל־57 מודלי דיבור־לטקסט מציב את Fun-Realtime-ASR-preview בראש טבלת הדיוק עם AA-WER של 1.7% בלבד, תוצאה שמשאירה מאחור שמות גדולים כמו ElevenLabs וג'מיני. המדד, שמבוסס על חמישה דאטה-סטים שונים במצב לא־סטרימינג, מראה שפער הביצועים בין המוביל לסגנים שלו צמוד: Scribe v2 של ElevenLabs מגיע ל־2.2%, MAI-Transcribe-1.5 ו־Smallest AI Pulse Pro חולקים מקום שלישי עם 2.4%, וג'מיני 3.5 טרנסקרייב סוגר את החמישייה עם 2.6%.
מהירות מול מחיר: נובה־3 טסה, מודולייט זול מכולם
בצד המהירות נובה־3 של Deepgram קובעת קצב של 527.2x בזמן אמת, פי שניים כמעט מהמקום השני, Resonant-1 עם 329.5x. וויספר לארג' v3 על Together.ai משלימה את הפודיום ב־287.7x. אבל מי שמחפש עלות נמוכה ימצא אותה דווקא אצל Modulate STT Batch English VFast: 0.417 דולר לאלף דקות (כ־1.5 שקל), כשאחריה Wizper על fal.ai ב־0.50 דולר ווויספר טורבו על Groq ב־0.667 דולר. הפער בין הזול ליקר בטבלה מגיע לפי עשרה ויותר, תלוי בספק ובתצורה.
מודלים פתוחים: ווקסטרל סמול של מיסטרל מוביל
מתוך 57 המודלים שנבדקו, 12 הם במשקלים פתוחים, והווקסטרל סמול של Mistral מוביל אותם עם AA-WER של 2.8%, מרחק נגיעה מהמובילים הסגורים. אינקלינג (256K) של Thinking Machines מגיע ל־3.5%, והווקסטרל מיני טרנסקרייב 2 של מיסטרל סוגר שלישייה ב־3.6%. הנתון המעניין: שלושת המודלים הפתוחים המובילים כולם מגיעים ממעבדות אירופיות, מה שמרמז על מיקוד מחקרי חזק ביבשת סביב ארכיטקטורות יעילות לדיבור.
מתודולוגיה ומגבלות
הבדיקה נערכה במצב באצ' (non-streaming) בלבד, כלומר על קבצים שלמים ולא על זרם חי, וכוללת חמישה דאטה-סטים שביניהם AA-AgentTalk ו־VoxPopuli בגרסה מנוקה לעומת המקורית. Artificial Analysis לא פרסמו מדדי השהיה (latency) לסטרימינג, וגם לא פירוט של שיעור שגיאות לפי סוג רעש, מבטא או אורך קטע. בלי הנתונים האלה קשה להסיק מסקנות ליישומי זמן אמת כמו מוקדי שירות או כתוביות חיות.
שורה תחתונה למפתחים
אין מודל אחד שמנצח בכל שלושת הצירים, דיוק, מהירות, מחיר. אם הדיוק קריטי (תמלול רפואי, משפטי), Fun-Realtime-ASR-preview ו־Scribe v2 הם הכתובת. לאפליקציות רילטיים נובה־3 נותנת יתרון מהירות עצום. לעומסים גדולים בתקציב מוגבל, מודולייט והוויספרים המוזלים על Groq או fal.ai עושים את העבודה. ובפעם הראשונה, מודל פתוח, ווקסטרל סמול, יושב בטווח ה־3% ומאפשר הרצה מקומית בלי תלות ב־API חיצוני.