סארוואם משיקה את סאאראס V4: זיהוי דיבור ל-22 שפות הודיות ואנגלית גלובלית

מודל אחד, 22 שפות ודגש על אנגלית עולמית
סארוואם AI (Sarvam AI) שחררה את סאאראס V4, הדור החדש של מודל זיהוי הדיבור שלה, שמכסה את כל 22 השפות המתוכננות של הודו בתוספת אנגלית עם מבטאים גלובליים. החברה מדווחת על דיוק מוביל (state-of-the-art) בכל השפות, והמודל זמין כבר עכשיו דרך ה-API בפרמטר `model="saaras:v4"`. המשקולות לא פורסמו לציבור, ותיעוד הסלף-הוסטינג (self-hosting) ב-SageMaker עדיין מתייחס רק לגרסה 3.
ארכיטקטורת אנקודר-דיקודר עם דיקודר שפותח בבית
מתחת למכסה המנוע יושבת מערכת אנקודר-דיקודר (encoder-decoder): אנקודר אודיו הופך את הגל ל-embeddings שנושאים פירוט פונטי ואקוסטי, ואדפטר דגימה-זמנית (temporal-downsampling adapter) מקצר את הרצף ומקרין אותו למרחב ה-embedding של מודל השפה. הדיקודר הוא סארוואם-3B, מודל שפה היברידי מסוג state-space עם 3 מיליארד פרמטרים שפותח מאפס in-house. הוא קורא את תכונות האודיו לצד פרומפט טקסטואלי ופולט את התמלול בצורה אוטורגרסיבית, כשכל טוקן מוזן חזרה כקלט לבא אחריו.
בנצ'מרקים: תוצאות מרשימות אבל רק vendor-reported
בצד האנגלית נבדקו 7 דאטהסטים, שישה מה-Open ASR Leaderboard של Hugging Face (AMI, GigaSpeech, LibriSpeech clean/other, SPGISpeech, VoxPopuli) ועוד אחד של AI4Bharat בשם Svarah עם מבטא הודי, וסארוואס V4 השיגה את ה-WER הממוצע הנמוך ביותר מבין המודלים שנבדקו. בשפות הודיות נמדד על Vistaar ב-10 שפות עם WER ו-LLM-WER, מדד שמוסיף בדיקה סמנטית כדי להפריד שגיאות משמעות משגיאות כתיב או עיצוב נפוצות בכתבים הודיים. באודיו רועש (Kathbath Noisy) ה-LLM-WER נמוך מחצי מזה של Deepgram Nova-3 ו-GPT-4o Transcribe. זיהוי שפה (Language ID) עומד על 2.9% שגיאה ב-10 השפות המובילות ו-5.22% בכל ה-22. חשוב לציין: כל המספרים הם vendor-reported, ושחזור עצמאי טרם פורסם.
חמישה מצבי פלט וקייטרמ פרומפטינג מובנה
אותו אודיו יכול לחזור ב-5 ייצוגים לפי פרמטר `mode`: transcribe (ברירת מחדל, כתב מקומי עם נרמול מספרים ותאריכים), verbatim (כל מילה כפי שנאמרה כולל מילות קישור), codemix (כתב מקומי עם מילים אנגליות שנשארות באנגלית), translit (כל המשפט בכתב לטיני), ו-translate (תרגום לאנגלית עם נרמול מספרים). הטיעון של סארוואם: טיפול בתוך המודל חוסך שלבי פוסט-פרוססינג שעלולים להצטבר לשגיאות. חידוש נוסף ב-V4 הוא keyterm prompting, מעבירים רשימת JSON של עד 50 מונחים (64 תווים כל אחד) תחת `keyterms`, והם מטים את הזיהוי בלי להבטיח פלט מדויק; במצב codemix מותג כמו PhonePe נשאר בכתב לטיני. על IndicContextEval (מאמר, Interspeech 2026) מדווח WER של 16.03% בהגדרת L5, הנמוך ביותר בבנצ'מרק לטענת החברה.
סטרימינג, באץ', תמחור ו-SDKs, מעבר בקו אחד מ-v3
לפרודקשן מציעים שלושה מסלולים: סטרימינג ב-WebSocket עם תוצאות חלקיות ו-time-to-first-token מתחת ל-150 מילישניות, REST סינכרוני לקטעים עד 30 שניות, ובאץ' אסינכרוני לקבצים עד שעתיים עם דיאריזציה (speaker diarization) אופציונלית. יש SDKs לפייתון 3.9 פלוס, Node.js 18 פלוס, ואינטגרציות ל-LiveKit Agents, Pipecat ו-Vercel AI SDK. התמחור: 30 רופי הודי לשעה (כ-1.30 ש"ח) לסטרימינג, ריל-טיים ובאץ', ו-45 רופי (כ-1.95 ש"ח) עם דיאריזציה. סארוואס v3 נשארת ברירת המחדל, ו-V4 משתמשת באותה צורת בקשה כך שהמעבר הוא שינוי של שורה אחת.