21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מוצרים

מטא משיקה את Muse Voice Transcribe, מודל תפיסת אודיו בזמן אמת ראשון ממעבדת הסופר-אינטליגנציה

מטא משיקה את Muse Voice Transcribe, מודל תפיסת אודיו בזמן אמת ראשון ממעבדת הסופר-אינטליגנציה

המודל זמין החל מהיום דרך Meta Model API, Meta AI למק ו-Muse Code. זו אבן הדרך הראשונה של מטא בהנגשת מודלי קול בזמן אמת, והיא מגיעה עם זיהוי דיבור זורם (streaming ASR), דיאריזציה של 20 דוברים ומעלה, וזיהוי סיום דיבור (endpointing), הכל במודל אוטורגרסיבי רב-מודאלי אחד ממשפחת Muse Spark.

ארכיטקטורה: טוקנים רכים והשהיה אדפטיבית

האודיו מעובד בחתיכות של 80 מילישניות (12.5 הרץ), כשכל חתיכה הופכת לטוקן רך יחיד. בכל שלב המודל מחליט אם להמשיך להאזין, באמצעות טוקן מיוחד <|next_audio|>, או לפלוט טוקן טקסט. כשהזרם נגמר, מוכנס טוקן <|empty_audio|> שמאותת שאין עוד קלט, והמודל משלים את הטקסט הנותר בלי להמתין. המנגנון הזה נותן למודל שליטה מלאה על כמה הקשר אודיו לצבור לפני כל מילה, מה שמכונה "השהיה" (delay).

החידוש המרכזי הוא השהיה אדפטיבית: המודל משנה את ההשהיה דינמית לכל מילה לפי רמת הקושי. זה מושג בלמידת חיזוק (RL) שמשלבת פרס על שיעור שגיאות מילים (WER) ופרס על השהיה במכפלה, לא בסכימה. התוצאה, לדברי מטא, היא חזית פארטו של יחס מהירות-דיוק שנמדדת בזמן עד תמלול סופי.

דיאריזציה ו-endpointing על גבי אותו שלד

על בסיס ה-ASR הזורם מוסיפה מטא טוקנים מיוחדים למשימות נוספות. לדיאריזציה: <|start_of_turn|> מסמן חילוף דובר אפשרי, ו-<|speaker_{A-Z}|> מתייג את הדובר, התיוג נדחה לסוף החתיכה. ל-endpointing: <|speech_onset|> מסמן תחילת דיבור ו-<|speech_endpoint|> מסמן סיום. שני המשימות מאומנות יחד עם ASR ומוסיפות פרסים ייעודיים מעל פרס ה-ASR הבסיסי.

הישגים בבנצ'מרקים ציבוריים

לפי מטא, המודל מדורג ראשון ב-Artificial Analysis בזיהוי דיבור זורם ובבנצ'מרקים פומביים של דיאריזציה, נכון ל-1 בספטמבר 2026. החברה לא פרסמה מדדי ביצועים מספריים משלה (WER, latency במספרים מוחלטים, או תוצאות על סטנדרטים כמו LibriSpeech), כך שהדירוג הוא האינדיקטור היחיד שזמין כרגע.

כיסוי שפות ו-code-switching מובנה

המודל אומן על 70 שפות ומעלה, מתוכן 25 עברו אימות נרחב ובהן מטא ממליצה להתחיל. התמיכה ב-code-switching, מעבר בין שפות בתוך משפט או בין משפטים, מובנית נייטיבית, לא מודבקת כשכבה נפרדת. בנוסף קיימת הטיית הקשר (context biasing) באמצעות מילות מפתח ושפה, שנועדה לשפר דיוק בתרחישים ספציפיים.