21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

מתודולוגיה חדשה למדידת זיהוי דיבור בסטרימינג

מתודולוגיה חדשה למדידת זיהוי דיבור בסטרימינג

Artificial Analysis פרסמה את המתודולוגיה שמאחורי לוח התוצאות (Leaderboard) החדש שלה למודלי Speech-to-Text בסטרימינג. המדד המרכזי, AA-WER Streaming, משלב שלושה מערכי נתונים: AA-AgentTalk במשקל 50%, VoxPopuli ב-25% ו-Earnings22 ב-25%. הציון מחושב כאחוז המילים שתומללו בצורה שגויה, ככל שהמספר נמוך יותר, הביצועים טובים יותר.

שני שלבי תמלול ושני מדדי השהיה

המבחן בודק שתי נקודות זמן נפרדות: התמלול החלקי הראשון (First Partial) שמופיע מיד אחרי זיהוי סוף הדיבור, והתמלול הסופי (Final Transcription) שמגיע לאחר עיבוד נוסף. לכל שלב מחושב WER משלו וזמן השהיה משלו בשניות. הגרפים מציגים את יחס העלות-תועלת (Pareto frontier) בין דיוק להשהיה, כך שניתן לראות אילו מודלים נמצאים ברביע האטרקטיבי ביותר, דיוק גבוה עם השהיה נמוכה.

תמחור לפי דקות שמע

מימד שלישי בלוח התוצאות הוא מחיר: עלות התמלול בדולרים לאלף דקות שמע (USD per 1000 minutes). המדד מאפשר השוואה ישירה בין מודלים שמציעים trade-offs שונים בין מהירות, דיוק ועלות, פרמטרים קריטיים ליישומי זמן אמת כמו בוטים קוליים, תמלול שיחות live וכתוביות אוטומטיות.

מה חסר בפרסום הנוכחי

הדף המתודולוגי מפרט את אופן החישוב ואת מבנה הגרפים, אך אינו כולל את תוצאות הבנצ'מרק עצמן, לא שמות המודלים שנבדקו, לא הציונים המספריים שלהם, ולא מיקומם על עקומת פארטו. Artificial Analysis טרם פרסמה את הטבלה המלאה עם הנתונים הגולמיים.