21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

עלי באבא משיקה מודל תרגום סימולטני שחותך את השהייה הממוצעת ל-2.3 שניות

עלי באבא משיקה מודל תרגום סימולטני שחותך את השהייה הממוצעת ל-2.3 שניות

ארכיטקטורה חדשה שמשנה את חוקי המשחק

צוות Qwen של עלי באבא שחרר את Qwen3.8-LiveTranslate, מודל פרשנות בזמן אמת שמאזין לדיבור חי, עם או בלי פריימים של וידאו, ומחזיר טקסט ואודיו מתורגמים בזמן שהדובר עדיין מדבר. השינוי המרכזי הוא ארכיטקטורת Interleave שבונה מחדש את הלולאה בין המתנה להקשר לבין יציאה מוקדמת, ומדד ה-LAAL (Length-Adaptive Average Lagging) ירד מ-2.8 שניות ל-2.3 שניות, שיפור של כ-18 אחוז בשהייה הממוצעת. המודל זמין כ-API מתארח ב-Alibaba Cloud Model Studio וב-QwenCloud תחת המזהה qwen3.8-livetranslate-flash-realtime על גבי WebSocket.

שלוש יכולות שסוגרות פערים מעשיים

המודל מביא שלוש תכונות שמטפלות בכאבי ראש מוכרים של תרגום חי. זיהוי דוברים בזמן אמת (speaker diarization) מבחין בין משתתפים בשיחה מרובת-קולות ומשמר את קולו של כל דובר באמצעות שיבוט יציב יותר; ה-API חושף מצבי שיבוט, כולל מצב "תמיד" שמבצע שיבוט מחדש לפני כל תגובה בסשנים מרובי-דוברים. תצוגה דו-לשונית מסונכרנת מציגה טקסט מקור ותרגום זה לצד זה, כשהתמלול זורם כאירועים נפרדים לצד זרם התרגום. פירוק דו-משמעות בהקשר ארוך משתמש בהיסטוריית השיחה כדי לשמור על עקביות שמות ומונחים, שם שהוזכר בתחילת פגישה יישאר זהה בתרגום גם שעה מאוחר יותר.

כיסוי שפות, קלט חזותי ומילים קבועות

המודל מבין 60 שפות, ומתוכן מסוגל להפיק דיבור ב-29, כולל סינית, אנגלית, ערבית, גרמנית, צרפתית, ספרדית, יפנית, קוריאנית והינדית, כשהשאר מחזירות טקסט בלבד. קלט מקובל אודיו ותמונות אופציונליות (עד שתי תמונות בשנייה לפי ההמלצה), ורמזים חזותיים כמו תנועות שפתיים, מחוות וטקסט על המסך עוזרים בסביבות רועשות ובמילים דו-משמעיות. צוותים יכולים להגדיר hotwords, מיפוי מונחי מקור לתרגום קבוע, עם מגבלה של עד 1,000 מיפויים בסשן.

תמחור, מגבלות ופרטי חיבור

התחברות נעשית דרך WebSocket Realtime API עם זיהוי דובר כברירת מחדל; הלקוח מזרים אודיו רציף ומקבל תגובות מהשרת. אודיו נכנס ב-16 קילוהרץ PCM ויוצא ב-24 קילוהרץ PCM, הקול הדיפולטי הוא Tina, ואפשר להגביל פלט לטקסט בלבד. חובה לשלוח session.finish לפני סגירת החיבור, אחרת הקטע האחרון אובד. חלון ההקשר עומד על 53,248 טוקנים (49,152 לקלט, 4,096 לפלט). תמחור בסינגפור: 7.50 דולר (כ-27.5 שקל) למיליון טוקני אודיו נכנס, 0.55 דולר (כ-2 שקל) לתמונה, 20 דולר (כ-73 שקל) לטקסט יוצא, 30 דולר (כ-110 שקל) לאודיו יוצא. בייג'ינג זולה יותר בכ-25 אחוז. צריכת טוקנים: 7 לשניית אודיו נכנס, 12.5 לשניית אודיו יוצא, שעת דיבור דו-כיוונית עולה כ-1.54 דולר (כ-5.6 שקלים) בסינגפור לפני טוקני טקסט ותמונות.

מקור: marktechpost.com