עלי באבא משיקה את Qwen3.8-Omni-Flash: אומני-מודאלי ראשון עם יכולות סוכניות מובנות

ארכיטקטורה וחלון הקשר
המודל החדש בנוי על גבי Qwen3.8-Flash-Next, שמשקולותיו הפתוחות שוחררו באוגוסט 2026. חלון ההקשר עומד על מיליון טוקנים, כש-QwenCloud מגביל את הקלט בפועל ל-991 אלף ואת הפלט ל-131 אלף; אורך החשיבה המקסימלי מגיע ל-262 אלף טוקנים. הפלט הוא טקסט בלבד, מי שזקוק לדיבור מיוצר מופנה ל-Qwen3.5-Omni. חשיבה מופעלת כברירת מחדל עם reasoning_effort על xhigh, ואפשר לכבות אותה בהגדרה ל-none. ה-API תומך הן בפרוטוקול DashScope והן בזה של OpenAI, כולל Chat Completions, Responses API, קריאות פונקציות, חיפוש רשת, פלטים מובנים, שמירת הקשר ובקשות אצווה.
תפיסה סוכנית לוידאו ארוך
במקום לקרוא קובץ וידאו מההתחלה עד הסוף, הסוכן מתחיל מהשאלה, מחליט אילו קטעים לצפות ולהאזין, ואוסף ראיות בסבבים מגס לעדין. לפי צוות המחקר של Qwen, הגישה הזו הקפיצה את הדיוק ב-OmniVideoBench מ-63.4 ל-67.8 תוך צניחה של כ-45.7% בשימוש בטוקנים, מ-145,736 ל-79,117. המספרים מגיעים כולם מהחברה; תוצאות עצמאיות לא היו זמינות במועד הפרסום.
בנצ'מרקים מוצהרים
על פני 29 הערכות, הממוצע משתפר ביותר מ-25% מול Qwen3.5-Omni-Plus. WildClawBench-MM עולה ב-36.5 נקודות, AgenticVBench ב-22.3, ו-UniClawBench מגיע ל-69.6. LongAudioSpan מוסיף 8.3 נקודות, OmniVideoBench עוד 9.6, ו-OmniCap-IF משפר CSR ב-8.5 ו-ISR ב-14.1. בציוץ הרשמי מציינים רווח ממוצע של 19.5 נקודות בשני הבנצ'מרקים הסוכניים. החברה טוענת שביצועי אודיו-וידאו קרובים ל-Gemini 3.8 Flash, ושביצועי אודיו כלליים עולים עליו, בלי להציג את פרוטוקול ההשוואה.
תמחור ומגבלות מעשיות
ב-QwenCloud המחיר עומד על 0.15 דולר (כ-0.56 שקל) למיליון טוקני קלט, 0.47 דולר (כ-1.74 שקל) למיליון טוקני פלט, ו-0.016 דולר (כ-0.06 שקל) למיליון פגיעות מטמון מרומזות. מול הדור הקודם מדווחים על הוזלה של יותר מ-98% לשעת קלט אודיו, יותר מ-93% לאודיו-וידאו, וכ-89% לוידאו. המגבלות הטכניות: קבצי וידאו עד שעתיים ו-2 ג'יגה-בייט דרך URL, אודיו עד שלוש שעות, 113 שפות וניבים, דגימה יציבה עד 15 פריימים לשנייה, סטריאו דו-ערוצי ו-FOA ארבע-ערוצי דרך use_multichannel. השירות זמין בשישה אזורים: בייג'ינג, סינגפור, הונג קונג, טוקיו, פרנקפורט ווירג'יניה. קריאה מה-API דורשת שורות בודדות עם ה-SDK של OpenAI.