קוואן משיקה את אומני-פלאש: מודל אומני-מודאלי ראשון עם יכולות סוכניות מובנות

אודיו-וידאו ביחד עם שימוש בכלים
קבוצת קוואן (Qwen) של עליבאבא משחררת את Qwen3.8-Omni-Flash, המודל האומני-מודאלי הראשון של החברה שתוכנן מלכתחילה סביב יכולות סוכניות (agentic). בניגוד למודלים שרק "מבינים" וידאו ואודיו, המודל החדש אמור לחבר בין הבנה, תכנון משימות והפעלת כלים בזרימה אחת: לנתח תוכן שנראה ונשמע, לתכנן את הצעדים הבאים, להריץ כלים חיצוניים ולהחזיר תוצאה מוגמרת. לדברי החברה, זה מאפשר תסריטים כמו עריכה אוטומטית של וולוגים, תרגום סרטונים קצרים או הפקת תקצירים מסרטים מלאים, בלי לפרק את התהליך לכמה מודלים נפרדים.
קפיצה בביצועים מול ג'מיני
הנתון הבולט בהכרזה הוא ההשוואה הישירה לג'מיני 3.8 פלאש (Gemini 3.8 Flash) של גוגל: קוואן טוענת שהמודל החדש "מתקרב" ליכולות האודיו-וידאו של המתחרה, ורושמת שיפור ממוצע של 19.5 נקודות בביצועי סוכן על שני בנצ'מרקים ייעודיים, WildClawBench-MM ו-UniClawBench. שני המבחנים האלה בודקים יכולת לתזמר כלים לאורך זרימות עבודה ארוכות (multi-step tool use), לא רק לענות על שאלות בודדות. עדיין לא פורסמו מדדי ביצועים מלאים או פירוט של תנאי הבדיקה, כך שהמספרים מגיעים מהיצרן בלבד.
חלון הקשר של מיליון טוקן ויעילות טוקנים
המודל מגיע עם חלון הקשר (context window) של מיליון טוקן, ובקוואן מדגישים יכולת "תפיסה סוכנית" (agentic perception) שמאפשרת לסרוק סרטונים ארוכים ולאתר רגעי מפתח בדיוק גבוה יותר. על פי בדיקה פנימית על OmniVideoBench, הגישה הזו צורכת 51.8% פחות טוקנים בהשוואה להבנה סטטית של אותו תוכן, חיסכון משמעותי כשמדובר בקלט וידאו ארוך. המשמעות המעשית: אפשר להכניס יותר חומר גלם לאותו תקציב הקשר, או לחלופין להקטין עלויות.
הוזלה של 89% בעלות קלט וידאו
בצד הכלכלי, קוואן מדווחת על הפחתה של כ-89% בעלות קלט וידאו לעומת Qwen3.5-Omni-Plus, הגרסה הקודמת במשפחה. זה הופך זרימות עבודה אומני-מודאליות ארוכות לנגישות בהרבה למפתחים שבונים אפליקציות על גבי המודל. התמחור החדש, בשילוב חלון ההקשר המורחב, מכוון ישירות למקרי שימוש כמו ניתוח הרצאות, פגישות מוקלטות או ספריות וידאו ארגוניות, שבהם נפח הקלט היה עד עכשיו צוואר בקבוק תקציבי.
ספריות פתוחות לפיתוח סביב אומני
כדי להקל על בניית אפליקציות, קוואן משחררת בקוד פתוח שני רכיבים משלימים: Qwen-MM-Plugins, ספריית תוספים לטיפול במדיה מרובת-מצבים (multi-modal), ו-Qwen-Live Harness, מסגרת להרצה והערכה של זרימות עבודה חיות (live workflows) עם המודל. הראשון זמין כבר עכשיו בגיטהאב, השני צפוי לעלות בקרוב. המהלך מסמן כוונה להפוך את האקוסיסטם סביב אומני לפלטפורמה ולא רק למודל בודד.
זמינות ונקודות גישה
המודל זמין כבר עכשיו דרך שלושה ערוצים: צ'אט ישיר ב-Qwen Studio (chat.qwen.ai), API מנוהל בענן עליבאבא (alibabacloud.com), וגישה דרך Qwencloud להרצה עצמאית. התיעוד הטכני והבלוג הרשמי מפרטים את מגבלות הקצב (rate limits) ואת מבנה הבקשות לקלט אודיו-וידאו משולב.