מיקרוסופט משיקה את MAI-Image-2.6 ואת MAI-Transcribe 2 ב-OpenRouter

מודל תמונה עם עריכה מרובת קבצים
המודל החזק ביותר של Microsoft לייצור תמונה נחת ב-OpenRouter בגרסה 2.6, והוא מביא איתו יכולת עריכה של כמה תמונות במקביל (multi-image editing) לצד גישה לרשת (web grounding) בזמן אמת. המודל תומך ביחסי גובה-רוחב דינמיים ומוציא עד 1.5K פיקסלים בצד הארוך, מה שמאפשר גמישות גדולה יותר בפרודקשן לעומת הגרסאות הקודמות שנעלו אותך לרזולוציות קבועות.
גרסת פלאש מהירה לייצור
לצד הגרסה המלאה שוחררה גם MAI-Image-2.6-Flash, וריאציה מואצת שמיועדת לסביבות ייצור שבהן לאטנסי (latency) הוא המגבלה העיקרית. מיקרוסופט AI (Microsoft AI) לא פרסמה מדדי ביצועים השוואתיים מול המתחרים, אבל ההבטחה היא throughput גבוה יותר בלי לוותר על סט הפיצ'רים המלא, עריכה מרובת קבצים, גישה לרשת ויחסי גובה-רוחב גמישים נשארים זמינים גם בגרסה המהירה.
תמלול רב-לשוני בראש טבלת FLEURS
במקביל, MAI-Transcribe 2 מגיע למקום הראשון בבנצ'מרק FLEURS הרב-לשוני, והוא מכסה 60 שפות עם זיהוי שפה אוטומטי ותמיכה ב-code switching, כלומר דיבור שמערבב שפות בתוך אותו משפט. המודל מיועד לכתוביות, תמלול שיחות, הנגשה ואפליקציות קוליות, ולדברי מיקרוסופט הוא מהיר מקודמו, MAI-Transcribe-1.5, בקבצי אודיו ארוכים (long-form).
יכולות מתקדמות למפתחים
המודל מוסיף דיאריזציה (speaker diarization) שמפרידה בין דוברים, חותמות זמן ברמת מילה (word-level timestamps), והטיית מילות מפתח (keyword biasing) לטרמינולוגיה ייעודית, למשל שמות מוצר או ז'רגון רפואי. אפשר לבחור בין סגנון תמלול מילולי (verbatim) לסגנון נקי (clean) לפי הצורך, וכל האפשרויות האלה נשלטות דרך פרמטרים ייעודיים ב-API.
זמינות דרך OpenRouter עם פרמטרים ייעודיים
ב-OpenRouter מפעילים את הפיצ'רים באמצעות response_format מסוג verbose_json לקבלת חותמות זמן של מקטעים, ומוסיפים timestamp_granularities: ["word"] לרמת המילה הבודדת. דיאריזציה מופעלת דרך provider.options.azure.diarization.enabled, רשימת מילות מפתח עוברת ב-provider.options.azure.phraseList.phrases, ובחירת סגנון התמלול נעשית ב-provider.options.azure.enhancedMode.modelOptions.transcribeStyle, כולם מתועדים במדריך ה-speech-to-text של הפלטפורמה.