Together AI מובילה בנתח טוקנים ב-OpenRouter; MiniMax-M3 מציגה חלון קונטקסט של מיליון טוקן בעשירית העלות

יחד בפסגה
Together AI תופסת את המקום הראשון בנתח טוקנים (token share) ב-OpenRouter בקרב מודלי קוד פתוחים מובילים לקידוד, לפי נתונים שפורסמו היום. שלושה מודלים חולקים את הצמרת: GLM 5.3 Flash של Z.ai עם 29.2%, V4.1 Flash של DeepSeek עם 25.6%, ו-Kimi K3 של Moonshot עם 18.9%. המספרים משקפים שימוש בפועל של מפתחים שמריצים סוכני קוד על גבי מודלים פתוחים, לא רק הורדות או בנצ'מרקים סינתטיים.
הארכיטקטורה שמאחורי MiniMax-M3
במקביל, MiniMax משיקה את M3, מודל יסוד מולטימודלי שתומך בקלט טקסט, תמונה ווידאו עם פלט טקסט, וחלון קונטקסט של מיליון טוקן. הליבה הטכנית היא MiniMax Sparse Attention (MSA), שמחליפה את מנגנון הקשב המלא בבחירת בלוקי KV, ובכך חותכת את עלות החישוב פר-טוקן בקונטקסט ארוך לכדי 5% מהדור הקודם במיליון טוקן, עם שלב מילוי מוקדם (prefill) ודיקוד (decode) מהירים משמעותית תוך שמירה על איכות ברוב המשימות.
אימון מכוון משימות ארוכות
המודל אומן כמולטי-מודלי נייטיב על דאטה משורשר (interleaved), ועבר כיול (fine-tuning) למספר רב של תורות שיחה (multi-turn) באמצעות מסגרת סימולציית משתמש אינטראקטיבית שמדמה עבודה בפרודקשן. הכיוון הזה מכוון את המודל למשימות מתמשכות ורבות-שלבים, סוכנים שכותבים קוד, מפעילים כלים ומנהלים הקשר לאורך זמן, במקום לביצוע חד-פעמי של פרומפט בודד.
מה זה אומר למפתחים
למי שמריץ סוכני קוד על מודלים פתוחים, הנתונים של OpenRouter מצביעים על כך שהאקוסיסטם מתכנס סביב שלושה שחקנים סיניים דומיננטיים, בעוד MiniMax מציעה אלטרנטיבה עם חלון קונטקסט עצום בעלות שמאפשרת להריץ וורקלודס (workloads) ארוכים בלי לשבור את התקציב. הירידה בעלות פר-טוקן ב-MSA משנה את הכלכלה של אינפרנס בקונטקסט ארוך, ומאפשרת להחזיק היסטוריה מלאה של סשן קידוד שלם בזיכרון.
השורה התחתונה
התמונה שמתקבלת היא של שוק שבו הביצועים בפועל, לא הבטחות בנצ'מרק, קובעים את נתח השימוש, ושהארכיטקטורה של קשב דליל (sparse attention) מתחילה להבשיל לכדי מוצר שמיש בפרודקשן. MiniMax-M3 עדיין לא פורסמה עם מדדי ביצועים השוואתיים מול המתחרים הישירים, אבל המפרט הטכני מציב אותה כמועמדת רצינית למי שצריך קונטקסט של מיליון טוקן בלי לשלם פרמיה של מודלים סגורים.