שיאומי משיקה שלושה מודלים חדשים: דגל 1T פרמטרים וגרסה מואצת פי 10

ענקית הטכנולוגיה הסינית חשפה את סדרת MiMo-V2.6 עם שלושה דגמים שמכוונים ישירות לזירת הקידוד הסוכני (agentic coding) ומשימות ארוכות-אופק. הדגם המוביל, MiMo-V2.6-Pro, מתהדר ביותר מטריליון פרמטרים, סדר גודל שמציב אותו בשורה אחת עם מודלי הדגל של OpenAI, Anthropic וגוגל. לצידו מושק MiMo-V2.6-Flash, ארכיטקטורת MoE (תערובת מומחים) של 309 מיליארד פרמטרים עם 15 מיליארד פעילים בלבד בכל העברה קדימה, וגולת הכותרת: MiMo-V2.6-Pro-UltraSpeed, שמבטיח את אותה איכות של דגם ה-Pro בקצב פליטה מהיר פי עשרה לערך.
הדגל: טריליון פרמטרים לחלון הקשר של מיליון טוקן
MiMo-V2.6-Pro נבנה כמודל יסוד (foundation model) בקנה מידה של 1T+ פרמטרים, עם חלון הקשר (context window) של מיליון טוקן, יכולת שמאפשרת עיבוד בסיסי קוד שלמים, מסמכים טכניים ארוכים והיסטוריות שיחה ממושכות בלי להידרש לטכניקות RAG או פיצול. המודל תומך ביכולות מולטימודליות מקוריות (native multimodal), כלומר הוא מעבד טקסט, תמונות וכנראה גם וידאו באותו מרחב ייצוג, בלי מודולים חיצוניים שמדביקים יחד פלטים נפרדים. בשיאומי מגדירים את הייעוד המרכזי כ"זרימות עבודה סוכניות" (agentic workflows), משימות שבהן המודל מתכנן, מבצע, בודק ומתקן עצמאית לאורך אופק ארוך, ולא רק משיב לשאילתות בודדות.
פלאש: יעילות MoE עם 15B פעילים בלבד
MiMo-V2.6-Flash מציע חלופה רזה יותר: 309 מיליארד פרמטרים כוללים בארכיטקטורת MoE, כשבכל העברה קדימה (forward pass) מופעלים רק 15 מיליארד. המשמעות המעשית היא עלות הסקה (inference) נמוכה משמעותית ביחס לדגם הדגל, תוך שמירה על חלק ניכר מהיכולות, דפוס מוכר ממודלים כמו Mixtral או DeepSeek-MoE, שמאפשרים פריסה על חומרה צנועה יותר או קיבולת גבוהה יותר לאותו תקציב מחשוב. שיאומי לא פרסמה בנצ'מרקים השוואתיים בין ה-Flash ל-Pro, כך שהיקף הוויתור על איכות נותר פתוח בשלב זה.
אולטרה-ספיד: אותו צ'קפוינט, קצב אחר לגמרי
ההכרזה המעניינת ביותר טכנית היא MiMo-V2.6-Pro-UltraSpeed. בשיאומי מדגישים שמדובר באותו צ'קפוינט (checkpoint) בדיוק של דגם ה-Pro, אותם משקולות, אותה איכות, שעבר אופטימיזציית הסקה אגרסיבית המביאה לקצב פליטת טוקנים (output throughput) גבוה פי עשרה לערך. אם הנתון מחזיק במבחני מציאות, מדובר בהישג הנדסי משמעותי: בדרך כלל האצת הסקה בסדר גודל כזה דורשת קוונטיזציה (quantization) אגרסיבית שפוגעת באיכות, או טכניקות כמו speculative decoding שמוסיפות מורכבות וחריגות התנהגות. העובדה שהחלון של מיליון טוקן והיכולות המולטימודליות נשמרות במלואן מרמזת על עבודת Kernel ואופטימיזציית זיכרון ברמה נמוכה מאוד, ולא רק על טריקי דגימה.
בלי מספרי בנצ'מרק, ובלי שיפוט עמיתים
מה שחסר בהכרזה בולט לא פחות ממה שיש בה: שיאומי לא פרסמה תוצאות על בנצ'מרקים סטנדרטיים כמו SWE-bench, HumanEval, MMLU, GPQA או MMMU, ולא הציגה השוואות ישירות מול GPT-4o, Claude 3.5 Sonnet או Gemini 1.5 Pro. גם לא פורסם מאמר טכני (technical report) או פרה-פרינט שמפרט את מתודולוגיית האימון, תמהיל הנתונים, או פרוטוקול ההערכה של "ביצועים ברמה הגבוהה ביותר בתרחישי קידוד, חזותיים, כלליים ומחקריים". בהיעדר שקיפות כזו, הקהילה הטכנית תתייחס לטענות כהצהרות יצרן, לא כמדידות מאומתות. הניסיון מלמד שפערים בין מצגות השקה לביצועי ייצור יכולים להיות גדולים, במיוחד במשימות סוכניות ארוכות-אופק שבהן שגיאות מצטברות.
הקשר: שיאומי בונה תשתית AI משלה
ההשקה מצטרפת למהלך רחב יותר של שיאומי להקטנת התלות במודלים סגורים של מתחרות אמריקאיות ולבניית ערוץ אנכי, מחומרה (סמארטפונים, רכב, IoT) דרך מערכת הפעלה ועד מודל יסוד קנייני. מודל עם חלון מיליון טוקן ויכולות סוכניות חזקות יכול להניע עוזרי קוד מקומיים על מכשירי החברה, אוטומציה בבדיקות QA, וניתוח לוגים ארוכים בלי לשלוח נתונים רגישים לענן חיצוני. עבור מפתחים ישראלים שעובדים עם שרשרת האספקה של שיאומי או מפתחים אפליקציות לאקוסיסטם שלה, זמינות של מודל כזה, אם ישוחרר במשקולות פתוחות (open weights) או דרך API תחרותי, עשויה להיות אלטרנטיבה רלוונטית למודלים המערביים, בפרט בתרחישים שדורשים ריבונות נתונים או עלות נמוכה להסקה בקנה מידה גדול.