15 באוגוסט 2026 האקדמיה ארכיון
מבזקים
OpenRouter משיק בנצ'מרק חיפוש רשת: תקציב החיפוש מכריע יותר מהמנוע אפוקיי מפרסמת ניתוח על שאלות המפתח ביכולות בינה מלאכותית בנצ'מרק חדש בודק אם אג'נטים שורדים שעות של עבודה אוטונומית מודלים פתוחים מצמצמים פערים ממעבדות סגורות, וחודשים בודדים מפרידים ביניהם באיכות המודלים הסיניים מדלגים על שלב הביניים ומשגרים ישר לחזית הענקית
מודלים

המודלים הסיניים מדלגים על שלב הביניים ומשגרים ישר לחזית הענקית

המודלים הסיניים מדלגים על שלב הביניים ומשגרים ישר לחזית הענקית

הדוח החדש של Hugging Face לקיץ 2026 חושף תמונה ברורה: המעבדות הסיניות הפסיקו לשחק את המשחק ההדרגתי של שחרור מודלים קטנים ואז הגדלה, ובמקום זה משגרות מדי חודש מודלים בטווח של 754 מיליארד עד 2.78 טריליון פרמטרים. בצד האמריקאי התקרה נותרה מתחת ל-130 מיליארד בחמישה מתוך שבעה חודשים, למעט Nemotron 3 Ultra של NVIDIA עם 561 מיליארד במאי-יוני, ו-Inkling של Thinking Machines Lab שהגיע ל-952 מיליארד. הפער הזה לא מקרי, הוא משקף אסטרטגיה שונה לגמרי לגבי מה מפתחים באמת צריכים.

החלוקה לשני מחנות בסין

הגרף בדוח מחלק את המעבדות הסיניות לשתי קבוצות עם פילוסופיה הפוכה. Moonshot, MiniMax, שיאומי (Xiaomi) ו-Z.ai מפרסמות כמעט רק מודלים מעל 70 מיליארד פרמטרים, כך שהמפגש הראשון של מפתח איתן הוא מודל גדול מכדי לרוץ על חומרה מקומית. לעומתן, Tencent ואליבאבא Qwen מכסות את כל הספקטרום, ממודלים מתחת למיליארד פרמטרים ועד לחזית. שיאומי ו-Meituan שתיהן חצו השנה את רף הטריליון פרמטרים, אף שאף אחת לא הייתה שם מוכר במשקולות פתוחות לפני שנה.

שכבת הקוונטיזציה משנה את חוקי המשחק

שני גורמים איפשרו את הגישה של "חזית בלבד". בניית מודל ענק הפסיקה להיות מבדל טכנולוגי כשלעצמה, והקהילה פיתחה שכבת קוונטיזציה (quantization) שהופכת מודל ענק לבר-הרצה על חומרה צנועה בתוך ימים. התלות הזו בקהילה הופכת את פרופיל הגדלים להצהרת כוונות ולא למגבלת יכולת, פורטפוליו חזית בלבד מהמר על מיקום בבנצ'מרקים וביקוש API, בעוד פורטפוליו מלא מהמר על הפיכה לסטנדרט שמפתחים בונים עליו.

ספקיות החומרה השתלטו על קצב השחרורים

השינוי הדרמטי ביותר בדוח נוגע לזהות המשחררים. שתי הארגונים שפרסמו הכי הרבה מודלים חדשים השנה הן AMD ו-NVIDIA, כל אחת עם יותר מ-200 מאגרים חדשים, הרבה לפני השאר. LiquidAI במקום השלישי עם כמאה. ספקיות החומרה הבינו שמודלים פתוחים מותאמים לסיליקון שלהן הם הוכחת יכולת יעילה יותר מכל מצגת שיווק. Google ומטא (Meta), שהגדירו את תחום המודלים הפתוחים בשנים קודמות, מדורגות כעת הרבה מתחת ל-NVIDIA בקצב שחרורים חדשים, והמעבר של מטא למודלי דגל סגורים רק מדגיש את המגמה.

החזית האמריקאית נשענת על בסיס סיני

בקנה מידה של מעל 100 מיליארד פרמטרים, רוב השחרורים האמריקאיים השנה אינם מודלים מקוריים אלא בנויים על גבי מודלים סיניים. המודלים המקוריים הבודדים בקנה מידה זה הם Inkling של Thinking Machines (952 מיליארד), Nemotron 3 Ultra ו-Nemotron 3 Super של NVIDIA (561 ו-124 מיליארד בהתאמה), ו-Trinity-Large של Arcee AI (399 מיליארד). AMD תרמה המרות רבות אבל אף מודל מקורי בחזית, עבודה חשובה שמאפשרת להריץ מודלים סיניים ביעילות על חומרה אמריקאית, אבל עדיין עבודת הפצה ואופטימיזציה ולא מחקר בסיסי.

המספרים מאחורי ההאב

מאגרי מודלים ציבוריים גדלו מ-2.43 מיליון ל-2.96 מיליון, דאטה-סטים מ-711 אלף למיליון, ו-Spaces ממיליון ל-1.44 מיליון. החלוקה נותרה קיצונית: 85.6% מהמודלים רשמו פחות מ-200 הורדות לאורך חייהם, ו-1.5% מהמאגרים אחראים ל-99.2% מכלל ההורדות. בתוך הריכוז הזה, Qwen מובילה בהרצה מקומית (local inference) ואחריה Gemma, בעוד סוכני AI (agents) הופכים לכוח משמעותי בהאב.