6 באוקטובר 2026 האקדמיה ארכיון
מבזקים
לאמה 0.6.0 מוסיפה תמיכה בקלף ובקוון, ומאיצה דרמטית על מטאל רדהאט משחררת צ'קפוינט NVFP4 של Qwen3.8-Flash-Next: מומחי MoE ב-4 ביט, השאר ב-BF16 MIT Technology Review פותח את EmTech Future 2026 לצפייה ישירה; מטיאס, נוון ודוקטורו בראש הרשימה OpenAI מתחילה לסמן טקסטים של צ'אטג'יפט באירופה כדי לעמוד בחוק ה-AI Reflection AI חושפת את Beam, מודל פתוח שמתחרה בסינים בפחות חומרה
מודלים

רדהאט משחררת צ'קפוינט NVFP4 של Qwen3.8-Flash-Next: מומחי MoE ב-4 ביט, השאר ב-BF16

רדהאט משחררת צ'קפוינט NVFP4 של Qwen3.8-Flash-Next: מומחי MoE ב-4 ביט, השאר ב-BF16

מה שיצא בפועל

רדהאט (RedHatAI) העלתה להוגינג פייס (Hugging Face) גרסה מכווצת של Qwen3.8-Flash-Next שבה רק השכבות הליניאריות של מומחי ה-MoE עברו קוונטיזציה ל-NVFP4, פורמט 4 ביט של NVIDIA, בעוד שאר המודל נשאר ב-BF16. הארכיטקטורה היא Qwen4ExpForConditionalGeneration, מולטימודלית בכניסה (טקסט, תמונה, וידאו) וטקסטואלית ביציאה. הצ'קפוינט מוכן להרצה ב-vLLM עם פרמטרים סטנדרטיים: tensor-parallel-size 4, tool-call-parser ו-reasoning-parser של Qwen3. תאריך השחרור הרשמי הוא 27 באוגוסט 2026, גרסה 1.0.

איך נמדדה ההתאוששות

לפי הבדיקות של רדהאט, הצ'קפוינט שלהם משיג 99.1% התאוששות דיוק (accuracy recovery) מול המודל הלא-מכווץ, כלומר הציון של המודל המכווץ חלקי הציון של המקור, כפול 100, עם תקרה של 100%. לשם השוואה, הצ'קפוינט המקביל של Inferact עומד על 97.6% ושל NVIDIA על 98.0%. הפער מוסבר בהבדלים בנתוני הכיול (calibration data) ובמימוש ה-observer. כל ההערכות בוצעו דרך Inspect עם שרת vLLM ו-seed יחיד.

מאחורי הקלעים: כיול ודחיסה

המודל נוצר באמצעות LLM Compressor עם 1,024 דגימות מהדאטהסט open-perfectblend. רק המשקלים והאקטיבציות של אופרטורים ליניאריים במומחי ה-MoE עברו קוונטיזציה; שאר הרכיבים, כולל ה-router, ה-embeddings והשכבות המשותפות, נשארו בדיוק המקורי. התוצאה: צמצום משמעותי בזיכרון ובנפח דיסק של פרמטרי המומחים, בלי לגעת בשאר הגרף. הפקודה להרצה דורשת 4 GPUs בטנזור-מקביליות, מה שמרמז על דרישת VRAM שעדיין לא זניחה למרות הדחיסה.

מה זה אומר לפריסה בפרודקשן

היתרון המעשי הוא חיסכון בזיכרון ובאחסון עבור החלק הכבד ביותר במודל MoE, המומחים, תוך שמירה על איכות כמעט זהה למקור. העובדה שהצ'קפוינט מגיע מוכן ל-vLLM עם פרמטרים ברורים מורידה את מחסום הכניסה לצוותים שרוצים להריץ מודל מולטימודלי גדול על חומרה מצומצמת יותר. 634 הורדות בחודש האחרון מצביעות על עניין התחלתי, לא על אימוץ המוני.

הזווית הישראלית

לרדהאט מרכז מו"פ גדול ברעננה, ואנשי הצוות הישראלי מעורבים עמוק בפרויקטי AI ובאינטגרציה עם vLLM. השחרור הזה מגיע ישירות מהקבוצה שמפתחת את כלי הדחיסה (LLM Compressor) ומתחזקת את המתכונים של vLLM למודלי Qwen, כך שהניסיון המקומי בדחיסה ובפריסה נכנס ישירות לצ'קפוינט הציבורי.