Qwen3.8-Flash-Next רץ מקומית על 75 ג'יגה זיכרון ועוקף את Claude Opus 4.6 Max

המודל החדש של Qwen, בגרסת 125 מיליארד פרמטרים בארכיטקטורת MoE, זמין כעת להרצה מקומית דרך GGUF של Unsloth, בלי כרטיס גרפי בכלל. לפי נתוני החברה, הגרסה המכווצת ל-1-ביט תופסת 75 ג'יגה זיכרון מערכת (או זיכרון מאוחד) ומצליחה לשחזר 80% מהדיוק המקורי, תוך שהיא קטנה ב-79% מגרסת BF16 מלאה ששוקלת 355 ג'יגה. ההישג המשמעותי כאן אינו רק הגודל, אלא העובדה שהארכיטקטורה החדשה מאפשרת להריץ הסקה בזיכרון מערכת רגיל במהירות שמתקרבת לזו של VRAM, שינוי מהותי לכל מי שמחזיק מק עם זיכרון מאוחד או תחנת DGX Spark של NVIDIA.
ארכיטקטורת Qwen4 וחלון הקשר
Qwen3.8-Flash-Next בנוי על ארכיטקטורת Qwen4 החדשה ותומך בחלון הקשר של 262,144 טוקנים, קפיצה משמעותית מהדור הקודם. המודל מולטי-מודאלי וכולל מנגנון חשיבה היברידי (hybrid thinking) עם שני מצבי ברירת מחדל נפרדים: מצב חשיבה (thinking) עם temperature של 1.0 ו-top_p של 0.95, ומצב הוראה רגיל עם temperature של 0.7 ו-top_p של 0.80. ההבדל המרכזי הוא ב-presence_penalty: אפס במצב חשיבה, 1.5 במצב רגיל, מה שמכריח את המודל לגוון יותר כשהוא לא "חושב" בקול רם.
קוונטיזציה חכמה: שכבות PLE ו-Ngram נשארות ב-4-ביט
הסוד מאחורי הדחיסה האגרסיבית טמון בטיפול נפרד בשכבות החדשות, PLE (Per Layer Embeddings) ו-Ngram, שמתפקדות כטבלאות חיפוש עם גישה אקראית. שכבות אלו נשארות ב-4-ביט מינימום, כי קוונטיזציה עמוקה יותר הורסת את הדיוק שלהן. שאר המשקולות יורדות ל-1-ביט, והתוצאה: גרסת UD-Q4_K_XL שוקלת 111.3 ג'יגה עם KLD של 0.0447 ודיוק של 93.48%, בעוד UD-IQ4_XS יורדת ל-93.7 ג'יגה עם KLD של 0.079 ודיוק 91.09%. הגרסה הקטנה ביותר בטבלה, UD-Q3_K_XL, עומדת על 90 ג'יגה עם דיוק 90.3%.
דרישות חומרה: 75 ג'יגה מינימום, 96 ג'יגה מומלץ
טבלת הדרישות של Unsloth מציגה מדרגות של 75, 79, 90, 112, 200, 270 ו-355 ג'יגה, כשהכוונה לזיכרון כולל (RAM פלוס VRAM, או זיכרון מאוחד). ה-1-ביט הקטן ביותר רץ על 75 ג'יגה, אבל בפועל כדאי מכשיר עם 96 ג'יגה לפחות כדי להשאיר מרווח למערכת ההפעלה ולהקשר ארוך. אפשר גם להוריד את שכבת ה-PLE/Ngram ל-SSD ולהשתמש ב-mmap, מה שמפחית את השימוש ב-RAM וב-VRAM בו-זמנית, טריק שימושי למי שנתקע על 64 או 80 ג'יגה.
שליטה בעומק החשיבה דרך reasoning_effort
המודל תומך בפרמטר reasoning_effort עם ארבע רמות: xhigh (ברירת מחדל), medium, low ו-none. ב-Unsloth Desktop ההחלפה נעשית דרך --chat-template-kwargs '{"reasoning_effort":"medium"}' (ב-PowerShell צריך לברוח את הגרשיים). יש גם מנגנון Preserve Thinking ששומר את שרשרת החשיבה מההודעה הקודמת, מגדיל את צריכת הטוקנים אבל עשוי לשפר דיוק בשיחות מתמשכות. ב-Unsloth זה מופעל דרך מתגי Think ו-Preserved Thinking ייעודיים.
אזהרת יצרן: הבנצ'מרקים מגיעים מ-Qwen עצמם
הטענה שהמודל "עוקף את Claude-Opus-4.6 (Max)" מגיעה מהודעת ההשקה של Qwen, לא ממבחן צד שלישי בלתי תלוי. גם נתוני ה-KLD והדיוק של הקוונטיזציות השונות פורסמו על ידי Unsloth שקיבלו גישה מוקדמת (day zero access). אין עדיין תוצאות מ-LMSYS Chatbot Arena, מ-MT-Bench או ממבחני קוד סטנדרטיים כמו HumanEval או SWE-bench. עד שיגיעו השוואות עצמאיות, המספרים האלה הם בגדר הערכת יצרן, מעניינת, אבל לא תחליף למדידה חיצונית.