Unsloth משיקה Qwen3.8-27B עם קוונטיזציה דינמית v3, 10% דיוק יותר באותו נפח

מה השתנה בגרסה 3
Unsloth שחררה גרסה חדשה של קבצי GGUF למודל Qwen3.8-27B שמבוססת על שיטת הקוונטיזציה הדינמית v3.0. לפי החברה, הקבצים החדשים משיגים יותר מ-10% דיוק top-1% טוב יותר מכל ספק אחר באותו גודל דיסק, תוך שמירה על תאימות למנועי הסקה נפוצים כמו llama.cpp ו-Unsloth Desktop. המתודולוגיה המעודכנת כוללת דאטסט כיול imatrix באיכות גבוהה יותר ממקורות מגוונים, מכוון לקידוד סוכני, צ'אט וריבוי שפות, לצד בחירת שכבות משופרת וטכניקות קוונטיזציה נוספות, כולן בשלב פוסט-אימון בלבד, ללא QAT או QAD.
איך מודדים בלי לרמות
כדי להימנע מהתאמת יתר (overfitting), Unsloth בנתה דאטסט הערכה של 300 דוגמאות שמורות (held-out) מתוך Terminal-Bench 2.1, DeepSWE, Harbor, MathArena 2025-26 והנחיות non-Latin וארוכות, אף אחת מהן לא נכללה בדאטסט הכיול. הבדיקה רצה decoding חמדני (greedy argmax) ל-32 טוקנים ומשווה את מסלולי הפלט של BF16 מול כל הקוונטים והספקים, באמצעות שני מדדים: KLD (סטיית קולמוגורוב-לייבלאר) ממוצע ו-Divergence-300 @32. הגרפים מנרמלים את השוואת נפח הדיסק על ידי הסרת ראש ה-MTP מהציר, כדי לאפשר השוואה הוגנת.
המספרים הקטנים שמפתיעים
בקצה הקטן, גרסת UD-IQ1_S שוקלת 6.2 ג'יגה-בייט בלבד (ללא MTP), קיטון של 89%, ועדיין שומרת על כ-72% דיוק top-1%. גרסת UD-Q2_K_XL ב-9.83 ג'יגה-בייט מציגה שיפור של כ-8% בדיוק top-1% מול החלופה הטובה הבאה, והצליחה לייצר תוכנית HTML עובדת עם באג JS זעיר אחד, בעוד גרסאות קודמות כשלו לחלוטין. הסרת מודול ה-MTP מקוונטים מתחת ל-UD-Q2_K_XL חוסכת כ-500 מגה-בייט, והמודול זמין בנפרד בגרסת Q4_0 למי שזקוק לו.
מה נשאר פתוח
Unsloth מדווחת על 5.1 מיליון הורדות של קבצי Qwen3.8 בחמישה ימים, ומשחררת את קובץ ה-imatrix לשימוש הקהילה למחקר, הערכה וכוונון עדין. בהשוואה פנימית ל-Dynamic v2.0, השיפור ב-KLD משמעותי בקוונטים הקטנים, אך זניח בגדולים, לכן החברה ממשיכה להשתמש ב-v2 לקוונטים הגדולים ומתכננת ניסויים נוספים. כל התהליך נשאר PTQ טהור, ללא אימון על דאטסט הכיול, מה שמפחית סיכון להתאמת יתר בהשוואה לגישות QAD/QAT.