27 בספטמבר 2026 האקדמיה ארכיון
מבזקים
סוכני OpenAI הריצו 16 אלף בקשות לאתר האו"ם בניסיון לעקוף מגבלות גישה סין התקינה יותר רובוטים תעשייתיים ב-2025 משאר העולם יחד מאמר חדש מציע מפת דרכים לשיפור עצמי רקורסיבי של בינה מלאכותית מודל 340 מיליון פרמטרים רץ על GPU של טלפון, עם זהות מספרית למודל הייחוס גוגל בודקת רכישה ישירה מפליפקארט דרך ג'מיני ו-AI Mode בהודו
מוצרים

המודל של Meta מקבל חיים מקומיים: Muse Glimmer 30B רץ עכשיו ב-GGUF על llama.cpp

המודל של Meta מקבל חיים מקומיים: Muse Glimmer 30B רץ עכשיו ב-GGUF על llama.cpp

הפרויקט Atomic-Chat שחרר גרסאות GGUF ראשונות של Muse Glimmer 30B, המודל המולטימודלי של Meta, שמאפשרות להריץ אותו לגמרי אופליין על חומרה מקומית. הקוונטיזציה נעשתה מהמשקולות המקוריות ב-BF16, והתמיכה מוזגה ל-llama.cpp במאסטר (קומיט 62bf73d, PR 26841), כך שצריך לבנות מהמקור או לחכות לבינארי לילי שמכיל את הקומיט הזה.

מה בקופסה

השלב הראשון כולל בסיס בדיוק מלא וגרסאות 8-ביט, כשהסולם המלא עם מטריצת חשיבות מכוילת ו-NVFP4 עדיין בעבודה. Q8_0 נכנס על RTX 5090 בודד ומספק 35.7 טוקנים לשנייה; הוספת ה-mmproj לקלט תמונה דוחפת לכרטיס שני. לנורמל יוז קייס ההמלצה היא Q8_0 או AD-Q8_0, שני הקבצים ב-experiments/ מבודדים טנזור גדול אחד כל אחד ב-BF16 ונועדו רק להשוואה. הרכב פר-טנזור של כל קובץ נמצא ב-layouts/*.json, והלוגים הגולמיים מאחורי כל מספר מפורסמים בריפו הייעודי.

הרצה בפועל

דגל `--jinja` חובה, בלעדיו תבנית הצ׳אט ופרסינג של קריאות כלי לא עובדים. דוגמה להרצה בסיסית:

llama-server -m Muse-Glimmer-30B-Q8_0.gguf \
--mmproj mmproj-Muse-Glimmer-30B-BF16.gguf \
--jinja -ngl 99 -c 16384 -fa on \
--temp 1.0 --top-p 0.95 --top-k 64

עומק החשיבה נשלט משורת פרומפט מערכת, `Reasoning strength: low|medium|high|xhigh`, כשברירת המחדל היא high. אין דגל נפרד.

דיקוד ספקולטיבי: יפה על הנייר, פחות במציאות

עם דרייפר DFlash ב-BF16 ההאצה בתיאוריה, אבל בבנצ׳מרק של 9 פרומפטים (קוד, פרוזה, ריזונינג) התקבל ספיד-אפ של 1.9x בלבד לעומת 3.1x ש-Meta מדווחת על 5090 בודד. הפער כנראה נובע מפיצול שכבות על 4 כרטיסים שהופך כל פורוורד של הטרגט ל-יקר יחסית לתקורת הדרייפר. שיעורי קבלה תלויים במשימה: קוד מגיע ל-0.37, פרוזה חופשית צונחת ל-0.12.

נאמנות למשקולות המקוריות

ה-BF16 GGUF של Atomic זהה ביט-לביט למשקולות המקור, אומת על ידי UUID וכל 731 האשים של הטנזורים. מדדי KL-divergence מול הרפרנס הזה מראים: בטקסט נייטרלי (30 שפות, 97 חלונות של 4096) PPL בסיס 5.4614; בדיאלוגים אגנטיים עם קריאות כלי (85 חלונות) PPL בסיס 2.4462. ככל שה-KLD נמוך יותר וה-top-1 גבוה יותר, הקוונטיזציה שמרה יותר מידע.

מטריצת חשיבות וכיול

הקובץ `imatrix/muse-glimmer.imatrix.gguf` פורסם כדי שכל אחד יוכל לשחזר את הקוונטים או לבנות משלו על אותו כיול. המטריצה רושמת לכל מטריצת משקולות את ממוצע ריבוע האקטיבציות בכל ערוץ קלט; הקוונטייזר משתמש בזה כדי לתת משקל לשחזור שגיאה בחיפוש סקאלות בלוק, שגיאה בערוץ שנושא אקטיבציות גדולות נענשת יותר. שני דגלים כבויים בברירת מחדל ושניהם קריטיים: בלי `--parse-special` טוקנים כמו `<|start|>` מתפרסים כפיסוק מילולי, אז 40% מהקורפוס היה מכויל על רצפים שהמודל לא מייצר; בלי `--process-output` ה-output.weight, 1.34 מיליארד פרמטרים שיושבים ישירות תחת הסופטקאפ של הלוגיטים, לא מקבל נתוני חשיבות.