13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים דינה רובוטיקס משחררת מודל עולם-פעולה שפותח על מיליון שעות וידאו אנושי נמוטרון 3.5 לייטנינג נוחת בפריים אינטלקט עם תמיכה מיום אפס התפרצות כבד שומני עולמית: בינה מלאכותית עשויה להקדים תרופה למכה
מודלים

מנוע C של 6,000 שורות מריץ את Kimi K3 על מקבוק פרו עם 64 ג'יגה

מאת הדר מזרחי כתב/ת AgentNet
מנוע C של 6,000 שורות מריץ את Kimi K3 על מקבוק פרו עם 64 ג'יגה

קבוצה בשם SQLite AI שחררה מנוע הסקה בשם WASTE שמצליח להריץ את הגרסה המלאה של Kimi K3, מודל MoE של כמעט 3 טריליון פרמטרים, על מחשב נייד עם 64 ג'יגה זיכרון מאוחד. בלי BLAS, בלי CUDA, בלי פייתון בזמן ריצה. המנוע כתוב ב-C טהור, שוקל 6,000 שורות, ומשתמש בגישה של הזרמת מומחים (expert streaming) מה-SSD ישירות לחישוב. המשקולות המלאות, אחרי המרה מ-safetensors לפורמט הקנייני של המנוע, תופסות 982 ג'יבייט (כ-1.05 טרה-בייט בדיסק). הן לא נכנסות לזיכרון, אפילו לא קרוב.

איך זה עובד בפועל

K3 הוא מודל Mixture-of-Experts עם 92 שכבות ו-16 מומחים בכל שכבה. בכל פורוורד-פאס של טוקן בודד מופעלים רק כ-4% מהמשקולות, המומחים הרלוונטיים לאותו טוקן. WASTE מחזיק בזיכרון רק חלק תושב (resident) של 27.28 ג'יגה, ומושך מומחים מה-NVMe בדיוק כשהם נדרשים. כל מומחה מאוחסן בקוונטיזציה וקטורית שאריתית (residual vector quantization) עם שלושה שלבי קודבוק של 256 רשומות כל אחד, 3 ביט למשקל. המטריצות gate, up ו-down של כל מומחה יושבות צמוד זו לזו על הדיסק, כך שטעינת מומחה אחד שווה לקריאה רציפה אחת. התוצאה: 0.49-0.54 טוקן לשנייה, משקולות מלאות, בלי דיסטילציה ובלי גזירת שכבות.

צוואר הבקבוק הוא הדיסק, לא החישוב

על כל טוקן המנוע קורא 17 ג'יגה מה-SSD. ה-NVMe הפנימי של המקבוק מספק 12.78 ג'יגה לשנייה, והמודל עומד בקצב. אותו ניסוי על כונן חיצוני בחיבור USB, 0.94 ג'יגה לשנייה, מוריד את קצב הייצור ל-13 שניות לטוקן. זה כבר תחום של "למאוד סבלניים בלבד". הנתון המעניין יותר מגיע מכיוון הזיכרון: הגדלת מטמון המומחים מעל 46 ג'יגה לא רק שלא עוזרת, היא הורסת ביצועים. ב-52 ג'יגה המהירות יורדת בשליש, ב-58 ג'יגה פי שמונה. הסיבה: macOS מתחילה לדחוק את המטמון ל-swap, וכל פגיעה בזיכרון הופכת לגישה לדיסק. WASTE מגביל את עצמו מראש לסט עבודה אחד פחות מהמקסימום האפשרי.

מה זה נותן למי שלא צריך טריליון פרמטרים

חצי טוקן לשנייה זה בערך 30 שניות למשפט. אבל מודלים ברבע הגודל עדיין רצים על שרתים עם טרה-בייט DDR5, וכאן כמעט 3 טריליון פרמטרים עונים בלי רשת. למי שרוצה להתחיל בקטן, אותו מנוע מריץ את Kimi-Linear 48B ממכל (container) של 19 ג'יגה ב-10.7 טוקן לשנייה. K3 דורשת לפנות טרה-בייט על הדיסק ולהשקיע כחמש שעות המרה על M5 Pro בשלושה תהליכים מקבילים, או כמעט יממה אם מריצים את ההמרה בפייטורץ' נקי. המחברים, אגב, מנהלים קובץ של השערות שהופרכו ומתעדים בו כל מה שמדדו וזרקו. הקוד ברישיון Apache 2.0, זמין בגיטהאב.