פריזאם משיקה מודל דחוס שרץ על לפטופ ומתקרב לביצועי המקור

דחיסה בלי איבוד אינטליגנציה
מעבדת AI בשם PrismML שחררה אתמול את Bonsai 2 27B, גרסה דחוסה של Qwen3 27B של עליבאבא שיורדת מ-27 מיליארד פרמטרים ל-5.9 ג'יגה-בייט בלבד. זהו צמצום של פי 9 עד 10 בזיכרון, שמאפשר להריץ את המודל על מחשב אישי ואולי גם על סמארטפון מתקדם. לפי החברה, הגרסה הדחוסה משיגה 98% מציוני הבנצ'מארק המצרפיים של המודל המקורי, שיפור מול 95% בגרסה הראשונה שיצאה במרץ.
טכניקת משקולות טרינרית
ההישג מבוסס על שיטת דחיסה שהחברה מכנה "משקולות טרינריות" (ternary weights). במקום לאחסן כל משקולת ב-16 סיביות, השיטה מצמצמת את הערכים האפשריים לשלושה בלבד: +1, 1- או 0. המשקולות הן המידע שהמודל לומד באימון, וצמצום הייצוג שלהן מקטין דרמטית את נפח האחסון. את הפירוט הטכני המלא פרסמה החברה בעמוד Hugging Face של הפרויקט.
מאחורי הקלעים: חוקרים מקלטק ויועץ מברקלי
את PrismML הקימו חוקרים מהמכון הטכנולוגי של קליפורניה (Caltech), והיא מנוהלת על ידי בבאק חסיבי (Babak Hassibi), פרופסור בקלטק ומומחה לטכנולוגיות דחיסה. כיועץ משמש איון סטויקה (Ion Stoica), ממייסדי Databricks ומנהל מעבדת Sky Computing בברקלי, חממה שהצמיחה בין היתר את Letta ו-SGLang. סבב הסיד עומד על 22.25 מיליון דולר (כ-82 מיליון שקל) ממשקיעים בהם Khosla Ventures, Cerberus Capital וקלטק עצמה.
הורדות במיליונים, אבל הדרך ל-100% עוד ארוכה
הגרסה הראשונה של Bonsai כבר נרשמה עם יותר מ-11 מיליון הורדות, והמודלים הקטנים יותר הוסיפו 2.6 מיליון נוספים. חסיבי מודה שדחיסה תמיד תגרור מחיר כלשהו בביצועים, ושפריטי בנצ'מארק לא משקפים במלואם משימות אמיתיות, כך שפער של 2% כנראה לא ישנה מהותית את חוויית השימוש. גם התוכנה העוטפת (inference harness) משפיעה על הדיוק לא פחות מהמשקולות עצמן.
היעד הבא: מאות מיליארדי פרמטרים
הצעד הבא של החברה הוא יישום אותה טכניקה על מודלים בסדר גודל של כמה מאות מיליארדי פרמטרים, עם השקה צפויה בחודשים הקרובים. חסיבי מעריך שדווקא במודלים גדולים יותר יהיה קל יותר לשמור על האינטליגנציה בדחיסה, כי "יש יותר מרחב לדחוס בלי לאבד". סטויקה מוסיף שהכיוון מאפשר אינטליגנציה בקצות האצבעות, בחינם, כי היא רצה על החומרה שכבר קנית. שמועות על מגעים עם אפל נותרו ללא תגובה.