21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מוצרים

פריזם אם אל משחררת טרנרי בונסאי 2: מודל 27 מיליארד ב-5.9 גיגה עם 98% ביצועים

פריזם אם אל משחררת טרנרי בונסאי 2: מודל 27 מיליארד ב-5.9 גיגה עם 98% ביצועים

דחיסה קיצונית שרצה על חומרה ביתית

פריזם אם אל (PrismML) השיקה את Ternary Bonsai 2 27B, גרסת משקולות טרינריות של Qwen3.8 27B שתופסת 5.93 גיגה-בייט בלבד, לעומת 53.8 גיגה-בייט בפורמט FP16. לפי נתוני החברה, המודל שומר על 98.2% מהביצועים הממוצעים של מודל המקור על פני 20 בנצ'מרקים, תומך בקלט טקסט ותמונות, ומכיל קונטקסט של 262 אלף טוקנים. ההדגמה הרשמית מריצה סוכני קידוד של Cline ושימוש במחשב על RTX 5090, והמודל מגיע חודשיים אחרי Bonsai 27B הראשון, שהגרסה הטרינרית שלו שמרה על כ-95% מהביצועים.

ארכיטקטורה ופורמט טרינרי

הארכיטקטורה של Qwen3.8 27B נשארה ללא שינוי: 27.36 מיליארד פרמטרים שמתחלקים ל-24.35 מיליארד בשלד השפה, 2.54 מיליארד באמבדינג וראש שפה (LM head), ו-0.47 מיליארד במגדל ראייה (vision tower). השלד משתמש באטנציה היברידית, כ-75% שכבות ליניאר-אטנשן ו-25% פול-אטנשן. המשקולות הטרינריות מכסות אמבדינג, הקרנות אטנציה, הקרנות MLP וראש שפה; רק 26.2 מיליון פרמטרים (0.0976%) נשארים בדיוק גבוה יותר, נתיב מצב חוזר (recurrent state path) ומשקולות נרמול. בפורמט GGUF מגדל הראייה ארוז בנפרד כקובץ 0.63 גיגה-בייט שנטען רק בקלט תמונה.

איך עובד הייצוג הטרינרי

כל משקל מקבל אחד משלושה ערכים: 1-, 0 או 1+. כל קבוצה של 128 משקולות חולקת סקייל (scale) אחד ב-FP16. ערך טרינרי נושא log2(3), כ-1.585 ביט; הוספת 16 ביטי סקייל ל-128 משקולות מביאה ל-1.71 ביט למשקל, ועם הטנזורים בדיוק גבוה המספר עולה ל-1.72. גרעיני הרצה אמיתיים דורשים פריסה דחוסה, והמאמר הלבן (whitepaper) מתאר שתי אריזות GGUF: PTQ1_0 דוחסת טריטים בצפיפות של 1.76 ביט למשקל (5.93 גיגה-בייט), ואילו PQ2_0 מאחסנת כל טריט בחריץ 2-ביט ב-7.25 גיגה-בייט, זול יותר לפענוח. המשקולות גם נשמרות בבסיס מסובב: פריזם אם אל מפעילה רוטציית האדמרד (Hadamard) בלוקית בגודל 1,024 לפני ההשמה הטרינרית, והריצה מפעילה את הטרנספורמציה התואמת על האקטיבציות לפני כל כפל. החברה מצטטת את SpinQuant כמקור הרעיון, אך לא מפרסמת כיצד נקבעים הערכים הטרינריים עצמם.

השוואה מול קוונטיזציה רגילה, והפערים שנשארים

ההשוואה החדה יותר היא מול קוונטיזציה קונבנציונלית: בניית IQ2_XXS של Qwen3.8 27B מגיעה לממוצע 75.2 ב-7.3 גיגה-בייט. ב-AIME26 בונסאי 2 משיגה 95.83 מול 78.6, וב-LiveCodeBench v6 הפער הוא 90.07 מול 70.05. כל הבדיקות בוצעו במצב חשיבה (thinking mode) עם EvalScope ו-vLLM על H100. אלא שהממוצע 98.2% מסתיר פערים לא אחידים: ראייה שומרת על 96.3%, ידע והסקה על 96.9%. בעבודת סוכנים ארוכת-אופק הנפילה חדה יותר, 52.8 ב-Terminal-Bench 2.1 מול 69.7, ו-60.8 ב-SWE-bench Verified מול 80.6 (כ-75% שמירה), ושני המבחנים האלה בכלל לא נכללו בממוצע 20 הבנצ'מרקים. מאמץ הסקה (reasoning effort) משפיע גם הוא: במאמץ בינוני הממוצע 79.3 מול 82.6 בבסיס FP16, ומאמץ נמוך לא נתמך. כל התוצאות הן של פריזם אם אל בלבד ולא שוחזרו עצמאית.

ביצועים על חומרה אמיתית ודרישות הרצה

נתוני מהירות (באצ' 1 דיקוד, גרעינים מותאמים, נמדדו ב-16 בספטמבר 2026): RTX 5090 מגיעה ל-142.5 טוקנים לשנייה ב-0.582 מיליוואט-שעה לטוקן; RTX 4090 מגיעה ל-96.7 עם PTQ1_0; L4 בהספק 72 וואט מספקת 32.1; לפטופים עם M5 Max ו-M5 Pro מגיעים ל-46.8 ו-27.7 בהתאמה. אף אריזה לא מנצחת בכל מקום: PTQ1_0 מהירה יותר בכרטיסי אדה (Ada) וב-L4, PQ2_0 מהירה יותר בבלאקוול (Blackwell), הופר (Hopper), אמפר (Ampere) ובאפל סיליקון, ובעיבוד פרומפט בכל הפלטפורמות. צוות המחקר טוען גם ל-40% יעילות אנרגטית טובה יותר ממודל 8 מיליארד בדיוק מלא. להרצה נדרש הפורק (fork) של פריזם אם אל ל-llama.cpp, הגרסה הרשמית דוחה את סוגי PTQ1_0 ו-PQ2_0. הנתיב הנתמך הוא מאגר Bonsai-demo: מריצים setup.sh ואז scripts/start_llama_server.sh לצ'אט.

מקור: marktechpost.com