21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

Qwen3.8-27B רץ מקומית על 17 גיגה-בייט זיכרון דרך Unsloth Dynamic GGUF

Qwen3.8-27B רץ מקומית על 17 גיגה-בייט זיכרון דרך Unsloth Dynamic GGUF

המודל החדש במשפחת Qwen מגיע למחשבים אישיים בלי להתפשר על גודל הקונטקסט או על יכולות ראייה. גרסת 27 מיליארד הפרמטרים של Qwen3.8 זמינה כעת בפורמט GGUF כמות (quantized) של Unsloth, שמאפשר הרצה על 17 גיגה-בייט RAM בלבד, נפח שמחשבים ניידים רבים כבר מכילים. לפי Unsloth, זהו המודל החזק ביותר בקטגוריית המשקל שלו, וגרסאות NVFP4 כמותות גם הן עלו למאגר.

ארכיטקטורה היברידית עם DeltaNet

מתחת למכסה המנוע יושבת ארכיטקטורה שמשלבת שני מנגנוני קשב שונים. המודל מכיל 64 שכבות במימד נסתר של 5,120, כאשר הפריסה הפנימית בנויה מ-16 בלוקים חוזרים: כל בלוק מכיל שלוש שכבות Gated DeltaNet (מנגנון קשב ליניארי עם 48 ראשים ל-V ו-16 ל-QK, מימד ראש 128) ואחריהן שכבת Gated Attention קלאסית (24 ראשי שאילתה, 4 ראשי מפתח-ערך, מימד ראש 256). רוטציה (RoPE) במימד 64, ו-FFN ברוחב 17,408. אימון MTP (חיזוי רב-טוקנים) מוסיף מהירות אינפרנס בלי להגדיל את המודל.

קוונטיזציה בגרסת תצוגה מקדימה של Unsloth V3.0

הקבצים שפורסמו משתמשים ב-Unsloth Dynamic V3.0 (preview), גרסת הרצה מוקדמת של מנוע הקוונטיזציה הדינמי של החברה. לטענת המפתחים, זהו הביצוע הטוב ביותר מסוגו (SOTA) ל-GGUF כרגע. החבילה כוללת תמיכה ב-Developer Role, מה שמאפשר למודל לתפקד בתוך כלים סוכניים (agentic) כמו Codex; MTP לאינפרנס מהיר; הרצה וכוונון עדין (fine-tuning) ישירות ב-Unsloth Desktop; ושיפורים בפרסינג של אובייקטים מקוננים לקריאות כלי (tool calling) אמינות יותר.

יכולות מולטי-מודאליות ושליטה בחשיבה

Qwen3.8-27B הוא מודל שפה-ראייה מובנה (native vision-language): הוא מבין תמונות, תרשימי STEM, מסמכים וסרטונים באורך של עד שעות. מצב חשיבה (thinking mode) מופעל כברירת מחדל, אבל ניתן לכבות אותו פר-בקשה; עומק ההיסק ניתן לכוונון דרך פרמטר reasoning_effort, והקשר החשיבה מהודעות קודמות נשמר באמצעות preserve_thinking. אורך הקונטקסט המקורי עומד על 262,144 טוקנים, עם הרחבה אפשרית עד מיליון טוקנים.

פרמטרי דגימה מומלצים לשני מצבים

למצב חשיבה ממליצים המפתחים: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0. למצב הוראה רגיל (ללא חשיבה): temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0. במסגרות שתומכות בהפרדה בין תקרת טוקנים לחשיבה פנימית לבין פלט סופי, ההמלצה היא להקצות מרחב נדיב לחשיבה בתוך חלון המיליון טוקנים.

משמעות מעשית: מודל קצה על חומרה נגישה

השילוב בין ארכיטקטורת DeltaNet-Attention היברידית, קוונטיזציה אגרסיבית אך מדויקת, ותמיכה מובנית בכלים סוכניים מציב את Qwen3.8-27B בעמדה ייחודית: מודל עם יכולות קידוד, מחקר ותכנון ארוך-טווח שנכנס ללפטופ בלי ענן ובלי GPUs יקרים. עבור מפתחים שבונים אפליקציות מקומיות או חוקרים שצריכים פרטיות מלאה, זהו צעד משמעותי לכיוון הרצה עצמאית של מודלים ברמת frontier על חומרה צרכנית.