21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות

עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות

מהפך בגודל שליש

צוות Qwen של עליבאבא שחרר את Qwen-Image-2.1, מודל משקולות-פתוחות (open-weight) שמאחד לראשונה ייצור טקסט-לתמונה ועריכה בצ'קפוינט אחד של 7 מיליארד פרמטרים. הגרסה הקודמת, Qwen-Image מאוגוסט 2025, הגיעה בגודל 20B תחת רישיון Apache 2.0 והחזיקה את העריכה במודל נפרד; כעת שתי המשימות נכנסות למודל יחיד בכשליש מהנפח. הצוות מגדיר אותו כמאוזן והכלכלי ביותר בסדרה, אבל חשוב לזכור: ה-7B סופרים רק את טרנספורמר הדיפוזיה. הפייפליין המלא טוען גם מקודד Qwen3-VL של 8B, כך שטביעת הזיכרון האמיתית גדולה יותר.

ארכיטקטורה: קאש שנשאר קבוע

בלב המודל עומד טרנספורמר דיפוזיה חד-זרמי (single-stream DiT) בן 32 שכבות עם מנגנון קשב בלוק-סיבתי (block-causal). החידוש המעשי נמצא במסכת הקשב: טוקני טקסט מקבלים מסכה סיבתית ברמת הטוקן, בעוד טוקני תמונה מקבלים מסכה דו-כיוונית ברמת הצ'אנק (chunk-level bidirectional) בתוך כל תמונת רפרנס. Qwen מכנים את זה "קשב בגרגיריות מעורבת" (mixed-granularity attention). הפריפיקס המותנה, טקסט ותמונות רפרנס, יושב לפני הלאטנט הרועש ולעולם לא מקשיב לו; לכן המפתחות והערכים שלו נשארים קבועים לאורך כל שלבי הדנואיזינג. המודל מחשב אותם פעם אחת, בצעד הראשון, ומשתמש בקאש KV הזה בכל הצעדים הבאים. החיסכון גדל עם מספר תמונות הרפרנס, מה שמסביר את טענת המהירות בריבוי תמונות.

יכולות: שקיפות, רפרנסים מרובים ושליטה מקומית

המודל מייצר RGBA נייטיבי, תמונות עם ערוץ אלפא מובנה, מטקסט, עורך שכבות שקופות ומחלץ אובייקטים מתצלומים; ב-README מומלץ תבנית פרומפט קבועה לפלט שקוף. עריכה מרובת-רפרנס תומכת בעד 10 תמונות מקור, עם דוגמאות כמו תמונה קבוצתית מ-6 פורטרטים או הרכבת אאוטפיט מ-5 רפרנסים. שליטה מקומית מתאפשרת דרך עיגולים, אנוטציות מצוירות או מסכות נפרדות, תוך שמירת זהות לאנשים ומוצרים. הרזולוציה הדיפולטיבית היא 2048×2048 עם 7 יחסים נתמכים עד 2752×1536. בצד האסתטי מדווחים על שיפור בטיפוגרפיה, תאורת פורטרטים ופרטים עדינים, עם דגש על פנורמות, אינפוגרפיקות, סטוריבורדים וטריאון וירטואלי.

בנצ'מרק ביתי: מוביל בין הפתוחים, עדיין מאחורי הסגורים

ההשוואה הרשמית רצה על Qwen-Image-Bench, בנצ'מרק אין-האוס של הצוות. שם Qwen-Image-2.1 מקבל 60.28 בסך הכול, מעל Nano Banana 2.0 (59.82) וכל מודל משקולות-פתוחות אחר ברשימה. FLUX 2 Max, מודל 32B פתוח, עומד על 55.33. שישה מודלים סגורים מקדימים אותו, בראשם GPT Image 2.5 Sunburst עם 67.01. מכיוון שהבנצ'מרק של המפתחת עצמה, המספרים דורשים אימות עצמאי לפני שמסיקים עליונות מעשית.

הרצה ודיפלוימנט: דיי-זירו באקוסיסטם, רישיון נפרד לפרודקשן

תמיכה מיידית (Day 0) קיימת ב-Diffusers, ComfyUI, vLLM-Omni, SGLang ו-LightX2V. הקוד המינימלי ב-Diffusers דורש PyTorch 2.4+, Transformers 5.17+, Diffusers מהמקור, Accelerate ו-Pillow; אותו פייפליין מטפל גם בעריכה כשמעבירים פרמטר image עם רפרנס אחד או יותר. לכרטיסים קטנים יותר pipe.enable_model_cpu_offload מוריד לחץ זיכרון. להגשה (serving), vLLM-Omni מוסיף קוואנטיזציית FP8, קאש פריפיקס KV, פענוח CUDA Graphs ומקביליות טנזור; SGLang מוסיף Cache-DiT, גרפי CUDA, מולטי-GPU ואופלוד רכיבים. ComfyUI מגיע עם נודס נייטיביים ומשקולות מומרות. פריסה מסחרית דורשת רישיון נפרד מ-Qwen, המודל אינו Apache 2.0 כמו קודמו.

מקור: marktechpost.com