21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

מינימקס H3 רץ על 4090 בודד עם האצה של פי 4.44 מול ריצה דחוסה

מינימקס H3 רץ על 4090 בודד עם האצה של פי 4.44 מול ריצה דחוסה

החוקרים של MiniMax שחררו חבילת ריצה ייעודית למודל H3 שמאפשרת להריץ את הצ'קפוינט BF16 FL2VA המלא, דייט 33B פרמטרים, קונדישנר Qwen3-VL ו-VAE, על כרטיס RTX 4090 בודד עם 24 ג'יגה זיכרון. ההישג המרכזי הוא מהירות של פי 4.44 מקצה לקצה מול ריצה דחוסה (dense) על אותו חומרה, הודות לשילוב של קירנל תשומת לב דליל (Sol-Attn) מותאם לארכיטקטורת SM89, מנגנון קאשינג בשם TeaCache וקומפילציה אזורית עם torch.compile.

איך זה נכנס ל-24 ג'יגה

הטריק הוא offload רכיבי שכבה-שכבה דרך SGLang: בכל רגע נתון רק הרכיב הפעיל יושב על ה-GPU, והשאר ממתינים בזיכרון המארח. הקונפיגורציה המלאה (rtx4090_fullopt.toml) מקבעת את כל הפרמטרים, מהפרומפט וה-seed דרך 50 צעדי דנוייזינג מדודים ועד פרופיל ה-SM89 ומטמון הקאש, כך שהריצה משחזרת בדיוק את הבנצ'מארק שפורסם. הדרישות: PyTorch 2.11 עם CUDA 12.8, Triton 3.6, צ'קפוינט ה-FL2VA דרך משתנה סביבה H3_MODEL_PATH, ו-ffmpeg/ffprobe לקידוד הווידאו הסופי.

הקרנלים שעושים את ההבדל

Sol-Attn רץ כאן עם tau=1.0, סף אלכסוני, כיור KV מדויק לקידומת, שאילתות קידומת דחוסות, ועשרה צעדים ראשונים ושני בלוקים ראשונים בדחיסות מלאה. צעד ה-forward הדליל הראשון דיווח על צפיפות בלוקים אפקטיבית של 19.65% בלבד בממדים [1, 38247, 56, 128]. TeaCache, עם סף 0.10, חמישה צעדים שמורים וצעד צינון אחד, ביצע 14 חישובי בלוק-סטאק ו-35 שימושים חוזרים מתוך 49 החלטות. שער Real-QKV עבר את מבחני השגיאה המוצהרים (שגיאה מוחלטת מקסימלית 0.0625, ממוצעת 0.000289, L2 יחסית 0.000609).

מה המספרים באמת אומרים

ההאצה של פי 4.44 נמדדה מול בסיס "ללא אובדן" שבו לא הופעלו לא TeaCache ולא דלילות Sol-Attn, כלומר ההשוואה היא מול ריצה דחוסה לגמרי עם אותו offload שכבתי ואותו קומפיילר אזורי. לא נטענה שקילות ביטוויז או איכות וידאו, לא נמדדו מטריקות תפיסתיות או הטמעות, והזמנים נלקחו מדגימה חמה בודדת בלי אפיון שונות. במילים אחרות: זה בנצ'מארק הנדסי של זמן ריצה, לא הוכחת איכות יצירה.

תכלס להרצה

ההרצה מתבצעת מהשורש של המאגר עם `python3 scripts/run.py config/minimax_h3/rtx4090_fullopt.toml`; הסקריפט תומך גם ב-override נקודתי דרך `--set` ובייצוא חבילת הרצה ל-Slurm דרך `launch_config.py`. חבילת הריצה שומרת את out.mp4, benchmark.json ולוגי השקה תחת תיקיית runs. הקומיטים המוצמדים: Sana 6fb7eb1, SGLang 6fa3f9d.