מינימקס H3 מאיץ עם תרומות קהילה פתוחה

מודל וידאו עם אודיו מובנה מקבל דחיפה קהילתית
מינימקס (MiniMax) שחררה את H3 כמודל משקולות פתוחות (open weights) ליצירת וידאו עם אודיו סטריאו מובנה (native stereo audio) ושליטת רפרנס מולטי-מודאלית. הקהילה לקחה את הבסיס הזה ובנתה עליו שרשרת אופטימיזציות שמקצרות זמני הסקה ומרחיבות את התמיכה בחומרה זמינה, מ-DGX Spark של NVIDIA ועד Apple Silicon.
זיקוק לארבעה צעדים והרצה על תחנות עבודה
צוות FastVideo יחד עם Nuva Lab ו-NVIDIA הציגו את FastH3, זיקוק (distillation) לארבעה צעדי הסקה בלבד שרץ כעת על DGX Spark ועל שבבי אפל. במקביל, צוות SANA של NVIDIA דיווח על Sol-H3: 15 שניות וידאו 768p עם אודיו ב-6.6 שניות על שמונה מאיצי B300, במדד warm-inference פנימי שלהם.
מנגנון קשב מחודש ו-LoRAs מואצים ב-ComfyUI
חאוצ'נג שי (Haocheng Xi) וקבוצת OpenVDN פרסמו את VDN, כתיבה מחדש של מנגנון הקשב (attention) להאצת הסקה של H3, כולל משקולות, קוד אימון וקוד הסקה. אליבאבא PAI העבירה את שיטת הזיקוק PDD של NVIDIA ל-H3 בתצורת 8-צעדי Acc-LoRAs, וכבר נתמכת ב-ComfyUI.
Turbo LoRAs לתנאי טקסט, תמונה ורפרנס
LightX2V שחררה LoRAs במתכונת 4 ו-8 צעדים (Turbo) עם זרימות עבודה (workflows) לכיסוי טקסט-לווידאו, תמונה-לווידאו ורפרנס-לווידאו, כולן עם אודיו. כל הרכיבים זמינים במאגר הקהילתי בכתובת github.com/MiniMax-AI/awe.
קרדיטים ותנועה קדימה
מאחורי כל שחרור עומדים חוקרים ומהנדסים שמאמנים, מכמתים (quantizing), בודקים ומשתפים, בהם צוותי NVIDIA, חוקרים ממעבדות אקדמיות ותורמים עצמאיים. מינימקס מודה להם ומזמינה את הקהילה להמשיך לדחוף את H3 הלאה.