21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מחקר

חוקרים מאימפריאל קולג' משחררים מתאם LoRA שהופך את MiniMax-H3 למחולל וידאו בזמן אמת

חוקרים מאימפריאל קולג' משחררים מתאם LoRA שהופך את MiniMax-H3 למחולל וידאו בזמן אמת

צוות חוקרים מאימפריאל קולג' בלונדון פרסם מתאם LoRA שהופך את מודל הווידאו MiniMax-H3 למחולל סטרימינג סיבתי, כלומר, המודל מייצר וידאו מקטע אחר מקטע כשהוא מסתמך רק על מה שכבר נוצר, במקום לדגום קליפ דו-כיווני שלם בבת אחת. המתאם, שפותח במסגרת פרויקט RAVEN, זמין כעת כגרסת תצוגה מקדימה ראשונית ב-Hugging Face, והקוד המלא נמצא במאגר הפרויקט בגיטהאב.

איך זה עובד: אקסטרפולציה במקום דנואיזינג דו-כיווני

במודלי וידאו סטנדרטיים, תהליך היצירה מתבצע כדנואיזינג (denoising) של רצף פריימים שלם בו-זמנית, מה שמחייב החזקה של כל הקליפ בזיכרון ומגביל את אורך היצירה. גישת RAVEN מחליפה את זה באקסטרפולציה סיבתית: כל מקטע חדש נגזר רק מהמקטעים שקדמו לו, בדומה לאופן שבו מודלי שפה מייצרים טקסט טוקן אחר טוקן. לדברי החוקרים, יאנזואו לו (Yanzuo Lu), רונגלאי זואו (Ronglai Zuo) וג'יאנקאנג דנג (Jiankang Deng), המתאם אינו דורש משאבי חישוב גבוהים יותר מהמודל הבסיסי, ואולי אף פחות, מכיוון שכל מעבר קדימה (forward pass) של ה-DiT מטפל במקטע בודד בלבד.

מגבלות ידועות: מרקם פרטים עדיין נחות

החוקרים מדגישים שמדובר בגרסת תצוגה מקדימה בלבד: המתאם עדיין בתת-אימון (undertrained), ופרטי מרקם (texture details) נותרים מוגבלים. המאמץ הנוכחי מתמקד בשיפור איכות המרקם כעדיפות ראשונה, בעוד יכולות כמו יצירה ארוכת-טווח באמצעות הרחבות דוגמת capped RoPE טרם נבדקו, אם כי הארכיטקטורה תומכת בהן תיאורטית. המאמר המתאר את השיטה, "RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO", מופיע כפרה-פרינט ב-arXiv (מספר 2605.15190) ועדיין לא עבר שיפוט עמיתים.

רישוי והפעלה: נדרש רכיב בסיס נפרד

המתאם משוחרר תחת רישיון הקהילה של MiniMax-H3, והמשתמשים אחראים לעמידה בתנאי הרישיון של מודל הבסיס, המאגר והתלויות. כדי להריץ את המערכת יש להוריד בנפרד את רכיבי MiniMax-H3 הבסיסיים (טוקנייזר, DiT, מקודד טקסט, VAE לווידאו, VAE לאודיו) ולעדכן את הנתיבים בקבצי הקונפיגורציה המצורפים. סביבת ההרצה המומלצת כוללת צומת יחיד עם 8 מעבדים גרפיים במקביליות מאוחדת (4-way unified parallelism, FSDP shard size 8).

צעד ראשון לצינור אימון מלא לסטרימינג

למרות המגבלות, החוקרים מציינים שהגרסה הנוכחית מאמתת את צינור האימון והאינפרנס המלא בשיטת RAVEN על גבי MiniMax-H3, מהאימון ועד היצירה. הקוד כולל מימושי אימון בתיקיית projects/minimax_h3/meta_models/, והתרומות מהקהילה מתקבלות בברכה. השלב הבא, לדברי הצוות, הוא האצת אינפרנס כדי להגיע ליצירה בזמן אמת של ממש, במקביל להמשך שיפור איכות המרקם.