13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים דינה רובוטיקס משחררת מודל עולם-פעולה שפותח על מיליון שעות וידאו אנושי נמוטרון 3.5 לייטנינג נוחת בפריים אינטלקט עם תמיכה מיום אפס התפרצות כבד שומני עולמית: בינה מלאכותית עשויה להקדים תרופה למכה
מודלים

NVIDIA משיקה LongLive-2.0 – מודל 5‑ביליוני פרמטרים שמייצר וידאו של דקה ב‑720p בזמן אמת

מאת הדר מזרחי כתב/ת AgentNet
NVIDIA משיקה LongLive-2.0 – מודל 5‑ביליוני פרמטרים שמייצר וידאו של דקה ב‑720p בזמן אמת

החוקרים מ‑NVIDIA פרסמו את LongLive-2.0, תשתית שמאפשרת לאמן ולהריץ מודלים ליצירת וידאו ארוך תוך שימוש בקוונטיזציה של 4‑ביטים בפורמט NVFP4, פורמט פנימי של NVIDIA שתומך באופן מקורי במעבדי גרפיקה מדור Blackwell (GB200). מכיוון שהאצה מלאה זמינה רק על החומרה הזו, השוואה ב‑מחקר נקטה בין קוונטיזציית BF16 – שבה כל מספר נשמר ב‑16 ביט – לבין NVFP4, שמכווץ את המספרים ל‑4 ביט, מה שמקטין את גודל המודל ומאיץ את החישוב. תיאורטית הקטנת הרזולוציה של הנתונים עלולה לפגוע באיכות, אך המחברים מצביעים על כך שההבדל בפועל זעיר: 85.06 מול 84.51 בנקודה על מדד VBench.

הגרסה המשודרגת של המודל, Wan2.2‑TI2V‑5B, שנאמן בעזרת LongLive‑2.0, מצליחה לייצר וידאו ברזולוציית 720p בקצב של 45.7 פריימים לשנייה. לעומת זאת, שיטות קודמות שהפיקו וידאו ב‑480p קלעו למהירות של 20‑25 FPS בלבד. בנוסף, זמן האימון קוצר ב‑2.15 פעמים, זמן האינפרנס (ההרצה) מתקצר ב‑1.84 פעמים, וצריכת הזיכרון הגרפי יורדת מ‑35.4 GB ל‑19.4 GB לעומת גרסת BF16. על מדד VBench‑Long המודל תפס את המקום הראשון מבחינת עקביות הדמויות והרקע בקטעי וידאו של 60 שניות.

ההישג מתאפשר בזכות שלושה רכיבים מרכזיים: Balanced SP, שמחלק את העיבוד של קטעי הזמן בין יחידות GPU ומונע חזרות מיותרות בקידוד VAE; קוונטיזציית KV‑Cache ב‑NVFP4 בזמן הייצור, שמכווצת את המטמון ב‑3.6 פעמים; ו‑Decoding אסינכרוני שמריץ את VAE על GPU נפרד במקביל למודל הראשי, כך שהקידוד אינו מאט את תהליך הייצור.

קוד המקור, המשקלים וקבוצות הנתונים זמינים לציבור ב‑GitHub וב‑Hugging Face.