גוגל משיקה את Gemini Omni 1.1 Flash והופכת את מודל הווידאו שלה מגנרטור לכלי שניתן לכוון

מה שמאחורי המספרים
המודל החדש (gemini-omni-1.1-flash) זמין כבר עכשיו דרך Gemini API ב-Google AI Studio וב-Gemini Enterprise Agent Platform. התמחור עומד על 1.50 דולר (כ-5.5 שקל) למיליון טוקנים של קלט, טקסט, תמונה, וידאו או אודיו, ו-9 דולר (כ-33 שקל) למיליון טוקני טקסט בפלט, או 17.50 דולר (כ-64 שקל) למיליון טוקני וידאו. בחישוב מעשי, שנייה אחת של 720p צורכת 5,792 טוקנים, מה שמביא את העלות לכ-0.10 דולר (כ-37 אגורות) לשנייה בתמחור סטנדרטי. כל וידאו שנוצר נושא סימן מים SynthID בלתי נראה אך ניתן לזיהוי תכנותי.
הרחבת סצנה ושליטה בפריימים
השינוי המרכזי בגרסה 1.1 הוא הרחבת סצנה (Scene Extension) שמאפשרת קריאה של עד 10 שניות של הקשר קודם במקום פריים בודד בגרסאות קודמות. ההרצה מתבצעת במקטעים של 10 שניות עד לצבירה של 40 שניות סך הכול, כאשר כל קריאה מייצרת המשך של 3 עד 10 שניות. המגבלות ברורות: אפשר להוסיף רק בסוף הקליפ, לא בתחילה ולא באמצע; קלט וידאו מוגבל ל-10 שניות אלא אם מדובר בהמשך של וידאו שנוצר במודל רב-שלבי; ולא ניתן להוסיף דיאלוג חדש כשמרחיבים וידאו שהועלה ובו מישהו מדבר - דיאלוג נתמך רק בהמשך רב-שלבי דרך previous_interaction_id.
פריימים ראשון ואחרון ורפרנס וידאו
כעת אפשר לספק פריים ראשון ואחרון ולתת למודל לייצר את הווידאו הרציף ביניהם, המנגנון שמאפשר אורביטים, דולי-זום ולופים חלקים. פרומפטים מקשרים מדיה לתפקידים באמצעות תגיות: FIRST_FRAME, LAST_FRAME, IMAGE_REF_N ו-VIDEO_REF_N. רפרנס וידאו מקבל עד שלושה קליפים של שלוש שניות כל אחד, עובד הכי טוב לדמיון דמויות, ומתעלם מאודיו שבתוכם; חשיבה על פני מספר סרטונים אינה נתמכת ועלולה לפגוע בתוצאה.
בקרת עלויות: דראפט ב-360p, גמר ב-4K
הפרמטר resolution ב-response_format מקבל 360p, 720p (ברירת מחדל), 1080p ו-4k, כאשר שני האחרונים עוברים אפסקייל. לפי גוגל, תצוגות 360p רצות עד 60% מהר יותר ועולות שליש ממחיר 720p, לפי תפוקת מערכת. זה הופך את הלולאה דראפט-אז-אפסקייל לדפוס הייצור המיועד: איטרציות זולות, רינדור סופי אחד.
עריכה בשיחה והחורים שנשארו
העריכה מתנהלת דרך Interactions API בצורה מדינתית (stateful), מעבירים previous_interaction_id והמודל מחיל את השינוי תוך שמירה על מה שלא צוין, בלי להעלות מחדש את הווידאו הקודם. רשימת החוסרים ארוכה: אין system instructions, temperature, top_p, רצפי עצירה או נגטיב פרומפטים (שליליים נכנסים בטקסט הפרומפט); עריכת קול לא נתמכת; רפרנסי אודיו לא נתמכים; כתובות יוטיוב אינן מקור קלט; אנגלית נתמכת במלואה, שאר השפות לא נבדקו. לקבצים מעל 4 MB נדרש delivery="uri" ופולינג ל-Files API עד סטטוס ACTIVE.
מי כבר רץ עם זה בייצור
אדובי (Firefly), Figma Weave, GMI Cloud ו-Runway כבר מופיעות כלקוחות שמריצות את Omni Flash בפרודקשן. המודל זמין גם ב-Google Flow למנויי AI Plus, Pro ו-Ultra, עם הרחבת סצנה באפליקציית Gemini.