גוגל משיקה הבנת וידאו אג'נטית במודלי ג'מיני 3.7 פלאש, 3.6 פלאש ו-3.5 פלאש-לייט

גוגל משחררת היום יכולת חדשה בשם "הבנת וידאו אג'נטית" (agentic video understanding) בשלושה ממודלי ג'מיני העדכניים שלה, 3.7 פלאש, 3.6 פלאש ו-3.5 פלאש-לייט. במקום לעבד וידאו בקצב פריימים קבוע (ברירת מחדל 1 FPS, ניתן לשינוי דרך ה-API), המודל מקבל כלי פנימי שמאפשר לו לחפש, לסרוק ולבחון קטעים ספציפיים לאורך הווידאו, בפריימים, באודיו ובתמליל, לפי הצורך האמיתי של המשימה. התוצאה המוצהרת: פחות טוקנים, פחות כסף, ודיוק גבוה יותר.
איך זה עובד בפועל
במקום בליעה פסיבית של זרם המדיה בקצב קבוע, המודל נכנס ללולאה אג'נטית: הוא מחליט איזה חלק לטעון, באיזה קצב, ואיזו מודליות (ויזואלית, אודיו, טקסט) רלוונטית כרגע. מפתחים יכלו לממש לוגיקה כזו ידנית קודם, אבל עכשיו היא מובנית במודל עצמו דרך קריאה לכלי פנימי, מה שחוסך תקורה פיתוחית משמעותית. גוגל מדגימה זאת כהרחבה טבעית של "ראייה אג'נטית" שהושקה קודם לכן, ששילבה הרצת קוד עם הבנת תמונה נייטיבית.
המספרים מאחורי ההבטחה
לפי הבנצ'מרקים שגוגל מפרסמת, ג'מיני 3.7 פלאש עם הבנה אג'נטית מציג הפחתה של עד 88 נקודות אחוז בצריכת טוקנים, חיסכון של עד 66 נקודות אחוז בעלויות ניתוח, ושיפור של עד 7 נקודות אחוז בדיוק, בהשוואה לעיבוד סטטי באותם מודלים. היתרון בולט במיוחד בווידאו ארוך: ממדריכי 10 דקות ועד הרצאות של 90 דקות והקלטות רב-שעתיות, שם עיבוד סטטי מכריח מפתחים לבחור בין עלות טוקנים גבוהה לבין טכניקות דילול שמאבדות פרטים קריטיים. ג'מיני 3.7 פלאש ממוקם, לדברי גוגל, על חזית פארטו של דיוק-מול-עלות בין המודלים שנבדקו למשימת הבנת וידאו.
מה זה מאפשר בפועל
היכולת פותחת ארבעה תרחישי שימוש עיקריים: אחזור רגע בתת-שנייה, זיהוי חיתוכים חדים ושינויי מצב שמתפספסים בקצב של 1 פריים לשנייה, מה שהופך עריכה אוטומטית מדויקת לאפשרית; חיפוש "מחט בערימת שחת" בווידאו ארוך, מענה לשאילתות מורכבות על הקלטות בנות שעות בלי לצרוך מיליוני טוקנים; זיהוי אנומליות, דגימה מחדש של חלונות זמן מעניינים בקצב גבוה כדי לבחון תנועה מהירה ופגמים ויזואליים עדינים; וספירת פעולות ואובייקטים, מעקב מדויק אחרי תנועות חוזרות ואובייקטים נפרדים לאורך זמן.
זמינות, תמחור והצעד הבא
התכונה זמינה החל מהיום דרך Gemini API ב-Google AI Studio וב-Gemini Enterprise Agent Platform, לכל שלושת המודלים הנתמכים. ההפעלה פשוטה: הגדרת `processing: "agentic"` בקונפיגורציית ה-API. התמחור נשאר תמחור טוקנים סטנדרטי של Gemini API, ללא עמלה נוספת על התכונה עצמה. גוגל מפנה למדריך מפתחים להעמקה טכנית; שותפי גישה מוקדמת דיווחו על ביצועים חזקים, אם כי מדובר בעדויות של צד ראשון ולא במדידה עצמאית.