21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מוצרים

גוגל משיקה את ג'מיני 3.8 לייב ו-3.8 לייב אקסטנדד ת'ינקינג: חשיבה בזמן אמת לסוכני קול

גוגל משיקה את ג'מיני 3.8 לייב ו-3.8 לייב אקסטנדד ת'ינקינג: חשיבה בזמן אמת לסוכני קול

גוגל מפצלת את היצע המודלים הקוליים שלה לשני מסלולים נפרדים: האחד בנוי לסקייל ועלות נמוכה, והשני מכוון למשימות חשיבה מרובות שלבים בלי לשבור את רצף השיחה. ההכרזה אתמול מציגה את Gemini 3.8 Live ואת Gemini 3.8 Live Extended Thinking, שניהם זמינים כבר עכשיו ב-Live API ובפלטפורמת Gemini Enterprise Agent Platform, במטרה לאפשר למפתחים לבנות סוכני קול (voice agents) שמוכנים לפרודקשן בלי להתעסק בתשתית סטרימינג מורכבת.

המודל לחשיבה מורכבת מוביל בבנצ'מרקים

Gemini 3.8 Live Extended Thinking תופס את המקום הראשון במדד איכות דיבור-לדיבור של Artificial Analysis עם ציון 82.6, ומוביל בהשלמת משימות סוכניות עם 68.6% ב-τ-Voice ו-35.1% בבנצ'מרק הבנקאות τ-Voice-banking של Sierra. יכולות ההיגיון שלו נמדדו ב-97.7% ב-Big Bench Audio, וכל זה לטענת גוגל בנקודת מחיר תחרותית מול מודלי פרונטיר אחרים. הייחוד הטכני כאן הוא חשיבה ודיבור בו-זמניים: המודל פולט רמזים מילוליים מוקדמים כמו "תן לי לבדוק את זה..." ומנגן נרטיב התקדמות חי (live progress narration) בזמן שמשימות רקע רצות, מה ששומר על זרימה טבעית גם בפלואים ארוכים.

גרסת הבסיס מכוונת לסקייל ועלות נמוכה

Gemini 3.8 Live הרגיל הגיע למקום שני בזירת הסוכנים הקוליים (Speech Agent Arena) מבחינת העדפת משתמשים, ונשאר חסכוני מאוד ביחס לביצועים. הוא מעבד קלט ויזואלי בזמן אמת כמעט, מזהה ועובר אוטומטית בין 97 שפות באמצע שיחה, ומבצע קריאות כלים ו-API ברקע בלי לעצור את הדיאלוג, המודל מאשר את הבקשה וממשיך לשוחח בזמן שהמשימה מסתיימת מאחורי הקלעים. התכונה הזו קריטית לאפליקציות שדורשות לאטנסי נמוך ותחושת "חי" בלי לשלם על מחזור חשיבה מלא בכל תור.

אקוסיסטם מפתחים ושותפים ארגוניים

את התשתית הכבדה של סטרימינג בזמן אמת מרימים פלטפורמות כמו Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel ו-Vision Agents, שמאפשרות למפתחים להתמקד בחוויית משתמש במקום בפלומבריה של מדיה. בצד הארגוני, סיילספורס, Genspark ו-Lumeris כבר מציינות לאטנסי נמוך, זרימה חלקה ויכולות קריאת כלים כסיבות לאימוץ. כל אודיו שיוצא מהמודלים חתום בסימן מים SynthID בלתי מורגש, שנארג ישירות לתוך הקובץ כדי לאפשר זיהוי תוכן AI ולצמצם דיסאינפורמציה.

רולאאוט מיידי למפתחים, ארגונים וחיפוש

ההפצה החלה אתמול: למפתחים ב-Gemini API וב-Google AI Studio, לארגונים בפריוויו פרטי ב-Gemini Enterprise עם הגעה קרובה ל-Gemini Enterprise for Customer Experience, ולכולם ב-Search Live. הגרסה המורחבת לחשיבה (Extended Thinking) גם היא ברולאאוט החל מאתמול, אם כי גוגל לא פירטה לוחות זמנים מדויקים לכל אזור או תמחור סופי מעבר לאמירה הכללית על תחרותיות.

מקור: deepmind.google