21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מוצרים

גוגל משיקה את Gemini 3.5 Transcribe, מודל דיבור-לטקסט מדויק יותר עם יכולות עריכה קוליות

גוגל משיקה את Gemini 3.5 Transcribe, מודל דיבור-לטקסט מדויק יותר עם יכולות עריכה קוליות

מודל חדש, שני ממשקים

גוגל הכריזה היום על Gemini 3.5 Transcribe, מודל התמלול המתקדם ביותר שלה עד כה, שזמין כעת למפתחים דרך Gemini API ב-גוגל AI סטודיו וב-פלטפורמת הסוכן הארגונית של ג'מיני. המודל מוצע בשני מסלולים נפרדים: סטרימינג בזמן אמת דרך Live API עם gemini-3.5-transcribe-live, שמספק השהייה תת-שנייה לאפליקציות קול אינטראקטיביות, ועיבוד אודיו מוקלט דרך Interactions API עם gemini-3.5-transcribe, שכולל ייחוס דוברים וחותמות זמן ברמת מילה. בגוגל מדגישים שהמודל נבנה להשתלב ישירות בתהליכי עבודה של מפתחים, בין אם הם בונים סוכני קול, כלי כתוביות בזמן אמת, או צינורות אנליטיקה לשיחות מוקלטות.

המספרים מאחורי ההבטחות

לפי מדידות של ארטיפישל אנליסיס, המודל משיג Word Error Rate ממוצע של 4.0% בסטרימינג ו-2.6% בשימוש לא סטרימינג, עם ביצועים חזקים בסביבות רועשות ובזיהוי ישויות אלפאנומריות כמו מיקודים ומספרי הזמנה. בבנצ'מרק FLEURS על קבוצת שפות ולוקלים מובילות, התוצאות עומדות על 5.50% WER בסטרימינג ו-5.04% בלי סטרימינג. בגוגל מציינים שיפור של 70 נקודות אחוז בזמן לקבלת תמלול סופי לעומת המודל הקודם, Chirp 3. חשוב לציין: המדדים מגיעים ממקור יחיד (ארטיפישל אנליסיס) ולא ממבחנים עצמאיים מרובים, ותמיכה ב-3+ דוברים מוגדרת עדיין כניסיונית.

תמלול חכם, לא רק מדויק

החידוש המרכזי אינו רק בדיוק אלא ב"תמלול חכם": המודל מטפל אוטומטית בתיקונים עצמיים (“ניפגש בשלישי, לא, ברביעי”), מסיר מילות מילוי (“אהה”, “הממ”), ומעצב את הטקסט אוטומטית. יכולת נוספת היא Function Calling; המודל יכול להאציל משימות מורכבות כמו יצירת תמונות או ניתוח קבצים למודלי Gemini אחרים דרך קריאות פונקציה, יכולת זמינה כרגע רק באפליקציית Gemini ל-macOS. עוד ברשימה: אוצר מילים מותאם לז׳רגון מקצועי ולאיות ייחודי, זיהוי אוטומטי של למעלה מ-85 שפות עם מבטאים ודיאלקטים אזוריים, וייחוס דוברים באודיו מוקלט עד שלושה משתתפים.

מהמעבדה למקלדת

המודל כבר משולב במוצרי גוגל לצרכנים: באפליקציית Gemini וב-אנדרואיד דרך פיצ׳ר Rambler, ב-Gboard, ב-Antigravity, וב-Chrome. ב-Gboard באנדרואיד, Rambler הופך מחשבות מדוברות לטקסט מעוצב היטב, מסנן מילות מילוי, ומאפשר עריכה קולית, תיקון שגיאות כתיב, שינוי סגנון כתיבה, וביצוע שינויים בטקסט באמצעות הקול בלבד. בגוגל מתארים זאת כצעד לכיוון אינטראקציה טבעית יותר שמבינה הקשר, כוונה, ועריכות inline.

שדרוג על הנייר, מבחן במציאות

Gemini 3.5 Transcribe מייצג קפיצה ברורה על הנייר מול Chirp 3, יכולות חדשות, WER משופר, השהייה נמוכה משמעותית. אבל כמו תמיד אצל ספקי תשתית, המבחן האמיתי יהיה באינטגרציה: איך המודל מתנהג בקוד פרודקשן עם אודיו מלוכלך, אקוסטיקה משתנה, ודרישות השהייה קשוחות. העובדה ש-Google לא חושפת פרטים על ארכיטקטורת המודל, נתוני אימון, או מגבלות רישוי מעבר ל-API, משאירה למפתחים מעט מרחב להערכה עצמאית לפני הטמעה.

מקור: deepmind.google