21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מוצרים

גוגל משיקה את Gemini 3.5 Transcribe עם שני ממשקי API נפרדים להקלטות ולסטרימינג חי

גוגל משיקה את Gemini 3.5 Transcribe עם שני ממשקי API נפרדים להקלטות ולסטרימינג חי

גוגל שחררה את Gemini 3.5 Transcribe, מודל דיבור-לטקסט שמגיע בשני נקודות קצה נפרדות במקום אחת, החלטה ארכיטקטונית שמכתיבה יכולות, מגבלות ותמחור שונים לגמרי. gemini-3.5-transcribe מטפל בקבצים מוקלטים דרך ה-Interactions API, ואילו gemini-3.5-transcribe-live מיועד לסטרימינג דו-כיווני בזמן אמת דרך ה-Live API. לפי בדיקות של Artificial Analysis, שיעור השגיאות הממוצע עומד על 4.0% בסטרימינג ו-2.6% בעיבוד לא-חי, עם שיפור של 70% בזמן עד לתמלול סופי לעומת Chirp 3, המודל הקודם של גוגל. זיהוי שפה אוטומטי מכסה יותר מ-85 שפות ומתמודד עם החלפת שפה באמצע משפט.

שני ממשקים, שני מוצרים שונים

ה-Live API מספק תמלול רציף בתת-שנייה. הוא פולט interim_input_transcription עבור חלקים ספקולטיביים בזמן שהדובר עדיין מדבר, ואז input_transcription כשהתור מסתיים. אודיו נכנס כ-PCM גולמי 16-ביט ב-16kHz מונו, בחבילות של 100 מילישניות, עם תמיכה בזיהוי פעילות קולית אוטומטי, היברידי או ידני. טוקנים ארעיים מאפשרים ללקוחות מובייל ווב להזרים בלי להחזיק מפתח API. המגבלות קשיחות: סשן חי מוגבל ל-10 דקות רצופות, אין דיאריזציה (זיהוי דוברים) ואין חותמות זמן ברמת מילה.

ה-Interactions API משלים את מה שהסטרימינג לא יודע לעשות. הוא מציע דיאריזציה, חותמות התחלה וסוף ברמת מילה, והטיית אוצר מילים מותאם, עד 1,000 מונחים, עם תוצאות מיטביות מתחת ל-100. בקשות רגילות מקבלות עד שעה אודיו; זה יורד לחצי שעה כשדיאריזציה או חותמות מילה מופעלות. זהו ההבדל התכנוני המרכזי: תמלול קריא ותמלול בר-ביקורת הם עכשיו שתי קריאות API נפרדות.

מצב verbatim מול smart, הבחירה שמכתיבה את הפיצ'רים

שני הממשקים חושפים שני מצבים. verbatim הוא ברירת המחדל ומחזיר הכול: מילות קישור, חזרות, התחלות שווא. smart מסיר דיספלואנסיות, פותר תיקונים עצמיים מדוברים בתוך השורה, ומיישם עיצוב מובנה. הדוגמה של גוגל עצמה: "אממ, אז לפגישה, אני חושב שצריך, אה, להזמין את אליס ו... רגע לא, בוב וקרול." Verbati שומר הכול. Smart מחזיר "לפגישה, אני חושב שצריך להזמין את בוב וקרול." הטריידאוף חד: מצב smart לא ניתן לשילוב עם חותמות זמן ברמת מילה או דיאריזציה. מי שצריך תמלול נקי לקריאה ומי שצריך תמלול מדויק לניתוח, יצטרך להריץ שתי קריאות נפרדות.

ביצועים: המספרים וההקשר שלהם

ב-FLEURS, בנצ'מרק רב-לשוני, המודל מדווח 5.50% WER בסטרימינג ו-5.04% בעיבוד לא-חי על קבוצת שפות ו-locales מובילות. המספרים האלה גבוהים יותר מהממוצע המוצהר (2.6%/4.0%), מה שמרמז שהממוצע נשען על שפות או תנאים נוחים יותר. השיפור של 70% בזמן לתמלול סופי מול Chirp 3 משמעותי ליישומי זמן אמת, אבל גוגל לא פרסמה מדדי השהייה מוחלטים, רק את השיפור היחסי. אין משקולות פתוחות ואין נתיב self-hosted; זו החלטת שירות מנוהל, לא החלטת תשתית.

זמינות: שלושה מסלולים, כולם בפריוויו ציבורי

מפתחים יחידים וסטארטאפים מתחילים בדרג החינמי של Google AI Studio. צוותי מיד-מרקט עוברים לדרג בתשלום עבור מגבלות קצב גבוהות יותר, שגם מבטיח שהתוכן לא ישמש לשיפור המוצרים של גוגל. ארגונים מפוקחים מנתבים דרך Gemini Enterprise Agent Platform, שמוסיף תפוקה מובטחת, בקרות ציות והנחות נפח. שני המסלולים, מפתחים ואנטרפרייז, נמצאים בפריוויו ציבורי, אז התחייבויות פרודקשן צריכות להילקח בהתאם.

מקור: marktechpost.com