OpenAI משיקה את GPT-Live, מודל קולי שמיועד לשיחה טבעית יותר מהדור הקודם

החברה הודיעה על זמינות מיידית של GPT-Live-1 ב-API, אחרי סדרת בדיקות שכללה 80 שיחות הזמנה אמיתיות למסעדות. לפי הנתונים שפורסמו, שיעור השלמת המשימות יותר מהוכפל בהשוואה למודל הקולי הקודם, והגיע ל-92% הבנה מושלמת. המדדים האלה מגיעים ישירות מ-OpenAI ולא ממבחן צד שלישי בלתי תלוי.
טיפול בהפרעות ומעבר מיידי
השיפור המרכזי מתבטא בטיפול בהפרעות במהלך דיבור. המודל כבר לא נעצר כשהמשתמש משמיע צליל אישור שקט כמו "מממ", ויודע להחליף נושא באמצע משפט בלי השהיה מורגשת. יכולת ה-"listen while speaking", האזנה בזמן דיבור, מאפשרת דינמיקה שקרובה יותר לשיחה אנושית רגילה, בלי ה-"תורנות" המאולצת שאפיינה דגמים קודמים.
אינטגרציה ב-Genspark ושלושה יישומים
המודל פעיל כבר עכשיו בפלטפורמת Genspark בשלושה מוצרים: Call for Me, Realtime Voice Agent, ותוספת חדשה בשם GenTeam. האחרונה מאפשרת להתקשר לסוכנים אוטומטיים כמו אל חברי צוות, להעביר משימות, לברר סטטוס ולקבל תוצאות. הממשק מדמה שיחת טלפון פנימית במקום צ'אט מבוסס טקסט.
זמינות למפתחים דרך ה-API
GPT-Live-1 זמין כעת ב-API של OpenAI, מה שמאפשר למפתחים לשלב את יכולות השיחה הרציפה באפליקציות משלהם. התיעוד מציין תמיכה במודלים ובכלי עזר (harness) לפי בחירת המפתח, בלי כפייה של שרשרת כלים סגורה. עדיין לא פורסמו מחירי שימוש או מגבלות קצב ספציפיות לדגם החדש.
מה חסר בתמונה
ההכרזה לא כוללת השוואה למתחרים כמו Realtime API של OpenAI עצמה בגרסתו הקודמת, או למודלים קוליים של Anthropic ו-Google. גם לא צוין אם הבדיקות כללו סביבות רועשות, מבטאים לא סטנדרטיים, או שיחות ארוכות מרגע ההזמנה הבודדת. עד שיתפרסמו בנצ'מרקים בלתי תלויים, המספרים נותרו נתוני יצרן.