27 בספטמבר 2026 האקדמיה ארכיון
מבזקים
סוכני OpenAI הריצו 16 אלף בקשות לאתר האו"ם בניסיון לעקוף מגבלות גישה סין התקינה יותר רובוטים תעשייתיים ב-2025 משאר העולם יחד מאמר חדש מציע מפת דרכים לשיפור עצמי רקורסיבי של בינה מלאכותית מודל 340 מיליון פרמטרים רץ על GPU של טלפון, עם זהות מספרית למודל הייחוס גוגל בודקת רכישה ישירה מפליפקארט דרך ג'מיני ו-AI Mode בהודו
מודלים

NVIDIA משחררת מודל קול־לקול פתוח שמאזין תוך כדי דיבור, אבל מתפרק אחרי כמה תורות

NVIDIA משחררת מודל קול־לקול פתוח שמאזין תוך כדי דיבור, אבל מתפרק אחרי כמה תורות

NVIDIA שחררה את NemotronLabs VoiceChat 11B, מודל end-to-end פתוח לדיבור בזמן אמת שמבצע הבנה ויצירה של דיבור בזרימה רציפה ברשת אחת מאוחדת, בלי לשרשר זיהוי דיבור (ASR), מודל שפה (LLM) וסינתזה (TTS). המעבר הזה מסיר את תזמון המודלים והעברות ה־API ששרשרת קסקדה דורשת ומקצר את ההשהיה מקצה לקצה. המודל מאזין תוך כדי דיבור, כך שמשתמש יכול לקטוע אותו באמצע תור והסוכן נכנע, עם יחס קטיעה מלא (TOR 1.00) ב־480 מילישניות. זהו גם מודל ה־full-duplex הפתוח הראשון שתומך בקריאת כלים (tool calling) תוך כדי שהשיחה ממשיכה לזרום, באמצעות ערוץ פלט נפרד לסקריפטים של <TOOLCALL> יחד עם שורות "המתנה" שמפעיל המערכת מגדיר מראש, שממלאות את הרווח בזמן ש־API רץ.

הארכיטקטורה היא היברידית מסוג Mamba/Transformer, מורכבת משלושה רכיבים קיימים של NVIDIA יחד עם נתיב פלט חדש. מקודד הדיבור Fast Conformer מ־Nemotron-Speech-Streaming-En-0.6b מקודד זרם קול נכנס ב־16 kHz ברציפות. עמוד השדרה של מודל השפה Nemotron Nano v2 צורך טוקנים של אודיו וחוזה טוקנים של טקסט. מפענח ומקודד ה־TTS חוזה קודי אודיו המומרים לדיבור סוכן ב־22.05 kHz, ובנוסף יש ערוץ פלט נפרד המוקדש לסקריפטים של קריאת כלים. הפלטים כוללים אודיו של הסוכן, טקסט של הסוכן ותמלול משתמש רץ. האימון השתמש בכ־550 אלף שעות אודיו על פני קורפוסים אמיתיים וסינתטיים, תוך הסתמכות על המודלים SALM-Duplex ו־Audio Flamingo 3.

קריאות כלים משודרות בערוץ הצדדי כבלוק <TOOLCALL>, והקוד שלכם מחזיר תוצאות בבלוק <TOOL_RESPONSE>. החלק המעניין הוא הודעת ההמתנה: לכל כלי, המפעיל מגדיר משפט שהסוכן אומר ברגע שהמודל מייצר את הטקסט שמפעיל את הקריאה, כך שהשיחה לא משתתקת בזמן ש־API רץ. המגבלות מפורשות: NVIDIA ממליצה על מקסימום חמישה כלים לכל סשן, המודל לא יכול לקרוא למספר כלים בו־זמנית באופן אמין, והמשתמש לא יכול לקטוע את הסוכן בזמן ביצוע הכלי. פרומפטים של המערכת ותגובות הכלים חייבים להיות ASCII בלבד וידידותיים ל־TTS.

במדד Full-Duplex-Bench 1.0 נמדדה השהיית תור חלקה של 448 מילישניות עם TOR 0.82, קטיעת משתמש ב־TOR 1.00 ב־480 מילישניות, וטיפול בהפסקות עם TOR 0.153 (סינתטי) ו־0.255 (Candor), כאשר נמוך יותר עדיף. במדד AU Harness BFCL-v3 לקריאת כלים קולית נרשמו 58.5% לקריאות פשוטות, 62.5% למרובות, 42.5% למקבילות, 27.5% למקבילות־מרובות, 89.6% לאי־רלוונטיות וממוצע 56.1%. ב־Full-Duplex-Bench v3 נמדדו 82.5% בבחירת כלים, 44.2% בדיוק ארגומנטים ו־33% ב־pass@1. NVIDIA מדווחת שהמודל מדורג שני.

מקור: marktechpost.com