TTFT הוא המדד שבוחרים איתו API לקול, והוא מטעה את כולם

למה TTFT לא מספיק לקול
זמן לאסימון ראשון (TTFT) מודד מתי המודל מתחיל לייצר, אבל מודל טקסט-לדיבור (TTS) לא יכול לדבר עד שמגיע משפט שלם. הפער בין שני הרגעים האלה, בין התחלת הגנרציה לאודיו ראשון, קובע אם סוכן קולי מרגיש שיחתי או נקטע. LiveKit מכנים את המדד האמיתי "זמן למשפט ראשון" (TTFS), וטוענים שזה מה שהמשתמש אשכרה מרגיש. בקיצור: יש שני כפתורים, לא אחד. TTFT קובע מתי מתחילים, קצב אסימונים לשנייה קובע כמה מהר נגמר המשפט הראשון. ספק שניצח באחד והפסיד בשני לא ירגיש מהיר.
תקציב הלייטנסי: מה עולה תור שיחה אחד
לפי פירוק של LiveKit, תור קול מורכב מ-STT ב-100-200 מילישניות, LLM ב-300-500 מילישניות עם סטרימינג, TTS ב-100-200 מילישניות, ורשת ב-50-150 מילישניות מעל WebRTC. היעד המעשי מקצה לקצה: 700 מילישניות עד 1.2 שניות. קווינדלה הולטמן קריימר (Kwindla Hultman Kramer), ממייסדי Pipecat, ממליץ לכוון ל-800 מילישניות חציון, עם 1,500 מילישניות כגבול עליון ל-POC. החשבון שלו מחלק את זה לארבע מנות של כ-200 מילישניות כל אחת: תעבורה ועיבוד מדיה, STT עם זיהוי סוף משפט, אינפרנס LLM, ו-TTS. הבסיס האנושי של Daily מראה שתגובה טבעית בשיחה יושבת על כ-500 מילישניות, והפסקות מעל 800 מילישניות כבר מרגישות מלאכותיות.
רף ה-700 מילישניות שצריך להחזיק מולו
הבנצ'מרק של Daily מפברואר 2026 מתרגם את זה לדרישת LLM קונקרטית: שיחה טבעית דורשת קול-לקול מתחת ל-1,500 מילישניות, מה שמשאיר בערך 700 מילישניות תקציב TTFT למודל טקסט בתוך שרשרת תמלול-LLM-קול. המספר הזה הוא הסרגל שכל ספק צריך לעמוד מולו, לא ה-TTFT הגולמי שהם מפרסמים.
חמש הערות מתודולוגיה שמשנות את המספרים
לפני שמסתכלים על טבלאות, חמישה דברים שמשנים מה המספרים אומרים: ראשית, צורת העומס קובעת, Artificial Analysis שינתה במרץ 2026 את ברירת המחדל ל-10,000 אסימוני קלט במקום 1,000, ופרומפטים ארוכים מעלים גם TTFT וגם מהירות פלט. LiveKit טוענים שזה קרוב יותר לפרודקשן, כי סוכנים אמיתיים דוחפים לפרומפט מדיניות, פרסונה, חוקי הסלמה, נתונים שנשלפו וסכמות כלים. שנית, מיקום השרת אפוי פנימה, הבדיקות רצות ממכונה וירטואלית באזור us-central1-a של Google Cloud, וה-TTFT כולל לייטנסי רשת שעשוי להיטיב או להרע עם ספקים לפי איפה הם מגישים. שלישית, אסימוני חשיבה נספרים, בהגדרה של Artificial Analysis, TTFT למודל חשיבה הוא האסימון הראשון של החשיבה, לא של התשובה; אלו עמודות נפרדות. רביעית, מודדים מהצד המקבל, Daily מציינים שספקים לפעמים מצטטים TTFT פנימי לסטאק שלהם, בעוד Daily מודדים משליחת הבקשה עד האסימון השמיש הראשון מה-API. חמישית, ריצות לא חוזרות, Daily ישירים בנושא: TTFT משתנה מהותית בין ריצות, וספקים מחליפים סטאקים ולפעמים משקולות בלי לשנות שמות מודל.
מה חסר בתמונה
המקור נקטע בדיוק בתחילת שכבת ה-LLM, הנתונים ההשוואתיים עצמם לא פורסמו בטקסט שהגיע לידינו. בלי המספרים קשה להגיד מי עומד ברף ה-700 מילישניות ומי רק נראה טוב על הנייר. המסקנה המעשית בינתיים: אל תסתמכו על TTFT בודד. תבדקו את הסטאק המלא, תמדדו מהצד שלכם, ותזכרו שהמשתמש שומע משפטים, לא אסימונים.