21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

אמ"ד מוסאטק מציג טאלס במהירות 14 אלף טוקן לשנייה בפודקאסט

אמ"ד מוסאטק מציג טאלס במהירות 14 אלף טוקן לשנייה בפודקאסט

אמ"ד מוסאטק (Emad Mostaque) הדגים את טאלס (Taalas) מייצר טקסט בקצב של כ־14,000 טוקן לשנייה, כך לפי ציוץ של רוהאן פול (Rohan Paul) שתיעד קטע מתוך "The Peter McCormack Show". לשם השוואה, ChatGPT נע כיום בין 50 ל־150 טוקן לשנייה בתנאים רגילים, פער של שני סדרי גודל לפחות.

המספרים והמשמעות שלהם

אם הנתון נכון בתנאים שווים, המשמעות היא צניחה דרמטית בעלות האינפרנס (Inference) ובלאטנסי (Latency) ליישומים בזמן אמת. קצב של 14 אלף טוקן לשנייה מאפשר להזרים תשובות ארוכות כמעט ללא השהיה מורגשת, ולשרת מספר גדול בהרבה של משתמשים מקבילים על אותה חומרה. אלא שהמקור לא מציין גודל מודל, אורך הקשר (Context Length), גודל אצווה (Batch Size) או מפרט חומרה, פרמטרים שבלעדיהם המספר לבדו לא אומר הרבה.

ההקשר: הדגמה בפודקאסט, לא בנצ'מרק רשמי

ההדגמה נערכה בשידור יוטיוב של פודקאסט, לא במסגרת בדיקה עצמאית או פרסום טכני מסודר. רוהאן פול, שצייץ את הקטע, אינו גורם מבקר אלא משקיף שמתלהב מהמהירות. אין במאמר, בדו"ח טכני או בהודעה לעיתונות של טאלס נתונים משלימים, לא מדדי איכות (Perplexity, משימות הערכה), לא יציבות לאורך זמן, ולא פירוט של מה בדיוק נמדד (זרם בודד? מקבילי? עם קאש?).

מה חסר ומה צריך לבדוק

לא פורסמו מדדי ביצועים מלאים, לא נמסר איזה מודל רץ (גודל פרמטרים, ארכיטקטורה), ולא ברור אם המהירות נשמרת גם בפרומפטים ארוכים או רק ביצירה קצרה. בהיעדר פרטים אלה, אי אפשר להשוות את הטענה למנועי אינפרנס קיימים כמו vLLM, TensorRT-LLM או פתרונות של גרוק (Groq) וסרברס (Cerebras) שגם הם מציגים מספרים גבוהים בתנאים ספציפיים. גם לא ידוע אם טאלס הוא חומרה ייעודית, מהדר (Compiler) למודלים קיימים, או שילוב של שניהם.

הרקע של המציג והספקנות המתבקשת

מוסאטק, מייסד סטייביליטי איי (Stability AI) לשעבר, מציג את טאלס כמיזם חדש שלו. ההיסטוריה של הכרזות מהירות בתחום האינפרנס מלמדת שכדאי להמתין לבדיקות בלתי תלויות: הדגמות בפודקאסטים נוטות לבחור תנאים אופטימליים, ולהשמיט את המגבלות שמתגלות בייצור. עד שיתפרסמו נתונים פתוחים להרצה חוזרת, המספר 14,000 טוקן לשנייה נשאר טענה, לא תוצאה מאומתת.