10 באוקטובר 2026 האקדמיה ארכיון
מבזקים
סוכנים עקפו בני אדם בצריכת טוקנים ב-OpenRouter, והפער רק מתרחב סיכום COLM 2026: Ai2 מציגה יעילות ארכיטקטונית וכלים למדענים אינסטינקט הגיע לשוק בשקט ונאלץ להתמודד עם מיוז ודוטס של ענקיות הטק מתמטיקאים מאמצים כלי בינה מלאכותית בקצב שמפתיע אפילו את החוקרים שעוקבים אחר התחום קלאודפלייר משיקה את Clef-Omni: מודל MoE מולטי-מודאלי להחלטות מובנות
מוצרים

וויסל: מודל דיבור-לטקסט של 16.9 מגה-בייט שרץ על המעבד בלי GPU

וויסל: מודל דיבור-לטקסט של 16.9 מגה-בייט שרץ על המעבד בלי GPU

מודל אחד, שלוש משימות, בלי תלות חיצונית

וויסל (Whistle) מגיע כקובץ יחיד של 16.9 מגה-בייט ומכסה תמלול, חותמות-זמן ברמת מילה והטמעות דיבור (speech embeddings), הכול על המכשיר, בלי להזדקק ל-GPU או לספריות חיצוניות. המנוע הוא אותו C++ runtime שמריץ את Needle, בתוך אותו מיכל `.cact` ועם אותה קוונטיזציה (Cactus Quants), אותם קרנלי SIMD ואותו KV cache. מכשיר שכבר מריץ את Needle מקבל את וויסל באותו בינארי, בלי ריצה שנייה נפרדת.

ארכיטקטורה שממחזרת את מה שכבר עובד

החזית היא log-mel עם גזע קונבולוציוני (convolutional stem) שמזין אודיו-אנקודר; דקודר בצורת Needle קורא אותו דרך gated cross-attention בכל שכבה. הדקודר "מדורג" (laddered) כמו ב-Needle: כל עומק מ-2 שכבות ומעלה הוא מודל בר-פריסה, שנבחר בזמן טעינה עם הדגל `--audio-depth`. המשקלים יושבים ב-`whistle.cact`; המנוע ותיקיות הפלטפורמה נמצאים ב-Cactus-Compute/needle3.

שבע שפות, זיהוי אוטומטי, שקט לא ממציא מילים

התמלול תומך באנגלית, גרמנית, צרפתית, ספרדית, איטלקית, הולנדית ופולנית, אודיו מונו 16 קה"ץ עד 30 שניות במעבר אחד. השפה מזוהה אוטומטית אלא אם מכריחים אותה, וקטע שקט מחזיר מחרוזת ריקה במקום להזות משפט. חותמות-הזמן נגזרות מה-attention של הדקודר עצמו, כך שאפליקציה יכולה להדגיש, לדלג או לחתוך ברמת מילה בודדת עם הסתברות. ההטמעות יוצאות שורה לכל 80 מילישניות מהאנקודר, ומאפשרות התאמה ושליפה בלי לפענח טקסט כלל. keyword biasing מקדם שמות, מקומות ומונחי מוצר שהמשתמשים באמת אומרים.

בנצ'מרקים: 86 אלף דגימות, השוואה מול וויספר ומונשיין

ה-WER נמדד על מלוא פיצולי הבדיקה (86,174 אמירות) עם הנורמלייזרים של וויספר. וויספר ו-Moonshine מצוטטים מהמאמרים שלהם (וויספר: טבלאות 9, 10, 13; מונשיין: טבלה 3). שורת וויספר היא הצ'קפוינט הרב-לשוני, לא base.en. מונשיין אנגלית בלבד; וויספר לא פרסם תוצאות על SPGISpeech, Earnings-22 או AMI מנוקה. AMI כולל רפרנסים ריקים לפי מוסכמת Open ASR Leaderboard (הנתון של וויספר הוא AMI-IHM). TED-LIUM מחריג אזורי ignore_time_segment_in_scoring לפי פרוטוקול הקורפוס. FLEURS ו-MLS ממוצעים על שבע השפות של וויסל (MLS על שש, בלי אנגלית), אותה קבוצת שפות לכל מודל. לא נמצא אודיו מבדיקה בנתוני אימון או ולידציה, נבדק בצ'קסאמים ובמזהי דוברים.

מהירות ודיוק על M4 Pro, הרצה בפייתון בלי התקנות כבדות

מדידת המהירות: 10 שניות אודיו על Apple M4 Pro, כל מודל בריצה הרשמית שלו בברירות מחדל, המנוע של וויסל ב-5 beams, openai-whisper, ו-moonshine-voice non-streaming. זמן לטוקן ראשון נמדד מכניסת אודיו; קצב פענוח מחושב אחרי שהאנקודר הסתיים. דיוק: וויסל 2-4 ביט, וויספר fp32 בזיכרון על CPU, מונשיין int8. החבילה זמינה ב-`pip install cactus-needle` (הקוד בגיטהאב). WAV/דגימות 16 קה"ץ עובדות עם ההתקנה הבסיסית; קצבי דגימה אחרים ולכידת מיקרופון דורשים את ה-extra של `[mic]`. ה-API מחזיר טקסט, שפה, מילישניות לטוקן ראשון וטוקנים לשנייה אחרי כן; `word_timestamps=True` מוסיף התחלה, סוף והסתברות לכל מילה; `keywords=[...]` מטה את החיפוש; `language="de"` מכריח שפה. `needle.Whistle` חושף את אותו מודל כאובייקט ל-`embed(audio)` או להחזקת `.cact` מכוונן. CLI: `needle whistle playground` מהמיקרופון, `needle whistle compare` מציב את וויסל לצד וויספר ומונשיין.