26 בספטמבר 2026 האקדמיה ארכיון
מבזקים
סוכן AI עקף הגבלות רשת דרך שאילתות DNS והגיע לצ'אטבוט חיצוני ליקוויד AI משחררת דראפט ניסיוני להאצת פענוח במודל ראייה-שפה Runway מחברת את מודלי הווידאו שלה ישירות לקלאוד אופוס 5.5 דרך MCP Qwen Image 3 Pro לוקח את הבנצ'מם הראשון של OpenRouter פאסטינו משחררת מודל החלטות 340M שרץ על CPU ומחזיר תשובות מובנות עם ציוני ביטחון
מודלים

ליקוויד AI משחררת דראפט ניסיוני להאצת פענוח במודל ראייה-שפה

ליקוויד AI משחררת דראפט ניסיוני להאצת פענוח במודל ראייה-שפה

ליקוויד AI (Liquid AI) הכריזה על LFM2.5-VL-3B-DSpark, מודל דראפט (drafter) ניסיוני שמתלבש על גבי מודל הראייה-שפה LFM2.5-VL-3B ומבטיח האצה של עד פי 3.13 בפענוח על סיליקון של אפל, ועד פי 2.66 על H100 של NVIDIA. הדראפט מוסיף כ-280 מיליון פרמטרים, כלומר עלייה של 8.9% בסך הפרמטרים הנפרסים, ואינו משנה את הפלט של המודל הראשי. המשקולות זמינות כבר עכשיו ב-Hugging Face בפורמט Safetensors ו-GGUF, עם תמיכה מיום ראשון ב-SGLang, MLX-VLM ו-llama.cpp. הרישיון הוא LFM Open License v1.0, שמתיר שימוש מסחרי חופשי רק לחברות עם מחזור שנתי מתחת ל-10 מיליון דולר (כ-37 מיליון שקל).

איך זה עובד

פענוח ספקולטיבי (speculative decoding) מוסיף מודל קטן שמציע כמה טוקנים קדימה; המודל הגדול בודק את כל הבלוק במעבר אחד ומשאיר רק את מה שהוא מסכים איתו. התובנה המרכזית כאן היא שהדראפט אדיש למודאליות: ברגע שהטוקנים מגיעים לשכבות הנסתרות, טקסט וטלאי תמונה (image patches) הם בסך הכול טנסורים. לכן ליקוויד AI יכולה למחזר את אותו אלגוריתם אינפרנס ששימש את דראפטי DSpark של מודלי הטקסט שלה, בלי לכתוב נתיב נפרד לראייה.

ארכיטקטורה ואימון

הדראפט הוא מודל קשב-בלבד (attention-only) מפושט עם 4 שכבות וגודל בלוק (block size) של 9; בהרצה ההמלצה היא 8 או 9, תלוי חומרה, על סיליקון אפל משתמשים ב-8. האמבדינג וה-LM head משותפים עם מודל המטרה, כך שהדראפט לא סוחב אותם בעצמו. האימון נעשה על דאטה של משימות ראייה-שפה נפוצות במשך 10 אפוקים, וכל האבלציות והאימונים רצו בלעדית על חומרת AMD.

מה המספרים באמת אומרים

הבנצ'מרק נעשה לפי MMSpec על 6 סוגי משימות, VQA כללי, Text VQA, כיתוב תמונות, Chart VQA, חשיבה מורכבת ושיחה מרובת-סבבים, עם גודל אצווה 1, טמפרטורה 0 ומשקולות 16-ביט למקודד הראייה ולשדרה. הנתונים נאספו על Pipette, תשתית הבנצ'מרק הפומבית של ליקוויד. המספרים "עד" מגיעים ממשימות שונות: על M5 Max, פי 3.13 בפענוח הגיע מ-COCO Captioning, ואילו פי 2.62 מקצה-לקצה הגיע מ-MMMU-Pro. שיעור הקבלה (acceptance rate) היה בטווח דומה בשתי ערימות התוכנה של אפל, מה שמלמד שהוא תלוי בדראפט ובעומס העבודה, לא בזמן הריצה (runtime). ב-SGLang על H100 בודד, היתרון בתפוקה (throughput) נשמר בכל רמת מקביליות שנמדדה, אם כי הפער מצטמצם ככל שהמקביליות עולה.

איכות פלט וטמפרטורה

בפענוח חמדני (greedy) המודל הראשי מאמת כל טוקן מוצע, ולכן הפלט זהה לחלוטין לזה של מודל הבסיס. בטמפרטורות שונות מאפס עם דגימה מתואמת, הפענוח הספקולטיבי משמר את התפלגות הפלט של מודל המטרה, תוצאה שהוכחה על ידי לויתן ואחרים (Leviathan et al.). טמפרטורה כן משפיעה על מהירות: טמפרטורות גבוהות מפזרות הסתברות על יותר טוקנים מועמדים, הדראפט והמטרה מסכימים פחות, ושיעור הקבלה והתפוקה יורדים.

למה הרווח מקצה-לקצה קטן יותר בקצה

פענוח ספקולטיבי מאיץ רק את שלב הפענוח. קידוד התמונה וה-prefill רצים באותה מהירות, ומודל ראייה-שפה חייב לקודד את התמונה ואז לעבד מאות טוקנים ויזואליים לצד הפרומפט. במכשירי קצה עם פחות כוח חישוב מ-GPU של דאטה-סנטר, ה-prefill תופס נתח גדול יותר מהשהיה הכוללת, חוק אמדל (Amdahl's law) בפעולה: סך ההאצה מוגבל על ידי החלק שלא מואץ. זה מסביר מקרים כמו TextVQA על M5 Max, שם פי 2.69 בפענוח מתורגם לפי 1.56 בלבד מקצה-לקצה.

להריץ את זה

SGLang דורש גרסה 0.5.19 ומעלה. מריצים את LiquidAI/LFM2.5-VL-3B עם הדגל `--speculative-algorithm DSPARK`.

מקור: marktechpost.com