ליקוויד AI משיקה דראפט ויזואלי ל-LFM2.5-VL-3B: האצה של עד פי 3.13 בדקודינג

ליקוויד AI (Liquid AI) משחררת את LFM2.5-VL-DSpark, מודל דראפט (drafter) שמתלבש על LFM2.5-VL-3B ומאיץ דקודינג ספקולטיבי במודלי שפה-ראייה. הדראפט מוסיף 280 מיליון פרמטרים בלבד, תוספת של 8.9% לגודל המודל המלא, ומגיע עם תמיכה מיידית ב-llama.cpp, MLX-VLM ו-SGLang. החברה מדווחת על האצת דקודינג של עד פי 3.13 על מכשירי אפל סיליקון ועד פי 2.66 על H100, כשהרווח מקצה-לקצה נע בין פי 1.56 לפי 2.62 בהתאם לפלטפורמה ולמשימה.
איך הדראפט עובד
הארכיטקטורה זהה לזו של דראפטי הטקסט בסדרת LFM2.5-DSpark: הדראפט דוגם מצבים נסתרים (hidden states) מקבוצה קבועה של שכבות במודל המטרה, ומתנה עליהם כדי לחזות בלוק של k טוקנים מועמדים. החידוש בגרסה הוויזואלית הוא שפאצ'ים של תמונה וטוקנים של טקסט מוקרנים לייצוג משותף לפני אותן שכבות, כך שהדראפט פועל על וקטורים באותו ממד בלי קשר למודאליות הקלט. אלגוריתם האינפרנס עצמו נותר ללא שינוי.
מתודולוגיית אימון ובחירת ארכיטקטורה
ליקוויד אימנה את הדראפט על תערובת נתוני SFT של שפה-ראייה, עם משקולות מוטות לעומסי העבודה הצפויים. אבלציות על 3, 4 ו-5 שכבות הובילו לבחירה בדראפט Attention-only מפושט עם 4 שכבות וגודל בלוק של 9. הריצה כללה 10 אפוקים, כששיעור הקבלה (acceptance rate) השתפר עם עוד טוקני אימון עד שהגיע לתשואה שולית פוחתת. בהרצה ההמלצה היא בלוק של 8 או 9, תלוי בחומרה.
ביצועים על מכשירי קצה
על M5 Max עם MLX, דקודינג מהיר פי 2.30 עד 3.13 לפי המשימה (VQA כללי, טקסט בתמונה, כיתוב, תרשימים, חשיבה מורכבת, רב-שיחה), ושיפור מקצה-לקצה של פי 1.56 עד 2.62. על M3 Ultra עם llama.cpp המספרים צנועים יותר: פי 1.57 עד 2.14 בדקודינג, פי 1.30 עד 1.77 מקצה-לקצה. הפער נובע מהבדלים בארכיטקטורת המאיץ הגרפי ובניהול זיכרון בין הדורות.
ביצועים על H100
באותו דראפט בדיוק, SGLang על H100 מניב האצת דקודינג של פי 2.04 עד 2.66, ושיפור מקצה-לקצה של פי 1.64 עד 2.27. הפער בין האצת הדקודינג לרווח הכולל עקבי בשתי הפלטפורמות, וזה לא מקרי.
חוק אמדאל במציאות
בלשון החברה: פרה-פיל (prefill) הוא ברובו Compute-bound, והעלות שלו גדלה ריבועית עם אורך הפרומפט. ב-VLM מתווסף מקודד ראייה שמייצר מאות טוקנים ויזואליים לפני שהשדרה הלשונית מתחילה לעבוד. במכשירי קצה כוח החישוב מוגבל, אז פרה-פיל תופס נתח גדול יותר מהזמן הכולל. דקודינג ספקולטיבי מאיץ רק את שלב הפענוח, לא את קידוד התמונה ולא את הפרה-פיל. כשהשלבים הלא-מואצים כבר גוזלים את רוב זמן הקיר, אפילו האצת דקודינג גדולה מתורגמת לרווח כולל מוגבל. זה חוק אמדאל בפעולה: המהירות הכוללת מוגבלת על ידי החלק שלא מואץ.
פריסה והפעלה
ב-SGLang נדרש בילד עם תמיכת DSpark ליעדי LFM2 (PR #40651), וההפעלה נעשית דרך דגלי `--speculative-*` עם block size 9. ב-llama.cpp נדרש בילד תואם (PR #29339) והפעלה עם `--spec-type draft-dspark` ו-`--spec-draft-n-max 8`. גודל הבלוק נקרא מה-config.json של הדראפט.