ליקוויד משיקה מודל ראייה של 3 מיליארד פרמטרים שרץ על המכשיר וקורא מסכים בלי ענן

ליקוויד (Liquid AI) שחררה אתמול את LFM2.5-VL-3B, מודל שפה-ראייה (Vision-Language) של 3.1 מיליארד פרמטרים שפותח מלכתחילה לה��צה מקומית (on-device). המודל יודע לקרוא מסכים דיגיטליים במובייל, ווב ודסקטופ, להצמיד אובייקטים לקואורדינטות, לחלץ טקסט ממ��מכים ותרשימים, ולה��עיל כלי תוכנה (tool calling) מתוך קלט טקסט או תמונה, וה��ל בלי לשלוח דבר לשרת חיצוני. לפי נתוני החברה, המ��וצע על 28 בנצ'מרקים של ראייה עומ�� על 69.4 נקודות, זה�� ל-InternVL-3.5-4B (שגדול ממ��ו בכ-50% במספר הפרמטרים) ורק 0.7 נקודות מאחורי Qwen3.5-4B. שניהם מודלים של 4.7 מיליארד פרמטרים.
מה שמאחורי המספרים
ה��יפור מול הגרסה הקודמת, LFM2-VL-3B, מגיע בארבעה צירים. בה����ת ממשקי משתמש (ScreenSpot-v2) המודל מגיע ל-80.7 נקודות במ��וצע, דסקטופ 78.7, מובייל 81.2, ווב 82.2, כשהוא עוקף את Qwen3.5-4B (78.5) ונושף בעורפו של InternVL-3.5-4B (84.1). בקריאות פונקציות (function calling) נרשם זינוק חד: ToolSandbox קפץ מ-26.4 ל-59.5, ו-BFCL v4 מ-20.5 ל-32.5; הקריאות נפלטות כקוד פייתוני בין טוקנים ייעודיים. בגרואונדינג (grounding), הצמדת אובייקט לקואורדינטות, הדיוק ב-RefCOCO זינק מ-57.1 ל-87.9 precision@1, קפיצה של 30 נקודות שה��ברה מייחסת להגדלה משמעותית של נתוני אימון סינתטיים למשימה זו. ברב-תמונה (multi-image) נרשמו שיפורים ב-BLINK (מ-50.2 ל-61.5) וב-MuirBench (מ-34.9 ל-58.3).
ארכיטקטורה ורישוי
שלדת השפה היא LFM2.5-2.6B, ומ��דל הראייה (vision tower) הוא מקודד SigLIP2 NaFlex מותאם-צורה של 400 מיליון פרמטרים. NaFlex מטפל ברזולוציה מקורית על ידי פיצול תמונות גדולות לפאצ'ים לא-חופפים של 512×512 בתוספת תאמ����יל (thumbnail) מוקטן של התמונה כולה. אורך הקונטקסט עומ�� על 32,768 טוקנים, עם תמיכה ב-16 שפות. אוצר המילים הוכפל ל-128 אלף טוקנים על ידי הרחבת הטוקנייזר הקיים במקום, מה שמשפר כיסוי כתבים לא-לטיניים. האימון המוקדם השתמש בכ-34 טריליון טוקנים; אימון הראייה הוגדל פי 4 בטוקנים עם נתונים מסוננים וסינתטיים של כיתוב, OCR, גרואונדינג והוראות. פוסט-אימון כלל SFT עם זיקוק ידע ממודל מורה גדול יותר ואימון "אנטידום" (Antidoom), ואחריהם חיזוק רב-פרס (multi-reward RL). המודל אינו מודל חשיבה (non-reasoning), הוא עונה ישירות, בחירת תכנון שמסבירה את פרופיל השהייה הנמוך.
ביצועים מול המתחרים
ה����רכה בוצעה עם vLLM 0.26.0 במ��ב non-reasoning. בנצ'מרקים בולטים: RealWorldQA 73.1 מול 67.7 של InternVL-3.5-4B, TextVQA 84.3 מול 81.2 של Qwen3.5-4B, DocVQA 91.1, ChartQA 81.3, OCRBench v1 84.2, MMStar 63.3, MathVista-mini 68.5. נקודת נסיגה: CountBenchQA ירד ל-87.3 מ-92.2 בגרסה הקודמת. בה��רכה טקסטואלית בלבד, IFEval הגיע ל-82.3 (עלייה מ-72.9), כש-Gemma-4-E4B עדיין מובילה עם 87.9. המודל נכנס בכ-3 ג'יגה-בייט זיכרון ומ��ענח כ-228 טוקנים לשנייה על Apple M5 Max.
מה זה אומר בפועל
ה��'קפוינט מגיע בארבעה פורמטים, native, GGUF, ONNX, MLX, עם תמיכת יום-אחד ב-llama.cpp, MLX, vLLM, SGLang ו-ONNX. הרישיון (LFM Open License v1.0) מבוסס Apache-2.0 עם שינוי אחד: שימוש מסחרי חופשי נפסק כשה��נסות החברה השנתיות חוצות 10 מיליון דולר (כ-37 מיליון שקל). מתחת לרף הזה, מפתחי אינדי, סטארטאפים ו-SMB, יכולים לשלב מסחרית ללא עלות. ארגונים גדולים יותר נדרשים למשא ומתן על רישיון מסחרי; שימוש מחקרי, חינוכי וללא כוונת רווח אינו מוגבל בה��נסות. החברה מציינת תעשיות יעד: אלקטרוניקה צרכנית, רכב, תעשייה ורובוטיקה, שירותים פיננסיים, בריאות, מסחר אלקטרוני, וספקי QA ו-RPA שמאמתים GUI. יישומים לדוגמה: סוכני מסך מקומיים, אוטומ��יית בדיקות GUI, המרת PDF לטקסט מוב��ה עם תוויות פריסה, OCR חשבוניות וקבלות, זיהוי אובייקטים בזמן-אמת-כמעט ברכב, תרגום אופליין של תפריטים ושלטי דרכים, והשוואת ריבוי תמונות. עבור האקוסיסטם הישראלי, שצפוף בסטארטאפים בתחומי רכב, סייבר, פינטק ורפואה, מודל כזה ברישיון ידידותי-ל-SMB וב��ודל שנכנס לטלפון או לבקר רכב הוא כלי עבודה מיידי, לא הדגמה.