14 באוגוסט 2026 האקדמיה ארכיון
מבזקים
אינדונזיה משיקה מרכז AI אוניברסיטאי ראשון בשיתוף NVIDIA ואינדוסאט ענקיות הענן מהמרות על גז טבעי לבינה מלאכותית, תחזית חדשה מזהירה ממחיר כפול ומשולש OpenAI משיקה "היסטוריית מחשב" בקודקס ובצ'אטג'יפטי עם הקשר עבודה אוטומטי למנויים משלמים מאמר MIT חדש מציע שפה מתמטית יחידה לתיאור ארכיטקטורות למידה עמוקה גוגל מסירה את סימן המים הגלוי מיוצרי ה-AI שלה, שומרת על הבלתי נראה
מודלים

ליקוויד AI משיקה מודל ראייה־שפה של 3 מיליארד פרמטרים שרץ על המכשיר

מאת הדר מזרחי
ליקוויד AI משיקה מודל ראייה־שפה של 3 מיליארד פרמטרים שרץ על המכשיר

ליקוויד AI (Liquid AI) שחררה אתמול את LFM2.5-VL-3B, מודל ראייה־שפה במשקל 3.1 מיליארד פרמטרים שתוכנן מלכתחילה לרוץ על המכשיר (on-device). המודל יודע לקרוא מסכים דיגיטליים במובייל, בווב ובדסקטופ, למקם אובייקטים בקואורדינטות, לחלץ מידע ממסמכים ותרשימים, ולהפעיל כלים (function calling) ישירות מטקסט או מתמונה. הממוצע שלו עומד על 69.4 נקודות ב־28 בנצ'מארקים של ראייה, תוצאה שמשווה אותו ל־InternVL-3.5-4B ומציבה אותו 0.7 נקודות בלבד מאחורי Qwen3.5-4B, שניהם מודלים גדולים יותר ב־1.6 מיליארד פרמטרים.

ביצועים ומספרים

בבדיקות פרטניות המודל מפתיע לטובה: RealWorldQA 73.1 מול 67.7 של InternVL, TextVQA 84.3 מול 81.2 של Qwen, DocVQA 91.1 ו־OCRBench v1 84.2. בצד ה־UI הוא משיג 80.7 ממוצע ב־ScreenSpot-v2 (דסקטופ 78.7, מובייל 81.2, ווב 82.2), עוקף את Gemma-4-E4B שעומדת על 51.2 ואת Qwen3.5-4B עם 78.5, ונשאר רק מאחורי InternVL-3.5-4B שמגיעה ל־84.1. החולשה היחידה שנרשמה היא רגרסיה ב־CountBenchQA, שירד מ־92.2 בגרסה הקודמת ל־87.3 הנוכחי. בטקסט בלבד IFEval קפץ מ־72.9 ל־82.3, אבל Gemma-4-E4B עדיין מובילה שם עם 87.9.

ארכיטקטורה ואימון

שלד השפה הוא LFM2.5-2.6B, ומגדל הראייה הוא מקודד SigLIP2 NaFlex מותאם־צורה של 400 מיליון פרמטרים. NaFlex מטפל ברזולוציה מקורית על ידי פיצול תמונות גדולות לפאצ'ים לא־חופפים של 512×512 בתוספת תאמבנייל מוקטן של התמונה כולה. אורך הקונטקסט עומד על 32,768 טוקנים, עם תמיכה ב־16 שפות. האימון המוקדם השתמש בכ־34 טריליון טוקנים, אוצר המילים הוכפל ל־128 אלף על ידי הרחבת הטוקנייזר הקיים במקום, מה שמשפר כיסוי כתבים לא־לטיניים, ואימון הראייה הוגדל פי ארבעה בטוקנים עם נתונים מסונטזים ואצורים של כיתוב, OCR, גראונדינג והוראות. פוסט־אימון כלל SFT עם זיקוק ידע ממודל מורה גדול יותר ואימון Antidoom, ואחריהם חיזוק רב־פרס (multi-reward RL). ההחלטה לבנות מודל non-reasoning, שעונה ישירות בלי שרשרת חשיבה, היא שמאחורי פרופיל השהייה הנמוך.

רישוי ופריסה

הצ'קפוינט מגיע בארבעה פורמטים כבר ביום ההשקה: נייטיב, GGUF, ONNX ו־MLX, עם תמיכה מיידית ב־llama.cpp, MLX, vLLM, SGLang ו־ONNX. המודל נכנס בכ־3 ג'יגה־בייט זיכרון ומפענח 228 טוקנים לשנייה על Apple M5 Max. הרישיון (LFM Open License v1.0) מבוסס Apache-2.0 עם שינוי אחד: שימוש מסחרי חופשי נגמר כשההכנסה השנתית של החברה חוצה 10 מיליון דולר (כ־37 מיליון שקל). מפתחי אינדי, סטארטאפים ו־SMBs מתחת לקו הזה יכולים לשלב במוצר בלי לשלם; ארגונים גדולים יותר יצטרכו לנהל מו"מ על רישיון מסחרי מול ליקוויד. שימוש מחקרי, חינוכי וללא כוונת רווח נותר ללא מגבלת הכנסות.

מה זה אומר בפועל

היעדים המוצהרים מכסים אלקטרוניקה צרכנית, רכב, תעשייה ורובוטיקה, פיננסים, בריאות, איקומרס, וספקי QA ו־RPA שאוטומטים ממשקי משתמש. תרחישי שימוש כוללים סוכני מסך על המכשיר, אוטומציה של בדיקות GUI, המרת PDF לטקסט מובנה עם תוויות פריסה, OCR של חשבוניות וקבלות, זיהוי אובייקטים בזמן אמת ברכב, תרגום אופליין של תפריטים ושלטי דרכים, והשוואת ריבוי תמונות. הקריאה לפונקציות מגיעה בפורמט פייתוני בין טוקנים ייעודיים, והגראונדינג קפץ מ־57.1 ל־87.9 דיוק ב־RefCOCO, זינוק של 30 נקודות בזכות נתונים סינתטיים בהיקף גדול. בקיצור: מודל קומפקטי, מהיר, עם רישיון ידידותי לקטנים, שסוגר פער מול הגדולים במשימות ראייה מעשיות.

מקור: marktechpost.com