ליקוויד משיקה מודלי החלטה מולטימודליים לקצה, d1-3B מוביל את מדד ההחלטות מתחת ל-10 מיליארד פרמטרים

ליקוויד (Liquid AI) משחררת שני מודלי החלטה פתוחים שמיועדים לרוץ על חומרת קצה: d1-3B ו-d1-omni-600M. בניגוד למודלים גנרטיביים, מודלי החלטה לא מייצרים טוקנים אלא מחזירים תשובה מובנית במעבר קדמי בודד (single forward pass). d1-3B משיג ציון 48.57 בגרסה 0.2.1 של ה-Decision Index, התוצאה הגבוהה ביותר בקטגוריית המשקל עד 10 מיליארד פרמטרים, כשהוא עוקף את כל המודלים בגודל 4B ו-9B וגם את Decider 35B-A3B שעומד על 47.11.
ארכיטקטורה כפולה על בסיס LFMs
שני המודלים בנויים על משפחת Liquid Foundation Models, אבל מגיעים משני ענפים שונים לגמרי. d1-3B פותח מ-LFM2.5-VL-3B, מודל שפה-ראייה (VLM) בגישת decoder-only שמקבל טקסט ותמונות. d1-omni-600M לעומת זאת נבנה על LFM2.5-Encoder-350M, מקודד דו-כיווני (bidirectional encoder) שאליו חוברו מקודדי ראייה ואודיו, והוא יודע לטפל בזוגות טקסט-תמונה או טקסט-אודיו. הגרסה הקטנה יותר מוגדרת כרגע כגרסת מחקר מוקדמת ועדיין בפיתוח.
בנצ'מרקים: איכות החלטה מול גודל
על שבעה מאגרי נתונים ציבוריים, הבנת הנקרא, זיהוי רעילות, סיווג כוונה, שאלות רפואיות והבנה רב-לשונית, d1-3B רושם ממוצע 82.9, הגבוה בטבלה ומעל Decider 4B. d1-omni-600M מגיע ל-78.4, עוקף את Decider 2B (77.1) עם רבע מכמות הפרמטרים. בליקוויד מציינים שיכולות הראייה של d1-3B נשמרו בבנצ'מרקי ראייה סטנדרטיים, אבל לא מדווחים ציוני ראייה או אודיו ייעודיים: ה-Decision Index v0.3 כולל רק פיצול ראייה פרטי, ובנצ'מרקי החלטה באודיו עדיין נחשבים בעיה פתוחה.
ביצועי קצה ו-GPU בשיתוף NVIDIA
בשיתוף עם NVIDIA נבדק d1-3B על ארבע פלטפורמות: GeForce RTX 4090, Jetson AGX Thor, Jetson AGX Orin 64 ג'יגה, ו-Jetson Orin Nano. על כל המכשירים זמן התשובה לשאלה בודדת נמוך מ-50 מילישניות, 16 מילישניות על AGX Thor, 26 על AGX Orin, 50 על Orin Nano. יעילות האצווה (batching) מפתיעה: שלוש שאלות יחד דורשות רק פי 1.3 מהזמן של שאלה אחת (ב-Thor מ-16 ל-20 מילישניות). על GPU זמן התשובה יורד מתחת ל-10 מילישניות, ועיבוד תמונה ברזולוציית 384 פיקסל מסתיים בפחות מ-18 מילישניות בשתי הפלטפורמות.
מגבלות ושימוש מעשי
d1-omni-600M לא קיבל עדיין מספרי מהירות בגלל היותו גרסת מחקר מוקדמת. המודלים מגיעים עם קוד משלהם ודורשים טעינה עם `trust_remote_code=True` וספריית transformers מגרסה 5.14 ומעלה. ה-API תומך בכמה סוגי שאלות על אותו מצב טקסטואלי במעבר אחד: שאלות כן/לא (noul), בחירה מרובה עם קריטריונים (choice), ודירוג מספרי (score), למשל ניתוב פנייה לצוות המתאים והערכת דחיפות בבת אחת. גם תמונה יכולה לשמש כמצב קלט שלם.
בשורה התחתונה: החלטות מובנות על המכשיר
ההבטחה ברורה: כשצריך החלטות מהירות ומובנות עם קלט מולטימודלי על חומרת קצה, d1-3B נותן את איכות ההחלטה הגבוהה ביותר בגודלו, ו-d1-omni-600M נכנס היכן שהתקציב (footprint) הוא המגבלה. הפער בין מודל החלטה למודל גנרטיבי אינו רק סמנטי, מעבר קדמי יחיד בלי פענוח טוקנים משנה את כלכלת ההשהיה בקצה.