21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

מודל 350M של Liquid AI עובר כוונון עדין לפלט מובנה ב-100 צעדי GRPO

מודל 350M של Liquid AI עובר כוונון עדין לפלט מובנה ב-100 צעדי GRPO

Liquid AI פרסמה מדריך טכני שמדגים כיצד מודל זעיר, LFM2.5-350M, משפר דרמטית את יכולת הפלט המובנה שלו באמצעות כוונון עדין מבוסס GRPO (Group Relative Policy Optimization) ב-100 צעדים בלבד. הרעיון המרכזי: משימת ה-structured output, כלומר החזרת JSON או YAML תקינים שניתנים לפארס ישיר למערכות downstream, נמדדת בנפרד מיכולות חשיבה כלליות, ודווקא שם מודלים קטנים יכולים לסגור פערים מול הגדולים בלי תקציבי עתק.

הבנצ'מרק IFStruct וסביבת ההרצה

הבדיקה נערכת על IFStruct, בנצ'מרק בקוד פתוח (Liquid4All/ifstruct) עם דאטה-סט פומבי ב-Hugging Face, שמתמקד אך ורק בציות לסכמה, האם הפלט עובר ולידציה מול המבנה הנדרש. ההערכה רצה מקומית על מקבוק פרו עם שבב M5 Max ו-36 ג'יגה זיכרון מאוחד, דרך llama.cpp שמקים שרת תואם OpenAI API; הכוונון עצמו רץ על GPU חינמי בקולאב או קאגל באמצעות uv לניהול הסביבה.

תוצאות מודל הבסיס לפני כוונון

לפני האימון, מודל הבסיס בגרסת BF16 GGUF עבר 22.6% מהדגימות (452 מתוך 2,000), קצת מעל ה-21.1% שדווחו במקור. הפירוט חושף פערים ברורים: YAML עומד על 27.2% הצלחה לעומת 18% ב-JSON; מבנה עם מפתח עוטף (wrapper key) מגיע ל-28.5% בעוד רשימה חשופה (bare list) נתקעת על 16.6%. זמן התגובה הממוצע עמד על 1.45 שניות לדגימה עם ארבע בקשות במקביל.

כוונון משימתי על חומרה צנועה

הפיפליין המתואר לא מנסה לשחזר את תוצאת מודל ה-RL מהבלוג של IFStruct, אלא להראות ש-GRPO ממוקד משימה על חומרה נגישה מספיק כדי להביא מודל 350M לביצועים שמתקרבים למודלים גדולים בהרבה. הקוד זמין בניוטבוק נלווה, וההפרדה בין סביבת האימון (GPU בענן) לסביבת ההערכה (מקומי דרך llama.cpp) מאפשרת איטרציה מהירה בלי תלות בשירות מנוהל.

מה זה אומר למפתחים שבונים מערכות אמיתיות

בשורה התחתונה: כשהצוואר בקבוק הוא פלט תקין שנכנס לפארסר בלי תיקוני פוסט-פרוססינג, לא חייבים לשלם על אינפרנס של מודל 70B. מודל 350M מכוונן, רץ מקומית על מקבוק עם llama.cpp, יכול להיות פתרון פרקטי וזול למשימות extraction ו-API calling, בתנאי שמקבלים את מגבלות הידע וההיגיון של מודל בסדר גודל כזה.

מקור: huggingface.co