26 בספטמבר 2026 האקדמיה ארכיון
מבזקים
סוכן AI עקף הגבלות רשת דרך שאילתות DNS והגיע לצ'אטבוט חיצוני ליקוויד AI משחררת דראפט ניסיוני להאצת פענוח במודל ראייה-שפה Runway מחברת את מודלי הווידאו שלה ישירות לקלאוד אופוס 5.5 דרך MCP Qwen Image 3 Pro לוקח את הבנצ'מם הראשון של OpenRouter פאסטינו משחררת מודל החלטות 340M שרץ על CPU ומחזיר תשובות מובנות עם ציוני ביטחון
מודלים

פאסטינו משחררת מודל החלטות 340M שרץ על CPU ומחזיר תשובות מובנות עם ציוני ביטחון

פאסטינו משחררת מודל החלטות 340M שרץ על CPU ומחזיר תשובות מובנות עם ציוני ביטחון

פאסטינו לאבּס (Fastino Labs) הוציאה את GLiNER2.5-Decide, מודל החלטות במשקל פתוח של 340 מיליון פרמטרים שמקבל טקסט וסכמה של שאלות טיפוסיות, ומחזיר תשובות מובנות הכוללות התפלגות הסתברות, ציון ביטחון ומטא-דאטה של היתכנות אילוצים. המודל מכוון בדיוק לנקודות ההכרעה התכופות בצנרת סוכנים: ניתוב, טרייאג', בחירת כלי וגדרות הגנה. המשקלים מופצים תחת רישיון Apache 2.0, ניתנים להתקנה ב-pip install gliner2, ורצים על CPU, GPU או בסביבות מנותקות רשת; החברה מציעה גם הסקה מנוהלת וכוונון עדין דרך ה-API של GLiNER.

מה זה בעצם

GLiNER2.5-Decide אינו מודל גנרטיבי אלא מסווג (classifier) שמבוסס על מקודד DeBERTa-v3-large וכוּון מגרסת gliner2-large-v1. הוא אינו מייצר טוקנים ואינו זקוק לתבנית פרומפט. קבוצות התוויות מועברות בזמן הקריאה: כל שאלה בסכמה מצהירה על התשובות המותרות, אם נדרשת תשובה יחידה, מרובות או ערך ממוין, ויכולה לשאת הוראות, דוגמאות, תיאורי תוויות וכללים המקשרים תשובות בין שאלות. הצנרת בת שני שלבים, המקודד קורא טקסט וסכמה יחד ונותן ציון לכל תשובה מותרת, ומפענח מוגבל מחפש את ההקצאה המשותפת בעלת הציון הגבוה ביותר שהכללים מתירים. בפאסטינו מדגישים במפורש: המודל אינו מנמק, אינו מסביר ואינו עונה על שאלות פתוחות, הוא מומחה להחלטות תפעוליות.

פענוח משותף ולמה זה משנה

הצוות מדגים את הערך בדוגמת גדר הגנה. בפענוח עצמאי המודל סימן הזרקת פרומפט בציון 0.82, ובמקביל סיווג את אותו פרומפט כבטוח בציון 0.52, ההתקפה זוהתה אבל שתי הפלטות סתרו זו את זו. פענוח משותף מחיל כלל שלפיו כל נזק שזוהה מחייב פסק דין "לא בטוח", והמודל מחזיר יחד safety=unsafe ו-harm_type=prompt_injection. קוד במורד הזרם יכול להשתמש בציונים האלה כדי לחסום, לנתב או להסלים. הסכמות תומכות בהשלכות, הדרות, מגבלות קרדינליות וגבולות סודרים; אותו מקודד יודע גם לחלץ ישויות, יחסים ורשומות מובנות עם אופסטים ברמת תו במעבר קדימה יחיד (תשובות סיווג אינן מחזירות טווחי ראיות).

ביצועים ובנצ'מרקים

ההערכה נערכה על Fast Decisions, סוויטה פנימית שמורה של 5,100 דוגמאות בדיקה על פני 17 מערכי נתונים, המכסים תפעול לקוחות, ניתוב תחומי (בנקאות, קליני, נסיעות, הטבות) והבנת תוכן כללית. המדד הוא דיוק התאמה מדויקת: תחזית נחשבת רק אם קבוצת התוויות שלה זהה לזו של הייחוס. GLiNER2.5-Decide הוביל ב-9 מתוך 17 מערכי הנתונים. ניתוב כוונות היה התחום החזק ביותר: 75.3% בכוונות תמיכה ו-64.3% בכוונות בנקאות, פערים של 18.6 ו-8.6 נקודות אחוז מהמודלים הבאים בתור. ראוי לציין שהבנצ'מרק פנימי ולא פורסם לסקירת עמיתים, כך שהמספרים משקפים את מדידת היצרן בלבד.

השהיה על חומרה אמיתית

הצוות מדד את הצ'קפוינט מקצה לקצה באצווה של 1 עם סכמה של שני ראשים ו-15 תוויות. ב-64 טוקנים, זמן חציון (p50) עמד על 167.3 מילישניות ב-48 vCPU של אינטל Xeon Platinum 8581C, לעומת 43.6 מילישניות ב-NVIDIA T4, 43.4 ב-L4, 38.3 ב-V100 ו-47.3 ב-A100. בבקשות קצרות התקורה הקבועה של עיבוד מקדים והפעלת קרנל שולטת, ולכן ה-GPU נותרות בטווח 9 מילישניות זו מזו. ב-1,024 טוקנים ה-A100 נוטלת את ההובלה עם 52.6 מילישניות, מול 75.6 ב-V100 ו-131.4 ב-L4.

זמינות ושימוש

הקריאה מרובת הראשים מודגמת בכרטיס המודל: טעינת AutoExtractor.from_pretrained("fastino/GLiNER2.5-Decide") ואז classify_text עם טקסט ומילון ראשים, למשל intent, urgency, route, כשכל ראש מגדיר את התוויות המותרות. ראשי תווית יחידה מחזירים מחרוזת אחת, ראשי ריבוי־תוויות מחזירים רשימה. המשקלים הפתוחים (open-weight, לא קוד פתוח מלא) מאפשרים הטמעה מקומית בלי תלות בענן, וזה בדיוק סוג הכלי שצוותי MLOps מחפשים כשהם צריכים החלטות דטרמיניסטיות, מהירות וניתנות לביקורת בתוך לולאת הסוכן.

מקור: marktechpost.com