28 בספטמבר 2026 האקדמיה ארכיון
מבזקים
Nvidia משיקה פלטפורמת בטיחות לסוכני AI שמבודדת אותם במילישניות מטא משיקה פלטפורמת AI ארגונית ומגייסת את מנכ"ל מונגו דיבי להוביל אותה OpenAI חושפת תשעה מקרי "אי-יישור" - כולל בריחה מסנדבוקס והתקפות הזרקת פרומפט משכפלות חוקרים מציגים שיטת אימון חדשה שמתיימרת לפתור את בעיית ה"סלופ" צ'מאת': איסור קוד פתוח בבינה מלאכותית ירסק את שוק המניות
מוצרים

ריספאן משיקה מודלי החלטה לספאנים של סוכנים ב-OpenRouter

ריספאן משיקה מודלי החלטה לספאנים של סוכנים ב-OpenRouter

מודלי Span-01 ו-Span-01 Lite זמינים כעת ב-OpenRouter. הם לא מודלי שפה כלליים אלא מסווגים (classifiers) שנבנו להעריך התנהגויות בתוך עקבות (traces) של סוכנים אוטונומיים, מקבלים ספאן מלא או טקסט פשוט, ומחזירים הסתברות לכל התנהגות מוגדרת: האם המשתמש מתוסכל, האם קריאת כלי בטוחה להרצה, וכן הלאה.

איך זה עובד בפועל

המודל מקבל את מלוא ההקשר, הודעות מערכת, משתמש, עוזר וכלים, ללא מגבלת גודל ספאן, ומפיק ציון לכל התנהגות שהמפתח מגדיר. זה מאפשר לחסום קריאת כלי מסוכנת לפני הרצה, לסמן שיחות תמיכה שדורשות התערבות אנושית, או לתייג בכמויות עקבות הערכה (eval traces) לצורך ניתוח מאוחר יותר. התשתית בנויה למהירות של מסווג, לא לאיטיות של מודל חשיבה מלא.

הטענות הטכניות והבנצ'מרק

בריספאן מכנים את Span-01 "מסווג חשיבה היפר-מקבילי ראשון לאתגרים בלתי נראים (RLAIF)" ומדווחים שהוא מוביל את Behavior Benchmark. מול Jev, מסווג מתחרה בקטגוריה, נטען ל-18% שיפור בביצועים במחצית העלות. מול GPT-6 Luna הפער גדול יותר: 700x זול יותר ו-4% טוב יותר. המספרים מגיעים מהיצרן ולא פורסמו מדדי ביצועים עצמאיים או פרוטוקול הבדיקה המלא.

מה חסר בתמונה

לא פורסמו פרטים על ארכיטקטורת המודל, גודל המשקלים, נתוני האימון או אופן יישום ה-RLAIF (למידה מחיזוק ממשוב AI). גם הגדרת "Behavior Benchmark" לא מלווה בקישור לגרסה פומבית או ברשימת המשימות שנבדקו. בהיעדר שקיפות כזו, קשה להעריך אם השיפורים המוצהרים מתורגמים לתרחישי פרודקשן מגוונים או שהם מותאמים לסט הבדיקה הספציפי.

זמינות ושיקולי אימוץ

שני המודלים זמינים מיידית דרך OpenRouter, Span-01 המלא ו-Span-01 Lite הקל יותר. עבור צוותים שבונים guardrails לסוכנים, היכולת להריץ סיווג התנהגותי בזמן אמת על ספאן מלא בלי תקרת קונטקסט היא שינוי תפעולי. השאלה המעשית תהיה האם יחס עלות-ביצועים מול האלטרנטיבות הקיימות (כולל מסווגים קלאסיים זולים בהרבה) מצדיק את המעבר למודל סגור של שחקן חדש.