ריספאן משיקה מודלי החלטה לספאנים של סוכנים ב-OpenRouter

מודלי Span-01 ו-Span-01 Lite זמינים כעת ב-OpenRouter. הם לא מודלי שפה כלליים אלא מסווגים (classifiers) שנבנו להעריך התנהגויות בתוך עקבות (traces) של סוכנים אוטונומיים, מקבלים ספאן מלא או טקסט פשוט, ומחזירים הסתברות לכל התנהגות מוגדרת: האם המשתמש מתוסכל, האם קריאת כלי בטוחה להרצה, וכן הלאה.
איך זה עובד בפועל
המודל מקבל את מלוא ההקשר, הודעות מערכת, משתמש, עוזר וכלים, ללא מגבלת גודל ספאן, ומפיק ציון לכל התנהגות שהמפתח מגדיר. זה מאפשר לחסום קריאת כלי מסוכנת לפני הרצה, לסמן שיחות תמיכה שדורשות התערבות אנושית, או לתייג בכמויות עקבות הערכה (eval traces) לצורך ניתוח מאוחר יותר. התשתית בנויה למהירות של מסווג, לא לאיטיות של מודל חשיבה מלא.
הטענות הטכניות והבנצ'מרק
בריספאן מכנים את Span-01 "מסווג חשיבה היפר-מקבילי ראשון לאתגרים בלתי נראים (RLAIF)" ומדווחים שהוא מוביל את Behavior Benchmark. מול Jev, מסווג מתחרה בקטגוריה, נטען ל-18% שיפור בביצועים במחצית העלות. מול GPT-6 Luna הפער גדול יותר: 700x זול יותר ו-4% טוב יותר. המספרים מגיעים מהיצרן ולא פורסמו מדדי ביצועים עצמאיים או פרוטוקול הבדיקה המלא.
מה חסר בתמונה
לא פורסמו פרטים על ארכיטקטורת המודל, גודל המשקלים, נתוני האימון או אופן יישום ה-RLAIF (למידה מחיזוק ממשוב AI). גם הגדרת "Behavior Benchmark" לא מלווה בקישור לגרסה פומבית או ברשימת המשימות שנבדקו. בהיעדר שקיפות כזו, קשה להעריך אם השיפורים המוצהרים מתורגמים לתרחישי פרודקשן מגוונים או שהם מותאמים לסט הבדיקה הספציפי.
זמינות ושיקולי אימוץ
שני המודלים זמינים מיידית דרך OpenRouter, Span-01 המלא ו-Span-01 Lite הקל יותר. עבור צוותים שבונים guardrails לסוכנים, היכולת להריץ סיווג התנהגותי בזמן אמת על ספאן מלא בלי תקרת קונטקסט היא שינוי תפעולי. השאלה המעשית תהיה האם יחס עלות-ביצועים מול האלטרנטיבות הקיימות (כולל מסווגים קלאסיים זולים בהרבה) מצדיק את המעבר למודל סגור של שחקן חדש.