פרספטרון משיקה את Mk1.5: אותו תמחור, מולטימודאליות מלאה לסוכנים פיזיים

מודל תפיסה עם תג מחיר מוכר
פרספטרון (Perceptron) משחררת את Mk1.5, מודל תפיסה (perception model) שפותח במיוחד עבור סוכנים פיזיים (physical agents), ושומרת על התמחור של הדור הקודם: 15 סנט למיליון טוקנים של קלט, ו-1.50 דולר למיליון טוקנים של פלט (כ-0.55 שקל וכ-5.5 שקל בהתאמה). ההשקה ב-25 בספטמבר 2026 מגיעה בלי העלאת מחיר, מה שמציב את המודל החדש כעדכון יכולות ולא כקפיצת דור שדורשת תקציב חדש.
קלט מולטימודאלי, פלט מובנה לפי דרישה
השינוי המרכזי הוא ברוחב הפס החושי: Mk1.5 מקבל טקסט, תמונות, וידאו ואודיו, ומחזיר טקסט לצד הערות מובנות (structured annotations) אופציונליות, נקודות, תיבות, פוליגונים לקיטוב מרחבי בתמונות, וקטעי זמן (clips) לפילוח טמפורלי בווידאו. ההערות אינן מגיעות כברירת מחדל; הן נפלטות בשורה אחת עם הטקסט רק כשהמפתח מבקש זאת במפורש דרך הפרמטר `annotation_format`. פסקול של וידאו מנותח רק כשמופעל דגל ייעודי לכל בקשה, מנגנון שנועד לחסוך עיבוד מיותר ועלויות נלוות.
חשיבה מדורגת, קריאות פונקציה ו-JSON Schema
מעבר למודאליות, המודל תומך בחשיבה מדורגת (graded reasoning) דרך בקרות החשיבה הסטנדרטיות של הפלטפורמה, בקריאות פונקציה (function tool calling) וביציאות מובנות לפי JSON Schema. השילוב הזה מאפשר לסוכן פיזי לא רק "לראות" אלא גם לתכנן צעדים, להפעיל כלים חיצוניים ולהחזיר פלט שמתממשק ישירות למערכות בקרה, בלי שכבת תרגום נוספת בצד הלקוח.
חלון הקשר צנוע, ביצועים יציבים
חלון ההקשר עומד על 37 אלף טוקנים, לא גדול במונחים של מודלי שפה כלליים, אבל מספיק לרוב תרחישי הרובוטיקה והראייה הממוחשבת שבהם הקלט הוויזואלי דחוס. התפוקה (throughput) נמדדת ב-93 טוקנים לשנייה (P50, הטוב ביותר בין הספקים), והשהיה חציונית של 0.57 שניות (P50, הספק הטוב ביותר). המספרים האלה מציבים את Mk1.5 בטריטוריה שמאפשרת לולאות בקרה בזמן אמת כמעט, בתנאי שהבקשה לא חורגת מההקשר.
זמינות 100% עם ניתוב אוטומטי
הפלטפורמה מדווחת על 100% זמינות בזכות ניתוב אוטומטי לספק בריא כשמתרחשת שגיאה אצל ספק עליון (upstream provider), כל עוד מסנני הבקשה מאפשרים זאת. נתוני זמינות פר-ספק נגישים תכנותית דרך ה-Endpoints API, מה שמאפשר לצוותי הנדסה לבנות לוחות מחוונים משלהם ולקבוע מדיניות fallback מותאמת.