TypeSafe AI משיקה את Jev, מודל שמחזיר החלטות מתויגות במקום טקסט

מה זה בעצם Jev
TypeSafe AI, חברה שהוקמה על ידי אחד ממפתחי ChatGPT המקוריים, שחררה את Jev, מודל מבוסס טרנספורמר שאינו LLM במובן המקובל. הוא לא מייצר טקסט חופשי. במקום זה, אתם שולחים מצב (state) ומפת שאלות מתויגות, ומקבלים בחזרה החלטות מתויגות עם הסתברויות שקוד יכול להסתעף עליהן. המודל זמין כ-API מאוחסן בגישה מוקדמת מאחורי רשימת המתנה; משקולות, ספירת פרמטרים או אופציית self-hosting לא פורסמו.
מערכת אחת, לא צ'אט
השם שואב מהחלוקה של דניאל כהנמן (Daniel Kahneman) בין אינטואיציה מהירה (System One) לחשיבה איטית (System Two). ב-TypeSafe טוענים ש-RLHF כיוון מודלים להעדפות אנושיות, מה שהניב צ'אט, אבל גם ביטחון יתר ו-mode dropping. הפגמים האלה משאירים אדם בלולאה. Jev נבנה על סטאק חדש: ארכיטקטורה לא נחשפת, סמפלר מקבילי, ו-RLCD, למידת חיזוק להחלטות מכוילות. הארכיטקטורה עצמה נשארה חסויה.
איך ה-API עובד
אנדפוינט יחיד מטפל בהכול: POST עם גוף שמכיל state, model, ומפת שאלות. התיעוד מגדיר שלושה סוגי שאלות, Choice (עד 255 אופציות), Noul (בוליאני רך), ו-Score (מספרי). השאלות רצות במקביל ובבידוד מול אותו state, ולדברי החברה הוספת שאלות כמעט לא משנה את זמן התגובה. SDK לפייתון (3.10 ומעלה) זמין ב-pip install typesafe-sdk, ל-JavaScript כ-@typesafe-ai/sdk, וגם דוגמאות cURL ו-skill לסוכן של Claude Code.
ביטחון כמוצר, לא כהבטחה
כל תשובת Choice ו-Score נושאת ערך confidence בין 0 ל-1, נגזר מצורת התפלגות ההסתברות. בדוגמת התיעוד, "billing" מנצח ב-0.84 אבל הביטחון רק 0.596, כי "technical" עדיין מחזיק 0.159. התיעוד מציע שלושה נתיבים: לפעול בביטחון גבוה, לשלוח לביקורת באמצע, ולהעביר לאדם בביטחון נמוך, כשהספים צריכים להשתנות לפי מחיר הטעות.
המספרים והאותיות הקטנות
התמחור: 42 דולר (כ-155 שקל) למיליארד טוקנים של קלט. לשם השוואה, LLMs קיימים נעים בין 20 סנט ל-10 דולר (0.74-37 שקל) למיליון טוקנים. בדמו מוקלט Jev סיים ב-0.114 שניות תמורת 0.000081 דולר (כ-0.0003 שקל), מול GPT-5.6 Terra שלקח 8.566 שניות ועלה 0.01388 דולר (כ-0.051 שקל). TypeSafe טוענת לפי 193.6 מהיר יותר ופי 444.6 זול יותר, אבל המספרים מגיעים מה-evals הפנימיים שלהם, כשהתשובה המבוססת (reference) היא ממוצע של GPT-6 Astra ו-Fable 5.1, ה-workflows נכתבו על ידי צוות ה-capabilities שלהם, והם מציינים במפורש שהרווחים האלה בקצה העליון של שימוש אמיתי, וגם שאין להם הוכחה שהמחיר לא מסובסד. "אפס הזיות" פירושו התאמת סכמה מובטחת; הנתון 0% אינו אמפירי, ותשובות עדיין יכולות להיות שגויות.
מה המפתחים כבר בונים
תוך ימים הופיעו פרויקטים קהילתיים. מנכ"ל Vercel, גיירמו ראוך (Guillermo Rauch), דיווח ש-Jev מהיר עד פי 18 ב-p95 מ-GPT Luna ומדויק יותר, אם כי ה-fx reviewer עדיין רץ על Luna. מהנדס פראניט שארמה (Pranit Sharma) שיתף את הבנצ'מרק. CTO של Bryo AI, ניקיל מודהולקר (Nikhil Mudholkar), מצא ש-Gemini מעט יותר מדויק אבל יקר פי 10-20. Browser Use הריצו חיפוש טיסות ציריך-לונדון ב-7.1 שניות. Droidrun הניעו אובר על אנדרואיד אמיתי, 9 פעולות בכ-21 שניות, בלי שההזמנה הושלמה.