המודל שמנסה להרוג את הצ'אט

דיאוגו אלמיידה (Diogo Almeida), ממחברי מאמר InstructGPT המקורי, השיק את Jev, מודל שפותח בחברת TypeSafe ומכוון לבעיה אחת: אמינות במשימות "System One", אותן החלטות מהירות ואינטואיטיביות שמודלים נוכחיים נוטים לפשל בהן. סרטון ההשקה הגיע לכ-40 מיליון צפיות, מספר שעוקף את GPT-4o (22 מיליון) ו-Fable 5 (15 מיליון), אם כי עדיין רחוק מ-Navier Stokes (74 מיליון) ומ-6 Astra (137 מיליון). אלמיידה טוען שכל שרשרת החידושים מאז InstructGPT, Function Calling, Structured Outputs, Reasoning, אינם אלא טלאים על גבי פרדיגמת חיזוי רצף טקסטואלי, ושהכיוון הזה מיצה את עצמו.
RLCD: למידת חיזוק להחלטות מכוילות
החידוש המרכזי של Jev הוא RLCD, Reinforcement Learning for Calibrated Decisions, טכניקה שטרם פורסמה רשמית. במקום אופטימיזציה מול פידבק אנושי (RLHF), שמייצרת הזיות, חנפנות ותלות קבועה במדרגים אנושיים, או מול פלטים ניתנים לאימות תוכניתי עם רובריקות (RLVR), שפותרת משוואות נוויה-סטוקס אך מחריפה "אינטליגנציה משוננת" ולא משתלבת היטב בתוכנה אחרת, RLCD מכוון לתשובות עם הסתברויות "ישרות אפיסטמית" במשימות System One. אלמיידה מבחין בין שלושה ענפי RLHF: כריסטיאנו ואחרים 2017 (דמו בקפיצה לאחור של רובוט), סטיינון ואחרים 2020 (למידת סיכום), ועבודתו שלו אוייאנג ואחרים 2022 (InstructGPT), ושלושתם, לטענתו, היו כוכב צפון שגוי.
למה מודלי צ'אט נכשלים באוטומציה בסיסית
הטיעון המרכזי: דור שלם של אימון עוזרים מועילים לבני אדם פגע ביכולתם לשמש כמצב (mode) אימון למודלים. אלמיידה נאבק ב-2023-2024 לאמן מודל שיפתור את בעיית האמינות בלב התוכנה, ונכשל בגלל תת-הערכה אישית וארגונית. Jev נבנה כדי "להיעלם ברקע", להיות בלתי מורגש כמו regex, ולא כדי לנהל שיחה. רשימת מקרי השימוש ארוכה: משחקים ושימוש במחשב מבוססי מהירות, קול פלוס שליטה במחשב, הדגמת Doom, נהיגה במשחקים, Excalidraw, מדידות וירטואליות, NPCs חכמים, תגובות מודרכות בהודעות טקסט, סוכני קוד רשמיים, לינטינג, דחיסת קריאות כלים, שפות תכנות שנבנות מעל Jev, שחזור אנליטיקות ומסע משתמש, "דאטה אפלה", ו"תוכנה חכמה". יש גם מדריך רשמי לשימוש ב-Jev כשופט (judge).
דחיית בנצ'מרקים גנריים והבעיה של KV Cache
אלמיידה דחה פומבית הקמת JevBench גנרי, בטענה שמדובר במאמץ נמוך שמחמיץ את הנקודה. תיאו (Theo) העלה ביקורת סבירה על "עריצות ה-KV Cache", ואלמיידה פרסם תגובה מפורטת שטוענת כי "Cache Rules Everything", עניין קריטי כשמדובר בסוכני קוד. בחברה רומזים על מודלים עתידיים דוגמת ReasoningJev, אך לא פורסמו מדדי ביצועים, תאריכים או פרטים טכניים מעבר לעקרון ה-RLCD. הסרטון המלא של ההרצאה ב-AIE זמין לצפייה, והחברה מפרסמת דפוסים רשמיים וספרי בישול (cookbooks) למפתחים שרוצים לבנות מעל Jev במקום לשכפל את ה-API בפעם ה-55.