הארווי משיקה את טנט: מודל משפטי שפותח על גבי קימי K3 עם למידת חיזוק אסינכרונית

הארווי (Harvey) הכריזה על הארווי טנט (Harvey Tenet), המודל הראשון שלה שעבר פוסט-טריינינג, כתצוגה מקדימה למחקר. טנט מבוסס על מודל הבסיס קימי K3 (Kimi K3) ועבר אימון נוסף בשיתוף פיירוורקס (Fireworks) באמצעות למידת חיזוק אסינכרונית על משימות משפטיות ארוכות-אופק. קורפוס האימון שילב נתונים סינתטיים, מידע משפטי זמין לציבור ונתוני מומחים אנושיים, והארווי מדגישה כי לא נעשה שימוש בנתוני לקוחות. המודל עצמו הוא צ׳קפוינט פרטי של הארווי; משקולות הבסיס של K3 הן במשקל-פתוח (open-weight), אך טנט טרם פורסם כמודל עצמאי.
ביצועים והעברה למשימות שלא נראו באימון
מול מודל הבסיס K3, טנט משלים כמעט פי שניים משימות מוחזקות (held-out) בבנצ׳מרק סוכן משפטי של הארווי (LAB), ו-20 נקודות אחוז יותר ב-LAB: Contracts, שיפור של 9 ו-2 נקודות אחוז בשיעור מעבר מלא (all-pass rate) בהתאמה. הארווי מדווחת על תוצאת שיא (state-of-the-art) ב-LAB: Contracts ומקום שני ב-LAB הכללי, לפי ציוני בסיס של Vals. המעניין יותר הוא העברה ללא אימון נוסף: טנט משתפר משמעותית גם ב-APEX Agents של מרקור (Mercor) לדיני תאגידים וב-Redline Bench של קרוסבי (Crosby), שניהם לא נכללו באימון, תוך שמירה על ביצועים בבנצ׳מרקי ידע כגון LegalBench, CUAD, MAUD ו-PRBench של Scale. אימון סוכני (agentic) לא פגע ביכולת הנימוק המשפטי הבסיסית.
מתודולוגיה: סביבות ארגז-חול, 150 מעבדי B300, ו-GSPO עם LoRA בדרגה 64
האימון נערך בסביבות ארגז-חול (sandboxed) הבנויות כמשימות LAB: הוראה בסגנון שותף בכיר באורך ממוצע של 50 מילים, תיק לקוח עם מסמכי מפתח והיקפיים, ורובריקת מומחה עם כ-50 קריטריוני עבר/נכשל אטומיים למשימה (מאות בקיצון). רולאאוט בודד יכול לעבור 1,000 תורות. דירוג הרולאאוטים בוצע על ידי LLM כשופט; אבלציות הובילו לבחירת קימי 2.6 כשופט. הפרס משלב שיעור קריטריונים מרוצים, ספירה הוליסטית של סוגיות משפטיות שנפתרו, ובונוס מעבר-מלא. המדיניות מותאמת ב-GSPO עם LoRA בדרגה 64 על מלוא רשת K3, שמונה קבוצות משימות של שמונה רולאאוטים לצעד אופטימיזציה, על פני כ-1,750 סביבות ויותר מ-10,000 רולאאוטים לאפוקה. פיירוורקס בנתה במשותף את המאמן ואת פריסת הרולאאוטים ברמת הקרנל, עם token-in-token-out ו-router replay, כדי לשמור על יישור נומרי של ה-MoE הגדול בין אימון להרצה.
לא פריס, מתכון: סטטוס תצוגה מקדימה ומגבלות גישה
נכון להיום טנט אינו ניתן לפריסה (deployable). הארווי לא פרסמה משקולות, כרטיס מודל (model card) או נקודת קצה API. הגישה תהיה דרך הפלטפורמה של הארווי, הנמכרת למשרדי עורכי דין גדולים, בינוניים וצוותים משפטיים פנימיים, Enterprise בלבד. מעבדה עם מחסנית RL יכולה לשחזר את השיטה; האימון צרך כ-150 מעבדי NVIDIA B300 על פני חודשיים. מה שמסופק כעת הוא המתכון, לא המודל המוגמר.
אופטימיזציית עלות: משקולות פתוחות ועיצוב פרס למסלולים קצרים
העלות מותאמת במשותף (co-optimized) ולא מוקרבת. משקולות פתוחות מוזילות מחיר לטוקן; עיצוב פרס שמעדיף מסלולים קצרים יותר באיכות זהה מפחית טוקנים שנצרכים. הארווי מדווחת על רווחי איכות משמעותיים בעלות יציבה. היישומים המיועדים כוללים מזכרי בדיקת נאותות מיזוגים ורכישות על דאטארומים, ניסוח חוזים, סקירה ורדליינינג (redlining), מיצוי מובנה על עד 10,000 מסמכים, וחיפוש תקדימים על ידע מצטבר של המשרד.
שלוש יכולות שפותחו בנפרד, והחלקים החסרים
צוות הארווי פוסט-אימן שלוש יכולות בנפרד (הטקסט נקטע כאן). בהיעדר משקולות, כרטיס מודל, API ובנצ׳מרקים שעברו ביקורת עמיתים, טנט נותר תצוגה מקדימה מחקרית, צעד מעניין בכיוון מודלים משפטיים מתמחים על בסיס משקל-פתוח, אך עדיין לא מוצר שניתן להריץ בסביבת ייצור.