DeepSeek V4 Pro מכה את Fable 5 בבנצ'מרק קוד ועולה שליש מחיר

המודל DeepSeek V4 Pro בגרסת 0813, שרץ עכשיו על Fireworks, עוקף את Fable 5 בשני מתוך ארבעה בנצ'מרקים מרכזיים לפיתוח תוכנה, SWE-Bench Verified ו-LiveCodeBench v6, ועושה את זה בעלות של כשליש למשימה פתורה. בניגוד למודלים סגורים מסוימים, הוא גם לא מסרב לבצע עבודות ביקורת אבטחה (security review) לגיטימיות, מה שהופך אותו לשותף מעשי יותר לצוותים שצריכים להריץ סריקות קוד אוטומטיות בלי להיתקל בסירובים מלאכותיים.
זמינות מלאה עם קונטקסט של מיליון טוקן
Fireworks הפעילה את המודל עם נקודות קצה serverless, פריסות ייעודיות ותמיכה באימון (fine-tuning), כולל SFT, DPO ו-RFT. החלון עומד על מיליון טוקן עם קריאות כלים מובנות (native tool calling) והיסטוריית חשיבה נשמרת (preserved reasoning history), מה שמכוון אותו לעומסי עבודה אגנטיים ארוכי-טווח (long-horizon agentic workloads) שבהם הסוכן צריך לשמור הקשר לאורך הרבה צעדים.
תוצאות הבנצ'מרק: חזק בשניים, חלש בג'אווה
חבילת ההערכה כללה ארבע משפחות: SWE-Bench Verified, LiveCodeBench v6, Aider Polyglot v1 ו-Terminal-Bench 2.1. V4 Pro מוביל כשחקן יחיד בשתיים מהן. ב-SWE-Bench העלות למשימה פתורה עומדת על 0.309 דולר (כ-1.13 שקל) מול 0.808 דולר (כ-2.95 שקל) של Fable 5. ב-LiveCodeBench הפער גדול עוד יותר: 0.040 דולר (כ-15 אגורות) מול 0.225 דולר (כ-82 אגורות). ב-Terminal-Bench יש שני פערים בולטים בביצועים ובעלויות של Fable 5, אבל הנקודה המעניינת יותר היא הרב-לשוניות: ב-Aider Polyglot המודל חזק ב-Rust (90.0%) וב-C++ (80.8%), אבל צונח ל-48.9% בג'אווה, הפרוסה הגדולה ביותר עם 47 משימות, מול 74.5% של Fable 5. הביצועים בג'אווה אחראים לכמעט כל הפער הכולל.
ניתוב אורקל: 16 פעמים זול יותר, 5.9 נקודות טוב יותר
הצוות בדק ניתוב אורקל (oracle routing), שיטה שמריצה כל משימה על שני המודלים ובוחרת בדיעבד את התשובה הנכונה הזולה יותר, בין V4 Pro ל-Fable 5. על 409 משימות משולבות, הניתוב מגיע ל-92.4% דיוק מול 86.6% של Fable 5 לבדו, בעלות של 0.279 דולר (כ-1.02 שקל) למשימה מול 4.510 דולר (כ-16.5 שקל). זה פי 16 זול יותר, ו-86.3% מהמשימות מנותבות ל-V4 Pro. המסקנה: המודל היקר הוא החריג, לא ברירת המחדל. חשוב לזכור שאורקל הוא חסם עליון תיאורטי שחושב בדיעבד; נתבים אמיתיים (real routers) משיגים רק שבריר ממנו, אבל גודל הפער מראה כמה מרחב שיפור קיים.
שותף ניתוב עדיף על Kimi K3
כל צימוד של V4 Pro עם Fable 5 מנצח את הצימוד המקביל של Kimi K3: LiveCodeBench מגיע ל-94.0% מול 92.0%, Aider ל-93.3% מול 91.6%, והקוהורטה המשולבת ל-92.5% מול 91.1%. זה קורה אף על פי ש-K3 מקבל ציון גבוה יותר ב-CyberGym, כי הניצחונות של V4 Pro נופלים בדיוק על המשימות ש-Fable 5 מפספס, מה שהופך אותו להשלמה טבעית יותר.
אימון והפצה על אותו בקאנד
מי שרוצה לבנות מודל מותאם לדומיין ספציפי יכול להריץ אימון על V4 Pro ישירות ב-Fireworks עם תשתית ברמת חזית (frontier-grade) ובלי מגבלות פלטפורמה מלאכותיות. כשהריצה מסתיימת, הצ'קפוינט המותאם נפרס לייצור בקליק אחד. מכיוון שהאימון וההגשה (serving) רצים על אותו בקאנד משותף ומותאם-ביחד (co-optimized), הביצועים בייצור תואמים את הבנצ'מרקים של האימון בכל פעם. הבנצ'מרקים הרשמיים של DeepSeek עצמה רצים על DeepSeek Harness (dsh), ריצה אגנטית מקורית שמטפלת בכל השרשרת ממתאם המודל ועד ליבת ההרצה.