21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מוצרים

פיירוורקס משיקה את DeepSeek-V4.1-Flash: אותו דיוק קידוד כמו GPT-6 Astra בעשירית המחיר

פיירוורקס משיקה את DeepSeek-V4.1-Flash: אותו דיוק קידוד כמו GPT-6 Astra בעשירית המחיר

פיירוורקס (Fireworks) שחררה בשבוע שעבר את DeepSeek-V4.1-Flash, ובדיקות הבנצ'מרק המלאות שערכה החברה מראות שהמודל החדש קובע חזית פארטו (Pareto frontier) חדשה בשלושת הפרמטרים הקריטיים, איכות, מהירות ועלות. במבחן DeepSWE, שמודד דיוק קידוד אוטונומי, המודל מגיע לרמת הדיוק של GPT-6 Astra בעלות של 1/15 למטלה. המשמעות המעשית: סוכני קידוד ברמת חזית (frontier-grade) הופכים לכדאיים כתשתית רקע רציפה, ולא רק ככלי נקודתי יקר.

ארכיטקטורת הפעלה מפוצלת שמותאמת לסוכני קוד

מתחת למכסה המנוע, DeepSeek-V4.1-Flash הוא הקטן במשפחת הארכיטקטורה החדשה של DeepSeek, ומביא עימו שיפור ארכיטקטוני מהותי: מודל MoE של 552 מיליארד פרמטרים עם ארכיטקטורת מקודד-מפענח מפוצלת (encoder-decoder split architecture). במקום תקציב הפעלה יחיד לכל מעבר קדימה (forward pass), המודל מקצה 8 מיליארד פרמטרים פעילים לקלט ו-16 מיליארד לפלט. הא-סימטריה הזו תואמת בדיוק את אופי העבודה של סוכני קידוד: במסלול טיפוסי (trajectory) הסוכן קורא שוב ושוב קבצים, פלט כלים והיסטוריה עצמית, ופולט תיקון קטן יחסית. בבדיקת DeepSWE נמדד יחס של 174:1 בין טוקני קלט לפלט, 36.9 מיליון טוקני קלט מול 211 אלף טוקני פלט למטלה. הארכיטקטורה החדשה מאפשרת להוציא חצי מכוח החישוב על הצד הכבד של הקלט, היכן שרוב הטוקנים ממילא מצטברים.

אופטימיזציית KV Cache שחותכת את העלות האמיתית בלולאות ארוכות

השיפור השני נוגע לניצול מטמון KV (KV Cache): בהשוואה לדור הקודם DeepSeek V4, המודל החדש צורך רבע מה-HBM ושמינית מאחסון SSD. הנתון הזה קריטי כי בלולאות סוכן ארוכות, רוב ההוצאה אינה על הטוקנים שהמודל מייצר, אלא על קריאה חוזרת של אותו הקשר (context) שוב ושוב. הפחתה של פי 4 בזיכרון מטמון מתורגמת ישירות לירידה של פי 15 בעלות למטלה בציון 74% ב-DeepSWE. ההפחתה של פי 8 בתקורת SSD משלימה את המהלך בכך שהיא שומרת על שיעורי פגיעה במטמון (cache hit rates) קרובים ל-99% לאורך מסלולים ארוכים.

המספרים ב-DeepSWE: אותה רצועת איכות, פער עלות עצום

בבדיקת DeepSWE ארבעת המודלים המובילים נופלים באותה רצועת איכות, כולם בטווח של 0.7 נקודות ב-pass@1, כשהשונות בין הרצות עומדת על 1.4 עד 3.2 נקודות. ההבדל כולו בעלות: DeepSeek-V4.1-Flash על גבי פיירוורקס מספק את אותה דיוק ב-0.43 דולר למטלה (כ-1.6 שקל), שהם פי 5.5 זול יותר מ-Gemini 3.8 Flash, פי 15 זול יותר מ-GPT-6 Astra, ופי 28 זול יותר מ-Claude Opus 5. במילים פשוטות: אפשר להריץ 15 ניסיונות קידוד אוטונומיים במחיר של קריאה בודדת ל-Astra.

Terminal-Bench 2.1: נקודה אחת מאחורי אסטרה ב-1/12 מחיר

במבחן שונה, Terminal-Bench 2.1, התמונה דומה: DeepSeek-V4.1-Flash מפגר בנקודה בודדת אחרי GPT-6 Astra, אבל עושה זאת בעלות נמוכה פי 12. השילוב בין ארכיטקטורת ההפעלה המפוצלת לאופטימיזציית המטמון מאפשר למודל הקטן במשפחה לסגור פערים מול מודלים סגורים ויקרים משמעותית, ולהפוך כלכלה של סוכני קידוד אוטונומיים למשהו שצוותי הנדסה יכולים להריץ ברציפות בלי לרוקן את התקציב.