21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

דיפסיק משנה את גבול היעילות בארג'נט ארינה

דיפסיק משנה את גבול היעילות בארג'נט ארינה

דיפסיק (DeepSeek) שחררה את V4.1-Flash (Max) והוא נכנס היישר למקום השלישי בין המודלים הפתוחים בארג'נט ארינה (Agent Arena), זירת הבדיקה שמדמה משימות של סוכנים (agents) מרובי-שלבים. ההישג האמיתי אינו הציון הגולמי, שעומד על 4.87% שיפור נטו מעל הבסיס (baseline) של הזירה, אלא המחיר החציוני למשימה: 7 סנט (כ-0.25 ש"ח). בנקודה הזו המודל מגדיר מחדש את חזית פארטו (Pareto frontier), הקו שמפריד בין מודלים שנותנים תמורה טובה יותר לכל דולר לבין אלה שלא.

המספרים שמאחורי המיקום

בטבלת הדירוג המלאה מופיעים לצד דיפסיק שמות כמו קלאוד פייבל 5.1 (מקס) עם 13.9% שיפור ב-4.54 דולר למשימה, GPT-6 אסטרה (מקס) עם 11.9% ב-4.09 דולר, וקלאוד אופוס 5 (מקס) עם 11.09% ב-3.52 דולר. המודל של דיפסיק מספק קצת יותר משליש מהשיפור של המובילים, אבל עולה בערך 1/60 מהמחיר. אפילו מול קלאוד אופוס 4.8 (היי) שעולה 1.36 דולר למשימה, הפער הוא פי 22 בעלות לטובת הסיני.

השוואה לשכבה הפתוחה

בתוך קבוצת המודלים הפתוחים ההשוואה חדה עוד יותר. היי-4 פריוויו (Hy4 preview) משיג 4.96% שיפור ב-22 סנט למשימה, דיפסיק שומר על 98% מהביצוע הזה ב-73% פחות עלות. קימי K3 (מקס) מגיע ל-6.39% ב-77 סנט, ודיפסיק מחזיק 76% מהביצועים ב-92% הנחה. במונחים של יחס עלות-תועלת נטו, V4.1-Flash (מקס) הוא כרגע היעיל ביותר בשלישייה הפותחת.

מודלים שנדחקו מהחזית

הכניסה של דיפסיק דחקה שלושה מודלים אל מחוץ לחזית פארטו: GPT-5.6 לונה (אקסטרים-היי), GLM-5.3-פלאש, והדור הקודם דיפסיק-V4-פלאש. המשמעות המעשית: לכל אחד מהם קיים עכשיו מודל אחר שנותן ביצועים שווים או טובים יותר במחיר נמוך יותר, או ביצועים טובים משמעותית באותו מחיר. בזירה שבה המפתחים בוחרים מודל לפי תקציב קשיח, יציאה מהחזית פירושה אובדן רלוונטיות מיידי.

מה זה אומר בפועל

עבור מי שבונה סוכנים אוטונומיים שרצים בלולאות ארוכות, סריקת קוד, תכנון משימות, קריאות API חוזרות, הפער בין 7 סנט ל-4 דולר למשימה הוא ההבדל בין פיילוט שנסגר אחרי שבוע לבין מוצר שעולה לייצור. דיפסיק לא טוענת לכתר הביצועים המוחלט; היא טוענת לכתר היחס, והנתונים כרגע מגבים את הטענה.