21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

GPT-6 אסטרה מקפיץ את הרף בבנצ'מרק Image-to-WebDev

GPT-6 אסטרה מקפיץ את הרף בבנצ'מרק Image-to-WebDev

המלך החדש והפער מהמתחרים

GPT-6 אסטרה (Max) של OpenAI תפס את המקום הראשון בטבלת Image-to-WebDev Arena עם 1,733 נקודות, כשהוא מקדים ב-129 נקודות את GPT-5.6 סול (xHigh) וב-23 נקודות בלבד את המקום השני. הפער הצמוד בצמרת מלמד שהמרוץ בין המעבדות הגדולות עבר לשלב של אופטימיזציות דקות ולא קפיצות דוריות. את המקום השני תופס קלוד פבל 5.1 (Max) של Anthropic עם 1,710 נקודות, שיפור של 87 נקודות מול פבל 5 ו-45 נקודות מעל קלוד אופוס 5 (Max) שיושב במקום השלישי עם 1,665 נקודות.

הכניסות החדשות והחזית היעילה

מוז ספארק 1.3 (Max) של Meta AI נחת היישר במקום הרביעי עם 1,645 נקודות, ו-GLM-5.3-פלאש של Z.ai מתברג בעשירייה הראשונה עם 1,588 נקודות. המעניין מבין הארבעה הוא ששלושה מהם, GPT-6 אסטרה, מוז ספארק ו-GLM-5.3-פלאש, יושבים על חזית פארטו (Pareto frontier) של ביצועים מול עלות. המשמעות: הם מספקים את התמורה הטובה ביותר לכל דולר שמושקע באינפרנס, בלי שאף מודל אחר מצליח לעקוף אותם בשני המדדים יחד.

פערי מחיר של שני סדרי גודל

הנתונים הכספיים חושפים פערים דרמטיים. GPT-6 אסטרה גובה 40 דולר למיליון טוקנים (כ-148 שקל) עבור הציון הגבוה ביותר. מוז ספארק מציע 1,645 נקודות ב-3.5 דולר למיליון (כ-13 שקל), הנחה של כ-91% במחיר תמורת ויתור של כ-5% בביצועים. GLM-5.3-פלאש שובר את השוק עם 0.21 דולר למיליון טוקנים (פחות משקל) ומספק 1,588 נקודות, כלומר כ-92% מהציון המוביל בעשירית האחוז מהמחיר.

מה הבנצ'מרק בכלל מודד

Image-to-WebDev Arena לא בודק ידע כללי או כתיבה יוצרת. המתודולוגיה מדרגת מודלים לפי היכולת להפוך צילומי מסך ותמונות לאתרים עובדים, כולל זרימות קוד אג'נטיות (agentic coding workflows) שדורשות חשיבה מרובת-שלבים ושימוש בכלים (tool use). זהו מבחן מעשי של הנדסת פרונט-אנד אוטומטית, לא משחק צ'אט, ולכן התוצאות רלוונטיות ישירות למפתחים שבונים כלי המרה מעיצוב לקוד.

השורה התחתונה למפתחים

מי שצריך את הביצוע המקסימלי ומוכן לשלם פרמיה, GPT-6 אסטרה הוא הבחירה היחידה בצמרת. מי שמחפש יחס עלות-תועלת אגרסיבי, מוז ספארק נותן 95% מהביצועים ב-9% מהמחיר. ומי שמריץ עומסים עצומים בתקציב מינימלי, GLM-5.3-פלאש מספק תוצאה שמישה כמעט בחינם. שלושתם על חזית פארטו, אז הבחירה תלויה רק איפה אתם יושבים על עקומת התקציב.