21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מחקר

הרולד מגיע לשולחן העבודה

הרולד מגיע לשולחן העבודה

פלטפורמת ההשוואה החדשה הרולד (Harold) עלתה לאוויר עם מה שנראה כמו מסד הנתונים המקיף ביותר עד כה לבחינת עלות־תועלת של מודלי שפה: 100 בנצ'מרקים, 840 מודלים ו־16,429 תוצאות מדודות, כולם מעודכנים ל־17 בספטמבר 2026. בניגוד לטבלאות השוואה שמסתפקות במחיר למיליון טוקנים, הרולד מציג עלות אמיתית למשימה, מדד שמשקף כמה באמת עולה להריץ מטלה שלמה, כולל תקורה, ניסיונות חוזרים והבדלי ביצועים בין ספקים.

מה שמאחורי המספרים

הנתון הבולט הוא היקף הכיסוי: מאה מבחנים שונים, ממבחני קידוד (HumanEval, MBPP) דרך חשיבה מתמטית (GSM8K, MATH) ועד משימות שפה טבעית ורב־לשוניות. כל מודל נבדק מול כל בנצ'מרק שבו יש לו תוצאות פומביות, והתוצאות מוצלבות עם תמחור עדכני של ספקי אינפרנס (inference), לא רק מחירון רשמי אלא מחירים שנמדדו בפועל אצל ספקים שמפרסמים תעריפים פומביים. התוצאה היא 16 אלף שורות נתונים שאפשר לסנן לפי משימה, תקציב, אזור אירוח ודרישות ראיות.

ציון בנצ'מקסינג ועלות למשימה

החידוד המרכזי שמציע הרולד הוא ציון "בנצ'מקסינג" (Benchmaxxing), ניסיון ראשון מסוגו, לדברי היוצרים, לכמת את יחס העלות־ביצועים בצורה שמאפשרת השוואה ישירה בין מודלים בגדלים שונים ובארכיטקטורות שונות. במקום להסתכל על ציון גולמי בבנצ'מרק בודד, הציון המשוקלל משלב ביצועים במספר מבחנים רלוונטיים למשימה נתונה, ומחלק אותם בעלות המשימה המחושבת. במקביל מוצג "ציון משוקלל" (Composite Score) שמאגד כמה בנצ'מרקים למשפחות משימה רחבות יותר, למשל "קידוד כללי" או "הסקת מסקנות מתמטית".

אירוח באיחוד האירופי ודרישות ראיות

חלק נפרד בממשק מוקדש להגדרת "אירוח באיחוד האירופי", הגדרה טכנית מחמירה שקובעת שאינפרנס נחשב EU-hosted רק אם הוא רץ בפועל באזור אירופי של הספק (AWS Bedrock EU cross-region, Azure Europe Data Zone, או ספק שכל הצי הציבורי שלו מתועד כמאורח באיחוד). אזור חיוב אירופי, חברה רשומה באירופה או מישור בקרה (control plane) אירופי אינם מספיקים כשלעצמם. חריג אחד של מדיניות חברה מוצהרת נשאר בטבלה ומסומן "EU equivalent". מעל כל טבלת מחירים מופיעות דרישות הראיות הרלוונטיות: ראיות בנצ'מרק, ספק מתומחר, וטוקנים שנמדדו בפועל למשימה.

מה זה משנה בפועל

עבור מפתחים שבוחרים מודל לפרודקשן, המשמעות היא יכולת להשוות תפוחים לתפוחים: לא "כמה עולה GPT-4o למיליון טוקנים" אלא "כמה יעלה לי להריץ את סוויטת הבדיקות שלי על GPT-4o מול Claude 3.5 Sonnet מול Llama 3.1 405B אצל ספק X", עם נתוני ביצועים מאותו בנצ'מרק בדיוק. הממשק מאפשר סינון לפי תקציב מקסימלי למשימה, דרישת אירוח גיאוגרפי, ורמת ראיות נדרשת, מה שחוסך את הסיבוב הידני בין דפי תמחור, דוחות בנצ'מרק ותיעוד ספקים.

עדיין חסרים חלקים בפאזל

מה שהרולד לא מספק כרגע הוא מדדי השהיה (latency), זמינות (uptime SLA), או מגבלות קצב (rate limits) של הספקים השונים, פרמטרים שמכריעים בפרודקשן לא פחות מעלות למשימה. גם אין עדיין API ציבורי לשליפת הנתונים לתוך צנרת CI/CD, אם כי היוצרים רומזים שזה בכיוון. בשורה התחתונה: הרולד סוגר פער מידע משמעותי בבחירת מודל, אבל הוא כלי תומך החלטה, לא תחליף לבדיקת עומס אמיתית על המערכת שלך.