29 בספטמבר 2026 האקדמיה ארכיון
מבזקים
JupyterLite WebMCP מכניס סוכן למחברת חיה ומאפשר לו לערוך תאים, להריץ קוד ולסקור שינויים בזמן אמת פאראדיי: סוכן שמנווט סריקות תלת-ממד בדפדפן בלי להוציא את המידע החוצה אנתרופיק מובילה את AA Benchmark עם שלושת המקומות הראשונים, כולל מודל ביניים Fireworks משיקה את FireRouter עם Opus, ניתוב חכם שחוסך 57% בעלויות קידוד NVIDIA משיקה פלטפורמת בטיחות לסוכני AI עם אכיפה ברמת החומרה
מוצרים

OpenRouter משיק בנצ'מרק חיפוש רשת: תקציב החיפוש מכריע יותר מהמנוע

OpenRouter משיק בנצ'מרק חיפוש רשת: תקציב החיפוש מכריע יותר מהמנוע

OpenRouter פרסמה סוויטה חדשה של בנצ'מרקים שמדרגת כלי חיפוש על פני מודלים וקונפיגורציות שונות, כדי לעזור למפתחים להחליט איך לגרונד את האייג'נטים שלהם. הבדיקה הקיפה ארבעה בנצ'מרקים מגוונים, ארבעה מודלים, ארבעה עומקי חיפוש וארבעה מנועים, Exa, Parallel, Perplexity והמנוע הנייטיבי של כל מודל. כל הקומבינציות דורגו לפי איכות, עלות ומהירות.

תקציב החיפוש הוא הגורם הדומיננטי

הממצא הבולט ביותר: הגדלת תקציב החיפוש (search budget) השפיעה על התוצאות יותר מכל פרמטר אחר. במעבר מתקציב של טרן אחד ל-25 טרנים, הציונים על בנצ'מרק BrowseComp הכפילו את עצמם בקירוב. המשמעות בפרודקשן פשוטה, אם אתם מוכנים לשלם על יותר סבבי חיפוש, האייג'נט מחזיר תשובות מדויקות משמעותית.

בחירת מודל חשובה מבחירת מנוע

החלפת מודל הניבה פער ממוצע של כ-15 נקודות בין מודלי פרונטיר למודלים חסכוניים בעלות. לעומת זאת, החלפת מנוע חיפוש תוך שמירה על אותו מודל הזיזה את הציונים בכ-10 נקודות בלבד. במילים אחרות: השקעה במודל חזק יותר מחזירה תמורה גדולה יותר מהחלפת ספק החיפוש.

חיפושים כושלים מייקרים את הריצה

בנצ'מרק BrowseComp עם תקציב 25 טרנים חשף פער עלות חד: כשהמודל הצליח, הוא ביצע בממוצע 10.3 חיפושים. כשנכשל, 19.7 חיפושים. אם אתם יודעים מראש ששיעור הכישלון יהיה גבוה, קיצוץ במספר הטרנים יחסוך כסף בלי לפגוע מהותית בתוצאות המוצלחות.

מנוע נייטיבי לא תמיד מנצח

הבדיקה הפריכה את ההנחה שהמנוע הנייטיבי של מעבדת המודל הוא ברירת המחדל הטובה ביותר. לדוגמה, החיפוש הנייטיבי של GPT 5.6 Sol ניצח צד שלישי רק ב-50% מהבנצ'מרקים. הבחירה האופטימלית תלויה בעומס העבודה הספציפי, אין פתרון אחד שמתאים לכל תרחיש.