OpenRouter משיק בנצ'מרק חיפוש רשת: תקציב החיפוש מכריע יותר מהמנוע

OpenRouter פרסמה סוויטה חדשה של בנצ'מרקים שמדרגת כלי חיפוש על פני מודלים וקונפיגורציות שונות, כדי לעזור למפתחים להחליט איך לגרונד את האייג'נטים שלהם. הבדיקה הקיפה ארבעה בנצ'מרקים מגוונים, ארבעה מודלים, ארבעה עומקי חיפוש וארבעה מנועים, Exa, Parallel, Perplexity והמנוע הנייטיבי של כל מודל. כל הקומבינציות דורגו לפי איכות, עלות ומהירות.
תקציב החיפוש הוא הגורם הדומיננטי
הממצא הבולט ביותר: הגדלת תקציב החיפוש (search budget) השפיעה על התוצאות יותר מכל פרמטר אחר. במעבר מתקציב של טרן אחד ל-25 טרנים, הציונים על בנצ'מרק BrowseComp הכפילו את עצמם בקירוב. המשמעות בפרודקשן פשוטה, אם אתם מוכנים לשלם על יותר סבבי חיפוש, האייג'נט מחזיר תשובות מדויקות משמעותית.
בחירת מודל חשובה מבחירת מנוע
החלפת מודל הניבה פער ממוצע של כ-15 נקודות בין מודלי פרונטיר למודלים חסכוניים בעלות. לעומת זאת, החלפת מנוע חיפוש תוך שמירה על אותו מודל הזיזה את הציונים בכ-10 נקודות בלבד. במילים אחרות: השקעה במודל חזק יותר מחזירה תמורה גדולה יותר מהחלפת ספק החיפוש.
חיפושים כושלים מייקרים את הריצה
בנצ'מרק BrowseComp עם תקציב 25 טרנים חשף פער עלות חד: כשהמודל הצליח, הוא ביצע בממוצע 10.3 חיפושים. כשנכשל, 19.7 חיפושים. אם אתם יודעים מראש ששיעור הכישלון יהיה גבוה, קיצוץ במספר הטרנים יחסוך כסף בלי לפגוע מהותית בתוצאות המוצלחות.
מנוע נייטיבי לא תמיד מנצח
הבדיקה הפריכה את ההנחה שהמנוע הנייטיבי של מעבדת המודל הוא ברירת המחדל הטובה ביותר. לדוגמה, החיפוש הנייטיבי של GPT 5.6 Sol ניצח צד שלישי רק ב-50% מהבנצ'מרקים. הבחירה האופטימלית תלויה בעומס העבודה הספציפי, אין פתרון אחד שמתאים לכל תרחיש.