ארטיפישיאל אנליסיס משיקה מדד אחיד להשוואת ספקי חיפוש בסביבה סנית

החברה שמאחורי לוחות ההשוואה הפופולריים למודלי שפה משיקה כעת את **Artificial Analysis Search Index**, מדד משוקלל שמדרג ספקי Search API לפי איכות התשובה שהם מאפשרים לסוכן לייצר, ולא לפי מהירות או כיסוי אינדקס בלבד. הרעיון פשוט: אותו מודל תשובה, אותה משימה, אותו תקציב תורות, רק מנוע החיפוש מתחלף. כך מבודדים את תרומת הספק בלי רעש של פרומפטינג שונה או מודל שונה.
שלושה בנצ'מרקים, מודל שיפוט אחד
המדד מורכב מממוצע שווה משקל של שלושה מבחנים נפרדים. **DeepSearchQA** מכיל 900 שאלות מחקר רחבות שתשובתן היא רשימת פריטים, והציון הוא F1 מול רשימת הייחוס; דוגמה מייצגת מבקשת למנות את כל הלחשים שמאפשרים טלפורטציה ל-Wilderness ב-Old School RuneScape ודורשים יותר מארבע רונות. **AA-Omniscience** מוסיף 600 דגימות פרטיות, מאוזנות 100 לכל תחום בשישה תחומים, ותרומתו למדד היא דיוק בלבד, לא האינדקס המלא שלו. **BrowseComp** תורם תת-קבוצה קשה של 200 דגימות מתוך 1,266. שלושתם נשפטים על ידי **GPT-5.6 Luna (medium)** עם רוברייקות ייעודיות.
סביבת הרצה קבועה לחלוטין
כדי שההשוואה תהיה הוגנת, כל הפרמטרים נעולים: מודל התשובה הוא GPT-5.6 Luna (medium) במאמץ חשיבה בינוני, טמפרטורה 0.6, תקרת פלט של 127 999 טוקנים, תקציב של 25 תורות סוכן עם קריאות כלי בלתי מוגבלות, עד 10 תוצאות חיפוש לשאילתה, ושני כלי עבודה, **web_search** ששולח את השאילתה ל-API של הספק הנבדק ומחזיר את התגובה הגולמית שלו, ו-**web_fetch** שמוריד תוכן טקסטואלי מכתובת שנמצאה. שכבת החילוץ היא טקסט בלבד עם טיימאאוט של 15 שניות לעמוד, והפורמט נשאר נאיבי לספק, המודל רואה את ה-JSON המקורי. סינון זיהום מופעל כברירת מחדל.
Stirrup, ההרתמה שמריצה את הלולאה
את לולאת הסוכן הקבועה מנהל **Stirrup**, הרתמה פתוחה של ארטיפישיאל אנליסיס. היא מספקת למודל את שני הכלים הנ"ל, מאפשרת לו לקרוא ל-finish כשהוא סבור שאסף מספיק חומר, ומחזירה שגיאות שחזור (timeouts, HTTP errors, כתובת שלא הגיעה מהחיפוש) כקריאת כלי כושלת שנשארת בתוצאות המפורסמות. שגיאות קטלניות של ספק החיפוש (429, 5xx, טיימאאוטים) מנוסות עד הצלחה ולא מתפרסמות. קו בסיס **model_only**, קריאה חד-פעמית למודל בלי כלי חיפוש, משמש לאומדן הידע הפנימי של המודל ומאפשר לחשב את ה-uplift האמיתי של החיפוש.
עלויות ופתיחות לספקים חדשים
הדוח מפצל את העלות הכוללת לשניים: עלות מודל התשובה (כל הטוקנים, קלט, מטמון, חשיבה, פלט) ועלות ספק החיפוש עצמו. ארטיפישיאל אנליסיס מזמינה ספקי Search API נוספים לפנות אליהם כדי להיכנס ללוח התוצאות; המנגנון בנוי כך שכל ספק חדש נכנס לאותה צנרת בדיוק, בלי צורך בהתאמת פרומפטים או פרמטרים מצד הבוחנים.
מה זה משנה בפועל
עד היום השוואת ספקי חיפוש נעשתה בעיקר על latency, כיסוי ומחיר לקריאה. המדד החדש מכריח את השוק למדוד **איכות תשובה סופית** בתרחיש ריאליסטי של סוכן שמחפש, קורא, מחפש שוב ומסכם, בדיוק הזרימה שמוצרי RAG ואוטומציה מריצים בפרודקשן. כשהמודל וההליך קבועים, ההבדל בין ספק שמחזיר 10 תוצאות רלוונטיות לבין ספק שמחזיר 10 תוצאות רעשניות מתורגם ישירות לפער בנקודות אחוז של ציון F1 או דיוק, וזה מספר שאפשר לשים עליו כסף.