אקסה משיקה את Agent Ultra: מצב מאמץ מרבי למחקר ממצה דרך API

מה שמאחורי ההשקה
אקסה (Exa) שחררה היום את Agent Ultra, רמת המאמץ הגבוהה ביותר של ה-Agent API שלה, שמיועדת למשימות מחקר שצריכות לרוץ עד מיצוי: בניית רשימות גדולות, העשרת ישויות, ושאלות שדורשות אלפי מקורות. לפי החברה, Ultra מנצח את Opus 5.5, GPT-6 Astra ואת Perplexity Agent, כל אחד בהגדרת המאמץ המקסימלית שלו, על ארבעה בנצ'מרקים של מחקר. המוד זמין מיידית דרך ה-API בפרמטר `effort: "ultra"`, אבל אינו משקולות פתוחות ואי אפשר להריץ אותו עצמאית.
איך זה עובד בפועל
המערכת מפצלת משימה לתת-משימות ומשגרת תת-סוכנים (subagents) שחוקרים כמה תחומים במקביל. היא מנתבת מודלי חזית לשלבים שצריכים אותם, ומודלים מהירים יותר למקומות שבהם הם מספיקים. ריצות Ultra טיפוסיות מסתיימות תוך כחצי שעה; משימות קשות במיוחד יכולות לקחת עד שלוש שעות. התמחור במודל חיוב לפי שימוש, עם תקרה של 20 דולר (כ-74 שקל) לריצה ברירת מחדל, ריצות שמסתיימות מוקדם יותר עולות פחות.
המספרים שהחברה מציגה
בבנצ'מרק WANDR של Perplexity, 500 משימות איסוף רחבות ועמוקות, Ultra מוביל ב-12.6% על Opus 5.5 בעלות של חצי לריצה; הפער המוחלט עומד על 9.1 נקודות. ב-DeepSearchQA של גוגל דיפמיינד (900 פרומפטים רב-שלביים) היתרון 4.7% על Perplexity בעלות נמוכה ב-46% מ-GPT-6 Astra. ב-WideSearch, שבוחן איסוף רחב, הפער 5.2% על Perplexity בעלות הנמוכה ביותר מבין הארבעה. ב-Company Find-All מדווחת אקסה על יתרון של 1,579% על Opus 5.5 בעלות הנמוכה ביותר לכל ישות שנמצאה. כל הנתונים מגיעים מפוסט ההשקה של אקסה; המתחרים רצו בהגדרת מאמץ מרבית; התוצאות טרם שוחזרו עצמאית.
מתודולוגיה וסייגים
ב-WANDR השתמשה אקסה במנגנון ההערכה הפתוח של Perplexity, החליפה את כלי התוכן באקסה, שינתה את לוגיקת התעבורה, והפעילה את gpt-6-luna כשופט. היכן שלמתחרה הייתה תוצאה מפורסמת על אותו רתמה, אקסה דיווחה אותה; היכן שלא, הריצה בעצמה. ב-DeepSearchQA ו-WANDR נבדקו עד 200 משימות לכל מערכת, וב-WideSearch ו-Company Find-All עד 100. מספר המשימות שדורגו בפועל משתנה בין ספקים. כלומר, המספרים הם דיווח יצרן, לא שכפול בלתי תלוי.
למי זה מיועד ואיך משתמשים
אקסה מכוונת לשלוש קבוצות: ספקי מודלים שבונים דאטה אימון (למשל כל מאמר וריפו שמממשים טכניקה מסוימת, עם אימות קריטריונים כמו "משקולות שוחררו, לא רק API"); שירותים פיננסיים שעושים מפות שוק בדיקת נאותות, KYC על הגשות ורשומות משפט, וניטור אותות תיק; וצוותי Go-to-market שבונים רשימות חשבונות ומעשירים שדות שיפוט עם URL מצוטט. אפשר גם להרחיב רשימה קיימת, מעבירים את השורות שכבר יש, והן מוחרגות מהתוצאות החדשות.
API, שליטה ותאימות
הקריאה הסטנדרטית תומכת ב-outputSchema, input.data וסטרימינג. אפשר לקבוע תקרת עלות של 1 עד 100 דולר (כ-3.7 עד 370 שקל) ומשך ריצה של 300 עד 10,800 שניות. קריאת עצירה מסיימת מוקדם, שומרת תוצאות ומחייבת רק עד אותה נקודה. ברירת המחדל של ה-SDK מסיימת פולינג אחרי שעה, צריך להאריך טיימאאוט או לעבוד בסטרימינג. יש גם תאימות OpenAI: בנתיב `/responses` מגדירים `reasoning.effort: "ultra"` עם סטרימינג או מצב רקע. אפשר להתנסות ב-Exa API Playground.