21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מוצרים

קיינבל משיקה את NEEDLE: בנצ'מרק חיפוש חי שבונה את סט השאילתות מחדש בכל שעה

קיינבל משיקה את NEEDLE: בנצ'מרק חיפוש חי שבונה את סט השאילתות מחדש בכל שעה

הבעיה: בנצ'מרקים סטטיים הם מטרה נוחה

כשסוכן חיפוש מקבל גישה לכלי שליפה, מאגר תשובות פומבי הופך למפתח תשובות, המודל פשוט מוריד את התוויות באמצע ההערכה ומדלג על שליפת המידע. אותה בעיה צצה כשהידע כבר מקודד בזיכרון הפרמטרי של המודל: תשובה נכונה לא מוכיחה שהחיפוש עבד. הפתרון של קיינבל (Keenable) הוא NEEDLE, מסגרת הערכה פתוחה שמייצרת שאילתות טריות ממקורות ציבוריים במקום להקפיא סט קבוע.

איך NEEDLE עובד: חמש זירות, עדכון חי

השם הוא ראשי תיבות של News, Everyday, Expert, Deep-tail, Legal Evaluation. כל ורטיקל מדמה כוונת סוכן שונה: חדשות שואבות פריט עדכני מכ-124 פידי RSS ו-Google Trends ומתרגמות אותו לשאילתת מילות מפתח, מדי שעה. פיננסים שולפים עובדות רישום של Wikidata ו-GLEIF ונתוני 10-Q רבעוניים של SEC XBRL, מדי יום. סקולר (Scholar) הופך מאמר אחד לארבעה סגנונות שאילתה: כותרת מושפלת, פרט מטקסט מלא, רמז בשפה טבעית, ותיאור "על קצה הלשון", ממאגרי arXiv ו-Europe PMC. דיפ-טייל (Deep-tail) דוגם שאילתות נדירות מתיעודי סוכנים פומביים כמו DeepResearchGym, OpenResearcher ו-LRAT. משפטי שואב פסקי דין עדכניים של CourtListener מ-14 בתי משפט פדרליים וסעיפי eCFR.

שיטות ניקוד שונות לכל משימה

הניקוד מותאם לאופי המשימה. חדשות ודיפ-טייל, שאין להן תוצאה נכונה יחידה, נשפטות על ידי מודל שפה שמדרג כל תוצאה 0-4, והרתמה מדווחת nDCG@5 עם קנס על כתובות URL כפולות. פיננסים מדווחים answer-recall@5: האם העובדה הגיעה לסוכן בתוך חמשת הקטעים הראשונים. סקולר ומשפטי הן משימות known-item שנמדדות בהתאמת מזהה.

התקרה המעניינת: ultimate oracle

כל מנוע מקבל בדיוק את אותו טקסט שאילתה, קריאה אחת בכל פעם, כך שנקודות אחוז של השהיה ברי השוואה ואף מנוע לא מקבל עומס מקביל. השיפוט נעשה על הדירוג, הכותרות והקטעים של המנוע עצמו, דפים לעולם לא נמשכים, תוצאות לעולם לא מדורגות מחדש, ראיות נגזרות ל-2,000 תווים לכולם, והשופט לא רואה את שם המנוע. המספר המעניין יותר הוא תקרת ultimate: לכל שאילתה, NEEDLE מאגדת את התוצאות שהחזירו כל המנועים למנוע אורקל סינתטי, ממיינת את האיחוד לפי רלוונטיות, ויוצרת תקרה אמפירית שמבוססת על מה שכל השוק הצליח לשלוף יחד. הפער מול ultimate הוא חסם עליון על איכות חיפוש סוכני כפי שהיא היום. פער גדול אומר שתוצאות טובות יותר היו קיימות אבל אף מנוע לא הציף או דירג אותן היטב. ציון ultimate חלש אומר משהו אחר: אפילו אחרי איגוד כל הספקים, הבנצ'מרק מצא מעט ראיות חזקות, כלומר NEEDLE יודעת להבחין בין בעיית דירוג לבעיית שליפה שמשותפת לכל השוק.

איפה השוק עומד היום

המספרים שלפניכם הם ממוצעי שבעה ימים לחלון המסתיים ב-28 באוגוסט 2026. בפיננסים התמונה קרובה לפתורה: Exa ב-0.910, קיינבל 0.872, פרפלקסיטי (Perplexity) 0.871, גוגל 0.847, מול תקרת ultimate של 0.965. בסקולר הפיזור רחב: קיינבל 0.774 מול טבילי (Tavily) 0.310 מול תקרה של 0.869, כי שאילתות כותרת נענות ממטאדאטה ושאילתות גוף טקסט לא. דיפ-טייל, (הנתונים נקטעו במקור).

קוד פתוח, הרצה מקומית

NEEDLE משוחררת כרתמת הערכה (evaluation harness) ולא כמוצר. זו CLI של פייתון שמותקנת עם uv sync ומופעלת בשתי פקודות משנה לכל בנצ'מרק, generate ו-run. נדרש מפתח OpenRouter לשיפוט ומפתח API לכל מנוע שנבדק, והיא רצה על לפטופ או ב-CI. הקוד מאפשר לשחזר את כל זרמי השאילתות שנמצאים בשימוש בנוסף לשיפוטי איכות הדירוג.

מקור: marktechpost.com