27 בספטמבר 2026 האקדמיה ארכיון
מבזקים
סוכני OpenAI הריצו 16 אלף בקשות לאתר האו"ם בניסיון לעקוף מגבלות גישה סין התקינה יותר רובוטים תעשייתיים ב-2025 משאר העולם יחד מאמר חדש מציע מפת דרכים לשיפור עצמי רקורסיבי של בינה מלאכותית מודל 340 מיליון פרמטרים רץ על GPU של טלפון, עם זהות מספרית למודל הייחוס גוגל בודקת רכישה ישירה מפליפקארט דרך ג'מיני ו-AI Mode בהודו
מחקר

שיפוט חד של מודלים לשירותי אינטרנט

שיפוט חד של מודלים לשירותי אינטרנט

הבנצ'מרק החדש, ClawBench, בוחן 153 משימה על 144 פלטפורמות מוכרות – החל מהזמנת מגורים ב‑Airbnb, דרך הזמנת אוכל ב‑UberEats, חיפוש והגשת מועמדות ב‑LinkedIn, השכרת רכב ב‑Sixt, קביעת תור ברפואה ב‑BetterHelp, יצירת מאגר קוד ב‑GitHub ועד כתיבת ביקורת ב‑Glassdoor. לכל משימה מצורפת הנחיה בטקסט חופשי, כתובת התחלה באינטרנט והבקשה הסופית שהשרת אמור לקבל, והמחקר כולל הרחבה ל‑Chrome שמפסיקה את הבקשה לפני שמגיעה לשרת כדי למנוע רכישות או שליחת טפסים אמיתיים.

בין המודלים שנבדקו, Claude Sonnet 4.6 הגיע לתוצאה הגבוהה ביותר – 33.3 % של משימות שהושלמו בהצלחה, ולאחריו GLM‑5 עם 24.2 % ו‑Gemini 3 Flash עם 19.0 %. המודלים האחרים סיימו בטווחים נמוכים יותר: GPT‑5.4 במרחק של 6.5 %, Gemini 3.1 Flash Lite ב‑3.3 % ו‑Kimi K2.5 ברק 0.7 %. הפער ב‑הישגים בולט מול בנצ'מרקים מסורתיים כגון OSWorld ו‑WebArena, שם המודלים משיגים 67‑75 % מכיוון שהסביבה נשלטת – אין קאפצ'ות, בנרים של קבצי cookie או תכנים דינמיים שמקשים על האינטראקציה.

הדפוסים שהופיעו ברמת ההצלחה מראים שמודלים מתמודדים טוב יותר עם משימות פיננסיות ואקדמיות, למשל רכישת ביטוח, רישום לקורס או שליחת פתרון ל‑LeetCode, שבהן הטפסים צפויים וסטנדרטיים. לעומת זאת, משימות שדורשות פיתוח או אינטראקציות חברתיות – כגון עבודה עם GitHub, Airtable או Confluence, או כתיבת ביקורות ב‑Glassdoor ו‑Tripadvisor – מציגות אתגר רב‑שלבי בו כל טעות קטנה מובילה לכשל כולל.