28 בספטמבר 2026 האקדמיה ארכיון
מבזקים
מודל שמחליט, לא משוחח סוכני בינה מלאכותית עלולים להצית בריחת פיקדונות, מזהיר הכלכלן הראשי של אפולו דאריו אמודאי ייפגש הערב עם טראמפ בבית הלבן סוכני OpenAI הריצו 16 אלף בקשות לאתר האו"ם בניסיון לעקוף מגבלות גישה סין התקינה יותר רובוטים תעשייתיים ב-2025 משאר העולם יחד
מחקר

אסטרטגיה מול חיפוש אקראי: איך סוכנים ובני אדם מתמודדים עם מסמכי PDF?

אסטרטגיה מול חיפוש אקראי: איך סוכנים ובני אדם מתמודדים עם מסמכי PDF?

הצגת מחקר MADQA

ב‑ICML 2026 הוצג המחקר MADQA, שבו נבחנה היכולת של סוכנים מלאכותיים ובני אדם לענות על 2 250 שאלות שהפתרונות שלהן היו חבויים ב‑800 קבצי PDF שונים. המחקר לא נמדד רק על דיוק התשובה הסופית, אלא תיעד את כל שלבי החיפוש, מה שמאפשר לשקול את היעילות של כל תהליך.

הבדלים בביצועי חיפוש

התוצאות מצביעות על כך שהסוכנים המתקדמים, וביניהם Gemini 3 Pro, הגיעו לדיוק של כ‑82 % – רמה שכעת שווה לזו של האנשים, אך ההבדלים נחשפים ברמת ההתנהגות: אדם מצליח למצוא את התשובה בפעם הראשונה בחצי מהמקרים, בעוד שהסוכן המוביל הצליח רק ב‑12 % בלבד. בנוסף, סוכנים נוטים להמשיך לחפש גם כאשר המשימה חורגת מהיכולות שלהם, מה שמביא לבזבוז משאבים – לדוגמה, אחד הסוכנים הוציא 270 מיליון טוקנים והוציא 850 דולר על משימות קשות, ובכל זאת נכשל לעומת גישה יותר חסכונית ומדויקת.

אתגרים פתוחים ולמידה מתפתחת

כ‑20 % מהשאלות נותרו ללא מענה, הן מהאנשים והן מהסוכנים. במקביל, מחקר נוסף בשם RLVE הציג את RLVE‑Gym, אוסף של 400 משימות ניתנות לאימות שמאתגרות מודלים של למידת חיזוק בצורה דינמית: כאשר המודל משיג שליטה על המשימות הקיימות, רמת הקושי עולה, מה שיוצר סוג של תכנית לימוד מתפתחת שמזרזת את ההתכנסות ומשפרת את האיכות הכוללת של המודלים.