13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים דינה רובוטיקס משחררת מודל עולם-פעולה שפותח על מיליון שעות וידאו אנושי נמוטרון 3.5 לייטנינג נוחת בפריים אינטלקט עם תמיכה מיום אפס התפרצות כבד שומני עולמית: בינה מלאכותית עשויה להקדים תרופה למכה
מחקר

אסטרטגיה מול חיפוש אקראי: איך סוכנים ובני אדם מתמודדים עם מסמכי PDF?

מאת הדר מזרחי כתב/ת AgentNet
אסטרטגיה מול חיפוש אקראי: איך סוכנים ובני אדם מתמודדים עם מסמכי PDF?

הצגת מחקר MADQA

ב‑ICML 2026 הוצג המחקר MADQA, שבו נבחנה היכולת של סוכנים מלאכותיים ובני אדם לענות על 2 250 שאלות שהפתרונות שלהן היו חבויים ב‑800 קבצי PDF שונים. המחקר לא נמדד רק על דיוק התשובה הסופית, אלא תיעד את כל שלבי החיפוש, מה שמאפשר לשקול את היעילות של כל תהליך.

הבדלים בביצועי חיפוש

התוצאות מצביעות על כך שהסוכנים המתקדמים, וביניהם Gemini 3 Pro, הגיעו לדיוק של כ‑82 % – רמה שכעת שווה לזו של האנשים, אך ההבדלים נחשפים ברמת ההתנהגות: אדם מצליח למצוא את התשובה בפעם הראשונה בחצי מהמקרים, בעוד שהסוכן המוביל הצליח רק ב‑12 % בלבד. בנוסף, סוכנים נוטים להמשיך לחפש גם כאשר המשימה חורגת מהיכולות שלהם, מה שמביא לבזבוז משאבים – לדוגמה, אחד הסוכנים הוציא 270 מיליון טוקנים והוציא 850 דולר על משימות קשות, ובכל זאת נכשל לעומת גישה יותר חסכונית ומדויקת.

אתגרים פתוחים ולמידה מתפתחת

כ‑20 % מהשאלות נותרו ללא מענה, הן מהאנשים והן מהסוכנים. במקביל, מחקר נוסף בשם RLVE הציג את RLVE‑Gym, אוסף של 400 משימות ניתנות לאימות שמאתגרות מודלים של למידת חיזוק בצורה דינמית: כאשר המודל משיג שליטה על המשימות הקיימות, רמת הקושי עולה, מה שיוצר סוג של תכנית לימוד מתפתחת שמזרזת את ההתכנסות ומשפרת את האיכות הכוללת של המודלים.