2 באוקטובר 2026 האקדמיה ארכיון
מבזקים
פגיעות באפליקציית ChatGPT למק אפשרה השתלטות על צ'אטים ודפדפן קראסו מחזירה את סדרת השיחות לסן פרנסיסקו עם פאנל על בחירת מודל אופוס 5 סוגר 100% במבחני חשבונאות, בני אדם נעצרים על 37% Artificial Analysis משיק מדד מאוחד לסוכני קוד: שלושה בנצ'מרקים, ציון אחד סרוויס נאו מציגה פייפליין אוטומטי לייצור דאטה אימון לאג'נטים ארגוניים
מודלים

אופוס 5 סוגר 100% במבחני חשבונאות, בני אדם נעצרים על 37%

אופוס 5 סוגר 100% במבחני חשבונאות, בני אדם נעצרים על 37%

מודל קלאוד אופוס 5 השיג ציון מושלם של 20 מתוך 20 במבחן משימות חשבונאות מוגדרות היטב, והשלים כל משימה בדקות ספורות. קבוצת ההשוואה, 12 רואי חשבון מורשים (CPAs), הניבה טווח ציונים שנע בין 0% לכ-90%, עם ממוצע אנושי של 37% בלבד. לפני כשנתיים, בגרסת GPT-4o של אמצע 2024, אותן משימות הניבו תוצאות קרובות לאפס.

הקפיצה התרחשה בתוך 18 חודשים

לפי הדוח שפורסם בבלוג של Mercor, לפני שנה וחצי המודלים המובילים עדיין פיגרו משמעותית אחרי רואי חשבון אנושיים. המעבר מציון קרוב לאפס ל-100% התרחש בטווח זמן קצר במיוחד, והמודל עקף את הממוצע האנושי כבר במהלך 2025. החוקרים מציינים במפורש: "במשימות חשבונאות באורך בינוני ומוגדרות היטב, מודלי חזית מהירים ומדויקים יותר מרואי חשבון זוטרים, אפילו הטוב שבהם במחקר שלנו."

מתודולוגיה ומגבלות

המבחן התמקד במשימות מבוססות-כללים (rule-based) באורך בינוני, סוג העבודה שמאפיין חלק ניכר מהשגרה של חשבונאות זוטרה. המדגם האנושי קטן (12 נבדקים), והמשימות נבחרו להיות מוגדרות היטב, מה שמקל על מודלים שפה גדולים. החוקרים לא פרסמו מדדי ביצועים על משימות פתוחות, ארוכות או כאלה הדורשות שיקול דעת מקצועי רחב יותר.

המשמעות: עבודה מבוססת-כללים הופכת לפרומפט

הטענה המרכזית שעולה מהנתונים פשוטה: במקצועות שבהם העבודה מוגדרת על ידי כללים ברורים, בני אדם הפכו לאפשרות האיטית, היקרה והמועדת לטעויות. אופוס 5 סיים כל משימה בדקות; הנבדקים האנושיים נזקקו לזמן ארוך משמעותית והפגינו שונות גדולה בדיוק. הממצא אינו מוכיח החלפה מלאה של המקצוע, אך הוא מסמן גבול ברור: החלק האלגוריתמי של העבודה כבר לא דורש מפעיל אנושי.