22 בספטמבר 2026 האקדמיה ארכיון
מבזקים
שיאומי מדווחת על קיצור מחזור מו״פ מחודש ליומיים באמצעות מודל MiMo-V2.6-Pro GPT-6 אוטומט 20.8% מפרויקטי עבודה מרחוק, אבל זה עדיין קרוב לרצפה מרכזי נתונים בפנסילבניה: התנגדות תושבים עוצרת השקעות עתק שיאומי משיקה שלושה מודלים חדשים: דגל 1T פרמטרים וגרסה מואצת פי 10 OpenRouter משיק Batch API עם הנחה של 50% על רוב המודלים
מודלים

GPT-6 אוטומט 20.8% מפרויקטי עבודה מרחוק, אבל זה עדיין קרוב לרצפה

GPT-6 אוטומט 20.8% מפרויקטי עבודה מרחוק, אבל זה עדיין קרוב לרצפה

קפיצה מ-2.5% ל-20.8% באוטומציה של פרויקטים אמיתיים נשמעת מרשימה, אבל מדד ה-Remote Labor Index החדש מראה שהמודלים המתקדמים עדיין נכשלים ברוב המוחלט של המשימות הכלכליות.

מה מודד המדד

ה-RLI שפותח על ידי חוקרים בראשות מנטאס מאזייקה (Mantas Mazeika) מורכב מפרויקטים אמיתיים שנלקחו מכלכלת העבודה מרחוק, פיתוח משחקים, עיצוב מוצר, אדריכלות, ניתוח נתונים ואנימציית וידאו. כל פרויקט תומחר ותוזמן על ידי אנשי מקצוע שביצעו אותו בפועל; סך הכל מעל 6,000 שעות עבודה בשווי של יותר מ-140 אלף דולר (כ-518 אלף שקל). עלויות בודדות מגיעות למעל 10,000 דולר (כ-37 אלף שקל) וזמני ביצוע של יותר מ-100 שעות.

תוצאות: התקדמות מדידה, ביצועים נמוכים

לפי הדוח, אוקטובר שעבר עמד שיעור האוטומציה על 2.5% בלבד. הגרסה החדשה של GPT-6 Astra מזנקת ל-20.8%, אלא שגם הנתון הזה מציב את המודלים "קרוב לרצפה", רובם המוחלט של הפרויקטים לא הושלמו ברמה שהייתה מתקבלת כעבודה מוזמנת. החוקרים מדגישים שהשיפור יציב ומדיד, מה שנותן בסיס משותף למעקב אחרי המסלול של אוטומציית AI.

מתודולוגיה ומגבלות

המדד בוחן ביצועי סוכנים (agents) מקצה לקצה, לא רק ידע או חשיבה בבנצ'מרקים אקדמיים. הפרויקטים נבחרו אקראית ומייצגים טווח קושי רחב. המאמר פורסם כפרה-פרינט ב-arXiv (2510.26787) ועדיין לא עבר שיפוט עמיתים; המספרים משקפים את הגרסה הנוכחית של המסגרת הנבדקת.

מה זה אומר בפועל

הפער בין רוויה בבנצ'מרקים מחקריים לכישלון במשימות כלכליות אמיתיות נשאר גדול. ה-RLI נותן כלי מדידה קרקעי יותר, לא הבטחות של יצרניות, אלא פרויקטים ששולמו עליהם כסף אמיתי. בינתיים, המסלול מצביע על שיפור הדרגתי, לא על פריצת דרך שמשנה את שוק העבודה מחר.