21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

אנתרופיק חותכת שליש מהעלות ודוחפת את Fable 5.1 ל־90% ב־ARC-AGI-2

אנתרופיק חותכת שליש מהעלות ודוחפת את Fable 5.1 ל־90% ב־ARC-AGI-2

התוצאה שמדברת בעד עצמה

מודל Fable 5.1 של Anthropic השיג 90.0% בבחינת ARC-AGI-2 ו־97.5% ב־ARC-AGI-1, לפי פרסום רשמי של ARC Prize ב־X. בשני המבחנים יחד העלות הממוצעת למשימה ירדה בכ־32% לעומת Fable 5, והגיעה ל־3.12 דולר (כ־11.5 שקל) למשימה ב־ARC-AGI-2 ול־1.40 דולר (כ־5.1 שקל) ב־ARC-AGI-1. השיפור מיוחס ליעילות טוקנים טובה יותר, לא להגדלת המודל.

מה בודקים הבנצ'מרקים האלה

ARC-AGI (Abstraction and Reasoning Corpus) נבנה כדי למדוד יכולת הכללה והסקה חזותית בלי אימון מוקדם על המשימות הספציפיות. הגרסה הראשונה שוחררה ב־2019, השנייה ב־2024 עם משימות קשות יותר, והשלישית נמצאת בפיתוח. ציון של 90% ב־ARC-AGI-2 מציב את Fable 5.1 קרוב לרף שהגדירו מארגני התחרות כ"ביצוע אנושי ממוצע", שעומד על כ־92% לפי הנתונים שפורסמו עד כה.

איפה הכסף הולך

הפער בעלות בין שני הבנצ'מרקים משקף את מורכבות המשימות: ARC-AGI-2 דורש יותר צעדי הסקה וכמות טוקנים גדולה משמעותית לכל פתרון. הירידה של 32% בעלות הממוצעת נובעת כולה מצמצום מספר הטוקנים שהמודל מייצר עד לתשובה סופית, לא משינוי בתמחור ה־API של אנתרופיק. במילים אחרות, המודל "חושב" קצר יותר בלי לאבד דיוק.

המכשול בבדיקת ARC-AGI-3

לפי ARC Prize, בקשות ה־API ל־ARC-AGI-3 סווגו שוב ושוב על ידי מערכות אנתרופיק כניסיונות הנדסה הפוכה (reverse engineering), מה שמנע השלמת הבדיקה לפני הפרסום. הציונים לגרסה השלישית יפורסמו כשהבדיקה תושלם. מדובר במגבלה תפעולית של סינון אבטחה, לא בכשל של המודל עצמו, אבל היא משאירה פער בנתונים כרגע.

מה זה אומר הלאה

השילוב של דיוק גבוה עם עלות יורדת מצביע על כיוון שבו מודלי הסקה (reasoning models) הופכים לכלכליים יותר לפריסה ביישומים שדורשים פתרון בעיות חדשות בזמן אמת. עדיין חסרים מדדי ביצועים על ARC-AGI-3, ואין נתונים על זמני תגובה (latency) או על התנהגות בקצה התחתון של התפלגות המשימות. כשהבדיקה תושלם, יהיה אפשר להעריך אם מגמת היעילות נמשכת גם בקפיצת המדרגה הבאה של הבנצ'מרק.