29 בספטמבר 2026 האקדמיה ארכיון
מבזקים
JupyterLite WebMCP מכניס סוכן למחברת חיה ומאפשר לו לערוך תאים, להריץ קוד ולסקור שינויים בזמן אמת פאראדיי: סוכן שמנווט סריקות תלת-ממד בדפדפן בלי להוציא את המידע החוצה אנתרופיק מובילה את AA Benchmark עם שלושת המקומות הראשונים, כולל מודל ביניים Fireworks משיקה את FireRouter עם Opus, ניתוב חכם שחוסך 57% בעלויות קידוד NVIDIA משיקה פלטפורמת בטיחות לסוכני AI עם אכיפה ברמת החומרה
מחקר

אנתרופיק מובילה את AA Benchmark עם שלושת המקומות הראשונים, כולל מודל ביניים

אנתרופיק מובילה את AA Benchmark עם שלושת המקומות הראשונים, כולל מודל ביניים

הדיווחים מהרשת מצביעים על כך ש־Anthropic תופסת כרגע את שלושת המקומות הראשונים ב-AA Benchmark, כשאפילו המודל הבינוני שלה, לא הדגל, מצליח להתברג לצמרת. הפרטים מגיעים מסדרת פוסטים של המשתמש Chubby ב-X, שחוזר על הטענה שלוש פעמים ברצף; אין עדיין פרסום רשמי של תוצאות מלאות, מתודולוגיה או גרסאות מדויקות של המודלים שנבדקו.

מה זה AA Benchmark ולמה זה משנה

AA Benchmark הוא מבחן השוואתי שבודק יכולות חשיבה, קידוד ומעקב הוראות במודלי שפה גדולים (LLM). העובדה שמודל ביניים, להבדיל מגרסת הדגל היקרה, מגיע למקום גבוה מרמזת על יעילות אימון וארכיטקטורה שמנצלות טוב יותר את משאבי החישוב (compute). מצד שני, בלי שקיפות של סט הנתונים, פרומפטים ומדדי שונות, קשה להעריך אם ההובלה יציבה או תלויה בהתאמה ספציפית למבחן.

יום המפתחים של OpenAI ברקע

מחר צפוי להתקיים DevDay של OpenAI, אירוע שנתי שבו החברה נוהגת לחשוף יכולות חדשות, מודלים או כלי מפתחים. הפוסט ממסגר את האירוע כרגע הכרעה: אם OpenAI תציג מודל שעוקף את ההובלה הנוכחית, האירוע ייחשב הצלחה; אם לא, הכנס עלול להיראות בצל של אנתרופיק. ההשוואה שמציע הכותב, "כמו כל המשחקים שממהרים לצאת לפני GTA 6", מתארת תחושה של תעשייה שמחכה למהלך הגדול הבא.

יתרון חישובי ותחזית לשנה הקרובה

לדברי הכותב, ל-OpenAI יתרון משאבי חישוב משמעותי, והוא צופה שהיא "תעקוף את אנתרופיק השנה". במקביל הוא מעריך שללא המעורבות של אילון מאסק (Elon Musk), קרי xAI ומודל Grok, אנתרופיק לא תצליח לסגור את הפער בחומרה. זו הערכה ספקולטיבית שמבוססת על הנחות לגבי תקציבי אימון וגישה לשבבים, לא על נתונים פומביים.

מה חסר בתמונה

אין במקור ציונים מספריים, גודל מדגם, או אישור מצד שלישי. לא פורסמו מדדי ביצועים נפרדים למשימות קידוד, חשיבה מתמטית או ריבוי שפות. עד שיתפרסמו תוצאות מלאות ובדיקות עצמאיות, ההובלה ב-AA Benchmark נשארת אינדיקציה מעניינת, לא הוכחה לעליונות כללית.