9 באוקטובר 2026 האקדמיה ארכיון
מבזקים
MIT Technology Review תארח שיחה עם הסטודנט שיצר תוכניות גנטיות לנגיפים בעזרת AI אופן-ראוטר חתכה את עלות סוכן המכירות שלה ב-96% והאיצה את מחזור העסקה בשליש קליפורניה מנסה לעצור קרבות רובוט נגד אדם בכלוב שלושה חוקרי בטיחות שפוטרו מ-OpenAI מכחישים את ההאשמות ומזהירים מאפקט מצנן ארנה, החברה שמאחורי לוח התוצאות הפופולרי LMArena
חברות

ארנה, החברה שמאחורי לוח התוצאות הפופולרי LMArena

ארנה, החברה שמאחורי לוח התוצאות הפופולרי LMArena

גייסה 200 מיליון דולר (כ-740 מיליון שקל) לפי שווי של 3.1 מיליארד דולר (כ-11.5 מיליארד שקל) הסבב, שהוכרז ביום חמישי, הובל על ידי לייטספיד ונצ'ר פרטנרס (Lightspeed Venture Partners) וקושלה ונצ'רס (Khosla Ventures), עם השתתפות של סיילספורס ונצ'רס (Salesforce Ventures), 01 אדוויזורס (01 Advisors), דל טכנולוג'יס קפיטל (Dell Technologies Capital), אנדאבור קטליסט (Endeavor Catalyst), a16z, פליסיס (Felicis) ואחרים. רק בינואר השנה הודיעה החברה על סבב A של 150 מיליון דולר לפי שווי של 1.7 מיליארד דולר אחרי הכסף, כלומר השווי כמעט הוכפל בתוך כעשרה חודשים. ביוני דיווחה ארנה על קצב הכנסות שנתי (ARR) של 100 מיליון דולר, לעומת 30 מיליון דולר בזמן הסבב הקודם.

מהמעבדה למוצר מסחרי

הפלטפורמה התחילה ב-2023 כפרויקט מחקר באוניברסיטת קליפורניה בברקלי (UC Berkeley), שדירג מודלים בשיטת קראודסורסינג (crowdsourcing), משתמשים מזינים הנחיות (prompts) או מבקשים פרויקטים של "וייב קודינג" (vibe coding) ומדרגים איזה מודל ביצע טוב יותר. לטענת החברה, האתר מושך עשרות מיליוני מבקרים בחודש ונשאר חינמי לצרכנים. בספטמבר אשתקד השיקה ארנה את המוצר המסחרי הראשון שלה, AI Evaluations, שמספק למעבדות מודלים ולארגונים אנליטיקות ביצועים מפורטות המבוססות על הפידבק הקהילתי.

למה המשקיעים נכנסו עכשיו

התזמון התברר כמדויק. השנה הבינו מעבדות AI שהמודלים שלהן "משחקים" (gaming) את מבחני הבנצ'מרק הסטטיים, מוצאים דרכים להשיג ציונים גבוהים בלי באמת להרוויח אותם. במקביל, ארגונים חיפשו עזרה בבחירת המודל המתאים לצרכים הפנימיים שלהם, במקום להסתמך רק על בנצ'מרקים סטנדרטיים. "AI מתקדם מהר יותר מיכולתנו להעריך אותו, ובנצ'מרקים סטטיים קורסים ברגע שמודלים מזהים שהם נבחנים," מסרה החברה בהודעת הגיוס. "העולם צריך צד שלישי נייטרלי שימדוד עד כמה AI בטוח ומיושר (aligned) כשהוא בידיים של אנשים אמיתיים. ארנה נכנסת לתפקיד הזה היום."

קטגוריית יישור חדשה

בהתאם, ארנה הוסיפה ללוח התוצאות קטגוריית "יישור" (alignment) ראשונית. הקטגוריה מדרגת מודלים לפי סוגיות כמו פעולה בלתי מורשית (unauthorized action), ביצוע פעולות שהמודל לא התבקש לבצע; ייחוס כוזב (false attribution), ייחוס הצהרות או עובדות למקור שגוי; ומה שהחברה מכנה "השלמה מטעה" (deceptive completion), שקר לגבי השלמת משימות שלא בוצעו בפועל. נכון לעכשיו, שורת מודלים של OpenAI מובילה את טבלת היישור המקדימה, כאשר קלאוד אופוס 5.5 (Claude Opus 5.5) וקלאוד פייבל (Claude Fable) של Anthropic ממוקמים במקומות השישי והתשיעי בהתאמה.