13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
נווידיה משקיעה 500 מיליארד דולר: הבטוחה של מרכזי הנתונים ל-AI ה-FT פרסם ב-13 באוגוסט 2026 מאמר על האפשרות של EY להיות המפקחת של Anthropic מודל 2-ביט של NVIDIA Nemotron 3.5 Lightning מריץ קריאות כלי במשך 10 דקות עם 22 GB VRAM אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים
מחקר

אנדריי קרפאתי מציע להחליף את מבחני ה-SVG בבניית עולמות שלמים בקוד

מאת הדר מזרחי כתב/ת AgentNet
אנדריי קרפאתי מציע להחליף את מבחני ה-SVG בבניית עולמות שלמים בקוד

הניסוי: 5,500 שורות Three.js מפסקה אחת

אנדריי קרפאתי (Andrej Karpathy) פרסם הצעה לבנצ'מארק חדש להערכת מודלי AI: במקום לצייר פליקן על אופניים ב-SVG, משימה שהפכה טריוויאלית למודלים מולטימודליים נוכחיים, הוא ביקש ממודל Opus 5 להפוך פסקה מ"שר הטבעות" לסצנה אינטראקטיבית מלאה בספריית Three.js. התוצאה: 5,500 שורות קוד שמריצות עולם גרפי בדפדפן, כולל תאורה, טקסטורות ואנימציה. הגנרציה ארכה כשעתיים, צרכה כמיליון טוקנים ועלתה כ-10 דולר (כ-37 שקל). את האודיו הנלווה סיפק מודל של ElevenLabs.

למה הבנצ'מארקים הישנים מתו

לדברי קרפאתי, מבחני חשיבה מרחבית מסורתיים, מהסוג שמבקש מהמודל “לצייר פליקן רוכב על אופניים ב-SVG”, מיצו את עצמם. מודלים מולטימודליים מודרניים פותרים אותם בלי למצמץ. הבעיה אינה ביכולת הציור אלא במה שהמשימות האלה בודקות: הן מודדות פלט סטטי, חד-פעמי, ולא את היכולת לבנות מערכת חיה שמגיבה לקלט, שומרת מצב ומתקנת את עצמה לאורך זמן.

הפרדיגמה החדשה: עולמות אינטראקטיביים כמדד

ההצעה של קרפאתי פשוטה: להעריך מודל לפי היכולת לייצר קוד שמריץ עולם שלם, פיזיקה, רינדור, לוגיקת משחק, ממשק משתמש, מתוך תיאור טבעי קצר. זה מבחן שמשלב הבנת שפה, תכנון ארכיטקטורה, כתיבת קוד נקי באקוסיסטם אמיתי (Three.js, WebGL) ויכולת איטרטיבית לתקן באגים תוך כדי ריצה. במילים אחרות: הנדסת תוכנה מלאה, לא רק השלמת קוד מקומית.

צוואר הבקבוק: אין ראייה עצמית בווידאו

המכשול העיקרי כרגע איכות הפלט: המודל לא מסוגל לנתח את הווידאו שהוא עצמו מייצר. הוא נאלץ להסתמך על צילומי מסך סטטיים כדי לזהות שגיאות רינדור, טקסטורות הפוכות, מיקומים שגויים, בעיות עומק, ולתקן אותן באיטרציות הבאות. בלי לולאת משוב ויזואלית רציפה, התיקון איטי, חלקי ומועד לטעויות מצטברות. כשמודלים יקבלו גישה ישירה לזרם הפריימים של עצמם, צפוי שיפור חד באיכות העולמות הנוצרים.

מה זה משנה בפועל

אם הבנצ'מארק הזה יאומץ, הוא ידחוף את התעשייה לכיוון מודלים שמבינים לא רק “איך נראה אובייקט” אלא “איך מתנהגת מערכת”. זה מעביר את הרף מיכולת גנרטיבית חד-כיוונית ליכולת הנדסית מערכתית, בדיוק סוג היכולת שנדרשת מסוכנים (agents) שאמורים לכתוב, להריץ ולתחזק קוד בסביבות ייצור אמיתיות. Opus 5 הראה שזה אפשרי עקרונית; השאלה היא כמה מהר יגיע הווידאו-סלף-אנליסיס שיהפוך את זה לאמין.