13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים דינה רובוטיקס משחררת מודל עולם-פעולה שפותח על מיליון שעות וידאו אנושי נמוטרון 3.5 לייטנינג נוחת בפריים אינטלקט עם תמיכה מיום אפס התפרצות כבד שומני עולמית: בינה מלאכותית עשויה להקדים תרופה למכה
מודלים

מודלים משחזרים תוכנות שלמות בלי לראות קוד מקור

מאת הדר מזרחי כתב/ת AgentNet
מודלים משחזרים תוכנות שלמות בלי לראות קוד מקור

METR ו-Epoch שחררו את MirrorCode, מדד שבודק עד כמה מערכות AI מסוגלות לממש מחדש תוכנות שלמות רק על בסיס גישה לשורת הפקודה (CLI), בלי גישה לקוד המקור ובלי גישה לאינטרנט. המשמעות היא שהמודל צריך להבין את התנהגות התוכנה דרך קלט-פלט בלבד ולבנות מאפס מבנה שלם שמשחזר את ההתנהגות הזו, במקום לתרגם קוד ישירות. המדד הוכרז לראשונה באפריל ועכשיו פורסם בגרסה מלאה עם מבחנים נוספים.

תוצאות עיקריות

מתוך 25 תוכנות יעד, 17 נפתרו לפחות פעם אחת לציון מלא, ו-ארבע נוספות הגיעו לציון מעל 99 נקודות אחוז. Claude Opus 4.7 ו-GPT-5.5 שניהם מימשו מחדש את gotree, כלי לניתוח וטיפול בעצים פילוגנטיים שמכיל 16 אלף שורות קוד, במספר שפות תכנות שונות, בעלות של 100 עד 400 דולר לריצה (בערך 370 עד 1,480 שקל). Opus 4.7 גם מימש מחדש את pkl, שפת תצורה תכנותית של Apple עם 61 אלף שורות קוד. המחיר הזול ביותר שדווח הוא 251 דולר (כ-930 שקל) ל-Opus 4.7, על משימה שעל פי הערכת METR ו-Epoch הייתה לוקחת לאדם בין שבועיים ל-17 שבועות.

איפה זה עדיין נכשל

שמונה מתוך 25 תוכנות מעולם לא נפתרו לציון מלא, ו-ארבע מעולם לא עברו את סף 99 נקודות אחוז. התוכנה שהכי קשה למודלים הייתה ruff, linter ו-formatter ל-Python. מלבד זאת, המודלים התקשו במיוחד עם giac_subset, ספריית מתמטיקה, ו-mailauth, ספריית אימות דואר אלקטרוני. כלומר, מדובר בכלים שדורשים הבנה עמוקה של חוקים תחבירתיים וסמנטיים מורכבים, לא רק היגיון לוגי כללי.

מגמה לאורך זמן

המחברים מציינים שמודלים מובילים מלפני שנתיים היו מקבלים בערך 30 נקודות אחוז במדד, והוגבלו לתוכנות פשוטות יותר כמו כלי לוח שנה. הקפיצה מ-30 נקודות אחוז למימוש מלא של 17 מתוך 25 תוכנות, כולל אחת עם 61 אלף שורות קוד, מצביעה על שיפור חד ביכולת לעבוד על משימות תכנות ארוכות טווח. גרסת השחרור כוללת scaffold ו-22 מתוך 25 תוכנות היעד, בסך הכל 132 מופעי משימות בשש שפות. שלוש תוכנות יעד לא נכללו בשחרור הציבורי.

למה זה משנה

הזווית שהמחברים מדגישים אינה רק שמודלים השתפרו בכתיבת קוד, אלא שהם מסוגלים להתמצא בסביבה זרה וללמוד ממנה דרך גישה מוגבלת. במקרה הזה, הסביבה היא תוכנה לא מוכרת, והמודל מצליח לבנות מאפס שכפול פונקציונלי רק דרך קלט ופלט. הם מציינים שזה רומז על יכולת עתידית של סוכני AI להפיק ידע מהעולם ולהמיר אותו ליכולות פנימיות משלהם, כלומר לבנות בעצמם גרסאות מקבילות של טכנולוגיות שהם נחשפים אליהן דרך גישה חיצונית בלבד. זו טענה רחבה, והמדד עצמו לא מוכיח אותה, אבל הוא כן מראה שהיכולת המעשית קיימת במקרה הפרטי של שכפול תוכנה.