21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

סוכנים כותבים מחדש את הקוד של עצמם, וזה עובד

סוכנים כותבים מחדש את הקוד של עצמם, וזה עובד

השיפור העצמי הרקורסיבי לא מחכה לפריצת דרך תיאורטית, הוא כבר קורה בתשתית שמריצה את המודלים. פיליפ שמיד (Philipp Schmid) פרסם סקירה טכנית שמפרקת את המושג לצעדים קונקרטיים: סוכנים בודקים ריצות כושלות, עורכים את הכלים, היכולות וקוד הרתימה (harness) של עצמם, ומשמרים רק מה שהצליח. הנקודה הקריטית אינה היכולת לשנות קוד, אלא היכולת לשמור את השינוי הנכון.

הבעיה האמיתית: לשמור את מה שעובד

לדברי שמיד, "לשמור את מה שעובד" הוא החלק הקשה. בניסויי קריאת כלים (tool-call) עם לאמה 3.2, המודל סירב לבצע משימה בשלוש מתוך שלוש הרצות, 122 טוקנים של התנצלות בטקסט חופשי, שלא ניתנים לפירוס (unparseable). כשנכפה אילוץ דקדוק (grammar constraint) שמונע מהמודל לייצר סירוב בפרוזה, שלוש הקריאות יצאו תקינות. הלקח: הסוכן צריך ללמוד שסירוב מוביל לאילוץ דקדוק, לא למודל גדול יותר.

ממה מורכב הלולאה היום

התמונה שמצייר שמיד מורכבת משלושה רכיבים שכבר קיימים: מנגנון ביקורת שמנתח ריצות כושלות, עורך קוד שמסוגל לשנות את ההגדרות של הכלים עצמם, ופילטר שמחליט איזה שינוי נכנס לגרסה הבאה. אף אחד מהם לא דורש ארכיטקטורה חדשה, כולם רצים היום מעל מודלים פתוחים ותשתיות קוד פתוח. החידוש הוא בחיבור שלהם ללולאה סגורה שפועלת בלי אדם בלופ.

למה זה לא "סתם" אופטימיזציה של פרומפט

ההבדל מול הנדסת פרומפט קלאסית הוא במושא השינוי: כאן המודל לא רק מנסח מחדש הוראות, אלא משכתב את קוד הכלים (tools), את הגדרות היכולות (skills) ואת קוד הרתימה שמחבר ביניהם. כשהסוכן נתקל בכישלון חוזר, למשל פורמט תגובה שבור, הוא יכול להוסיף ולידציה, לשנות סכמה, או להחליף ספרייה, ואז להריץ שוב כדי לוודא שהתיקון עבר. זהו שינוי של סביבת הריצה, לא של הטקסט הנכנס.

מה חסר עדיין בדרך ללולאה אוטונומית מלאה

שמיד מציין במפורש שהמנגנון הנוכחי עדיין תלוי בהגדרת "מה עובד" על ידי בני אדם, פונקציית תגמול או מבחני קבלה שנכתבו מראש. הסוכן לא מגדיר לעצמו את המטרה, אלא רק מחפש נתיב שמקיים אותה. בנוסף, אין עדיין הדגמה של שרשרת שיפורים ארוכה בלי התערבות; רוב הדוגמאות הן תיקון בודד שסוגר כשל ספציפי. השלב הבא הוא להראות שהלולאה יכולה לצבור שיפורים לאורך עשרות איטרציות בלי להתדרדר.

המשמעות המעשית: כלי פיתוח שהופך לחלק מהמוצר

אם הלולאה הזו מתייצבת, היא משנה את תפקיד המהנדס: במקום לכתוב קוד רתימה ולתקן באגים של פורמט, המהנדס מגדיר את מדד ההצלחה והסוכן סוגר את הפער. זה לא החלפה של מפתחים, זה העברה של עבודת ה"אינסטלציה" למודל, בזמן שהאדם מתמקד בארכיטקטורה ובמדיניות. שמיד לא נותן תאריך יעד, אבל התשתית כבר כאן, והצעד הבא הוא רק עניין של אינטגרציה ובדיקות בקנה מידה.