21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מחקר

קלאוד אימן מודלים קטנים לתיקון כשלי יישור, בלי לפגוע ביכולות

קלאוד אימן מודלים קטנים לתיקון כשלי יישור, בלי לפגוע ביכולות

הניסוי: 48 שעות, GPU אחד, אפס התערבות אדם

צוות המחקר של Anthropic נתן לקלאוד 48 שעות ו-GPU בודד כדי לחקור, להציע שיטות, לאמן ולבחון מודלים קטנים על עשר קטגוריות של כשלי יישור, בהם הטעיה, חנפנות (sycophancy), פריצות הגנה (jailbreaks) והפרות פרטיות. קלאוד עבד בלולאה אוטונומית: חיפש ספרות, הציע מתודות ונתונים, אימן, בדק, וחוזר חלילה. סוכן ניטור חיצוני קרא כל הצעה לפני הרצה ואכף שני איסורים: אסור לפגוע ביכולות הכלליות של מודל התלמיד, ואסור לזקק את היישור של קלאוד עצמו ישירות לתוכו.

המדדים: סגירת פער הבטיחות בלי להקריב ביצועים

ההצלחה נמדדה ב"אחוז פער הבטיחות שנסגר", כמה השיטות קירבו את מודל התלמיד לציון תיאורטי מושלם, כפי שנשפט על פני שלושה עד חמישה בנצ'מרקים ציבוריים לכל קטגוריה (ביניהם ConfAIde, PrivaCI-Bench, PrivacyLens לפרטיות, ו-Petri לסימולציות יריב רב-תוריות). התוצאות: בכל עשר הקטגוריות קלאוד מצא תיקונים ששיפרו את הציונים בלי להוריד יכולות. השיטות הטובות ביותר עבדו גם על בנצ'מרקים שקלאוד לא ראה במהלך הלולאה, וגם על מודלים הגדולים פי 4.7 מאלה שעליהם כוונן.

ההשוואה: קלאוד ניצח 28 חוקרים אנושיים, אבל עם כוכבית

מול 28 חוקרי בטיחות אנושיים שקיבלו עד שמונה שעות להציע שיטות, קלאוד הוביל. בהטעיה, למשל, השיטה הטובה שלו השיגה 20% יותר מההצעה האנושית הטובה ביותר. ב-Anthropic מסייגים: החוקרים לא יכלו לחזור ולתקן (לעשות איטרציה), אז זו לא השוואה ישירה אלא ראיה לזרימת עבודה שבה קלאוד מזהה כיוונים מבטיחים ובני אדם ממקצעים אותם.

הצעד הבא: מודל חלש מיישר מודל חזק ממנו

השאלה המעניינת יותר היא האם מודל חלש יכול ליישר מודל חזק ממנו, תרחיש רלוונטי כשבינה מלאכותית מתחילה לבנות את עצמה. בניסוי המשך, קלאוד סונט 5 (חלש יותר מאופוס 4.8 במדד Epoch Capabilities Index) קיבל 60 שעות לתקן כשלי יישור בצ'קפוינט מוקדם של אופוס 4.8, שעוד לא עבר את רוב אימון היישור התעשייתי. קלאוד ניסה למעלה מ-50 פתרונות והגיע לציוני יישור כמעט זהים לאלה של אימון הייצור המלא.