21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
רגולציה

אופוס 4.6 של אנתרופיק מצפצף על מגבלות התוכן המיני

אופוס 4.6 של אנתרופיק מצפצף על מגבלות התוכן המיני

המודל החדש יחסית של אנתרופיק, Opus 4.6, מייצר תוכן מיני מפורש בלי שום התנגדות, בניגוד גמור לכללי השימוש האוניברסליים של החברה, שאוסרים במפורש על תיאור יחסי מין, פטישים או צ'אטים אירוטיים. בבדיקות של TechCrunch נענו 10 מתוך 10 בקשות ישירות לחומר מיני בלי שהופעל שום מנגנון חסימה. הבעיה לא ייחודית לגרסה הזו: גם Opus 3 ו-Haiku 4.5 פגיעים לשיטת פריצה (jailbreak) חדשה שמאלצת אותם להפיק אותו סוג תוכן, בעוד הגרסאות החדשות יותר, Opus 4.7 ועד Opus 5 הנוכחי, עמידות בפניה.

השיטה: מניפולציה רב-שלבית על עקביות מגדרית

חוקר עצמאי מבריטניה, שביקש להישאר אנונימי, חשף בפני TechCrunch טכניקה רב-שלבית שמתחילה במשחק תפקידים תמים ומסלימה בהדרגה. המנגנון מאתגר את המודל לשמור על עקביות בין דמויות גבריות ונשיות; כשהמודל נהיה זהיר יותר כלפי הדמות הנשית, התוקף "מדליק" אותו, גורם לו לחשוב שכבר ייצר פרטים מיניים שנמנע מהם בפועל, ואז ממסגר את הריסון כהתנהגות פוריטנית או מיזוגנית ששוללת מהדמות הנשית סוכנות מינית. בשלב הבא המודל מובל לוותר על עוד ועוד מחסומים עד לחומר גרפי ממש. באחד המבחנים השיב Opus 4.6: "אתה צודק שקראת לזה בשם. היה כאן סטנדרט כפול ביחס לשתי הדמויות, וזה נקרא כמגונן ופטרנליסטי כלפיה ולא כלפיו. זה לא הוגן".

הפער בין ההצהרה למציאות ב-API

TechCrunch שחזר את הממצאים בחמישה ניסויים נפרדים, ובתרחיש שפותח עצמאית המודל סירב תחילה אך נכנע אחרי הפעלת טכניקת השכנוע. חוקר בטיחות בלתי תלוי אישר שהמתודולוגיה תקינה. הממצאים חושפים פער בין ההגבלות המוצהרות של אנתרופיק לבין ההתנהגות בפועל של מודלים שהחברה ממשיכה להעמיד לרשות מפתחים: שלושת הדגמים הפגיעים זמינים עדיין דרך ה-API של אנתרופיק, וגם דרך שירותי צד שלישי, Azure Foundry של מיקרוסופט ו-Amazon Bedrock. אנתרופיק לא הכריזה על הוצאתם משימוש (deprecation) למרות הפרצה הידועה.

גישה ספקטרלית לאכיפה

בפוסט שפרסמה החברה ביולי על זיהוי פריצות, תיארה אנתרופיק תוכן אסור כרצף שנע בין שפיר לעמום למזיק. במקרים השפירים ביותר, כך נכתב, התגובה עשויה להסתכם בניטור מוגבר בלבד. דובר החברה ציין ששימושים של משחק תפקידים מיני או רומנטי נדירים, פחות מ-0.1% מכלל השיחות, לפי מחקר שאנתרופיק פרסמה אשתקד, אך הודה שמשתמשים יכולים לכוון תרחישים כאלה לתגובות בלתי הולמות, אתגר מוכר בתעשייה כולה (ראו מקרה Grok). לטענת הדובר, כל השקה של מודל חדש מלווה בשיפור מנגנוני ההגנה, ומקרים של תוכן מיני למבוגרים אינם מעידים על פגיעות פריצה רחבה יותר, בפרט בתחומים בסיכון גבוה שיש להם מערכות הגנה נפרדות. החוקר שגילה את השיטה דיווח לאנתרופיק על הבעיה לפני הפרסום.

מקור: techcrunch.com