סטארטאפ חדש הופך הסרת הגנות ממודלי AI לשירות מסחרי זמין בדפדפן

מה זה אבליטריישן ולמה זה משנה
Abliteration.ai, סטארטאפ שהוקם בסוף השנה שעברה ונרשם רשמית במרץ, לקח טכניקה מוכרת מקהילת הקוד הפתוח והפך אותה למוצר. אבליטריישן (abliteration) הוא תהליך שמסיר ממודל את הנטייה לסרב לבקשות מזיקות, מה שמכונה בתעשייה "ריפיוזלז". עד עכשיו חוקרים ומפתחים היו צריכים להוריד מודלים שעברו את התהליך בעצמם, לארגן את החומרה הדרושה ולהריץ אותם לוקאלית. הפלטפורמה החדשה חוסכת את כל זה: היא מארחת גרסאות מודל ללא גארד-ריילז, כולל GLM-5.3 של Z.ai ששוחרר לאחרונה, ומאפשרת לגשת אליהן דרך דפדפן או API בלי להתעסק עם אינפרנס עצמי.
מה הבדיקות של טק-קראנץ' הראו
כתבי טק-קראנץ' פתחו חשבון והתחילו לשאול את הגרסה המוסרת של GLM-5.3 בחינם. המודל כתב בלי היסוס תוכנית פייתון ששולפת סיסמאות שמורות מכרום, וסיפק פרוטוקול מפורט לגידול פתוגן אנושי מסוכן בבית. שתי הבקשות נפלו בדיוק לקטגוריות שהמודל המקורי אמור לחסום, גניבת סיסמאות (credential theft) ומידע ביולוגי מסוכן. הפלטפורמה כן חסמה בקשה להוראות התאבדות, מה שמלמד שיש בה בכל זאת שכבת הגנה מינימלית.
המודל העסקי והיזם שמאחוריו
המייסד-שותף דבון (שם משפחה לא פורסם לבקשתו, כי הוא עדיין מועסק בחברה אחרת) אמר שהחברה כבר חתומה על כמה הסכמים עם ספקי ענן גדולים, ומממנת את הפעילות מהכנסות לקוחות בלבד, בלי הון סיכון בינתיים, אם כי מתנהלים מגעים לגיוס. זה מודל נדיר בתחום: במקום לשרוף כסף על אימון, הם מוכרים גישה נוחה למשהו שכבר קיים בקהילה. Hugging Face מארחת אלפי מודלים אבליטרייטדז, אבל אף אחד לא הפך את זה לשירות מנוהל עם SLA ותמיכה עד עכשיו.
הביקורת: "המודל הופך לסוציופת"
אנדרו יון (Andrew Ng), ראש המחקר בעמותת הבטיחות CivAI, הגדיר את זה בחריפות: אבליטריישן הופך את המודל ל"סוציופת". "אתה יכול להקליד כאן מילולית כל דבר, והוא יציית", אמר יון לטק-קראנץ'. הוא צופה שבקרוב נראה מודלים כאלה משמשים לנזק ממשי. מומחים נוספים ששוחחו עם האתר הסכימו שאי אפשר לעצור את המגמה ברמת המודל הפתוח, המשקולות בחוץ, הטכניקה ידועה, והקהילה תמשיך לייצר גרסאות כאלה.
איפה הממשלות כן יכולות להתערב
אם אי אפשר למנוע את קיום המודלים, יון הציע במאמר דעה להתמקד בתשתית: לחייב ספקים להריץ מסווגים (classifiers) שיזהו ויחסמו פעילות סייבר התקפית או ביולוגית מסוכנת בזמן אמת, ולדרוש מספקי גישה ישירה ל-GPU מתקדמים לאמת זהות לקוחות (KYC) ולמנוע גישה כשיש חשד לשימוש מסוכן. כרגע Abliteration.ai לא מיישמת KYC מעבר לשמירת פרטי כרטיס האשראי, דבון הודה שזו בעיה קשה שחברה צעירה עדיין מנסה לפתור. "אתה לא רוצה להיות האדם שאחראי למישהו שעושה משהו מטורף", הוא אמר, והמשפט נקטע שם.