צבא סין מזקק את קלוד ו-GPT כדי לעקוף את מגבלות החומרה

השיטה: זיקוק במקום אימון מאפס
הצבא הסיני לא מחכה לשבבים החדשים של NVIDIA, הוא לוקח את המודלים המוגמרים של OpenAI ואנת'רופיק, מריץ עליהם מיליוני שאילתות, ומאמן על התשובות מודלים קטנים שרצים על חומרה מקומית. התהליך, שמכונה זיקוק מודלים (Model Distillation), נחשף בסוף השבוע בדיווח של רויטרס שהתבסס על סקירה של יותר מ-80 מאמרים ופטנטים סיניים שערך מכון המחקר קרן ג'יימסטאון מוושינגטון. שר המדע והטכנולוגיה האמריקני, מייקל קרציוס, כבר האשים בשבוע שעבר את Moonshot AI מבייג'ינג בזיקוק מודל פייבל של אנת'רופיק לטובת Kimi K3; המסמכים מראים שהפרקטיקה רחבה בהרבה וכוללת מוסדות ביטחוניים רשמיים.
יחידה 96941 והקוד המסווג
באחד המאמרים שפורסמו בשנה שעברה תיארו חוקרי יחידת המודיעין ולוחמת הסייבר PLA 96941 כיצד השתמשו ב-GPT-3.5 לעיבוד קוד מקור צבאי רגיש. המודל של OpenAI חוסם טיפול במידע מסווג, אז החוקרים העבירו את הקוד דרך GPT-3.5 לסיכום, ואז אימנו מודל מקומי על הסיכומים האלה, מודל שיכול לרוץ ברשתות הצבא הסיני בלי מגבלות מדיניות של ספק זר. סאני צ'אנג, עמית מחקר בג'יימסטאון שניתח יותר מ-60 מאמרים, מסביר שמדענים צבאיים סיניים "לוכדים באופן שיטתי את שלבי ההיגיון של המודלים המערביים" כדי להתאים אותם למעקב, לוחמת סייבר וקבלת החלטות טקטיות.
התגובות וההכחשות
בייג'ינג דחתה את הממצאים וטענה שוושינגטון בונה "הגמוניה של בינה מלאכותית", והוסיפה שחברות אמריקניות נוקטות פרקטיקות דומות. Moonshot AI הכחישה ש-Kimi K3 נבנה בזיקוק וציינה שהוא מבוסס על חידושים קנייניים. הבית הלבן, הפנטגון, משרד החוץ הסיני, צבא סין ו-OpenAI לא הגיבו לדיווח.
גניבת קניין רוחני או שיקוף מציאות?
מומחים שהגיבו לפרסום כינו את הזיקוק "סוג של גניבת קניין רוחני" שמאפשר למפתחים להעתיק את היכולות המרכזיות של מודל סגור. אנת'רופיק עצמה האשימה בתחילת השנה את עליבאבא בזיקוק קלוד, וטענה שהקמפיין הסיני השתמש ב-25 אלף חשבונות מזויפים כדי להריץ 28.8 מיליון אינטראקציות במשך שישה שבועות, נפח שמעיד בבירור על כוונת שכפול. כשמודל לומד להסיק דרך חולשות תוכנה ונתיבי תקיפה, העתקת ההתנהגות שלו מעתיקה גם את היכולת האנליטית הזו.
המסורת נמשכת
חוקרים מציינים שהעתקת מודלי AI ממשיכה מסורת ארוכה של גניבת קניין רוחני בחסות סין, ומשווים אותה למפעלי הדיסקים המזויפים שפעלו שם לפני שני עשורים. מנגד, יש מי שמזכיר ש-OpenAI ואנת'רופיק בנו את המודלים שלהן על נתונים ותוכן של אחרים שנלקחו ללא רישיון, כך שהקו בין למידה לגניבה נשאר מטושטש, לפחות עד שהרגולטורים יחליטו איפה עובר הגבול.