מתמטיקאים דורשים הוכחה ש-OpenAI לא השתמשה בעבודתם

אנדריאס תום (Andreas Thom), מתמטיקאי שחוקר קבוצות לא-סופיות, פרסם סדרת פוסטים ב-Mastodon ובה האשים את OpenAI ב"חוסר יושר" ובהיעדר שקיפות בנוגע למקורות נתוני האימון של מודליה. הטענה מגיעה ימים ספורים אחרי שטריסטן בקמאסטר (Tristan Buckmaster), פרופסור למתמטיקה באוניברסיטת ניו יורק, העלה חשד דומה לגבי שימוש אפשרי בעבודתו דרך Codex. שני המקרים מצביעים על דפוס: חוקרים שמקיימים אינטראקציה עם כלי החברה רואים לאחר מכן פריצות דרך בתחומם, ותוהים האם השיחות שלהם הזינו את המודל.
הקבוצות הלא-סופיות והקשר של תום
אחד מעשרת ההישגים המתמטיים שהכריזה OpenAI בחודש שעבר נגע בדיוק לתחום ההתמחות של תום, קבוצות לא-סופיות, מבנים מתמטיים אינסופיים שלא ניתנים לקירוב על ידי מבנים סופיים. החברה הודתה שההישג נשען במידה רבה על עבודות קודמות של תום ושל המתמטיקאי גאבור קון (Gábor Kun). תום ציין שהמודל הפגין "שליטה מפורטת בטכניקות שלנו", שלדבריו לא היו המסלול הברור או המבטיח ביותר לפתרון באותה עת. העובדה שההודעה המקורית לא הזכירה את תרומתם העדכנית הובילה לביקורת בקהילה המתמטית, ו-OpenAI תיקנה את המסמך בשקט.
התשובה שלא סיפקה את תום
תום פנה במייל לחוקרי OpenAI סבסטיאן בובק (Sébastien Bubeck) ומארק סלק (Mark Sellke), סטטיסטיקאי בהרווארד, ושאל האם שיחותיו עם ChatGPT היו "חלק מנתוני האימון או נגישות לתהליך ההנמקה". התשובה שקיבל התייחסה רק לגישה ישירה לשיחות, לא לשאלה האם תוכנן נכנס למאגרי האימון העצומים שבהם החברה משתמשת לשיפור המודלים. "שום הסבר, הסתייגות או ראיה לא ניתנו", כתב תום. "אני רואה בזה חוסר יושר לכל הפחות". לדבריו, חוקרים אינם מצוידים להנדס לאחור את צינור האימון של OpenAI, רק לחברה יש את הנתונים הרלוונטיים.
הדפוס חוזר: נוויה-סטוקס והנתונים ה"מוסתרים"
ההתחמקות הזו מזכירה את האופן שבו הגנה OpenAI על פריצת הדרך שלה בפרס מילניום, פתרון משוואות נוויה-סטוקס (Navier-Stokes) העוסקות בתנועת נוזלים. בפוסט הרשמי הכחישה החברה שימוש בנתוני משתמש ספציפיים: "לא ראינו אף אחת מעבודותיהם דרך שום אמצעי עד שפרסמו אותן בפומבי". אלא שבאותה נשימה הוסיפה: "אף שזה לא סביר, איננו יכולים לשלול שנתונים מזוהים-למחצה שמקורם בשימוש שלהם במוצרינו עזרו לשפר את המודלים שלנו". תום טוען שזו אותה הבחנה מעורפלת: "הסרת זיהוי עשויה להסיר שם; היא לא מסירה את התוכן האינטלקטואלי של רעיון מתמטי". בקמאסטר, אגב, עבד על הבעיות עם חוקר Anthropic ליוונט אלפוגה (Levent Alpöge) במסגרת אישית.
מה זה אומר בפועל
הבעיה אינה רק משפטית, היא מתודולוגית. כשמודל מגיע להישג בתחום צר שבו מספר החוקרים הפעילים קטן, היכולת להפריד בין "ידע כללי" לבין תרומה קונקרטית של משתמש ספציפי נעשית תאורטית בלבד. OpenAI דורשת אמון בלי לספק את השקיפות הנדרשת כדי לאמת אותו: חשיפת מערכי הנתונים, הגדרות האימון והתנאים שקובעים כיצד נתוני משתמש נכנסים (או לא נכנסים) למחזור הפיתוח. עד שזה יקרה, הקהילה האקדמית תמשיך להתייחס לכל פריצת דרך כאל חשודה, ובצדק.