מצפה הכוכבים של הבינה המלאכותית חושף: חצי מהשיחות לא קשורות לעבודה

חברות כמו Anthropic ו-OpenAI מפרסמות דוחות שימוש קבועים, אבל הנתונים שהן משחררות עוברים סינון כבד, ומציגים תמונה חלקית בלבד. חוקרים מזהירים שאין מקור עצמאי שמאמת את המספרים האלה, וההחלטות שמתקבלות על סמך המידע המוגבל הזה הן בעלות השלכות מרחיקות לכת.
הפרויקט שמנסה לסגור את הפער
אנקה רויאל (Anka Reuel), דוקטורנטית למדעי המחשב במעבדת STAIR של סטנפורד, מובילה במשותף את "מצפה הכוכבים של הבינה המלאכותית" (AI Observatory). הפלטפורמה הציבורית אגרגטה וניתחה שיחות אמיתיות עם מודלים פופולריים כמו Claude ו-Gemini, שנאספו בהסכמת משתמשים דרך שבעה מערכי נתונים קיימים. המטרה: לספק לחוקרים ולמקבלי החלטות מקור מידע בלתי תלוי על האופן שבו אנשים משתמשים בבינה מלאכותית יוצרת בפועל.
מה שהחברות מסתירות בסינון
מדד הכלכלה של Anthropic הוא אחד המקורות המצוטטים ביותר, אבל כפי ששמו מרמז, הוא מתמקד בשימושי עבודה ופרודוקטיביות, ומסנן החוצה שיחות שלא קשורות לכך. כשצוות המצפה החיל את אותה מתודולוגיה על מערך הנתונים שלו, התברר ש-48% מהשיחות היו נפסלות. השיחות המסוננות הכילו שיעורים גבוהים בהרבה של נושאים רגישים: בריאות ומערכות יחסים (44.2% לעומת 31.2%), תוכן למבוגרים או בלתי חוקי (7.9% לעומת 2.1%), הטרדה ושנאה (27.5% לעומת 5.66%), ותוכן מיני (16.7% לעומת 2.4%). דוח ChatGPT של OpenAI מ-2025 הראה תמונה דומה, רק 30% מהשימוש הצרכני היה קשור לעבודה.
שינויים לאורך זמן: יותר חברות, פחות גילוי עצמי
מערך הנתונים WildChat, הגדול והמפורט במחקר, הראה שהשיחות התארכו ונעשו מורכבות יותר בין 2023 ל-2025, יותר טוקנים בפרומפט, יותר טוקנים בתשובה, יותר סבבי שיחה. במקביל זינק היקף ה"סמול טוק", מה שמרמז על עלייה בשימוש לצרכי חברות (companionship); מנגד, הנטייה של העוזרים לחשוף שהם צ'אטבוטים דווקא ירדה. החוקרים גם זיהו ירידה בשיחות שסווגו כ"שימוש רגיש", תוכן פוגעני או מוגבל, מה שעשוי להעיד על שיפור במנגנוני ההגנה של הפלטפורמות.
לא כל המודלים שווים: גרוק וג'מיני מובילים בשליפת מידע
השימוש נראה שונה מהותית בין מודל למודל, בנושאים, בסגנון האינטראקציה, במבנה השיחה, ובסוג ובהיקף המקרים הרגישים. גרוק (Grok) וג'מיני (Gemini) שימשו בתדירות גבוהה יותר לשליפת מידע (information retrieval). גרוק בלט במיוחד בחדשות ופוליטיקה, אבל גם ריכז סביבו ריכוז גבוה של מידע שגוי, ממצא שעולה בקנה אחד עם מחקרים קודמים. לדברי דייוויד וידר (David Widder), פרופסור בבית הספר למידע של UT-Austin שחוקר אינטראקציית אדם-בינה מלאכותית ואינו מעורב בפרויקט, המבט הכולל שהמצפה מספק, במקום דוחות נפרדים לכל נושא, עוזר לחוקרים להבין את מגוון השימושים באופן עקבי יותר.