3.8 מיליון קובצי SKILL.md: מחקר חדש ממפה את מאגר הכישורים של סוכני AI ב-GitHub

תשעה חודשים אחרי ש-Anthropic פרסמה את פורמט SKILL.md כמפרט פתוח, יש כבר בערך 3.8 מיליון קבצים כאלה פזורים ב-282,200 מאגרים ציבוריים ב-GitHub. מחקר חדש לקח את כולם, כרה אותם ודחס אותם למאגר נתונים אחד שנקרא GitSkills. המחקר, שפורסם כפרה-פרינט ב-arXiv (מספר 2608.10906), עדיין לא עבר שיפוט עמיתים.
למה כריית כישורים שונה מכריית קוד
קובץ SKILL.md לא מתנהג כמו קוד רגיל, וזה בדיוק מה שמקשה על כריית נתונים קונבנציונלית. הוא כתוב בשפה טבעית, סוכן AI בוחר אותו באופן הסתברותי בזמן ריצה, ואין מהדר או בודק טיפוסים שמוודא שהבחירה הזו בכלל הגיונית. אין רישום מרכזי ואין מנהל חבילות, כך שהקבצים מתפשטים פשוט על ידי העתקת תיקיות בין מאגרים שונים. התוצאה היא שכמות עצומה של קבצים שקשה לעקוב אחריה.
מה נכנס למאגר הנתונים
GitSkills מקבץ את כל הקבצים הללו ל-1,877,981 תכנים ייחודיים. המאגר מסופק כקובץ SQLite יחיד שכולל נתוני שלד המסמך, תוכן התיקיות והיסטוריית ההזדהויות. מי שרוצה לעקוב אחרי מאמרי AI נוספים יכול למצוא אותם באקדמיה של DAIR.AI, ארגון שעוסק במחקר וחינוך בתחום בינה מלאכותית.
כישורים כמסמך פעולה
הקובץ הזה הוא לא רק תיעוד טכני כשסוכן יכול להשתמש בו כדי להחליט אילו כלים להפעיל ואילו פעולות לבצע. המקור וגבולות ההרשאות של כל קובץ הופכים לשאלה קריטית, במיוחד כשמדובר בקבצים שמועתקים ידנית בין מאגרים בלי שום בקרה מרכזית.