מודלים יסוד בפתולוגיה דיגיטלית: רובם לא עמידים לסיבוב תמונה אלא אם אומנו עם אוגמנטציית סיבוב

הממצא המרכזי
חוקרים בדקו שתים עשרה מודלי יסוד (foundation models) שמקודדים טלאים (patches) מתמונות H&E שלמות (whole slide images) לייצוגים לטנטיים, וגילו שהעמידות לסיבוב אינה מובנת מאליה. רק מודלים שעברו אימון עצמי-מפוקח (self-supervised) עם אוגמנטציית סיבוב הפגינו אינוריאנטיות משמעותית, כלומר, הייצוג של אותו טלאי נשאר דומה גם אחרי סיבוב של 90, 180 או 270 מעלות. שאר המודלים ניבאו וקטורים שונים מהותית לאותו תוכן כשהוא מסובב, מה שעלול לפגוע במשימות משניות כמו סיווג או חיפוש דמיון.
איך נבדקה העמידות
הצוות השתמש בשני מדדים: מרחק קוסינוס (cosine distance) בין הייצוגים של טלאי מקורי ומסובב, ומדד שכנים קרובים הדדי (mutual k-nearest neighbours) שבוחן האם שני הייצוגים מצביעים לאותם שכנים במרחב הלטנטי. הבדיקה נערכה על טלאים זהים שסובבו בזוויות שונות, בלי להזין את הזווית כקלט למודל. התוצאות הראו פער ברור: מודלים עם אוגמנטציית סיבוב השיגו ציוני אינוריאנטיות גבוהים משמעותית, בעוד מודלים בלעדיה התפזרו.
למה ארכיטקטורת טרנספורמר נכשלת בלי עזרה
ההשערה של החוקרים פשוטה: ארכיטקטורת טרנספורמר (Transformer) חסרה הטיה אינדוקטיבית (inductive bias) לסיבוב, בניגוד ל-CNN שמכילה קונבולוציות עם שיתוף משקלים המייצרות אינוריאנטיות חלקית מובנית. בלי לראות דוגמאות מסובבות במהלך האימון, המודל לא לומד שסיבוב לא משנה את המשמעות הסמנטית של הרקמה. האוגמנטציה מספקת את הדוגמאות החסרות וכופה על המודל ללמוד ייצוג שאינו תלוי בכיוון.
מה זה אומר למעשה
מי שמפעיל מודל יסוד בפתולוגיה דיגיטלית ומצפה שהוא יתמודד עם סריקות בזוויות שונות, למשל כשהסורק מיושר אחרת או כשהטלאי נחתך בזווית, צריך לוודא שהמודל אומן עם אוגמנטציית סיבוב, או להוסיף אותה בעצמו ב-fine-tuning. הקוד של המחקר זמין לציבור, כך שאפשר לשחזר את הבדיקה על מודלים נוספים לפני שמחליטים איזה מהם לפרוס בייצור.