מודל פתוח שמקדים את AlphaFold3 בחיזוי חלבונים

קבוצת המחקר מ‑Biohub חשפה את ESM Cambrian (ESMC), מודל שפה פתוח שמטרתו לחזות ולעצב חלבונים, ובכך הצליחה לעקוף את AlphaFold3 של Google בדיוק החיזוי. המודל יצר אטלס עצום של 6,8 מיליארד רצפי חלבונים, שמספק מאגר מוכן לשימוש בחיפוש אחר תרופות, אנזימים וחומרים חדשים, ללא צורך בניסויים יקרים במעבדה.
ב‑ESMC עוצבו מולקולות שהפגנת אפיניות של עד 0,068 ננומטר לשאילתות CTLA‑4 ו‑EGFR – רמת אפיניות השווה לזו של האנטיגנים הקליניים המאושרים ביותר לטיפול בסרטן. תהליך ניסוי‑מעבדה קלאסי שמצריך חודשים כדי להגיע למולקולה באיכות זו, הוכח כמתאפשר במחשוב בלבד, כאשר הסריקה החישובית דרך ESMC מספקת תוצאות דומות תוך כמה ימים בלבד.
המודל אומן על‑ידי משימת חיזוי של טוקנים מוסתרים: חלק מהחומצות האמיניות ברצף מוסתרות והמודל לומד לשחזרן, בדומה למודלים לשפה טבעית כמו BERT שמבינים משמעות מילים וקשרים ביניהן על‑ידי השבת מילים חסרות, ללא צורך במילונים או בתיוגים ידניים. באמצעות אוטואנקודרים מדוללים (SAE) הראו המחברים שה‑ESMC קלטה היררכיה ביולוגית שלמה – מהחומצות האמיניות הבודדות ועד למוטיבים אבולוציוניים משותפים לבקטריות, ארכיאה ואאוקריוטים – תופעה של התהוות עצמאית של דפוסים במהלך הלמידה, ללא תיוג חיצוני.
ב‑BenchMark FoldBench המודל הגיע לשיעור הצלחה של 50 % ב‑DockQ במשימת חיזוי קומפלקס של נוגדן‑אנטיגן מתוך רצף יחיד, מה שהקדים את AlphaFold3 שהשיג 47 %. יתרה מכך, AlphaFold3 דורש יישור של מאות רצפים קרובים (MSA), תהליך שמצריך חיפוש יקר במיליארדי רשומות, בעוד ש‑ESMC מבצע זאת ללא צורך ב‑MSA.
הקוד והמשקלים של המודל זמינים ב‑GitHub וב‑HuggingFace, והסביבה האינטראקטיבית פועלת ב‑biohub.ai.