מפת עולם חדשה לחלבונים: בינה מלאכותית מחברת בין רצף, מבנה ומיליארדי שנות אבולוציה

מודל שפותח בידי חוקרים מאוניברסיטת חיפה, אוניברסיטת תל אביב ושותפיהם ממפה חלבונים לפי רצף חומצות האמינו והמבנה התלת־ממדי באותו מרחב חישובי. החוקרים מקווים להשתמש בו כדי לזהות קרבה בין משפחות חלבונים ולשחזר מסלולים אבולוציוניים עתיקים

חלבונים הם המכונות המולקולריות שמבצעות כמעט כל פעולה בתא החי, אבל השאלה כיצד אלפי משפחות החלבונים המוכרות קשורות זו לזו לאורך האבולוציה עדיין רחוקה מפתרון מלא. צוות בינלאומי בהובלת חוקרים מאוניברסיטת חיפה ומאוניברסיטת תל אביב פיתח כעת מודל בינה מלאכותית שמנסה לסדר את "יקום החלבונים" על מפה אחת — תוך שימוש בו־זמני בשני סוגי המידע החשובים ביותר על כל חלבון: רצף חומצות האמינו שלו והמבנה התלת־ממדי שאליו הוא מתקפל.

המודל, המכונה CLSS – Contrastive Learning Sequence–Structure, מתואר במאמר שפורסם ב־PNAS. את המחקר הובילו פרופ' רחל קולודני והדוקטורנט גיא ינאי מהחוג למדעי המחשב באוניברסיטת חיפה, יחד עם פרופ' ניר בן־טל וגבריאל אקסל מאוניברסיטת תל אביב וד"ר ליאם לונגו מהמכון למדעי כדור הארץ והחיים, ELSI, במכון למדע בטוקיו.

אותו חלבון, שתי דרכים לתאר אותו

כל חלבון בנוי משרשרת של חומצות אמינו. הרצף שלהן הוא מעין "טקסט" מולקולרי, אך כדי לבצע את תפקידו החלבון מתקפל לצורה תלת־ממדית. שתי רמות המידע האלה קשורות זו בזו, אך הקשר ביניהן אינו פשוט.

חלבונים שרצפי חומצות האמינו שלהם שונים מאוד יכולים להתקפל למבנים דומים, ואילו רצפים דומים מאוד יכולים להופיע במבנים שונים. משום כך, שיטות שממיינות חלבונים רק לפי הרצף או רק לפי המבנה עלולות להחמיץ חלק מן הקשרים ביניהם.

מודלים מודרניים של "שפת חלבונים" ממירים חלבון לייצוג מספרי רב־ממדי המכונה embedding. אפשר לחשוב עליו כעל כתובת במפה: חלבונים בעלי מאפיינים דומים אמורים להימצא קרוב זה לזה. אלא שבמודלים רבים המפה שמתקבלת מן הרצף והמפה שמתקבלת מן המבנה אינן חופפות היטב.

בהודעת המחקר של ELSI מסבירים החוקרים כי מטרת CLSS הייתה ליצור מרחב משותף שבו ניתן להשוות את שני סוגי המידע בעת ובעונה אחת.

לגרום לרצף ולמבנה להיפגש באותה מפה

CLSS נבנה באמצעות למידה ניגודית — contrastive learning. במהלך האימון מקבל המודל זוגות תואמים של רצפי חלבון ומבנים תלת־ממדיים, ולומד להציב אותם קרוב זה לזה במרחב המתמטי, בעוד זוגות שאינם שייכים לאותו חלבון מורחקים זה מזה.

כך מתקבלת מפה משותפת שבה אותו חלבון אמור לקבל ייצוג דומה בין אם מזינים למודל את הרצף שלו ובין אם את המבנה התלת־ממדי שלו.

החוקרים אימנו את המודל על כמיליון תחומי חלבון, תוך שימוש במבנים שנקבעו בניסוי ובמבנים שחוזו באמצעות AlphaFold. האימון היה בפיקוח עצמי: המודל לא קיבל מראש תוויות המסבירות אילו חלבונים משתייכים לאותה משפחה.

כאשר החוקרים השוו את התוצאה למערכות הסיווג ECOD ו־CATH, שמרכזות ידע שנצבר במשך עשרות שנים על משפחות ומבנים של חלבונים, התברר שהמודל הצליח לשחזר במידה רבה את הקשרים הידועים ביניהם — אף שהסיווגים האלה לא שימשו אותו במהלך האימון.

המודל גם השיג ביצועים טובים יותר ממספר מודלי שפה מתקדמים אחרים לחלבונים במשימות הסיווג שנבדקו במחקר.

גם מקטעים קצרים שומרים זיכרון אבולוציוני

אחד החידושים המעניינים במחקר הוא שהמודל מסוגל למפות לא רק חלבונים ותחומי חלבון שלמים, אלא גם מקטעי רצף קצרים יותר.

לכך עשויה להיות חשיבות בחקר האבולוציה. במהלך מיליארדי שנים מקטעים של חלבונים הועתקו, שולבו מחדש ועברו שינויים בתוך חלבונים שונים. חלק מן המקטעים הללו עשויים להיות שרידים של אבני בניין מולקולריות קדומות שקדמו לחלבונים המורכבים המוכרים כיום.

האפשרות הזאת משתלבת במחקרים קודמים על ראשית האבולוציה של חלבונים. באתר הידען תואר, למשל, כיצד מדענים הצליחו "לחשב לאחור" את התפתחותו של חלבון ולשחזר במעבדה שלבים בהתפתחותו, וכן כיצד חוקרי מכון ויצמן יצרו אב־טיפוס של אנזים קדום שעשוי לשפוך אור על החלבונים הראשונים.

ממפת חלבונים לחיפוש אחר ההיסטוריה שלהם

כאשר החוקרים הציגו את החלבונים במפה הדו־ממדית שנוצרה מן הייצוגים של CLSS, נראו אזורים שבהם חלבונים בעלי מבנים ותכונות דומות התקבצו יחד.

הם בדקו גם קשרים בין אזורים שונים במפת החלבונים לבין סוגי ליגנדים — מולקולות או יונים הנקשרים לחלבונים. בין השאר נמצאו דפוסים שונים עבור חלבונים הקשורים לקו־פקטורים אורגניים ועבור חלבונים הקושרים מתכות.

המטרה הרחבה יותר היא לספק דרך חדשה לארגן את "מרחב החלבונים" — לא רק לצורך מיון, אלא גם כדי לזהות קשרים רחוקים בין חלבונים ולנסח השערות על הדרך שבה משפחות חלבונים התפתחו לאורך האבולוציה.

מבחינה זו CLSS משלים כלים כמו AlphaFold. בעוד AlphaFold נועד בעיקר לחזות כיצד רצף מסוים מתקפל למבנה תלת־ממדי, CLSS נועד למקם חלבונים בתוך מרחב של קרבה ודמיון ולשאול אילו חלבונים עשויים להיות קשורים זה לזה.

מודל קטן יחסית

אחת התכונות הבולטות של CLSS היא שהוא אינו מודל עצום. החלקים הניתנים לאימון כוללים כ־36 מיליון פרמטרים בלבד, והייצוג הסופי של כל חלבון הוא וקטור בן 32 ממדים.

לדברי החוקרים, המבנה הקומפקטי עשוי להקל על אחסון וחיפוש במאגרים גדולים של חלבונים ולפתוח אפשרויות לשימוש במודלים ייעודיים שאינם דורשים משאבי חישוב עצומים.

בעתיד מודלים כאלה עשויים לסייע בחיפוש במאגרי חלבונים, בהשוואת רצפים, בהנדסת חלבונים ובחקר מסלולים אבולוציוניים.

עם זאת, חשוב להדגיש כי CLSS אינו משחזר ישירות ארבעה מיליארד שנות אבולוציה ואינו מוכיח שכל שני חלבונים הנמצאים קרוב זה לזה במפה חולקים אב קדמון מסוים. הוא מספק דרך חדשה לארגן מידע על דמיון וקשרים בין חלבונים, שממנה אפשר לגזור השערות לבדיקה נוספת.

שאלות ותשובות

מהו CLSS? מודל שפה לחלבונים המשתמש בלמידה ניגודית כדי לייצג רצפים ומבנים תלת־ממדיים של חלבונים בתוך אותו מרחב מתמטי.

מה החידוש לעומת מודלים קודמים? במקום להתייחס לרצף ולמבנה כשתי מפות נפרדות, CLSS מנסה להציב את שני הייצוגים של אותו חלבון באותו אזור של המפה.

מדוע מקטעי חלבון קצרים חשובים לחקר האבולוציה? מקטעים כאלה עברו לאורך האבולוציה העתקה ושילוב מחדש בחלבונים שונים, ולכן הם עשויים לשמר רמזים לקשרים עתיקים בין משפחות חלבונים.

האם המודל משחזר בפועל את החלבונים שחיו לפני מיליארדי שנים? לא. הוא ממפה דמיון בין חלבונים ומקטעים קיימים ויכול לסייע בזיהוי קשרים והשערות אבולוציוניות, שאותם יש לבדוק באמצעים נוספים.

עוד בנושא באתר הידען

לפרסום המקורי: פתיחת הפרסום המקורי