
Google DeepMind הציגה את SynthID Bio – מערכת לסימון חלבונים שנוצרו באמצעות AI
צוות DeepMind של Google הציג ב-Nature את SynthID Bio, שיטה לסימון באמצעות סימן מים של חלבונים שנוצרו ב-AI. המערכת אינה פוגעת בתפקוד החלבון ואמורה לסייע לסקרינג לבטיחות ביולוגית.
צוות DeepMind של Google פרסם ב-30 בספטמבר בכתב העת המדעי Nature מחקר, שבו הציג את SynthID Bio, מערכת לסימון בסימן מים של חלבונים שנוצרו באמצעות AI. השיטה אינה פוגעת בפעילות החלבון ומאפשרת לזהות חלבונים שתוכננו על ידי חוקרים מהימנים, בעוד חלבונים אחרים ייבדקו לעומק רב יותר.
הפער בבטיחות הביולוגית
כלים מבוססי AI לעיצוב חלבונים כבר מניבים כמה תוצאות חשובות: קיימים אנזימים שמפרקים פלסטיק, וחלבונים שמנטרלים ארס נחשים. באותם כלים אפשר גם ליצור רעלים. תוכנית סקרינינג לרצפי DNA אינה מזהה חלבונים שנוצרו באמצעות AI, מפני שאין עליהם עדיין מספיק נתונים כדי להעריך סיכון. כמעט שנה לאחר זיהוי הסיכון לא היה פתרון.
כיצד פועל SynthID Bio
המערכת מבוססת על טכנולוגיית SynthID של Google. SynthID מוסיפה סימן בלתי מורגש לחומר דיגיטלי שנוצר על ידי AI: הסימן משנה את הבחירה ההסתברותית של המודל, ולכן הוא מתפזר באופן אחיד על פני כל המוצר, ואי אפשר להסירו בלי לדעת את הקידוד.
חלבון הוא מטרה מורכבת הרבה יותר. הוא מורכב רק מ-20 חומצות אמינו, שכל אחת מהן עשויה להיות הכרחית למבנה או לפעילות קטליטית. באזורים מסוימים שינוי מותר, ובאחרים אפילו סטייה קטנה הופכת את החלבון לבלתי פעיל. החלבון קטן: 500 חומצות אמינו נחשבות לחלבון גדול, ובהשוואה לתמונה עם מיליוני פיקסלים יש הרבה פחות חומר להסתרת הסימן.
החוקרים חיברו את השיטה לכלי הפופולרי לעיצוב חלבונים ProteinMPNN. תוכנית זו מציבה חומצות אמינו זו אחר זו לאורך השרשרת. SynthID Bio מציע מועמד באמצעות קוד דמוי מפתח קריפטוגרפי ובהתאם לחומצות האמינו שכבר נבחרו, ו-ProteinMPNN מקבל אותו רק אם החלבון נשאר פונקציונלי. לכן חומצות האמינו של סימן המים מופיעות רק במקום שבו הכימיה מאפשרת זאת. הסימן מפוזר על פני כל הרצף, ולכן זיהויו סטטיסטי: בודק עם מפתח סורק את כל הרצף ומודד באיזו תדירות מופיעות חומצות האמינו המוצעות שלו.
תוצאות ומגבלות
הצוות יצר בעזרת המערכת חלבונים שנקשרים למטרות טבעיות. סימון בסימן מים לא פגע בתפקוד החלבונים: החלבונים המסומנים נקשרו לחלבוני המטרה כרגיל. לצורכי בטיחות ביולוגית Google מציעה ליצרני DNA לקבל סט מפתחות מארגונים מהימנים, למשל אוניברסיטאות וחברות ביוטכנולוגיה גדולות. כך הם יקבעו במהירות אם חלבון לא מוכר הוא עיצוב AI מהימן, וימקדו את תשומת הלב בחלבונים לא מאומתים.
לשיטה יש גם מגבלות. בטיחותה תלויה בהפצת המפתחות. בחלבונים קצרים מאוד ייתכן שיהיו מעט מדי חומצות אמינו של הסימן כדי לזהותן. הוספת חומר ללא סימן, למשל מיזוג עם חלבון פלואורסצנטי טבעי, עשויה לדלל את סימן המים. כלים רבים של AI אינם משתמשים ב-ProteinMPNN. מכיוון שהזיהוי סטטיסטי, בחירת הסף משפיעה על תוצאות חיוביות שגויות ושליליות שגויות. בצורתו הראשונית המערכת עשויה שלא להיות שימושית במיוחד בפועל, אבל השיטה עובדת וזה חשוב.
מקורות: Ars Technica · Techmeme
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.