Repurposing PeTriBERT for Protein Protein Interaction Prediction with Sequence Structure Fusion
यह शोध पत्र PeTriPPI2 को पेश करता है, जो एक हाइब्रिड फ्रेमवर्क है जो प्रोटीन-प्रोटीन इंटरैक्शन की भविष्यवाणी करने के लिए ESM-2 अनुक्रम एम्बेडिंग को PeTriBERT संरचनात्मक निरूपणों के साथ जोड़ता है, जो Pinder डेटासेट पर उच्च सटीकता और परिशुद्धता प्राप्त करता है और एब्लेशन अध्ययनों के माध्यम से अनुक्रम और संरचनात्मक दोनों विशेषताओं के पूरक मूल्य को प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
सूक्ष्म स्तर पर जीवन निरंतर जुड़ाव की एक दुनिया है। प्रत्येक जीवित कोशिका के भीतर, प्रोटीन उन श्रमिकों, निर्माताओं और संदेशवाहकों के रूप में कार्य करते हैं जो जीवन की मशीनरी को चालू रखते हैं। ये अणु एकाकी आकृतियाँ नहीं हैं; वे शायद ही कभी अकेले काम करते हैं। इसके बजाय, उन्हें विशिष्ट साथियों को खोजना होता है और एक साथ जुड़कर ऐसी टीमें बनानी होती हैं जो रासायनिक प्रतिक्रियाओं को संचालित करती हैं, संकेत भेजती हैं, या कोशिकीय संरचनाओं का निर्माण करती हैं। दो प्रोटीनों के एक-दूसरे को खोजने और आपस में जुड़ने की इस प्रक्रिया को प्रोटीन-प्रोटीन इंटरेक्शन (protein-protein interaction) कहा जाता है। यह समझना कि कौन से प्रोटीन आपस में जुड़ते हैं और वे ऐसा कैसे करते हैं, वैज्ञानिकों के लिए अत्यंत महत्वपूर्ण है। यदि शोधकर्ता इन संबंधों का मानचित्रण कर सकें, तो वे यह पता लगा सकते हैं कि बीमारियाँ कैसे शुरू होती हैं, कुछ दवाएं क्यों काम करती हैं, और टूटी हुई जैविक प्रणालियों को ठीक करने के लिए नई दवाएं कैसे डिजाइन की जाएं।
लंबे समय तक, इन साझेदारियों का पता लगाना लापता टुकड़ों वाले पहेली को सुलझाने जैसा था। वैज्ञानिक प्रयोगशाला में प्रोटीनों के बीच होने वाली अंतःक्रियाओं को देख सकते थे, लेकिन यह प्रक्रिया धीमी, महंगी और अक्सर अधूरी थी। हाल के वर्षों में, कृत्रिम बुद्धिमत्ता (AI) ने मदद के लिए कदम बढ़ाया है, जो यह सीखने में सक्षम है कि प्रोटीन अपने त्रि-आयामी आकार में कैसे मुड़ते हैं। इस सफलता ने एक नया द्वार खोल दिया है: यदि हम एक प्रोटीन के आकार की भविष्यवाणी कर सकें, तो हम यह भी अनुमान लगा सकते हैं कि वह दूसरों के साथ कैसे अंतःक्रिया करेगा। हालाँकि, एक प्रोटीन का आकार केवल आधी कहानी है। उसका रासायनिक अनुक्रम (chemical sequence)—उसके निर्माण खंडों का विशिष्ट क्रम—भी महत्वपूर्ण सुराग रखता है। चुनौती एक ऐसा कंप्यूटर मॉडल बनाने की थी जो अनुक्रम और आकार दोनों को एक साथ पढ़ सके, और यह अनुमान लगाने के लिए उन्हें जोड़ सके कि क्या दो प्रोटीन आपस में क्रिया करेंगे।
फ्रांस के शोधकर्ताओं की एक टीम ने इस प्रयास में एक महत्वपूर्ण कदम उठाया है और PeTriPPI2 नामक एक नया उपकरण बनाया है। उनका कार्य मौजूदा कृत्रिम बुद्धिमत्ता मॉडलों को एक नई समस्या को हल करने के लिए पुन: उपयोग करने की एक चतुर रणनीति पर केंद्रित है। उन्होंने दो शक्तिशाली, पूर्व-प्रशिक्षित प्रणालियों से शुरुआत की। पहला एक ऐसा मॉडल है जिसने लाखों प्रोटीन अनुक्रमों को पढ़ा है, जिससे उसने जैविक भाषा को उसी तरह सीखा है जैसे कोई मनुष्य बोली जाने वाली भाषा सीखता है। दूसरा एक मॉडल है जिसे मूल रूप से सामान्य अपेक्षा के विपरीत कार्य करने के लिए डिज़ाइन किया गया था: आकार की भविष्यवाणी करने के बजाय, इसे उस अनुक्रम का अनुमान लगाने के लिए प्रशिक्षित किया गया था जो एक विशिष्ट आकार बनाता है। यह दूसरा मॉडल, जिसे PeTriBERT के रूप में जाना जाता है, इस बात को समझने में असाधारण रूप से कुशल है कि प्रोटीन के हिस्से त्रि-आयामी स्थान में एक साथ कैसे फिट होते हैं।
शोधकर्ताओं ने महसूस किया कि हालांकि PeTriBERT एक अलग कार्य के लिए बनाया गया था, लेकिन इसकी ज्यामितीय समझ (geometric understanding) अंतःक्रियाओं की भविष्यवाणी करने के लिए अविश्वसनीय रूप से उपयोगी हो सकती है। उन्होंने इस ज्यामितीय मॉडल को अनुक्रम-पढ़ने वाले मॉडल के साथ मिला दिया, जिससे एक हाइब्रिड सिस्टम तैयार हुआ। उनके सेटअप में, परीक्षण किए जाने वाले दो प्रोटीनों को दो तरीकों से सिस्टम में डाला जाता है। एक पथ अमीनो एसिड के कच्चे अनुक्रम को रासायनिक निर्देशों को पकड़ने के लिए भाषा मॉडल के माध्यम से भेजता है। दूसरा पथ प्रोटीनों की त्रि-आयामी संरचना को ज्यामितीय मॉडल के माध्यम से भेजता है। सिस्टम फिर यह देखता है कि सूचना के ये दो प्रवाह एक दूसरे के साथ कैसे संरेखित होते हैं। यह पूछता है कि क्या दो प्रोटीनों के रासायनिक निर्देश और भौतिक आकार एक स्थिर बंधन बनाने के लिए पर्याप्त अनुकूल हैं।
यह परीक्षण करने के लिए कि क्या यह दृष्टिकोण काम करता है, टीम ने अपने नए मॉडल को 1.6 मिलियन से अधिक प्रोटीन जोड़ों के विशाल डेटासेट पर प्रशिक्षित किया, जिनमें से आधे ज्ञात रूप से अंतःक्रिया करते थे और आधे नहीं करते थे। इसके बाद उन्होंने मॉडल को 2,342 प्रोटीन जोड़ों के एक अलग समूह पर परखा जिसे उसने पहले कभी नहीं देखा था। परिणाम मजबूत थे। मॉडल ने उच्च सटीकता के साथ अंतःक्रिया करने वाले जोड़ों की सही पहचान की, और 0.898 का स्कोर प्राप्त किया। इससे भी महत्वपूर्ण बात यह है कि जब इसने कहा कि दो प्रोटीन अंतःक्रिया करेंगे, तो यह 91.7 प्रतिशत बार सही था। इस उच्च स्तर की सटीकता का अर्थ है कि मॉडल गलत अलार्म देने से बचने में बहुत अच्छा है, जो उन शोधकर्ताओं के लिए एक महत्वपूर्ण विशेषता है जिन्हें प्रयोगशाला में आगे बढ़ने के लिए विश्वसनीय संकेतों की आवश्यकता होती है।
अध्ययन ने यह भी खुलासा किया कि मॉडल के हिस्सों को हटाने पर क्या होता है, इसका परीक्षण करके कि यह कैसे काम करता है। जब शोधकर्ताओं ने मॉडल को अनुक्रम की जानकारी देखने से रोका, तो अंतःक्रिया की भविष्यवाणी करने की इसकी क्षमता काफी कम हो गई। जब उन्होंने संरचनात्मक जानकारी को रोका, तो मॉडल की सटीकता गिरकर 0.523 और इसका F1 स्कोर 0.118 हो गया, जो केवल यादृच्छिक अनुमान (random guessing) से थोड़ा बेहतर प्रदर्शन कर रहा था। इसने पुष्टि की कि रासायनिक अनुक्रम और भौतिक आकार दोनों ही इस प्रणाली के कार्य करने के लिए आवश्यक हैं। मॉडल केवल पैटर्न को याद नहीं कर रहा है; यह निर्णय लेने के लिए डेटा के दोनों प्रकारों के संयोजन का वास्तव में उपयोग कर रहा है।
अन्य अग्रणी तरीकों की तुलना में, PeTriPPI2 ने एक विशिष्ट शक्ति दिखाई। यह एक समान हाइब्रिड मॉडल, जिसे SpatialPPIv2 कहा जाता है, की तुलना में अधिक सटीक था, जिसका अर्थ है कि इसने यह भविष्यवाणी करने में कम गलतियाँ कीं कि एक अंतःक्रिया होगी। हालाँकि, यह थोड़ा कम संवेदनशील था, यानी इसने कुल संभावित अंतःक्रियाओं को कम पकड़ा। यह सुझाव देता है कि PeTriPPI2 एक सख्त मानक के साथ काम करता है, और कोई निर्णय लेने से पहले सुनिश्चित होना पसंद करता है। वैज्ञानिकों के लिए, यह ट्रेड-ऑफ मूल्यवान हो सकता है। कई शोध परिदृश्यों में, गलत संकेतों वाली लंबी सूची के बजाय अत्यधिक विश्वसनीय उम्मीदवारों की छोटी सूची होना बेहतर होता है।
यह कार्य प्रदर्शित करता है कि एक विशिष्ट जैविक कार्य के लिए प्रशिक्षित कृत्रिम बुद्धिमत्ता मॉडलों को सफलतापूर्वक दूसरे कार्य के लिए अनुकूलित किया जा सकता है। प्रोटीन के आकार को रिवर्स-इंजीनियर करने के लिए डिज़ाइन किए गए मॉडल को अंतःक्रियाओं को पहचानने के लिए सिखाकर, शोधकर्ताओं ने दिखाया कि अंतर्निहित ज्यामितीय ज्ञान हस्तांतरणीय (transferable) है। जबकि मॉडल को काम करने के लिए प्रोटीन के आकार के अच्छे अनुमान की आवश्यकता होती है, इस दृष्टिकोण की सफलता यह सुझाव देती है कि प्रोटीन विज्ञान का भविष्य इन हाइब्रिड सिस्टम में निहित हो सकता है। वे प्रोटीन अनुक्रमों के विशाल ज्ञान को भौतिक ज्यामिति के सटीक तर्क के साथ जोड़ते हैं, जो आणविक दुनिया के जुड़ाव की एक अधिक पूर्ण तस्वीर पेश करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।