← नवीनतम पेपर
🧬 biology

ProtSyntax: a protein large language model for decoding post-translational modification syntax and function

ProtSyntax एक 4-बिलियन-पैरामीटर वाला प्रोटीन लार्ज लैंग्वेज मॉडल है जो अवशेष रसायन विज्ञान (residue chemistry), मोटिफ क्रम (motif order) और 3D संदर्भ को एकीकृत करके पोस्ट-ट्रांसलेशनल संशोधनों (PTMs) को स्वतंत्र लेबल के रूप में मानने की सीमाओं को दूर करता है, ताकि PTM साइटों की सटीक भविष्यवाणी की जा सके, क्रॉसटॉक को मॉडल किया जा सके और विविध जैविक अनुप्रयोगों में उनके कार्यात्मक परिणामों को डिकोड किया जा सके।

मूल लेखक: Yiyu Lin, Jiahui Wu, You Zhou, Xinye Ni, Shan Chang, Jun Ding, Yan Wang, Xin Gao, Sen Yang

प्रकाशित 2026-08-06
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yiyu Lin, Jiahui Wu, You Zhou, Xinye Ni, Shan Chang, Jun Ding, Yan Wang, Xin Gao, Sen Yang

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

अपने शरीर की कल्पना एक हलचल भरे शहर के रूप में करें जहाँ प्रोटीन कार्यकर्ता, मशीनें और इमारतें हैं जो सब कुछ सुचारू रूप से चलाने का काम करते हैं। लेकिन ये कार्यकर्ता स्थिर नहीं हैं; उन्हें लगातार छोटे रासायनिक नोट्स के साथ "टैग" किया जाता है जो उन्हें बताते हैं कि कब काम शुरू करना है, कहाँ जाना है, या कब ब्रेक लेना है। इन टैग्स को पोस्ट-ट्रांसलेशनल मॉडिफिकेशन (PTM) कहा जाता है। इन्हें प्रोटीन के बनने के बाद जोड़े जाने वाले स्टिकी नोट्स, हाइलाइटर, या यहाँ तक कि डिजिटल नोटिफिकेशन की तरह समझें। कभी-कभी, एक एकल प्रोटीन पर दर्जनों ऐसे टैग हो सकते हैं, जो एक जटिल, परिवर्तनशील कोड बनाते हैं जो आपकी प्रतिरक्षा प्रणाली से लेकर आपकी याददाश्त तक सब कुछ नियंत्रित करता है।

लंबे समय तक, वैज्ञानिकों ने यह अनुमान लगाने की कोशिश की है कि ये टैग कहाँ दिखाई देते हैं, लेकिन यह केवल एक समय में एक अक्षर देखकर एक गुप्त कोड का अनुमान लगाने जैसा था। सोचने का पुराना तरीका इन टैग्स को स्वतंत्र घटनाओं के रूप में मानता था, यह मानकर कि यदि किसी प्रोटीन का एक टैग के लिए सही "आकार" है, तो उसे एक टैग मिल जाएगा। लेकिन वास्तव में, इसके नियम एक भाषा की तरह बहुत अधिक मिलते-जुलते हैं। एक टैग तभी सार्थक होता है जब उसके आस-पास का "व्याकरण" (अमीनो एसिड का अनुक्रम), "पड़ोस" (प्रोटीन की 3D संरचना), और यहाँ तक कि अन्य पास के टैग भी सहमत हों। यदि व्याकरण गलत है या पड़ोस बहुत भीड़भाड़ वाला है, तो टैग चिपकेगा नहीं, चाहे वह प्रोटीन कितना भी इच्छुक क्यों न हो। इस "नियामक भाषा" (regulatory language) को समझना अत्यंत महत्वपूर्ण है क्योंकि जब व्याकरण टूट जाता है, तो यह कैंसर या अल्जाइमर जैसी बीमारियों का कारण बन सकता है।

यहाँ ProtSyntax का प्रवेश होता है, जो इस जटिल भाषा को डिकोड करने के लिए डिज़ाइन किया गया एक नया 4-बिलियन-पैरामीटर वाला "प्रोटीन मस्तिष्क" है। केवल यह पहचानने के बजाय कि एक टैग कहाँ जा सकता है, ProtSyntax खेल के नियमों को सीखता है। यह केवल टाइपो (लिखने की त्रुटियों) को खोजने वाले स्पेल-चेकर से अपग्रेड होकर एक साहित्यिक आलोचक बनने जैसा है जो कथानक, पात्र की प्रेरणा और वाक्य संरचना को समझता है। शोधकर्ताओं ने इस मॉडल को 4 मिलियन प्रोटीन उदाहरणों के विशाल पुस्तकालय पर प्रशिक्षित किया, जिससे इसे न केवल टैगों को पहचानना सिखाया गया, बल्कि यह भी सिखाया गया कि वे कैसे परस्पर क्रिया करते हैं, वे प्रोटीन के काम को कैसे बदलते हैं, और वे विभिन्न 3D वातावरणों में कैसे व्यवहार करते हैं।

परिणाम प्रभावशाली हैं। 40 अलग-अलग प्रकार के प्रोटीन टैग्स पर किए गए परीक्षणों में, ProtSyntax ने मौजूदा सर्वश्रेष्ठ मॉडलों को एक बड़े अंतर से पीछे छोड़ दिया, कुछ क्षेत्रों में सटीकता में 12% से अधिक सुधार किया। लेकिन असली जादू उस ज्ञान के साथ यह कर सकता है जो इसके पास है। यह मॉडल संदर्भ को देखते हुए गायब टैग या साइटों का अनुमान लगाकर "रिक्त स्थान भरें" (fill-in-the-blank) जैसे खेल खेल सकता है, ठीक वैसे ही जैसे कोई इंसान वाक्य पूरा करता है। यह यहाँ तक बता सकता है कि एक प्रोटीन जो ऐसा दिखता है कि उसमें एक टैग होना चाहिए, लेकिन वास्तव में वह एक ऐसी 3D आकृति में है जो उसे रोक देती है, और एक ऐसा प्रोटीन जो वास्तव में तैयार है।

शायद सबसे रोमांचक बात यह है कि ProtSyntax यह सुझाव देता है कि वह इन टैग्स और प्रोटीन के कार्य के बीच कारण-और-प्रभाव (cause-and-effect) के संबंध को समझता है। जब शोधकर्ताओं ने एक टैग को बदलने का अनुकरण (simulate) किया, तो मॉडल यह अनुमान लगाने में सक्षम था कि यह प्रोटीन की गति या दक्षता को कैसे बदल देगा, जिससे वह सूक्ष्म रासायनिक परिवर्तन को प्रोटीन के बड़े-स्तर के कार्य से जोड़ सका। इसने टैग्स के बीच के "क्रॉसटॉक" (crosstalk) को भी सफलतापूर्वक पुनर्निर्मित किया—यह पता लगाया कि कब एक टैग दूसरे को चिपकने में मदद करता है, या कब वह उसे दूर धकेलता है। बीमारी से संबंधित उत्परिवर्तन (mutations) वाले सिमुलेशन में, मॉडल ने सफलतापूर्वक पहचान की कि किन परिवर्तनों से प्रोटीन का नियामक कोड टूट जाएगा, जिससे पुराने तरीकों द्वारा छोड़े गए खतरनाक उत्परिवर्तनों को पहचानने का एक नया तरीका मिला। हालाँकि ये निष्कर्ष वर्तमान में कंप्यूटर सिमुलेशन और बेंचमार्क पर आधारित हैं, फिर भी वे संकेत देते हैं कि हम अंततः यह समझने की दिशा में बढ़ रहे हैं कि हमारे प्रोटीन कैसे काम करते हैं, न कि केवल उनकी सुर्खियों को पढ़ रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →