RNASeek: A Cross-Phyla Generative Foundation Model for Multipurpose RNA Modeling and Reinforcement Learning-Based Design
RNASeek एक 1..6-बिलियन-पैरामीटर वाला जनरेटिव फाउंडेशन मॉडल है जो RNA अनुक्रम प्रतिनिधित्व, कार्यात्मक भविष्यवाणी और डी नोवो डिज़ाइन को एकीकृत करने के लिए सुदृढीकरण लर्निंग (reinforcement learning) का लाभ उठाता है, और उन्नत प्रदर्शन के साथ प्रयोगात्मक रूप से प्रमाणित राइबोजाइम और 3' UTRs को सफलतापूर्वक उत्पन्न करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
प्रत्येक जीवित कोशिका के भीतर, एक विशाल और जटिल संवाद होता है, जो शब्दों के साथ नहीं, बल्कि अणुओं के साथ होता है। इस संवाद के केंद्र में आरएनए (RNA) है, जो एक बहुमुखी अणु है जो एक संदेशवाहक और एक नियामक दोनों के रूप में कार्य करता है, आनुवंशिक ब्लूप्रिंट से निर्देश लेकर आता है और यह तय करता है कि उन निर्देशों को कैसे निष्पादित किया जाए। दशकों से, वैज्ञानिक यह समझते आए हैं कि आरएनए स्ट्रैंड में अक्षरों का विशिष्ट क्रम उसके आकार और कार्य को निर्धारित करता है, ठीक वैसे ही जैसे एक वाक्य में अक्षरों की व्यवस्था उसके अर्थ को निर्धारित करती है। हालाँकि, यह सटीक भविष्यवाणी करना कि अक्षरों का एक नया क्रम कैसा व्यवहार करेगा, एक कठिन चुनौती रही है। नियम जटिल हैं, जिनमें लंबी दूरी की अंतःक्रियाएं और सूक्ष्म संरचनात्मक बारीकियां शामिल हैं जिन्हें हाथ से मैप करना कठिन है। अब, शोधकर्ताओं ने एक नया उपकरण विकसित किया है जो जीवन के जैविक साहित्य को पढ़कर इन नियमों को सीखता है, जिससे वे न केवल यह भविष्यवाणी कर सकते हैं कि आरएनए कैसे व्यवहार करेगा, बल्कि विशिष्ट, वांछित गुणों वाले पूरी तरह से नए अणुओं को भी डिजाइन कर सकते हैं।
इस कार्य के पीछे की टीम ने, जिसका नेतृत्व कैलिफोर्निया विश्वविद्यालय, रिवरसाइड और कोलंबिया विश्वविद्यालय के शोधकर्ताओं ने किया, एक विशाल कंप्यूटर प्रोग्राम बनाया जिसे वे 'आरएनएसीक' (RNASeek) कहते हैं। इस प्रोग्राम को एक ऐसे छात्र के रूप में सोचें जिसने पौधों और जानवरों से लेकर कवक और वायरस तक, सौ से अधिक विभिन्न प्रजातियों के आनुवंशिक निर्देशों वाली लाइब्रेरी की हर किताब को पढ़ा है। पिछले उपकरणों के विपरीत, जिन्हें केवल एक विशिष्ट पहेली को हल करने के लिए डिज़ाइन किया गया था, आरएनएसीक को आरएनए की सामान्य भाषा को समझने के लिए बनाया गया था। इसे लगभग 150 बिलियन आनुवंशिक सूचनाओं के डेटासेट पर प्रशिक्षित किया गया था, जिससे इसने यह पहचानना सीखा कि विभिन्न जीव अपने आरएनए का निर्माण कैसे करते हैं। इस प्रोग्राम ने प्राकृतिक भाषा के निर्देशों को पढ़ना भी सीखा, जिसका अर्थ है कि एक वैज्ञानिक बस इसे बता सकता है कि वे क्या चाहते हैं, जैसे कि "एक स्थिर आरएनए अनुक्रम बनाएं" या "एक ऐसा अणु डिजाइन करें जो खुद को काट सके," और मॉडल समाधान उत्पन्न करने का प्रयास करेगा।
यह परीक्षण करने के लिए कि क्या इस डिजिटल छात्र ने वास्तव में भाषा सीखी है, शोधकर्ताओं ने सबसे पहले इसे राइबोजाइम (ribozymes) के व्यवहार की भविष्यवाणी करने के लिए कहा। ये आरएनए अणु हैं जो एंजाइम के रूप में कार्य करते हैं, जो स्वयं को या अन्य अणुओं को काटने में सक्षम होते हैं। टीम ने मॉडल को हजारों ज्ञात राइबोजाइम अनुक्रम और उनकी मापी गई कटने की गति प्रदान की। आरएनएसीक ने सफलतापूर्वक यह भविष्यवाणी करना सीख लिया कि कौन से अनुक्रम तेजी से काटेंगे और कौन से धीरे, जिससे उन सूक्ष्म विशेषताओं की पहचान हुई जो गति में योगदान देती हैं, जैसे कि अणु की संरचना में कुछ लूप्स का लचीलापन। मॉडल ने उन कई विशिष्ट उपकरणों के समान या उनसे बेहतर प्रदर्शन किया जो विशेष रूप से इस कार्य के लिए डिज़ाइन किए गए थे, जिससे यह सिद्ध हुआ कि इसने उन अंतर्निहित सिद्धांतों को समझ लिया है कि कैसे आरएनए की संरचना कार्य को निर्धारित करती है।
इस सफलता से उत्साहित होकर, शोधकर्ताओं ने मॉडल को और आगे बढ़ाया, और इसे शून्य से नए आरएनए अनुक्रम डिजाइन करने के लिए कहा। उन्होंने 3' अनट्रांसलेटेड रीजन (3' untranslated region) में पाए जाने वाले एक अलग प्रकार के आरएनए पर ध्यान केंद्रित किया, जो अणु का एक ऐसा हिस्सा है जो यह निर्धारित करने में मदद करता है कि कोशिका के भीतर आरएनए कितने समय तक जीवित रहता है। लंबे जीवन का अर्थ है कि कोशिका उस प्रोटीन का अधिक उत्पादन करती है जिसके लिए आरएनए कोड करता है, जो एमआरएनए (mRNA) टीकों जैसी चिकित्सा के लिए अत्यंत महत्वपूर्ण है। शोधकर्ताओं ने 'रीइन्फोर्समेंट लर्निंग' (reinforcement learning) नामक एक तकनीक का उपयोग किया, जो एक ऐसी विधि है जहाँ कंप्यूटर प्रोग्राम प्रयास और त्रुटि (trial and error) का खेल खेलता है। इसने हजारों संभावित अनुक्रम उत्पन्न किए, और मॉडल का एक अलग हिस्सा एक न्यायाधीश के रूप में कार्य करता था, जो उन्हें उनके अनुमानित स्थायित्व के आधार पर स्कोर देता था। फिर प्रोग्राम ने बेहतर उम्मीदवार उत्पन्न करने के लिए अपनी रणनीति को समायोजित किया, जिससे वह धीरे-धीरे अत्यधिक स्थिर अनुक्रमों को उत्पन्न करना सीख गया।
परिणाम आश्चर्यजनक थे। आरएनएसीक द्वारा डिजाइन किए गए अनुक्रम केवल अक्षरों के यादृच्छिक संयोजन नहीं थे; उनमें विशिष्ट पैटर्न थे, जैसे कि एडेनिन और यूरासिल की प्रचुरता, जो आरएनए को स्थिर करने में मदद करने के लिए जाने जाते हैं। जब शोधकर्ताओं ने प्रयोगशाला सेटिंग में इन कंप्यूटर-जनित डिजाइनों का परीक्षण किया, तो उन्होंने पाया कि नए अनुक्रम असाधारण रूप से अच्छा प्रदर्शन करते हैं। डिजाइन किए गए कुछ अणु प्रकृति में पाए जाने वाले सर्वश्रेष्ठ अनुक्रमों या अन्य कृत्रिम बुद्धिमत्ता उपकरणों द्वारा बनाए गए अनुक्रमों की तुलना में भी अधिक स्थिर थे। महत्वपूर्ण रूप से, जब शोधकर्ताओं ने इन सफल डिजाइनों के अक्षरों को आपस में बदल दिया, यानी उनके समान घटकों को रखते हुए उनके क्रम को अस्त-व्यस्त कर दिया, तो स्थिरता समाप्त हो गई। इसने पुष्टि की कि सफलता केवल रासायनिक संरचना से नहीं, बल्कि अक्षरों की विशिष्ट व्यवस्था से आई थी, जिससे सिद्ध हुआ कि मॉडल ने भाषा के वास्तविक व्याकरण (syntax) को सीख लिया था।
अध्ययन ने यह भी प्रदर्शित किया कि मॉडल जटिल निर्देशों का पालन कर सकता है। वैज्ञानिक प्रोग्राम को क्लोनिंग के लिए एक विशिष्ट मोटिफ (motif) को शामिल करने वाला एक स्थिर आरएनए अनुक्रम बनाने या किसी ऐसे पैटर्न को बाहर करने के लिए कह सकते हैं जो समस्या पैदा कर सकता है। मॉडल ने स्थिरता के लिए अनुकूलन करते हुए इन बाधाओं का सफलतापूर्वक पालन किया। प्राकृतिक भाषा के आदेशों का पालन करने और कार्यात्मक जैविक भागों को उत्पन्न करने की यह क्षमता जीवन को इंजीनियर करने के एक नए तरीके का सुझाव देती है। प्रयोगशाला में धीमी, महंगी 'प्रयास और त्रुटि' की प्रक्रियाओं पर निर्भर रहने के बजाय, वैज्ञानिक अब एक एकीकृत प्रणाली का उपयोग कर सकते हैं जो यह भविष्यवाणी करती है कि आरएनए कैसे व्यवहार करेगा और सटीक आवश्यकताओं को पूरा करने के लिए नए अणुओं को डिजाइन करती है। यह कार्य स्थापित करता है कि एक एकल, बड़े पैमाने का मॉडल जैविक डेटा को समझने और नए, कार्यात्मक जैविक उपकरण बनाने के बीच के अंतर को पाट सकता है, जो चिकित्सा और अनुसंधान उपकरणों के अधिक कुशल डिजाइन के द्वार खोलता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।