mRNA Design and Optimization with Deep Knowledge-Infused Approach
यह शोध पत्र RNop को प्रस्तुत करता है, जो एक ज्ञान-निर्मित (knowledge-infused) ट्रांसफार्मर मॉडल है जो तंत्र-संरेखित नुकसानों (mechanism-aligned losses) को एकीकृत करके mRNA अनुकूलन के "असंभव त्रिकोण" (impossible triangle) को हल करता है ताकि पूर्ण अनुक्रम निष्ठा (absolute sequence fidelity), काफी बेहतर जैविक मेट्रिक्स और उच्च थ्रूपुट प्राप्त किया जा सके, जिससे mRNA डिजाइन एक ब्लैक-बॉक्स प्रक्रिया से बदलकर एक पूर्वानुमानित और व्याख्या योग्य इंजीनियरिंग समस्या बन जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
मैसेंजर आरएनए (mRNA), या mRNA, कोशिका की निर्देश पुस्तिका है। यह डीएनए से प्रोटीन बनाने वाली फैक्ट्रियों तक आनुवंशिक ब्लूप्रिंट ले जाता है, जो कोशिका को ठीक से बताता है कि कौन से प्रोटीन बनाने हैं और कितनी मात्रा में। दशकों से, वैज्ञानिक चिकित्सा उपयोग के लिए इन निर्देशों को फिर से लिखने के लिए संघर्ष कर रहे हैं। जब शोधकर्ता वैक्सीन या उपचार बनाने के लिए mRNA को डिजाइन करते हैं, तो उन्हें एक कठिन संतुलन बनाए रखना पड़ता है। उन्हें अनुक्रम (sequence) को इस तरह से बदलना होता है ताकि कोशिका अधिक प्रोटीन बना सके, लेकिन वे वास्तव में बनने वाले प्रोटीन को नहीं बदल सकते, अन्यथा उपचार विफल हो जाएगा। उन्हें यह काम इतनी तेज़ी से भी करना होता है कि वे एक साथ हज़ारों अनुक्रमों को डिज़ाइन कर सकें। अब तक, मौजूदा उपकरण वैज्ञानिकों को इन लक्ष्यों में से किसी एक को चुनने के लिए मजबूर करते थे: वे या तो यह सुनिश्चित कर सकते थे कि प्रोटीन सही रहे, या वे गति और मात्रा के लिए अनुकूलन (optimize) कर सकते थे, लेकिन शायद ही कभी दोनों कर पाते थे।
शोधकर्ताओं के एक दल ने अब एक नया दृष्टिकोण विकसित किया है जो इस गतिरोध को तोड़ता है। केवल पैटर्न का अनुमान लगाने के बजाय एक कंप्यूटर मॉडल को विशिष्ट जैविक नियमों का पालन करना सिखाकर, उन्होंने एक ऐसी प्रणाली बनाई है जो पूर्ण सटीकता, उच्च गति और बेहतर प्रोटीन उत्पादन के साथ mRNA अनुक्रमों को अनुकूलित कर सकती है। यह विधि, जिसे RNop कहा जाता है, डिजाइन प्रक्रिया को एक रहस्यमय अनुमान लगाने वाले खेल के रूप में नहीं, बल्कि एक नियंत्रित इंजीनियरिंग कार्य के रूप में देखती है जहाँ प्रत्येक परिवर्तन ज्ञात जैविक सिद्धांतों द्वारा निर्देशित होता है। इसका परिणाम यह है कि यह एक ऐसा उपकरण है जो ऐसे mRNA अनुक्रम उत्पन्न कर सकता है जो पिछले तरीकों की तुलना में काफी अधिक प्रभावी हैं, जबकि यह गारंटी भी देता है कि अंतिम प्रोटीन बिल्कुल वैसा ही रहे जैसा इरादा था।
mRNA डिजाइन में मुख्य चुनौती को अक्सर एक 'असंभव त्रिकोण' के रूप में वर्णित किया जाता है। इसके एक कोने पर 'फिडेलिटी' (fidelity) है, यानी यह आवश्यकता कि नया अनुक्रम मूल के समान ही सटीक प्रोटीन बनाए। दूसरे कोने पर एक साथ कई जैविक लक्ष्यों को अनुकूलित करने की क्षमता है, जैसे कि mRNA को अधिक स्थिर बनाना या कोशिका के लिए इसे पढ़ना आसान बनाना। तीसरे कोने पर 'गति' है, यानी बड़ी संख्या में अनुक्रमों को तेज़ी से प्रोसेस करने की आवश्यकता। पारंपरिक कंप्यूटर एल्गोरिदम यह सुनिश्चित कर सकते थे कि प्रोटीन सही हो, लेकिन वे बड़े पैमाने पर उपयोग के लिए बहुत धीमे थे। नए आर्टिफिशियल इंटेलिजेंस मॉडल तेज़ थे और कई लक्ष्यों के लिए अनुकूलन कर सकते थे, लेकिन वे अक्सर छोटी, अनचाही गलतियाँ कर देते थे जिससे प्रोटीन बदल जाता था, जिससे डिजाइन बेकार हो जाता था। ये मॉडल एक "ब्लैक बॉक्स" की तरह काम करते थे, जो अंतर्निहित नियमों को समझे बिना डेटा के विशाल भंडार से सीखते थे, जिससे उनकी गलतियों को नियंत्रित करना या उनके द्वारा किए गए निर्णयों को समझाना असंभव हो जाता था।
शोधकर्ताओं ने इसे मॉडल को प्रशिक्षित करने के दौरान दंड (penalties) और पुरस्कारों (rewards) की एक प्रणाली के माध्यम से स्पष्ट रूप से जैविक नियम सिखाकर हल किया। उन्होंने एक ऐसा मॉडल बनाया जो जेनेटिक कोड और परिणामी प्रोटीन के बीच के संबंध को समझता है। यदि मॉडल ऐसा बदलाव सुझाता है जो प्रोटीन को बदल देगा, तो सिस्टम तुरंत उस सुझाव को दंडित करता है, जिससे मॉडल को एक अलग रास्ता खोजने के लिए मजबूर किया जाता है जो प्रोटीन को समान रखता है। यह सुनिश्चित करता है कि अंतिम आउटपुट हमेशा मूल प्रोटीन अनुक्रम के प्रति वफादार रहे। साथ ही, मॉडल को अन्य लाभकारी बदलाव करने के लिए पुरस्कृत किया जाता है, जैसे कि ऐसे जेनेटिक कोड चुनना जिन्हें कोशिका की मशीनरी पसंद करती है या अनुक्रम को अधिक स्थिर बनाने के लिए व्यवस्थित करना।
इस दृष्टिकोण ने टीम को छह मिलियन से अधिक जेनेटिक अनुक्रमों पर एक सिस्टम को प्रशिक्षित करने की अनुमति दी। कंप्यूटर सिमुलेशन में परीक्षण करने पर, नए मॉडल ने लगातार ऐसे अनुक्रमों का उत्पादन किया जो मूल प्रोटीनों के सटीक मिलान थे, जिनमें शून्य त्रुटियां थीं। साथ ही, इन अनुकूलित अनुक्रमों ने उन जैविक मेट्रिक्स में महत्वपूर्ण सुधार दिखाया जो यह भविष्यवाणी करते हैं कि कोशिका उन्हें कितनी अच्छी तरह पढ़ेगी। मॉडल विभिन्न लंबाई के अनुक्रमों को संभालने और बैक्टीरिया से लेकर मनुष्यों तक विभिन्न प्रजातियों में काम करने में सक्षम था, जिससे सिद्ध हुआ कि उसने केवल विशिष्ट उदाहरणों को याद करने के बजाय जीव विज्ञान के सामान्य नियमों को सीख लिया है। पुराने तरीकों के विपरीत जो लंबे अनुक्रमों के साथ संघर्ष करते थे या एक अकेले डिजाइन को प्रोसेस करने में घंटों लेते थे, यह नई प्रणाली प्रति सेकंड दर्जनों अनुकूलित अनुक्रम उत्पन्न कर सकती थी, जो इसे उच्च-थ्रूपुट औद्योगिक अनुप्रयोगों के लिए उपयुक्त बनाती है।
वास्तविक दुनिया में इन निष्कर्षों की पुष्टि करने के लिए, शोधकर्ताओं ने जीवित कोशिकाओं में अनुकूलित अनुक्रमों का परीक्षण किया। उन्होंने लैब डिश में मानव कोशिकाओं का उपयोग यह देखने के लिए किया कि नए निर्देशों से कितना प्रोटीन उत्पादित होता है। परिणाम चौंकाने वाले थे। नए सिस्टम द्वारा डिजाइन किए गए अनुक्रमों ने उन अनुक्रमों की तुलना में 2.28 गुना अधिक प्रोटीन का उत्पादन किया जो पहले से ही व्यावसायिक मानकों द्वारा अत्यधिक अनुकूलित माने जाते थे। एक विशिष्ट परीक्षण में, एक प्रतिस्पर्धी की विधि पूरी तरह से विफल रही, क्योंकि उसने संदेश की संरचना को बहुत अधिक बदल दिया था जिससे लगभग कोई प्रोटीन नहीं बना। नए सिस्टम ने सभी आवश्यक कारकों को संतुलित करके इस विफलता से बचने में सफलता प्राप्त की, यह सुनिश्चित करते हुए कि संदेश पठनीय और स्थिर बना रहे। इसने प्रदर्शित किया कि कंप्यूटर की भविष्यवाणियां सीधे वास्तविक जैविक सफलता में परिवर्तित होती हैं।
इस प्रणाली की शक्ति इसकी पारदर्शिता में निहित है। क्योंकि नियम मॉडल में निर्मित हैं, वैज्ञानिक विभिन्न लक्ष्यों के महत्व को समायोजित कर सकते हैं। यदि वे प्रोटीन को अपरिवत रखने के बारे में अत्यंत सख्त होना चाहते हैं, तो वे नियमों को कड़ा कर सकते हैं। यदि वे नई संभावनाओं को तलाशने के लिए थोड़ी अधिक लचीलापन देना चाहते हैं, तो वे उन्हें ढीला कर सकते हैं। यह नियंत्रण डिजाइन प्रक्रिया को एक रहस्यमय 'ट्रायल-एंड-एरर' अभ्यास से एक अनुमानित इंजीनियरिंग अनुशासन में बदल देता है। शोधकर्ताओं ने दिखाया कि मॉडल में स्पष्ट, व्याख्या योग्य ज्ञान भरने से, वे उन परिणामों को प्राप्त कर सकते थे जो पहले परस्पर अनन्य (mutually exclusive) माने जाते थे।
यह कार्य इस दिशा में एक बदलाव है कि वैज्ञानिक जैविक डिजाइन के प्रति कैसे दृष्टिकोण रखते हैं। यह आर्टिफिशियल इंटेलिजेंस का उपयोग प्रकृति में अंधाधुंध पैटर्न खोजने के बजाय, ज्ञात वैज्ञानिक सिद्धांतों को कठोरता से लागू करने के लिए करने की ओर बढ़ता है। यह प्रणाली लचीली होने के लिए डिज़ाइन की गई है, जिसका अर्थ है कि जैसे-जैसे वैज्ञानिक नए जैविक नियम खोजते हैं, वे पूरे सिस्टम को फिर से बनाए बिना उन्हें मॉडल में जोड़ सकते हैं। यह नए टीकों से लेकर औद्योगिक प्रोटीन उत्पादन तक, अनुप्रयोगों की एक विस्तृत श्रृंखला के लिए mRNA डिजाइन करने का द्वार खोलता है, जिसमें गति और विश्वसनीयता का वह स्तर है जो पहले संभव नहीं था। फिडेलिटी, अनुकूलन और गति के 'असंभव त्रिकोण' को हल करके, शोधकर्ताओं ने एक नया उपकरण प्रदान किया है जो जीवन के निर्देशों की इंजीनियरिंग को अधिक सटीक और अधिक शक्तिशाली बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।