← नवीनतम पेपर
📄 molecular biology

An RNA Language Model trained on sequence alone reveals the structural logic of Internal Ribosome Entry Sites

लेखक Albatross को प्रस्तुत करते हैं, जो केवल अनुक्रम डेटा (sequence data) पर प्रशिक्षित एक RNA भाषा मॉडल है, जो इंटरनल राइबोसोमल एंट्री साइट (Internal Ribosome Entry Site) संरचनाओं की भविष्यवाणी करने में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है, जिससे नवीन कार्यात्मक उप-वर्गों की खोज सक्षम होती है और एंटीवायरल लक्ष्य पहचान में तेजी आती है।

मूल लेखक: Sychla, A., Bongrand, P., Yang, G., Iyer, A., Rulison, J., Wesselhoeft, R. A., Bisaria, N., Rouskin, S.

प्रकाशित 2026-09-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sychla, A., Bongrand, P., Yang, G., Iyer, A., Rulison, J., Wesselhoeft, R. A., Bisaria, N., Rouskin, S.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

वायरस छलावरण के उस्ताद हैं, लेकिन उनके सबसे महत्वपूर्ण रहस्य अक्सर उनके आनुवंशिक कोड के भीतर ही छिपे होते हैं। कई वायरसों के लिए, जिनमें पिकोर्नावायरस (picornaviruses) भी शामिल हैं जो सामान्य सर्दी से लेकर विनाशकारी तंत्रिका संबंधी रोगों तक का कारण बनते हैं, नए वायरल कणों को बनाने के निर्देश केवल अक्षरों की एक साधारण सूची नहीं हैं। वे जटिल त्रि-आयामी आकृतियों में मुड़े हुए होते हैं। ये आकृतियाँ स्विच और हैंडल के रूप में कार्य करती हैं, जिससे वायरस कोशिका की प्रोटीन बनाने वाली मशीनरी का अपहरण करने में सक्षम होता है। इनमें से एक सबसे महत्वपूर्ण आकृति को 'इंटरनल राइबोसोम एंट्री साइट' (Internal Ribosome Entry Site) या IRES कहा जाता है। मानव कोशिकाओं के विपरीत, जिन्हें अपने आनुवंशिक निर्देशों को पढ़ना शुरू करने के लिए शुरुआत में एक विशिष्ट 'कैप' की आवश्यकता होती है, ये वायरल IRES एक सीधे निमंत्रण की तरह कार्य करते हैं, जिससे वायरस तुरंत और स्वतंत्र रूप से प्रोटीन बनाना शुरू कर सकता है। यह समझना कि ये IRES वास्तव में कैसे मुड़ते हैं, यह जानने के लिए अत्यंत महत्वपूर्ण है कि कुछ वायरस विशिष्ट ऊतकों को क्यों संक्रमित करते हैं, कुछ वायरस गंभीर बीमारी का कारण क्यों बनते हैं जबकि अन्य नहीं, और हम उन्हें रोकने के लिए दवाएं कैसे डिजाइन कर सकते हैं। हालाँकि, इन संरचनाओं का मानचित्रण करना अत्यंत कठिन है। वे लंबे, अत्यधिक परिवर्तनशील हैं, और वातावरण के आधार पर अपना आकार बदल लेते हैं, जिससे पारंपरिक पूर्वानुमान विधियाँ धीमी और अक्सर गलत साबित होती हैं।

शोधकर्ताओं की एक टीम ने अब इन छिपी हुई आकृतियों को देखने का एक नया तरीका विकसित किया है, जो महंगे और समय लेने वाले प्रयोगों की आवश्यकता को समाप्त करता है। उन्होंने एक कृत्रिम बुद्धिमत्ता प्रणाली बनाई, जिसे उन्होंने 'अलबट्रॉस' (Albatross) नाम दिया, जिसे विशेष रूप से हजारों इन वायरल तत्वों के कच्चे आनुवंशिक अनुक्रमों (genetic sequences) पर प्रशिक्षित किया गया था। इस प्रणाली को यह जानकारी नहीं दी गई थी कि RNA कैसे मुड़ता है, रसायन विज्ञान के नियम क्या हैं, या स्थिरता के भौतिकी क्या हैं। इसे बस लाखों अनुक्रम दिए गए और उनके भीतर के पैटर्न को सीखने के लिए कहा गया। उल्लेखनीय रूप से, मॉडल ने इन वायरल तत्वों की त्रि-आयामी संरचना की उच्च सटीकता के साथ भविष्यवाणी करना सीख लिया, जो केवल अनुक्रम के अक्षरों के बीच सांख्यिकीय संबंधों को पहचानने पर आधारित था। जब शोधकर्ताओं ने अलबट्रॉस का परीक्षण 96 विभिन्न पूर्ण-लंबाई वाले वायरल IRES के पुस्तकालय के विरुद्ध किया, तो मॉडल की भविष्यवाणियाँ मौजूदा सर्वोत्तम विधियों की तुलना में कहीं अधिक सटीक थीं। जहाँ अन्य उपकरण वास्तविक संरचनात्मक संबंधों में से आधे से भी कम को सही ढंग से पहचान पाए, वहीं अलबट्रॉस 80 प्रतिशत बार सही रहा।

इस दृष्टिकोण की शक्ति उस चीज़ में निहित है जो मॉडल ने वास्तव में सीखा। इसने केवल आकृतियों को याद नहीं किया; इसने वायरस के तर्क को सीखा। यह विश्लेषण करके कि अनुक्रम के एक हिस्से में बदलाव दूसरे हिस्से की भविष्यवाणी को कैसे प्रभावित करता है, मॉडल ने पहचान लिया कि कार्य करने के लिए RNA के कौन से हिस्से एक-दूसरे के करीब होने चाहिए। इसने शोधकर्ताओं को उन आकृतियों के बीच अंतर करने में सक्षम बनाया जो केवल स्थिर हैं और वे जो वायरस के कार्य करने के लिए आवश्यक हैं। वास्तव में, मॉडल कार्यात्मक संरचनाओं को पहचानने में इतना कुशल था कि वह भविष्यवाणी कर सका कि RNA के कौन से हिस्से संक्रमण प्रक्रिया शुरू करने में सबसे अधिक शामिल होने की संभावना रखते हैं। इस क्षमता ने टीम को 75,000 से अधिक अनुमानित संरचनाओं का एक विशाल एटलस बनाने में सक्षम बनाया, जो उन वायरसों की एक विस्तृत विविधता को कवर करता है जिनका पहले इतने विस्तार से अध्ययन नहीं किया गया था।

इस नए मानचित्र का उपयोग करते हुए, शोधकर्ताओं ने कुछ पूरी तरह से नया खोजा। उन्होंने वायरल संरचनाओं के एक पहले से अज्ञात उप-समूह की खोज की जिसमें एक विस्तारित स्टेम (extended stem) शामिल था, जो एक विशिष्ट फोल्डिंग पैटर्न था जो इस वर्ग के वायरसों में पहले कभी नहीं देखा गया था। उन्होंने प्रयोगशाला में इस खोज का परीक्षण किया, और पुष्टि की कि विस्तारित स्टेम वास्तविक था और इसने वायरस की कार्य करने की क्षमता में महत्वपूर्ण भूमिका निभाई। यह खोज बताती है कि मॉडल उन जैविक सत्यों को उजागर कर सकता है जो पहले वैज्ञानिकों के लिए अदृदृश्य थे। इसके अलावा, टीम ने दिखाया कि यह विधि केवल एक प्रकार के वायरस तक सीमित नहीं है। जब उन्होंने हंतावायरस (hantaviruses) और बैक्टीरियल सेंसर के आनुवंशिक पदार्थ पर समान प्रशिक्षण रणनीति लागू की, तो मॉडल ने जटिल, लंबी दूरी की अंतःक्रियाओं और यहाँ तक कि एक एकल RNA अणु की अपने वातावरण के आधार पर दो अलग-अलग आकृतियों के बीच स्विच करने की क्षमता को सफलतापूर्वक पहचाना।

इस कार्य के निहितार्थ केवल वायरसों के मानचित्रण से कहीं आगे तक विस्तृत हैं। दशकों से, वैज्ञानिक RNA की संरचना की भविष्यवाणी करने के लिए संघर्ष कर रहे हैं क्योंकि ये अणु बहुत लचीले होते हैं और इनके नियम बहुत जटिल होते हैं। पारंपरिक विधियाँ अक्सर हर संभावित आकार की ऊर्जा की गणना करने पर निर्भर करती हैं, जो लंबी अनुक्रमों के लिए असंभव हो जाता है। अन्य विधियों के लिए कई समान वायरसों की तुलना करना आवश्यक होता है ताकि पैटर्न खोजे जा सकें, जो तब विफल हो जाता है जब वायरस बहुत भिन्न होते हैं। अलब्रॉस सीधे अनुक्रम डेटा से सीखकर इन समस्याओं से बच निकलता है। शोधकर्ताओं ने पाया कि जैसे-जैसे उन्होंने प्रशिक्षण डेटा और मॉडल के आकार को बढ़ाया, मॉडल की सटीकता में सुधार हुआ, जो यह सुझाव देता है कि यह दृष्टिकोण अधिक डेटा के साथ और बेहतर हो सकता है।

यह अध्ययन RNA जीव विज्ञान के प्रति हमारे दृष्टिकोण में एक महत्वपूर्ण बदलाव का प्रतिनिधित्व करता है। इन अणुओं को भौतिकी समीकरणों के साथ हल किए जाने वाले स्थिर पहेलियों के रूप में मानने के बजाय, शोधकर्ताओं ने उन्हें एक भाषा के रूप में माना जिसे सीखा जाना है। परिणाम दर्शाते हैं कि एक वायरस का विकासवादी इतिहास उसके अनुक्रम में इस तरह से अंकित होता है जिसे एक कृत्रिम बुद्धिमत्ता डिकोड कर सकती है। इन वायरल तत्वों के संरचनात्मक तर्क को प्रकट करके, यह कार्य यह समझने के लिए एक शक्तिशाली नया उपकरण प्रदान करता है कि वायरस कैसे संचालित होते हैं और उन्हें कैसे रोका जा सकता है। इन संरचनाओं की बड़े पैमाने पर भविष्यवाणी करने की क्षमता का अर्थ है कि वैज्ञानिक अब हजारों वायरल अनुक्रमों की कार्यात्मक क्षमता का अन्वेषण कर सकते हैं जो पहले अध्ययन करने के लिए बहुत कठिन थे, जिससे वायरोलॉजी और चिकित्सा में नई खोजों के द्वार खुल गए हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →