← नवीनतम पेपर
💻 bioinformatics

Vipsania: Unsupervised Deep Gene Finding

विप्सानिया (Vipsania) पहला अनसुपरवाइज्ड डीप लर्निंग टूल है जो अनएनोटेटेड अनुक्रमों से सीधे सीखकर विविध यूकेरियोटिक जीनोमों में प्रोटीन-कोडिंग जीन संरचनाओं की सटीक भविष्यवाणी करता है, जिससे यह उन सुपरवाइज्ड विधियों की सीमाओं को दूर करता है जिन्हें उच्च गुणवत्ता वाले प्रशिक्षण डेटा की आवश्यकता होती है और जो दूरस्थ या आधारभूत क्लेड्स (clades) के साथ संघर्ष करती हैं।

मूल लेखक: Krieg, R., Becker, F., Saenko, S., Diehl, J., Stanke, M.

प्रकाशित 2026-08-30
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Krieg, R., Becker, F., Saenko, S., Diehl, J., Stanke, M.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

पृथ्वी पर हमारे द्वारा खोजा गया प्रत्येक नया जीवन रूप अपने वैज्ञानिक जीवन की शुरुआत अक्षरों की एक श्रृंखला के रूप में करता है: डीएनए (DNA) का एक लंबा, अटूट अनुक्रम जो एक जीवित जीव के निर्माण के लिए ब्लूप्रिंट रखता है। लेकिन एक कच्चा अनुक्रम उस पुस्तक की तरह है जिसे ऐसी भाषा में लिखा गया है जहाँ शब्दों के बीच के स्थान मिटा दिए गए हैं और बड़े अक्षरों (capital letters) को हटा दिया गया है। वह जीव कैसे कार्य करता है, इसे समझने के लिए वैज्ञानिकों को पहले उन वाक्यों—जीन्स (genes)—को खोजना होगा जो कोशिका को प्रोटीन बनाने का निर्देश देते हैं, जो जीवन के वास्तविक कार्य करने वाली आणविक मशीनें हैं। यह प्रक्रिया, जिसे 'जीन फाइंडिंग' (gene finding) कहा जाता है, लगभग किसी भी जैविक अनुसंधान के लिए एक आवश्यक पहला कदम है। इसके बिना, जीनोम एक मौन कोड बना रहता है। दशकों से, इन कोडों को पढ़ने का सबसे विश्वसनीय तरीका बाहरी दुनिया से सुराग ढूंढना रहा है, जैसे कि संबंधित प्रजातियों के ज्ञात प्रोटीनों के साथ डीएनए का मिलान करना या आरएनए (RNA) डेटा का उपयोग करके यह देखना कि जीनोम के कौन से हिस्से सक्रिय हैं। हालाँकि, यह दृष्टिकोण तब एक दीवार से टकरा जाता है जब वैज्ञानिक पृथ्वी पर मौजूद जीवन के विशाल बहुमत का सामना करते हैं, जिनका कोई करीबी संबंधी ज्ञात जीन्स के साथ नहीं है और कोई आरएनए डेटा उपलब्ध नहीं है। इन जीवों के लिए, जीवन के निर्माण के निर्देश छिपे रह गए हैं।

यूनिवर्सिटी ऑफ ग्रीफ्सवाल्ड (University of Greifswald) के शोधकर्ताओं की एक टीम ने अब 'विप्सानिया' (Vipsania) नामक एक नया उपकरण पेश किया है जो यह बदल देता है कि हम इन मौन पुस्तकों को कैसे पढ़ते हैं। बाहरी सुरागों या पूर्व-मौजूदा मानचित्रों पर निर्भर रहने के बजाय, विप्सानिया यह सीखने के लिए कि जीन कैसे खोजे जाते हैं, डीएनए अनुक्रम को स्वयं पढ़कर काम करता है, बिना इस पूर्व ज्ञान के कि एक जीन कैसा दिखता है। शोधकर्ताओं ने इस कंप्यूटर प्रोग्राम को हजारों विभिन्न प्रजातियों के लगभग एक ट्रिलियन डीएनए अक्षरों पर प्रशिक्षित किया, जिससे इसे पिछले अक्षरों के आधार पर अनुक्रम में अगले अक्षर की भविष्यवाणी करना सिखाया गया। ऐसा करते हुए, प्रोग्राम ने अनजाने में जीवन के छिपे हुए व्याकरण को सीख लिया: वे विशिष्ट पैटर्न जो एक जीन को उसके आसपास के नॉन-कोडिंग (non-coding) डीएनए से अलग करते हैं। इसका परिणाम एक ऐसी प्रणाली है जो लगभग किसी भी यूकेरियोटिक (eukaryotic) जीव में जीन की सटीक पहचान कर सकती है, सूक्ष्म शैवाल से लेकर जटिल जानवरों तक, भले ही पहले कभी उस विशिष्ट समूह का जीन न देखा गया हो।

जीन खोजने की चुनौती विशेष रूप से कठिन है क्योंकि निर्देश एक सरल, निरंतर रेखा में नहीं लिखे होते हैं। जटिल जीवों में, एक जीन के वे भाग जो प्रोटीन के लिए कोड करते हैं, अक्सर नॉन-कोडिंग डीएनए के लंबे हिस्सों द्वारा बाधित होते हैं, ठीक वैसे ही जैसे एक वाक्य जहाँ महत्वपूर्ण शब्द यादृच्छिक, अर्थहीन भराव (filler) द्वारा अलग किए गए हों। जीन को पुनर्गठित करने के लिए, एक कंप्यूटर को यह पता लगाना होगा कि ये व्यवधान कहाँ शुरू और समाप्त होते हैं, और वाक्य किस दिशा में पढ़ा जा रहा है। पारंपरिक तरीके "सुपरवाइज्ड" (supervised) लर्निंग पर निर्भर करते हैं, जहाँ कंप्यूटर को अच्छी तरह से अध्ययन की गई प्रजातियों के सही जीन्स के हजारों उदाहरण दिखाए जाते हैं और पैटर्न पहचानने के लिए सिखाया जाता है। यह मनुष्यों या फ्रूट फ्लाई जैसे परिचित समूहों के लिए अच्छा काम करता है, लेकिन जब कंप्यूटर ऐसी प्रजाति का सामना करता है जो उसके प्रशिक्षण उदाहरणों से बहुत भिन्न है, तो यह विफल हो जाता है। यदि कंप्यूटर ने केवल स्तनधारियों के जीन देखे हैं, तो उसे स्पंज या कवक (fungus) में जीन खोजने में संघर्ष करना पड़ेगा, जिससे वे या तो छूट जाएंगे या ऐसी संरचनाएं बना देंगे जो अस्तित्व में ही नहीं हैं।

विप्सानिया एक अलग रास्ता अपनाता है। यह एक "अनसुपरवाइज्ड" (unsupervised) प्रणाली है, जिसका अर्थ है कि इसे इसके प्रशिक्षण के दौरान एक भी सही जीन का उदाहरण नहीं दिखाया गया था। इसके बजाय, इसे कच्चे डीएनए अनुक्रम दिए गए थे और खाली स्थानों को भरने के लिए कहा गया था। शोधकर्ताओं ने अनुक्रम में यादृच्छिक अक्षरों को छिपा दिया (masked) और मॉडल से पूछा कि परिवेश के आधार पर वे क्या थे। इस कार्य को संभव बनाने के लिए, उन्होंने कंप्यूटर के मस्तिष्क में एक विशेष परत बनाई जो एक 'ग्रामर चेकर' (व्याकरण परीक्षक) की तरह कार्य करती है। यह परत जीन संरचना के नियमों को लागू करती है, जैसे कि यह सुनिश्चित करना कि रीडिंग फ्रेम (reading frame) सुसंगत रहे और स्टॉप सिग्नल (stop signals) सही स्थानों पर दिखाई दें। जैसे-जैसे मॉडल ने गायब अक्षरों की भविष्यवाणी करने की कोशिश की, उसे सफल होने के लिए जीनोम की अंतर्निहित संरचना को सीखना पड़ा। समय के साथ, मॉडल ने बिना यह जाने कि जीन क्या है, अपने आप जीन्स के पैटर्न की खोज की, और कोडिंग और नॉन-कोडिंग क्षेत्रों के बीच अंतर करना सीखा।

इस दृष्टिकोण के परिणाम चौंकाने वाले हैं। मौजूदा सर्वोत्तम उपकरणों के विरुद्ध परीक्षण किए जाने पर, विप्सानिया ने उनके द्वारा जांचे गए लगभग हर जीव समूह में अधिक सटीकता प्रदर्शित की। जबकि अन्य विधियाँ अक्सर दूरस्थ प्रजातियों पर लागू होने पर अपनी सटीकता खो देती हैं, विप्सानिया ने अपना प्रदर्शन बनाए रखा, जिससे पता चलता है कि इसने विशिष्ट उदाहरणों को याद करने के बजाय जीवन के मौलिक नियमों को सीख लिया है। कवक, कीटों और विभिन्न प्रकार के शैवालों जैसे समूहों से जुड़े परीक्षणों में, विप्सानिया ने अधिकांश मामलों में जीन्स की संरचना को सही ढंग से पहचाना, और अक्सर उन उपकरणों से बेहतर प्रदर्शन किया जो भारी मात्रा में बाहरी डेटा पर निर्भर करते हैं। यह उन जीवों में भी जीन खोजने में सफल रहा जो थोड़े अलग जेनेटिक कोड का उपयोग करते हैं, जहाँ जीन के मानक "स्टॉप" संकेत कुछ और ही अर्थ रखते हैं। केवल उस जीव के विशिष्ट कोड से मेल खाने के लिए एक छोटी सेटिंग को समायोजित करके, शोधकर्ता विप्सानिया को केवल कुछ घंटों में एक एकल जीनोम पर प्रशिक्षित करने में सक्षम थे, और इसने तुरंत सटीक एनोटेशन (annotations) बनाना शुरू कर दिया।

यह क्षमता जीव विज्ञान के भविष्य के लिए अत्यंत महत्वपूर्ण है। वर्तमान में पृथ्वी के प्रत्येक नामित प्रजाति के जीनोम को अनुक्रमित करने के लिए एक विशाल वैश्विक प्रयास चल रहा है, जिसका लक्ष्य सभी 1.67 मिलियन ज्ञात यूकेरियोटिक प्रजातियों के लिए एक संदर्भ पुस्तकालय बनाना है। हालाँकि, बाधा अब डीएनए को अनुक्रमित करना नहीं है; बल्कि इसे एनोटेट (annotate) करना है। वर्तमान में, सार्वजनिक डेटाबेस में 20 प्रतिशत से भी कम जीनोम में जीन एनोटेशन है, जिससे जीवन के पेड़ की पूरी शाखाएं, जैसे कि कई प्रकार के शैवाल और सूक्ष्म जीव, बिना किसी संरचनात्मक मानचित्र के रह गई हैं। विप्सानिया इस अंतर को भरने का एक तरीका प्रदान करता है। क्योंकि इसे काम करने के लिए आरएनए डेटा या संबंधित प्रजातियों की आवश्यकता नहीं है, इसलिए इसे किसी भी जीनोम पर लागू किया जा सकता है, चाहे उस जीव के बारे में कितनी भी कम जानकारी क्यों न हो। शोधकर्ताओं ने जीवन के 17 प्रमुख समूहों के लिए प्री-ट्रेंड मॉडल जारी किए हैं, जो सभी ज्ञात यूकेरियोटिक प्रजातियों के 99 प्रतिशत से अधिक को कवर करते हैं, और शेष अंश के लिए एक सामान्य मॉडल भी प्रदान किया है।

विप्सानिया की सफलता यह सुझाव देती है कि जीन संरचना के नियम इतने सार्वभौमिक हैं कि उन्हें केवल डीएनए के कच्चे पाठ (raw text) से सीखा जा सकता है। बाहरी साक्ष्य की आवश्यकता को हटाकर, शोधकर्ताओं ने एक ऐसा उपकरण बनाया है जो जीवन के पेड़ के अंधेरे कोनों में भी प्रकाश ला सकता है। जबकि आरएनए डेटा का उपयोग करने वाले उपकरण उन अच्छी तरह से अध्ययन की गई प्रजातियों के लिए सबसे अच्छा विकल्प हो सकते हैं जहाँ ऐसा डेटा प्रचुर मात्रा में है, विपसांनिया पृथ्वी पर मौजूद जीवन के विशाल बहुमत के लिए एक अत्याधुनिक समाधान प्रदान करता है जिसे इस तरह से कभी नहीं देखा गया है। यह जो हम पहले से जानते हैं उस पर निर्भर रहने के बजाय, वहां क्या है उसे खोजने की ओर एक बदलाव है, केवल जीनोम की भाषा को सुनकर। पहली बार, वैज्ञानिकों के पास लगभग किसी भी यूकेरियोटिक जीव के लिए उच्च-गुणवत्ता वाले जीन मानचित्र बनाने की एक विधि है, जो डीएनए की मौन श्रृंखलाओं को जीवन के पठनीय निर्देशों में बदल देती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →