← नवीनतम पेपर
🧬 biology

Reconstructing sequence-grammar trajectories enables interpretable and tunable cis-regulatory element design

यह शोध पत्र GO-CRE प्रस्तुत करता है, जो एक व्याख्यात्मक (interpretable) डीप लर्निंग फ्रेमवर्क है जो हाइब्रिड ट्रांसफॉर्मर-मैम्बा2 (Transformer-Mamba2) मॉडल को सुदृढीकरण शिक्षण (reinforcement learning) और अनुक्रम-व्याकरण प्रक्षेपवक्र पुनर्निर्माण (sequence-grammar trajectory reconstruction) के साथ जोड़ता है ताकि उन्नत गतिविधि और विशिष्टता वाले विविध, कोशिका-प्रकार-विशिष्ट सिस-रेगुलेटरी तत्वों (cis-regulatory elements) को डिजाइन और प्रयोगात्मक रूप से मान्य किया जा सके।

मूल लेखक: Mingqian Ma, Wanjuan Bu, Guoqing Liu, Yuxuan Liu, Sizhen Liu, Zhen Zhao, Shijie Yao, Qingru Hua, Yujie Zhang, Cuiting Zhong, Haitao Huang, Pan Deng, Peiran Jin, Qijin Yin, Chuan Cao, Haiguang Liu, Mo
प्रकाशित 2026-09-23
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingqian Ma, Wanjuan Bu, Guoqing Liu, Yuxuan Liu, Sizhen Liu, Zhen Zhao, Shijie Yao, Qingru Hua, Yujie Zhang, Cuiting Zhong, Haitao Huang, Pan Deng, Peiran Jin, Qijin Yin, Chuan Cao, Haiguang Liu, Mo Xu, Yuan He, Tao Qin, Zeyu Chen

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

प्रत्येक कोशिका के भीतर, निर्देशों का एक विशाल पुस्तकालय यह निर्धारित करता है कि जीवन कैसे कार्य करता है, लेकिन इस पुस्तकालय के सबसे महत्वपूर्ण हिस्से स्वयं जीन नहीं हैं। इसके बजाय, कोशिकीय जीवन के वास्तविक संचालक डीएनए के छोटे, स्विच जैसे खंड हैं जिन्हें 'सिस-रेगुलेटरी एलिमेंट्स' (cis-regulatory elements) कहा जाता है। ये खंड डिमर स्विच और ऑन-ऑफ बटन के रूप में कार्य करते हैं, जो विशिष्ट जीन्स को बताते हैं कि कब चालू होना है, कितनी ज़ोर से गाना है, और किन प्रकार की कोशिकाओं में संचालित होना है। इनके बिना, एक यकृत (लीवर) कोशिका यह नहीं जान पाती कि विषाक्त पदार्थों को कैसे फ़िल्टर करना है, और एक रक्त कोशिका यह नहीं जान पाती कि ऑक्सीजन कैसे ले जानी है। दशकों तक, वैज्ञानिक इन स्विचों को पढ़ पाने में सक्षम रहे हैं, लेकिन उपचार या अनुसंधान के लिए कोशिकाओं को नियंत्रित करने हेतु नए स्विचों को शून्य से डिजाइन करना एक गहन चुनौती बना हुआ है। यह एक नई भाषा लिखने की कोशिश करने जैसा है जहाँ व्याकरण अदृश्य है और नियम उस पड़ोस के आधार पर बदल जाते हैं जहाँ वह शब्द रहता है।

शोधकर्ताओं की एक टीम ने अब इन आनुवंशिक स्विचों को डिजाइन करने का एक नया तरीका विकसित किया है, जिससे एक ऐसी प्रक्रिया पारदर्शी और नियंत्रणीय बन गई है जो पहले एक 'ब्लैक बॉक्स' थी। एक ऐसा सिस्टम बनाकर जो यह देखता है कि डिज़ाइन किए जाने के दौरान डीएनए अनुक्रम (sequences) कैसे विकसित होते हैं, वे देख सकते हैं कि जीवन का "व्याकरण" कैसे उभरता है। इस दृष्टिकोण ने उन्हें ऐसे सिंथेटिक स्विच बनाने में सक्षम बनाया जो विशिष्ट मानव कोशिका प्रकारों में उच्च सटीकता के साथ काम करते हैं, जो हमारे स्वास्थ्य को नियंत्रित करने वाले आनुवंशिक सर्किट को इंजीनियर करने की दिशा में एक स्पष्ट मार्ग प्रदान करते हैं।

शोधकर्ताओं ने, जिनका नेतृत्व मिंगकियान मा और सहयोगियों ने किया, एक ढांचा तैयार किया जिसे वे GO-CRE कहते हैं, जिसका अर्थ है 'गाइडेड ऑप्टिमाइजेशन ऑफ सिस-रेगुलेटरी एलिमेंट्स' (Guided Optimization of Cis-Regulatory Elements)। यह समझने के लिए कि यह कैसे काम करता है, एक कंप्यूटर प्रोग्राम की कल्पना करें जो एक ऐसा वाक्य लिखने की कोशिश कर रहा है जो एक विशिष्ट कोशिका प्रकार को वांछित तरीके से प्रतिक्रिया करने के लिए प्रेरित करे। अतीत में, वैज्ञानिक आर्टिफिशियल इंटेलिजेंस को हजारों डीएनए अनुक्रम उत्पन्न करने, उनका परीक्षण करने और यह उम्मीद करने के लिए छोड़ देते थे कि सबसे अच्छे वाले काम करेंगे। यह अक्सर एक 'ट्रायल-एंड-एरर' (परीक्षण और त्रुटि) की प्रक्रिया थी जहाँ कंप्यूटर संयोग से काम करने वाला समाधान ढूंढ सकता था, जो सरल, दोहराव वाले पैटर्न का उपयोग करके परीक्षण को तो धोखा दे देता था लेकिन वास्तव में जीव विज्ञान को नहीं समझता था। नया सिस्टम इसे बदलकर इसे एक फिनिश लाइन की दौड़ के बजाय एक यात्रा के मानचित्र के रूप में देखता है।

उनके तरीके का मूल एक शक्तिशाली कंप्यूटर मॉडल पर आधारित है जिसे HybriDNA कहा जाता है। इस मॉडल को सैकड़ों प्रजातियों के डीएनए के विशाल संग्रह पर प्रशिक्षित किया गया था, जिसने उन सूक्ष्म पैटर्न को सीखा कि कैसे आनुवंशिक जानकारी संग्रहीत और पढ़ी जाती है। शोधकर्ताओं ने इस मॉडल का उपयोग करके नए डीएनए अनुक्रम उत्पन्न किए, लेकिन वे वहीं नहीं रुके। उन्होंने अवलोकन की एक परत जोड़ी जो ट्रैक करती है कि कंप्यूटर द्वारा अनुक्रम को बेहतर बनाने के प्रयास में किया गया प्रत्येक छोटा परिवर्तन क्या है। उन्होंने इन परिवर्तनों को सूक्ष्म निर्माण खंडों (building blocks) में विभाजित किया, और यह देखा कि विशिष्ट अक्षर संयोजनों की आवृत्ति और ज्ञात जैविक टैग की उपस्थिति समय के साथ कैसे बदली। इसने उन्हें उस 'ट्रैजेक्टरी' या पथ को पुनर्गठित करने की अनुमति दी, जिस पथ पर अनुक्रम एक यादृच्छिक डीएनए स्ट्रिंग से एक कार्यात्मक स्विच के रूप में विकसित हुआ।

जब टीम ने हेपजी2 (HepG2) नामक यकृत कोशिका प्रकार में इन पथों को प्रकट होते देखा, तो उन्होंने कुछ अप्रत्याशित पाया। अनुक्रम एक जाल में फंस रहे थे। कंप्यूटर ने एक एकल अक्षर के लंबे, दोहराव वाले हिस्सों (विशेष रूप से 'G' की एक स्ट्रिंग) को बनाकर एक शॉर्टकट खोज लिया था, जिसे मॉडल ने गलती से एक अच्छा समाधान मान लिया था। यह एक निम्न-गुणवत्ता वाला उत्तर था जिसने कंप्यूटर की स्कोरिंग प्रणाली को तो संतुष्ट किया लेकिन एक वास्तविक, काम करने वाला जैविक स्विच बनाने में विफल रहा। क्योंकि शोधकर्ता इसे वास्तविक समय में देख पा रहे थे, वे हस्तक्षेप करने में सक्षम थे। उन्होंने खेल के नियमों को समायोजित किया, इन दोहराव वाले स्ट्रिंग्स के लिए एक दंड (penalty) जोड़ दिया। इस सरल सुधार ने कंप्यूटर के पथ को पुनर्निर्देशित किया, उसे जाल से दूर और एक अधिक जटिल, जैविक रूप से सार्थक समाधान की ओर मोड़ दिया।

यात्रा के बीच में ही डिजाइन प्रक्रिया को निदान करने और ठीक करने की इस क्षमता ने यह प्रकट किया कि इन स्विचों का सफल निर्माण तीन विशिष्ट चरणों में होता है। पहले, कंप्यूटर व्यापक रूप से अन्वेषण करता है, कई अलग-अलग संयोजनों को आज़माता है। इसके बाद, वह एक विशिष्ट दिशा के प्रति प्रतिबद्ध होता है, लक्षित कोशिका प्रकार के जैविक लक्षणों के एक सेट पर टिक जाता है। अंत में, वह परिणाम को परिष्कृत करता है, अपने मूल स्वरूप को बनाए रखते हुए अनुक्रम को पॉलिश करता है। यकृत कोशिकाओं में, सिस्टम ने एक सटीक क्रम में नियामक टैग की एक विशिष्ट टीम को संयोजित करना सीखा, जिससे एक संक्षिप्त और कुशल स्विच बना। रक्त कोशिकाओं (K562) में, इसने उस वातावरण के अनुकूल टैग की एक अलग टीम को संयोजित किया।

यह सिद्ध करने के लिए कि ये कंप्यूटर-जनित स्विच वास्तव में काम करते हैं, शोधकर्ताओं ने प्रयोगशाला में उनका परीक्षण किया। उन्होंने एक हानिरहित वायरस का उपयोग करके जीवित यकृत और रक्त कोशिकाओं में नए डीएनए अनुक्रमों को डाला। फिर उन्होंने यह मापने के लिए परीक्षण किया कि ये नए स्विच एक चमकते हुए 'रिपोर्टर जीन' को कितनी अच्छी तरह से चालू करते हैं। परिणाम आश्चर्यजनक थे। यकृत कोशिकाओं के लिए डिज़ाइन किए गए स्विच यकृत कोशिकाओं में चमक उठे लेकिन रक्त कोशिकाओं में अंधे रहे, और इसके विपरीत भी। इसने पुष्टि की कि कंप्यूटर ने सफलतापूर्वक कोशिका-विशिष्ट निर्देश लिखना सीख लिया है। इसके अलावा, नए यकृत स्विच, मानव जीनोम में पाए जाने वाले प्राकृतिक स्विचों की तुलना में औसतन अधिक सक्रिय थे, जो यह सुझाव देता है कि कंप्यूटर ने आनुवंशिक कोड को व्यवस्थित करने का एक अधिक कुशल तरीका खोज लिया है।

इस अध्ययन ने यह भी रेखांकित किया कि हर कोशिका प्रकार के लिए डिजाइन करना समान रूप से आसान नहीं था। जबकि सिस्टम यकृत और रक्त कोशिकाओं में शानदार सफलता प्राप्त करने में सफल रहा, इसे एक तंत्रिका कोशिका (neural cell) प्रकार के लिए विशिष्ट स्विच बनाने में संघर्ष करना पड़ा। इस मामले में, कंप्यूटर का पथ बिखरा हुआ रहा और किसी स्पष्ट पैटर्न पर स्थिर होने में विफल रहा। यह विफलता सफलता जितनी ही सूचनात्मक थी; इसने दिखाया कि सिस्टम उस विशिष्ट कोशिका प्रकार के लिए उपलब्ध डेटा की गुणवत्ता और मात्रा से सीमित है। इसने प्रकट किया कि कंप्यूटर को किसी कोशिका के व्याकरण को सीखने के लिए, अध्ययन करने हेतु उदाहरणों के एक समृद्ध पुस्तकालय की आवश्यकता होती है, और पर्याप्त डेटा के बिना, डिजाइन प्रक्रिया एक स्थिर पथ नहीं खोज सकती।

डिजाइन प्रक्रिया को दृश्यमान और समायोज्य बनाकर, यह कार्य वैज्ञानिकों के आनुवंशिक इंजीनियरिंग के प्रति दृष्टिकोण को बदल देता है। एक भाग्यशाली परिणाम की उम्मीद करने के बजाय, वे अब अनुक्रम को विकसित होते देख सकते हैं, यह देख सकते हैं कि वह कब पटरी से उतर रहा है, और उसे वापस एक उत्पादक पथ पर निर्देशित कर सकते हैं। परिणामी स्विच केवल यादृच्छिक अनुक्रम नहीं हैं जो संयोग से काम करते हैं; वे एक निर्देशित विकास का परिणाम हैं जो संक्षिप्त, कुशल और अत्यधिक विशिष्ट जैविक कार्यक्रमों पर अभिसरित (converge) होते हैं। यह दृष्टिकोण भविष्य के उपचारों के लिए आवश्यक सटीक आनुवंशिक नियंत्रण बनाने के लिए एक शक्तिशाली नया उपकरण प्रदान करता है, जो डीएनए लिखने के अमूर्त कार्य को एक मूर्त, समझने योग्य और नियंत्रणीय प्रक्रिया में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →