Reconstructing sequence-grammar trajectories enables interpretable and tunable cis-regulatory element design
यह शोध पत्र GO-CRE प्रस्तुत करता है, जो एक व्याख्यात्मक (interpretable) डीप लर्निंग फ्रेमवर्क है जो हाइब्रिड ट्रांसफॉर्मर-मैम्बा2 (Transformer-Mamba2) मॉडल को सुदृढीकरण शिक्षण (reinforcement learning) और अनुक्रम-व्याकरण प्रक्षेपवक्र पुनर्निर्माण (sequence-grammar trajectory reconstruction) के साथ जोड़ता है ताकि उन्नत गतिविधि और विशिष्टता वाले विविध, कोशिका-प्रकार-विशिष्ट सिस-रेगुलेटरी तत्वों (cis-regulatory elements) को डिजाइन और प्रयोगात्मक रूप से मान्य किया जा सके।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
प्रत्येक कोशिका के भीतर, निर्देशों का एक विशाल पुस्तकालय यह निर्धारित करता है कि जीवन कैसे कार्य करता है, लेकिन इस पुस्तकालय के सबसे महत्वपूर्ण हिस्से स्वयं जीन नहीं हैं। इसके बजाय, कोशिकीय जीवन के वास्तविक संचालक डीएनए के छोटे, स्विच जैसे खंड हैं जिन्हें 'सिस-रेगुलेटरी एलिमेंट्स' (cis-regulatory elements) कहा जाता है। ये खंड डिमर स्विच और ऑन-ऑफ बटन के रूप में कार्य करते हैं, जो विशिष्ट जीन्स को बताते हैं कि कब चालू होना है, कितनी ज़ोर से गाना है, और किन प्रकार की कोशिकाओं में संचालित होना है। इनके बिना, एक यकृत (लीवर) कोशिका यह नहीं जान पाती कि विषाक्त पदार्थों को कैसे फ़िल्टर करना है, और एक रक्त कोशिका यह नहीं जान पाती कि ऑक्सीजन कैसे ले जानी है। दशकों तक, वैज्ञानिक इन स्विचों को पढ़ पाने में सक्षम रहे हैं, लेकिन उपचार या अनुसंधान के लिए कोशिकाओं को नियंत्रित करने हेतु नए स्विचों को शून्य से डिजाइन करना एक गहन चुनौती बना हुआ है। यह एक नई भाषा लिखने की कोशिश करने जैसा है जहाँ व्याकरण अदृश्य है और नियम उस पड़ोस के आधार पर बदल जाते हैं जहाँ वह शब्द रहता है।
शोधकर्ताओं की एक टीम ने अब इन आनुवंशिक स्विचों को डिजाइन करने का एक नया तरीका विकसित किया है, जिससे एक ऐसी प्रक्रिया पारदर्शी और नियंत्रणीय बन गई है जो पहले एक 'ब्लैक बॉक्स' थी। एक ऐसा सिस्टम बनाकर जो यह देखता है कि डिज़ाइन किए जाने के दौरान डीएनए अनुक्रम (sequences) कैसे विकसित होते हैं, वे देख सकते हैं कि जीवन का "व्याकरण" कैसे उभरता है। इस दृष्टिकोण ने उन्हें ऐसे सिंथेटिक स्विच बनाने में सक्षम बनाया जो विशिष्ट मानव कोशिका प्रकारों में उच्च सटीकता के साथ काम करते हैं, जो हमारे स्वास्थ्य को नियंत्रित करने वाले आनुवंशिक सर्किट को इंजीनियर करने की दिशा में एक स्पष्ट मार्ग प्रदान करते हैं।
शोधकर्ताओं ने, जिनका नेतृत्व मिंगकियान मा और सहयोगियों ने किया, एक ढांचा तैयार किया जिसे वे GO-CRE कहते हैं, जिसका अर्थ है 'गाइडेड ऑप्टिमाइजेशन ऑफ सिस-रेगुलेटरी एलिमेंट्स' (Guided Optimization of Cis-Regulatory Elements)। यह समझने के लिए कि यह कैसे काम करता है, एक कंप्यूटर प्रोग्राम की कल्पना करें जो एक ऐसा वाक्य लिखने की कोशिश कर रहा है जो एक विशिष्ट कोशिका प्रकार को वांछित तरीके से प्रतिक्रिया करने के लिए प्रेरित करे। अतीत में, वैज्ञानिक आर्टिफिशियल इंटेलिजेंस को हजारों डीएनए अनुक्रम उत्पन्न करने, उनका परीक्षण करने और यह उम्मीद करने के लिए छोड़ देते थे कि सबसे अच्छे वाले काम करेंगे। यह अक्सर एक 'ट्रायल-एंड-एरर' (परीक्षण और त्रुटि) की प्रक्रिया थी जहाँ कंप्यूटर संयोग से काम करने वाला समाधान ढूंढ सकता था, जो सरल, दोहराव वाले पैटर्न का उपयोग करके परीक्षण को तो धोखा दे देता था लेकिन वास्तव में जीव विज्ञान को नहीं समझता था। नया सिस्टम इसे बदलकर इसे एक फिनिश लाइन की दौड़ के बजाय एक यात्रा के मानचित्र के रूप में देखता है।
उनके तरीके का मूल एक शक्तिशाली कंप्यूटर मॉडल पर आधारित है जिसे HybriDNA कहा जाता है। इस मॉडल को सैकड़ों प्रजातियों के डीएनए के विशाल संग्रह पर प्रशिक्षित किया गया था, जिसने उन सूक्ष्म पैटर्न को सीखा कि कैसे आनुवंशिक जानकारी संग्रहीत और पढ़ी जाती है। शोधकर्ताओं ने इस मॉडल का उपयोग करके नए डीएनए अनुक्रम उत्पन्न किए, लेकिन वे वहीं नहीं रुके। उन्होंने अवलोकन की एक परत जोड़ी जो ट्रैक करती है कि कंप्यूटर द्वारा अनुक्रम को बेहतर बनाने के प्रयास में किया गया प्रत्येक छोटा परिवर्तन क्या है। उन्होंने इन परिवर्तनों को सूक्ष्म निर्माण खंडों (building blocks) में विभाजित किया, और यह देखा कि विशिष्ट अक्षर संयोजनों की आवृत्ति और ज्ञात जैविक टैग की उपस्थिति समय के साथ कैसे बदली। इसने उन्हें उस 'ट्रैजेक्टरी' या पथ को पुनर्गठित करने की अनुमति दी, जिस पथ पर अनुक्रम एक यादृच्छिक डीएनए स्ट्रिंग से एक कार्यात्मक स्विच के रूप में विकसित हुआ।
जब टीम ने हेपजी2 (HepG2) नामक यकृत कोशिका प्रकार में इन पथों को प्रकट होते देखा, तो उन्होंने कुछ अप्रत्याशित पाया। अनुक्रम एक जाल में फंस रहे थे। कंप्यूटर ने एक एकल अक्षर के लंबे, दोहराव वाले हिस्सों (विशेष रूप से 'G' की एक स्ट्रिंग) को बनाकर एक शॉर्टकट खोज लिया था, जिसे मॉडल ने गलती से एक अच्छा समाधान मान लिया था। यह एक निम्न-गुणवत्ता वाला उत्तर था जिसने कंप्यूटर की स्कोरिंग प्रणाली को तो संतुष्ट किया लेकिन एक वास्तविक, काम करने वाला जैविक स्विच बनाने में विफल रहा। क्योंकि शोधकर्ता इसे वास्तविक समय में देख पा रहे थे, वे हस्तक्षेप करने में सक्षम थे। उन्होंने खेल के नियमों को समायोजित किया, इन दोहराव वाले स्ट्रिंग्स के लिए एक दंड (penalty) जोड़ दिया। इस सरल सुधार ने कंप्यूटर के पथ को पुनर्निर्देशित किया, उसे जाल से दूर और एक अधिक जटिल, जैविक रूप से सार्थक समाधान की ओर मोड़ दिया।
यात्रा के बीच में ही डिजाइन प्रक्रिया को निदान करने और ठीक करने की इस क्षमता ने यह प्रकट किया कि इन स्विचों का सफल निर्माण तीन विशिष्ट चरणों में होता है। पहले, कंप्यूटर व्यापक रूप से अन्वेषण करता है, कई अलग-अलग संयोजनों को आज़माता है। इसके बाद, वह एक विशिष्ट दिशा के प्रति प्रतिबद्ध होता है, लक्षित कोशिका प्रकार के जैविक लक्षणों के एक सेट पर टिक जाता है। अंत में, वह परिणाम को परिष्कृत करता है, अपने मूल स्वरूप को बनाए रखते हुए अनुक्रम को पॉलिश करता है। यकृत कोशिकाओं में, सिस्टम ने एक सटीक क्रम में नियामक टैग की एक विशिष्ट टीम को संयोजित करना सीखा, जिससे एक संक्षिप्त और कुशल स्विच बना। रक्त कोशिकाओं (K562) में, इसने उस वातावरण के अनुकूल टैग की एक अलग टीम को संयोजित किया।
यह सिद्ध करने के लिए कि ये कंप्यूटर-जनित स्विच वास्तव में काम करते हैं, शोधकर्ताओं ने प्रयोगशाला में उनका परीक्षण किया। उन्होंने एक हानिरहित वायरस का उपयोग करके जीवित यकृत और रक्त कोशिकाओं में नए डीएनए अनुक्रमों को डाला। फिर उन्होंने यह मापने के लिए परीक्षण किया कि ये नए स्विच एक चमकते हुए 'रिपोर्टर जीन' को कितनी अच्छी तरह से चालू करते हैं। परिणाम आश्चर्यजनक थे। यकृत कोशिकाओं के लिए डिज़ाइन किए गए स्विच यकृत कोशिकाओं में चमक उठे लेकिन रक्त कोशिकाओं में अंधे रहे, और इसके विपरीत भी। इसने पुष्टि की कि कंप्यूटर ने सफलतापूर्वक कोशिका-विशिष्ट निर्देश लिखना सीख लिया है। इसके अलावा, नए यकृत स्विच, मानव जीनोम में पाए जाने वाले प्राकृतिक स्विचों की तुलना में औसतन अधिक सक्रिय थे, जो यह सुझाव देता है कि कंप्यूटर ने आनुवंशिक कोड को व्यवस्थित करने का एक अधिक कुशल तरीका खोज लिया है।
इस अध्ययन ने यह भी रेखांकित किया कि हर कोशिका प्रकार के लिए डिजाइन करना समान रूप से आसान नहीं था। जबकि सिस्टम यकृत और रक्त कोशिकाओं में शानदार सफलता प्राप्त करने में सफल रहा, इसे एक तंत्रिका कोशिका (neural cell) प्रकार के लिए विशिष्ट स्विच बनाने में संघर्ष करना पड़ा। इस मामले में, कंप्यूटर का पथ बिखरा हुआ रहा और किसी स्पष्ट पैटर्न पर स्थिर होने में विफल रहा। यह विफलता सफलता जितनी ही सूचनात्मक थी; इसने दिखाया कि सिस्टम उस विशिष्ट कोशिका प्रकार के लिए उपलब्ध डेटा की गुणवत्ता और मात्रा से सीमित है। इसने प्रकट किया कि कंप्यूटर को किसी कोशिका के व्याकरण को सीखने के लिए, अध्ययन करने हेतु उदाहरणों के एक समृद्ध पुस्तकालय की आवश्यकता होती है, और पर्याप्त डेटा के बिना, डिजाइन प्रक्रिया एक स्थिर पथ नहीं खोज सकती।
डिजाइन प्रक्रिया को दृश्यमान और समायोज्य बनाकर, यह कार्य वैज्ञानिकों के आनुवंशिक इंजीनियरिंग के प्रति दृष्टिकोण को बदल देता है। एक भाग्यशाली परिणाम की उम्मीद करने के बजाय, वे अब अनुक्रम को विकसित होते देख सकते हैं, यह देख सकते हैं कि वह कब पटरी से उतर रहा है, और उसे वापस एक उत्पादक पथ पर निर्देशित कर सकते हैं। परिणामी स्विच केवल यादृच्छिक अनुक्रम नहीं हैं जो संयोग से काम करते हैं; वे एक निर्देशित विकास का परिणाम हैं जो संक्षिप्त, कुशल और अत्यधिक विशिष्ट जैविक कार्यक्रमों पर अभिसरित (converge) होते हैं। यह दृष्टिकोण भविष्य के उपचारों के लिए आवश्यक सटीक आनुवंशिक नियंत्रण बनाने के लिए एक शक्तिशाली नया उपकरण प्रदान करता है, जो डीएनए लिखने के अमूर्त कार्य को एक मूर्त, समझने योग्य और नियंत्रणीय प्रक्रिया में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।