Evaluation of multiple sclerosis risk loci reveals that genomic oracles fail to generalise sequence effects across host contexts
यह अध्ययन प्रदर्शित करता है कि डीप-लर्निंग जीनोमिक ओरेकल्स (oracles) विभिन्न होस्ट संदर्भों में अनुक्रम प्रभावों (sequence effects) को सामान्यीकृत करने में विफल रहते हैं, क्योंकि नियामक तत्व गतिविधि (regulatory element activity) के लिए उनके पूर्वानुमान विशिष्ट जीनोमिक स्थान पर अत्यधिक निर्भर हैं और केवल अनुक्रम विशेषताओं द्वारा विश्वसनीय रूप से अनुमानित नहीं किए जा सकते हैं।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मानव जीनोम के विशाल परिदृश्य में, डीएनए के कुछ हिस्से स्विच की तरह कार्य करते हैं, जो जीन को चालू या बंद करके यह नियंत्रित करते हैं कि कोशिकाएं कैसे कार्य करती हैं। वैज्ञानिक लंबे समय से उस सटीक कोड को समझने की कोशिश कर रहे हैं जो इन स्विचों को बताते हैं कि उन्हें कहाँ और कब सक्रिय होना है। हाल के वर्षों में, इस भाषा को डिकोड करने में मदद करने के लिए शक्तिशाली कंप्यूटर प्रोग्राम उभरे हैं। ये प्रोग्राम, जिन्हें अक्सर "जीनोमिक ओरेकल" (genomic oracles) कहा जाता है, डीएनए अक्षरों की एक श्रृंखला को देख सकते हैं और भविष्यवाणी कर सकते हैं कि एक जीवित कोशिका के भीतर यह कैसा व्यवहार करेगा, और यह अनुमान लगा सकते हैं कि क्या यह जीन गतिविधि की अनुमति देने के लिए खुलेगा या बंद रहेगा। क्योंकि प्रयोगशाला प्रयोगों की तुलना में ये डिजिटल उपकरण तेज़ और सस्ते हैं, शोधकर्ता तेजी से नए डीएनए अनुक्रमों (sequences) को डिजाइन करने के लिए इनका उपयोग कर रहे हैं, इस उम्मीद में कि वे ऐसे कस्टम स्विच बना सकें जो बिल्कुल इच्छित रूप से कार्य करें। अंतर्निहित आशा यह है कि यदि कोई कंप्यूटर प्रोग्राम कहता है कि एक विशिष्ट डीएनए अनुक्रम जीनोम के एक हिस्से में एक अच्छा स्विच है, तो वह एक अच्छा स्विच बना रहेगा यदि उसे किसी अन्य स्थान पर स्थानांतरित किया जाए।
एक नया अध्ययन इस मौलिक धारणा को चुनौती देता है कि क्या ये डिजिटल भविष्यवाणियां तब भी बनी रहती हैं जब एक ही डीएनए अनुक्रम को जीनोम के विभिन्न क्षेत्रों में रखा जाता है। शोधकर्ताओं ने मल्टीपल स्केलेरोसिस (multiple sclerosis) पर ध्यान केंद्रित किया, जो एक ऐसी बीमारी है जिसमें प्रतिरक्षा प्रणाली तंत्रिका तंत्र पर हमला करती है, और उन विशिष्ट आनुवंशिक क्षेत्रों को देखा जो इस स्थिति के विकसित होने के जोखिम को बढ़ाते हैं। उन्होंने एक कृत्रिम बुद्धिमत्ता (AI) मॉडल का उपयोग करके हजारों संभावित डीएनए अनुक्रम उत्पन्न किए जो दिखने में ऐसे थे जैसे कि वे प्रतिरक्षा कोशिकाओं में नियामक स्विच के रूप में कार्य कर सकते हैं। इसके बाद उन्होंने एक जीनोमिक ओरेकल का उपयोग करके इन उम्मीदवारों को स्कोर किया, और उन चुनिले गए अनुक्रमों को चुना जिन्हें कंप्यूटर ने सबसे अधिक सक्रिय होने की भविष्यवाणी की थी। टीम ने एक कठोर परीक्षण किया: उन्होंने चुने गए बिल्कुल उन्हीं अनुक्रमों को लिया और उन्हें जीनोम के चौबीस अलग-अलग स्थानों में रखा ताकि यह देखा जा सके कि क्या कंप्यूटर की भविष्यवाणी सुसंगत रहती है।
परिणामों ने एक चौंकाने वाली विसंगति का खुलासा किया। हालांकि कंप्यूटर प्रोग्राम एक एकल स्थान के भीतर अनुक्रमों को अच्छी तरह से रैंक कर सकता था, लेकिन जब अनुक्रमों को स्थानांतरित किया गया तो उसकी भविष्यवाणियां सामान्यीकरण करने में विफल रहीं। डीएनए अनुक्रम में एक विशिष्ट परिवर्तन का प्रभाव स्वयं अनुक्रम का एक स्थिर गुण नहीं था; बल्कि, यह पूरी तरह से इस बात पर निर्भर था कि वह अनुक्रम जीनोम में कहाँ स्थित है। कुछ स्थानों में, डीएनए अनुक्रम में एक विशिष्ट संपादन ने अनुक्रम को अधिक सक्रिय बना दिया, जबकि अन्य स्थानों में, उसी संपादन ने इसे कम सक्रिय बना दिया या कोई प्रभाव नहीं डाला। शोधकर्ताओं ने पाया कि अनुक्रम का व्यवहार उसके परिवेश पर इतना निर्भर था कि विभिन्न स्थानों के बीच भिन्नता बहुत अधिक थी, और लगभग आधे परीक्षण किए गए स्थानों में प्रभाव की दिशा उलट गई थी।
यह समझने के लिए कि कंप्यूटर वास्तव में क्या "देख" रहा था, टीम ने डीएनए अनुक्रमों पर सीधे हस्तक्षेप किए। उन्होंने परीक्षण किया कि क्या कंप्यूटर की प्राथमिकता उन प्रोटीन बाइंडिंग साइटों की उपस्थिति से प्रेरित थी जो जीन को नियंत्रित करते हैं, या इन साइटों के घनत्व से। उत्तर 'नहीं' था; इन साइटों को हटाने या उनकी संख्या बदलने से कंप्यूटर का स्कोर किसी भी अनुमानित तरीके से नहीं बदला। इसके बजाय, वह कारक जो वास्तव में मायने रखता था, वह एक विशिष्ट रासायनिक संरचना थी जिसे CpG कहा जाता है, जिसमें डीएनए के दो अक्षरों का युग्म शामिल होता है। हालांकि, यहाँ तक कि यह कारक भी अकेला कार्य नहीं करता था। डीएनए में इस संरचना की मात्रा बढ़ाने से कुछ जीनोमिक स्थानों में स्कोर में सुधार हुआ लेकिन अन्य स्थानों में स्कोर गिर गया। प्रभाव की दिशा स्वयं संपादन द्वारा नहीं, बल्कि मेजबान स्थान (host location) द्वारा निर्धारित की गई थी।
टीम ने यह भी परीक्षण किया कि क्या दूसरा, स्वतंत्र रूप से प्रशिक्षित कंप्यूटर प्रोग्राम समान परिणाम देगा। इस नए मॉडल ने, जिसे एक अलग आर्किटेक्चर के साथ बनाया गया था और अलग डेटा पर प्रशिक्षित किया गया था, मुख्य निष्कर्ष की पुष्टि की: डीएनए संपादन का प्रभाव अत्यधिक अस्थिर था और जीनोमिक स्थान के आधार पर बहुत भिन्न होता था। हालांकि, दोनों प्रोग्राम इस बात पर सहमत नहीं थे कि कौन से स्थान सकारात्मक या नकारात्मक प्रभाव दिखाएंगे, जिससे पता चलता है कि हालांकि अस्थिरता एक वास्तविक घटना है, लेकिन एक स्थान की व्याख्या करने के तरीके का विशिष्ट विवरण उस मॉडल के लिए अद्वितीय होता है।
शायद सबसे महत्वपूर्ण बात यह है कि शोधकर्ताओं ने जांचा कि क्या कंप्यूटर द्वारा चुने गए अनुक्रम वास्तव में प्रयोगशाला प्रयोग में बेहतर काम करते हैं। उन्होंने कंप्यूटर के स्कोर की तुलना हजारों डीएनए तत्वों वाले बड़े पैमाने के प्रयोगशाला परीक्षण से प्राप्त मापे गए गतिविधि से की। कंप्यूटर का चयन मानदंड यह भविष्यवाणी करने में विफल रहा कि कौन से अनुक्रम वास्तव में सक्रिय थे। वास्तव में, जिन अनुक्रमों को कंप्यूटर ने सर्वश्रेष्ठ प्रदर्शन करने वाला माना था, वे प्रयोगशाला में अक्सर विपरीत व्यवहार दिखाते थे; सबसे विशिष्ट और सक्रिय तत्वों को ओरेकल से सबसे कम स्कोर प्राप्त हुआ। यह विसंगति बताती है कि कंप्यूटर जिस लक्ष्य को अनुकूलित (optimize) कर रहा था, वह डीएनए की वास्तविक जैविक गतिविधि को प्रतिबिंबित नहीं करता है।
शोधकर्ताओं ने यह भी खोजा कि एक बहुत ही सरल गणितीय विधि, जो डीएनए में अक्षरों के पैटर्न की गिनती पर आधारित है, जटिल डीप-लर्निंग कृत्रिम बुद्धिमत्ता मॉडल के समान ही अच्छे अनुक्रम उत्पन्न कर सकती है। यह सरल विधि, जिसके लिए किसी शक्तिशाली कंप्यूटर की आवश्यकता नहीं है और जिसे सेकंडों में फिट किया जा सकता है, प्रत्येक परीक्षण किए गए माप पर उन्नत न्यूरल नेटवर्क के प्रदर्शन से मेल खाती है। यह निष्कर्ष बताता है कि डीएनए के आवश्यक पैटर्न को पकड़ने के लिए डीप-लर्निंग मॉडल की जटिलता आवश्यक नहीं थी।
अंततः, अध्ययन यह निष्कर्ष निकालता है कि एक जीनोमिक ओरेकल द्वारा सीखा गया या मापा गया अनुक्रम-स्तर का प्रभाव केवल अनुक्रम का गुण नहीं है। यह अनुक्रम और उस विशिष्ट जीनोमिक संदर्भ का संयुक्त गुण है जिसमें वह स्थित है। इस स्थान-निर्भरता का अनुमान आसपास के सरल, सस्ते डीएनए लक्षणों से नहीं लगाया जा सकता है। नए आनुवंशिक तत्वों को डिजाइन करने वाले वैज्ञानिकों के लिए, इसका अर्थ है कि कंप्यूटर सिमुलेशन में एक स्थान पर चुना और सत्यापित किया गया डिज़ाइन, इस बात की कोई गारंटी नहीं देता कि उसे कहीं और स्थानांतरित या सम्मिलित करने के बाद वह कैसा व्यवहार करेगा। ये निष्कर्ष चेतावनी देते हैं कि ये शक्तिशाली डिजिटल उपकरण, उपयोगी होने के बावजूद, बिना प्रत्यक्ष प्रयोगात्मक सत्यापन के मानव जीनोम के विविध परिदृश्य में डिज़ाइन किए गए अनुक्रमों के व्यवहार की भविष्यवाणी करने के लिए अभी तक भरोसेमंद नहीं हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।