← नवीनतम पेपर
🧬 genetics

ChromBPNet: bias factorized, base-resolution deep learning models of chromatin accessibility reveal cis-regulatory sequence syntax, transcription factor footprints and regulatory variants

ChromBPNet एक हल्का, बेस-रेज़ोल्यूशन वाला डीप लर्निंग मॉडल है जो नियामक संकेतों से परख-विशिष्ट पूर्वाग्रहों को अलग करता है ताकि ट्रांसक्रिप्शन फैक्टर बाइंडिंग सिंटैक्स को मजबूती से डिकोड किया जा सके, सटीक फुटप्रिंट्स उत्पन्न किए जा सकें, और क्रोमैटिन सुलभता एवं जटिल लक्षणों को प्रभावित करने वाले कार्यात्मक आनुवंशिक वेरिएंट्स को प्राथमिकता दी जा सके।

मूल लेखक: Pampari, A., Shcherbina, A., Kvon, E. Z., Kosicki, M., Nair, S., Kundu, S., Kathiria, A. S., Risca, V. I., Kuningas, K., Alasoo, K., Greenleaf, W., Pennacchio, L., Kundaje, A.

प्रकाशित 2026-09-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pampari, A., Shcherbina, A., Kvon, E. Z., Kosicki, M., Nair, S., Kundu, S., Kathiria, A. S., Risca, V. I., Kuningas, K., Alasoo, K., Greenleaf, W., Pennacchio, L., Kundaje, A.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

लगभग हर मानव कोशिका के केंद्रक (न्यूक्लियस) के भीतर, डीएनए एक ढीले धागे की तरह नहीं बल्कि एक कसकर लिपटे हुए पैकेज के रूप में होता है। इसके भीतर छिपे आनुवंशिक निर्देशों को पढ़ने के लिए, कोशिका को पहले इन पैकेजों को खोलना पड़ता है, जिससे डीएनए के विशिष्ट क्षेत्र उन मशीनों के लिए सुलभ हो सकें जो जीन गतिविधि को नियंत्रित करती हैं। वैज्ञानिक शक्तिशाली प्रयोगशाला तकनीकों का उपयोग करके इन खुले, सुलभ क्षेत्रों को देख सकते हैं जो एक स्पॉटलाइट की तरह कार्य करती हैं, जो जीनोम के उन हिस्सों को रोशन करती हैं जो वर्तमान में सक्रिय हैं। ये सक्रिय क्षेत्र, जिन्हें नियामक तत्व (रेगुलेटरी एलिमेंट्स) कहा जाता है, वे स्थान हैं जहाँ ट्रांसक्रिप्शन फैक्टर्स नामक प्रोटीन डीएनए से जुड़ते हैं ताकि जीनों को चालू या बंद किया जा सके। यह समझना कि कौन से सटीक डीएनए अनुक्रम इन प्रोटीनों को जुड़ने की अनुमति देते हैं, और कैसे लोगों के बीच आनुवंशिक अंतर इस जुड़ाव को बदलते हैं, यह समझना महत्वपूर्ण है कि लक्षण कैसे बनते हैं और बीमारियाँ क्यों होती हैं। हालाँकि, वैज्ञानिकों द्वारा इन प्रयोगों से प्राप्त संकेत अक्सर शोर (नॉइज़) से भरे होते हैं और उन्हीं उपकरणों द्वारा विकृत कर दिए जाते हैं जिनका उपयोग माप के लिए किया जाता है, जिससे वास्तविक जैविक संकेत और तकनीकी त्रुटियों (आर्टिफैक्ट्स) के बीच अंतर करना कठिन हो जाता है।

एक नया अध्ययन 'क्रोमबीपीनेट' (ChromBPNet) नामक एक परिष्कृत कंप्यूटर मॉडल पेश करता है, जिसे इस शोर को काटने और यह बताने के लिए डिज़ाइन किया गया है कि डीएनए सुलभता (एक्सेसिबिलिटी) को नियंत्रित करने वाले सटीक नियम क्या हैं। शोधकर्ताओं ने इस आर्टिफिशियल इंटेलिजेंस सिस्टम को मानव कोशिकाओं के विशाल डेटा पर प्रशिक्षित किया, जिससे इसे केवल आनुवंशिक अक्षरों के अनुक्रम के आधार पर डीएनए सुलभता के सटीक पैटर्न की भविष्यवाणी करना सिखाया गया। यह मॉडल उच्चतम संभव रिज़ॉल्यूशन पर काम करता है, जो जीनोम को एक समय में एक अक्षर के स्तर पर देखता है। क्रोमबीपीनेट की एक प्रमुख विशेषता तकनीकी विकृतियों को वास्तविक जैविक कहानी से अलग करने की इसकी क्षमता है, जो प्रयोगों में उपयोग किए जाने वाले एंजाइमों द्वारा उत्पन्न होती हैं। ATAC-seq जैसे प्रयोगों में, जो खुले डीएनए को टैग करने के लिए एक ट्रांसपोसेज़ एंजाइम का उपयोग करते हैं, एंजाइम का स्वयं का कुछ विशिष्ट डीएनए अनुक्रमों के प्रति झुकाव होता है, जिससे एक ऐसा पक्षपात (बायस) पैदा होता है जो एक प्रोटीन बाइंडिंग साइट जैसा दिख सकता है जबकि वह वास्तव में केवल एंजाइम की अपनी एक विचित्रता होती है। क्रोमबीपीनेट इन एंजाइम प्राथमिकताओं को पहचानने और उन्हें घटाने (सबट्रैक्ट करने) में सक्षम है, जिससे एक स्वच्छ, उच्च-सटीकता वाला मानचित्र प्राप्त होता है कि ट्रांसक्रिप्शन फैक्टर्स वास्तव में डीएनए के साथ कहाँ परस्पर क्रिया कर रहे हैं।

इस बायस सुधार (बायस करेक्शन) को लागू करके, शोधकर्ताओं ने पाया कि सुलभता को नियंत्रित करने वाला आनुवंशिक कोड आश्चर्यजनक रूप से संक्षिप्त है। उन्होंने पाया कि ट्रांसक्रिप्शन फैक्टर मोटिफ्स (बाइंडिंग पैटर्न) का एक अपेक्षाकृत छोटा सेट, विशिष्ट व्यवस्थाओं में संयोजित होकर, यह समझाने के लिए पर्याप्त है कि विभिन्न कोशिका प्रकारों में क्रोमैटिन कैसे खुलता है। मॉडल ने खुलासा किया कि ये कारक अक्सर सहकारी टीमों (कोऑपरेटिव टीम्स) में मिलकर काम करते हैं, जहाँ उनके बाइंडिंग साइट्स के बीच की दूरी और अभिविन्यास (ओरिएंटेशन) को कड़ाई से विनियमित किया जाता है। उदाहरण के लिए, मॉडल ने विशिष्ट 'कंपोजिट एलिमेंट्स' की पहचान की जहाँ दो अलग-अलग प्रोटीनों को सुलभता बढ़ाने के लिए एक सटीक विन्यास में बंधना आवश्यक होता है, जो विवरण का एक ऐसा स्तर है जिसे पिछले तरीकों ने अक्सर छोड़ दिया था। इसके अलावा, मॉडल ने बहुत कम मात्रा में आनुवंशिक सामग्री वाले डेटासेट से भी प्रोटीन फुटप्रिंट्स (प्रोटीन के पदचिह्न) के उच्च-रिज़ॉल्यूशन मानचित्रों का सफलतापूर्वक पुनर्निर्माण किया—जो कि प्रोटीन द्वारा डीएनए की भौतिक रूप से रक्षा किए जाने वाले सूक्ष्म अंतराल होते हैं—एक ऐसा कार्य जो व्यापक अनुक्रमण (सीक्वेंसिंग) डेटा के बिना पहले असंभव था।

क्रोमबीपीनेट की शक्ति यह समझने में भी विस्तृत है कि आनुवंशिक भिन्नताएं स्वास्थ्य को कैसे प्रभावित करती हैं। शोधकर्ताओं ने जटिल लक्षणों और दुर्लभ बीमारियों से जुड़े लाखों आनुवंशिक वेरिएंट्स के प्रभावों की भविष्यवाणी करने की मॉडल की क्षमता का परीक्षण किया। मॉडल ने सटीक भविष्यवाणी की कि डीएनए के एक अक्षर में एकल परिवर्तन किस प्रकार एक क्षेत्र की सुलभता को बदल देगा, और अक्सर इसने उन बहुत बड़े और अधिक जटिल एआई मॉडलों को भी पीछे छोड़ दिया जिन्हें विविध डेटासेट्स पर प्रशिक्षित किया गया था। महत्वपूर्ण रूप से, मॉडल यह स्पष्ट कर सका कि किसी वेरिएंट का प्रभाव क्यों था, यह सटीक रूप से पहचानते हुए कि कौन सा प्रोटीन बाइंडिंग साइट बाधित हुआ और कारकों के बीच की सहकारी संरचना (कोऑपरेटिव सिंटैक्स) कैसे टूट गई। एक उल्लेखनीय उदाहरण में, मॉडल ने एक मरीज में पाए गए एक दुर्लभ आनुवंशिक वेरिएंट की पहचान की, जिसमें एक न्यूरोडेवलपमेंटल विकार था, जिसने एक रिप्रेशर प्रोटीन के लिए एक नया बाइंडिंग साइट बना दिया, जिससे मस्तिष्क के विकास के लिए आवश्यक जीन प्रभावी रूप से बंद हो गया। शोधकर्ताओं ने प्रयोगशाला में इस भविष्यवाणी को सत्यापित किया, यह दिखाते हुए कि जोखिम वाला एलील वास्तव में विकसित होते माउस मस्तिष्क में डीएनए क्षेत्र की गतिविधि को समाप्त कर देता है।

यह कार्य नियामक जीनोम को डिकोड करने के लिए एक शक्तिशाली नया लेंस प्रदान करता है। प्रयोगों के तकनीकी शोर से जैविक संकेतों को अलग करके, क्रोमबीपीनेट हमारे कोशिकाओं को नियंत्रित करने वाली आनुवंशिक संरचना (जेनेटिक सिंटैक्स) का एक स्पष्ट और अधिक सटीक दृश्य प्रस्तुत करता है। यह प्रदर्शित करता है कि डीप लर्निंग मॉडल हल्के (लाइटवेट) और अत्यधिक सटीक दोनों हो सकते हैं, जो विभिन्न कोशिका प्रकारों, पूर्वजों के समूहों और प्रयोगात्मक स्थितियों में सामान्यीकरण करने में सक्षम हैं। अध्ययन बताता है कि जीन विनियमन को नियंत्रित करने वाले नियम पहले की तुलना में अधिक सुसंगत और समझने योग्य हैं, जो मानव लक्षणों और रोगों को चलाने वाले विशिष्ट आनुवंशिक परिवर्तनों की पहचान करने के लिए एक मजबूत ढांचा प्रदान करते हैं। जैसे-जैसे इन मॉडलों को परिष्कृत और लागू किया जाएगा, वे जटिल डेटा को कार्रवाई योग्य जैविक अंतर्दृष्टि में बदलकर, आनुवंशिक भिन्नता के विशाल परिदृश्यों की व्याख्या करने के तरीके को बदलने का वादा करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →