← नवीनतम पेपर
🤖 machine learning

CoDiffGRN: Rethinking Gene Regulatory Network Inference via the BEELINE-KGC Benchmark and Co-evolutionary Discrete Diffusion

यह शोध पत्र CoDiffGRN प्रस्तुत करता है, जो एक सह-विकासवादी (co-evolutionary) डिस्क्रीट डिफ्यूजन फ्रेमवर्क है जिसे नए BEELINE-KGC बेंचमार्क पर मूल्यांकित किया गया है, जो जीन नियामक नेटवर्क अनुमान (gene regulatory network inference) को एक इंडक्टिव रैंकिंग समस्या के रूप में पुनर्गठित करता है ताकि प्रयोगात्मक सत्यापन के लिए उच्च-विश्वास वाले, नवीन नियामक अंतर्संबंधों की खोज में महत्वपूर्ण सुधार किया जा सके।

मूल लेखक: Jiaze Song, Runhao Zhao, Minghao Xu, Bin Cui, Wentao Zhang

प्रकाशित 2026-07-16
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiaze Song, Runhao Zhao, Minghao Xu, Bin Cui, Wentao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

अपने शरीर की कल्पना एक हलचल भरे, हाई-टेक शहर के रूप में करें। इस शहर में, प्रत्येक कोशिका एक अनूठा मोहल्ला है जिसका अपना विशिष्ट कार्य है—कुछ मांसपेशी कोशिकाएं हैं, कुछ तंत्रिका कोशिकाएं हैं, और कुछ प्रतिरक्षा रक्षक (immune defenders) हैं। लेकिन एक कोशिका को कैसे पता चलता है कि उसे क्या काम करना है? यह केवल जागकर निर्णय नहीं लेती; यह निर्देशों के एक जटिल सेट का पालन करती है जो इसके DNA में लिखे होते हैं। इन निर्देशों को एक मास्टर कंट्रोल सिस्टम द्वारा प्रबंधित किया जाता है जिसे जीन रेगुलेटरी नेटवर्क (GRN) कहा जाता है। इस नेटवर्क को स्विचों के एक विशाल, अदृश्य जाल के रूप में सोचें। कुछ प्रोटीन, जिन्हें ट्रांसक्रिप्शन फैक्टर्स (TFs) कहा जाता है, स्विच-ऑपरेटर के रूप में कार्य करते हैं। जब एक TF एक स्विच को घुमाता है, तो वह एक विशिष्ट जीन को "ऑन" या "ऑफ" कर देता है, जिससे कोशिका को प्रोटीन बनाने या उसे रोकने का निर्देश मिलता है।

वैज्ञानिकों के लिए, इस जाल का मानचित्र बनाना एक ऐसे शहर का नक्शा बनाने की कोशिश करने जैसा है जहाँ सड़कें लगातार बदल रही हैं और नक्शे में आधे रास्ते गायब हैं। वे सिंगल-सेल आरएनए सीक्वेंसिंग (single-cell RNA sequencing) नामक एक शक्तिशाली उपकरण का उपयोग करते हैं ताकि एक एकल कोशिका में प्रत्येक जीन का एक स्नैपशॉट लिया जा सके। हालाँकि, डेटा अव्यवस्थित है, जैसे तूफान में किसी की फुसफुसाहट सुनने की कोशिश करना। बड़ी चुनौती केवल एक नक्शा बनाना नहीं है; बल्कि एक ऐसा नक्शा बनाना है जो उन नए मोहल्लों के लिए भी काम करे जिन्हें उन्होंने पहले नहीं देखा है। यदि कोई वैज्ञानिक एक नए प्रकार की कोशिका या एक दुर्लभ बीमारी की खोज करता है, तो उन्हें एक ऐसे नक्शे की आवश्यकता होती है जो यह भविष्यवाणी कर सके कि नए हिस्से पुराने सिस्टम में कैसे फिट होते हैं, बिना खो जाए। यह वही पहेली है जिसे यह शोध पत्र हल करता है: जीवन की निर्देश पुस्तिका का एक स्मार्ट, अधिक लचीला नक्शा कैसे बनाया जाए।


समस्या: पुराने नक्शे और टूटे हुए दिशा-सूचक यंत्र (Compasses)

शोधकर्ताओं ने शुरुआत में इस बात की ओर इशारा किया कि वर्तमान में वैज्ञानिक इन जीन नेटवर्क को मैप करने के लिए अपने कंप्यूटर प्रोग्रामों का परीक्षण कैसे करते हैं, इसमें एक अजीब समस्या है। कल्पना कीजिए कि आप एक छात्र को शहर में नेविगेट करना सिखा रहे हैं। यदि आप उन्हें केवल उन्हीं सड़कों पर अभ्यास करने देते हैं जिन पर उनका परीक्षण किया जाना है, तो वे एक बेहतरीन स्कोर प्राप्त कर सकते हैं। लेकिन यदि आप उन्हें एक बिल्कुल नए मोहल्ले में छोड़ देते हैं जहाँ ऐसी सड़कें हैं जिन्हें उन्होंने कभी नहीं देखा है, तो वे दुर्घटनाग्रस्त हो सकते हैं।

जीन अनुसंधान की दुनिया में यही हो रहा था। अधिकांश कंप्यूटर मॉडल एक ही सेट के जीनों (एक "ट्रांसडक्टिव" सेटिंग) पर प्रशिक्षित और परीक्षण किए जा रहे थे। वे ज्ञात सड़कों को याद रखने में बहुत अच्छे थे लेकिन नए, अनदेखे जीनों के कनेक्शन का अनुमान लगाने में बहुत खराब थे। इसके अलावा, उनके ग्रेडिंग का तरीका भी त्रुटिपूर्ण था। पुराना ग्रेडिंग सिस्टम पूरे मानचित्र को देखता था और पूछता था, "क्या आपने औसत सही प्राप्त किया?" लेकिन वास्तविक जीवन में, एक जीवविज्ञानी के पास हर एक संभावित कनेक्शन का परीक्षण करने का बजट नहीं होता है। उनके पास केवल सबसे संभावित शीर्ष कुछ कनेक्शनों का परीक्षण करने के लिए ही पैसा होता है। यदि कोई मॉडल शीर्ष 10 भविष्यवाणियों को गलत करता है, तो वह बेकार है, भले ही उसने निचले 90% को सही किया हो। पुराने परीक्षण एक छात्र को उसके गणित के औसत स्कोर पर ग्रेड देने जैसे थे, भले ही वह उस एक विशिष्ट समस्या में विफल रहा हो जिसे शिक्षक वास्तव में हल करने की आवश्यकता समझते थे।

समाधान: एक नया नक्शा और एक नया दिशा-सूचक यंत्र

इसे ठीक करने के लिए, जियाज़ सांग और सहयोगियों के नेतृत्व वाली टीम ने दो बड़े काम किए।

सबसे पहले, उन्होंने BEELINE-KGC नामक एक नया परीक्षण मैदान बनाया।
मॉडलों को प्रशिक्षण के दौरान सभी जीनों को झांकने देने के बजाय, उन्होंने एक "जीन-होल्डआउट" चुनौती बनाई। उन्होंने सीखने के चरण के दौरान जीनों के एक सेट (अनजानों) को छिपा दिया और उन्हें केवल परीक्षण के दौरान प्रकट किया। इसने मॉडलों को सामान्यीकरण (generalize) करने के लिए मजबूर किया, ठीक वैसे ही जैसे एक वास्तविक वैज्ञानिक को आवश्यकता होगी। उन्होंने ग्रेडिंग प्रणाली को भी बदला। पूरे मानचित्र को देखने के बजाय, उन्होंने "Hits@K" के आधार पर ग्रेडिंग करना शुरू किया। यह एक सरल प्रश्न पूछता है: "यदि मैं केवल आपके शीर्ष 10 अनुमानों को देखता हूँ, तो क्या आपने वास्तविक कनेक्शन खोज लिए?" यह वास्तविक दुनिया की बाधा की नकल करता है जहाँ वैज्ञानिक केवल कुछ ही भविष्यवाणियों का परीक्षण करने का खर्च उठा सकते हैं।

दूसना, उन्होंने CoDiffGRN नामक एक नया मॉडल बनाया।
इस मॉडल को एक ऐसे जासूस के रूप में सोचें जो न केवल सड़कों (जीनों के बीच संबंध) को देखता है बल्कि यातायात के पैटर्न (जीनों की गतिविधि) पर भी ध्यान देता है। पिछले मॉडलों ने सड़कों और यातायात को अलग-अलग चीजों के रूप में माना। हालाँकि, CoDiffGRN एक तकनीक का उपयोग करता है जिसे को-इवोल्यूशनरी डिस्क्रीट डिफ्यूजन (Co-evolutionary Discrete Diffusion) कहा जाता है।

यह समझने के लिए एक मनोरंजक तरीका है कि यह कैसे काम करता है:
कल्पना कीजिए कि आपके पास शहर के मानचित्र की एक शोर भरी, धुंधली फोटो है। आप इसे साफ करना चाहते हैं।

  1. डिस्क्रीटाइजेशन (Discretization): पहले, मॉडल अव्यवस्थित डेटा को सरल बनाता है। निरंतर यातायात के प्रवाह को देखने के बजाय, यह कोशिकाओं को विशिष्ट "क्लस्टर्स" (जैसे "मॉर्निंग रश," "लंच ब्रेक," "नाइट शिफ्ट") में समूहित करता है। यह धुंधले डेटा को स्पष्ट, ब्लॉक वाले पिक्सेल (0s और 1s) में बदल देता है।
  2. को-इवोल्यूशन (Co-evolution): अब, मॉडल मानचित्र को "डीनॉइज" (शोर हटाना) करना शुरू करता है। यह केवल यह अनुमान नहीं लगाता कि सड़कें कहाँ हैं; यह यातायात के पैटर्न के आधार पर सड़कों का अनुमान लगाता है। यदि एक जीन "सक्रिय" है (जैसे एक व्यस्त सड़क), तो मॉडल जानता है कि इसके अन्य सक्रिय जीनों के साथ संबंध होने की अधिक संभावना है। यह सीखता है कि जीन की स्थिति और कनेक्शन की स्थिति दोनों एक साथ बदलते हैं, जैसे कि तालमेल में नाचने वाले नर्तक।
  3. TASS (जादुई ट्रिक): चूंकि डेटा इतना कम है (हर संभव जीन इंटरेक्शन के पर्याप्त उदाहरण नहीं हैं), मॉडल TF-ALL सबग्राफ सैंपलिंग (TASS) नामक रणनीति का उपयोग करता है। कल्पना कीजिए कि आप केवल छोटे, यादृच्छिक मोहल्लों को देखकर पूरे शहर के मानचित्र को सीखने की कोशिश कर रहे हैं। TASS इस मामले में स्मार्ट है; यह विशेष रूप से उन मोहल्लों को चुनता है जिनमें "स्विच-ऑपरेटर" (TFs) और उनके लक्ष्य शामिल हैं, यह सुनिश्चित करता है कि मॉडल बार-बार शहर के सबसे महत्वपूर्ण हिस्सों को देखे, भले ही कुल डेटा कम हो।

उन्होंने क्या पाया

जब उन्होंने अपने नए, कठिन बेंचमार्क (BEELINE-KGC) पर CoDiffGRN का परीक्षण किया, तो परिणाम आश्चर्यजनक थे।

  • पुराने मॉडल लड़खड़ा गए: अधिकांश मौजूदा मॉडल, जो ज्ञात सड़कों को याद रखने पर निर्भर थे, "अनदेखे जीनों" का सामना करने पर पूरी तरह से विफल रहे। उनका स्कोर शून्य के करीब गिर गया। वे सामान्यीकरण नहीं कर सके।
  • CoDiffGRN सफल रहा: नया मॉडल केवल जीवित नहीं रहा; वह फला-फूला। इसने लगातार शीर्ष रैंकिंग में सही कनेक्शन खोजे, और पिछले सर्वोत्तम तरीकों की तुलना में काफी अंतर से बेहतर प्रदर्शन किया। कुछ मामलों में, इसने अगले सबसे अच्छे मॉडल की तुलना में सही शीर्ष-10 भविष्यवाणियों को खोजने की क्षमता में 40% से अधिक सुधार किया।
  • "क्यों" मायने रखता है: जब उन्होंने "को-इवोल्यूशन" वाले हिस्से को हटाया (मॉडल को यातायात को देखे बिना सड़कों का अनुमान लगाने के लिए बनाया), या स्मार्ट सैंपलिंग (TASS) को हटाया, तो मॉडल का प्रदर्शन गिर गया। इसने साबित किया कि जीन गतिविधि और कनेक्शन को एक साथ देखना ही सफलता का रहस्य था।

मुख्य निष्कर्ष

यह शोध पत्र सुझाव देता है कि जीवन को वास्तव में समझने के लिए, हमें अपने AI को पुराने डेटा पर प्रशिक्षित करना बंद करना होगा और इसे अज्ञात के साथ चुनौती देनी होगी। इन मॉडलों के परीक्षण के तरीके को बदलकर और एक ऐसा सिस्टम बनाकर जो जीन गतिविधि और नेटवर्क कनेक्शन के बीच के नृत्य को समझता है, लेखकों ने एक ऐसा उपकरण बनाया है जो बहुत बेहतर तरीके से भविष्यवाणी कर सकता है कि नए जैविक सिस्टम कैसे व्यवहार करेंगे। यह उन दुर्लभ बीमारियों या नई कोशिका प्रकारों के लिए निर्देश मैनुअल को जल्दी से मैप करने की दिशा में एक कदम है, जिससे वैज्ञानिकों को इलाज खोजने में मदद मिलेगी। हालांकि यह मॉडल शक्तिशाली है, लेखक नोट करते हैं कि इसके लिए भारी कंप्यूटिंग शक्ति की आवश्यकता होती है, और वे भविष्य में इसे और भी तेज़ और अधिक बहुमुखी बनाने की योजना बना रहे हैं। लेकिन फिलहाल, उन्होंने दिखाया है कि जीन मानचित्रों के बारे में सोचने का एक नया तरीका बहुत बेहतर उत्तर दे सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →