← नवीनतम पेपर
🤖 AI

CausalMoE: A Billion-Scale Multimodal Foundation Model for Granger Causal Discovery with Pattern-Routed Heterogeneous Experts

CausalMoE एक बिलियन-स्केल मल्टीमॉडल फाउंडेशन मॉडल है जो पारंपरिक "वन-साइज़-फिट्स-ऑल" दृष्टिकोणों की सीमाओं को दूर करने के लिए विषम विशेषज्ञों के पैटर्न-रूटेड मिश्रण और कॉज़ैलिटी-अवेयर सेल्फ-अटेंशन का लाभ उठाता है, जिससे टेक्स्टुअल और विजुअल प्रायर्स को एकीकृत करके बेहतर सामान्यीकरण और व्याख्यात्मकता के साथ स्टेट-ऑफ-द-आर्ट ग्रेंजर कॉज़ल डिस्कवरी प्राप्त होती है।

मूल लेखक: Bo Liu, Di Dai, Jingwei Liu, Jiarui Jin, Xiaocheng Fang, Guangkun Nie, Hongyan Li, Shenda Hong

प्रकाशित 2026-06-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bo Liu, Di Dai, Jingwei Liu, Jiarui Jin, Xiaocheng Fang, Guangkun Nie, Hongyan Li, Shenda Hong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शोर-शराबे वाले कमरे में यह समझने की कोशिश कर रहे हैं कि कौन किसे प्रभावित कर रहा है, जहाँ बहुत से लोग एक साथ बातें कर रहे हैं। शायद रसोई से आई एक आवाज़ से लिविंग रूम में हलचल मच जाए, या शायद दो लोग बिना एक-दूसरे से बात किए बस एक ही चुटकुले पर हंस रहे हों। यही ग्रेंजर कॉज़ल डिस्कवरी (Granger Causal Discovery) की चुनौती है: जटिल डेटा के बीच वास्तविक "कारण-और-प्रभाव" (cause-and-effect) की कड़ियों को खोजने की कोशिश करना।

लंबे समय तक, कंप्यूटरों ने इसे एक "वन-साइज़-फिट्स-ऑल" (एक ही नियम सबके लिए) दृष्टिकोण का उपयोग करके हल करने का प्रयास किया। उन्होंने माना कि पूरा कमरा नियमों के एक ही सेट का पालन करता है। लेकिन वास्तविक दुनिया में, नियम बदलते रहते हैं। कभी रसोई शांत होती है, तो कभी वहाँ शोर होता है। जब एक कंप्यूटर एक ऐसे कमरे के लिए एक ही नियम लागू करने की कोशिश करता है जिसका मिजाज बदलता रहता है, तो वह भ्रमित हो जाता है। वह ऐसे संबंध देखने लगता है जो वहां हैं ही नहीं (जैसे यह सोचना कि टोस्टर ने कुत्ते को भौंकने के लिए मजबूर किया क्योंकि वे दोनों एक ही समय पर हुए थे)।

यहाँ आता है CausalMoE, एक नया "बिलियन-स्केल" AI मॉडल जो विशेषज्ञों की एक टीम वाले एक सुपर-स्मार्ट जासूस की तरह काम करता है। यह कैसे काम करता है, इसे सरल भागों में यहाँ दिया गया है:

1. "गिरगिट" रणनीति: पैटर्न-रूटेड एक्सपर्ट्स (Pattern-Routed Experts)

पूरे कमरे का विश्लेषण करने के लिए एक विशाल मस्तिष्क का उपयोग करने के बजाय, CausalMoE डेटा को छोटे टुकड़ों में तोड़ देता है (जैसे हर कुछ सेकंड में कमरे की एक तस्वीर लेना)। फिर यह एक स्मार्ट ट्रैफिक कंट्रोलर (जिसे "पैटर्न-रूटेड मिक्सचर ऑफ हेट्रोजेनियस एक्सपर्ट्स" कहा जाता है) का उपयोग प्रत्येक स्नैपशॉट को देखने के लिए करता है।

  • उपमा: एक अस्पताल के इमरजेंसी रूम की कल्पना करें। यदि कोई मरीज टूटी हुई टांग के साथ आता है, तो आप उसे कार्डियोलॉजिस्ट के पास नहीं भेजते; बल्कि आप उसे ऑर्थोपेडिस्ट (हड्डी विशेषज्ञ) के पास भेजते हैं।
  • यह कैसे काम करता है: CausalMoाMoE डेटा के एक टुकड़े को देखता है और पूछता है, "यह किस तरह का पैटर्न है? क्या यह एक स्थिर लय है? क्या यह एक अराजक उछाल है? क्या यह एक मौसमी रुझान है?" फिर यह तुरंत उस विशिष्ट टुकड़े को सबसे उपयुक्त विशेषज्ञ (expert) के पास भेज देता है।
    • एक विशेषज्ञ मौसमी रुझानों (जैसे मौसम बदलना) को पहचानने में माहिर है।
      {% if context %}
    • दूसरा विशेषज्ञ तेज़, अराजक परिवर्तनों (जैसे शेयर बाजार की गिरावट) में माहिर है।
    • एक अन्य सिमेंटिक विशेषज्ञ है जो नंबरों के पीछे की "कहानी" पढ़ता है।
    • एक अन्य विजुअल विशेषज्ञ है जो डेटा के "आकार" को देखता है।

विभिन्न स्थितियों के लिए सही विशेषज्ञ को काम सौंपकर, यह मॉडल अलग-अलग प्रकार के कारणों को आपस में मिलने से रोकता है, जिससे यह गलत संबंध बनाने से बच जाता है।

2. "मल्टीमॉडल" सुपरपावर: लाइनों के बीच पढ़ना

पुराने मॉडल केवल कच्चे नंबरों (तापमान, शेयर की कीमत, हृदय गति) को देखते थे। CausalMoE अलग है क्योंकि यह मल्टीमॉडल (multimodal) है। यह केवल नंबरों को नहीं देखता; यह उन्हें बेहतर समझ के लिए अन्य भाषाओं में अनुवादित करता है।

  • टेक्स्ट ट्रांसलेटर: यह नंबरों के एक टुकड़े को एक टेक्स्ट प्रॉम्प्ट (जैसे एक छोटी कहानी या समाचार की हेडलाइन) में बदल देता है और एक विशाल लैंग्वेज मॉडल (LLM) से उसे पढ़ने के लिए कहता है। इससे AI को डेटा के "संदर्भ" या "मिजाज" को समझने में मदद मिलती है।
  • विजुअल आर्टिस्ट: यह नंबरों को एक तस्वीर (जैसे एक लाइन ग्राफ) में बदल देता है और एक विजन-लैंग्वेज मॉडल (VLM) से उसे देखने के लिए कहता है। इससे AI को डेटा के "आकार" को देखने में मदद मिलती है, जैसे कि एक तीखा शिखर या एक चिकना वक्र, जिसे स्प्रेडशीट में देखना कठिन हो सकता है।

इससे क्या मदद मिलती है? कल्पना कीजिए कि आप अंदाजा लगाने की कोशिश कर रहे हैं कि कार क्यों रुकी। यदि आप केवल स्पीडोमीटर (नंबर) देखते हैं, तो आपको लग सकता है कि पेट्रोल खत्म हो गया। लेकिन यदि आप कार की एक तस्वीर (विजुअल) देखते हैं और एक नोट (टेक्स्ट) पढ़ते हैं जिसमें लिखा है "फ्लैट टायर", तो आपको असली जवाब मिल जाता है। CausalMoE इन अतिरिक्त "सुरागों" का उपयोग करके वास्तविक कारण का पता लगाता है, भले ही नंबर अस्त-व्यस्त या कम हों।

3. "ट्रुथ डिटेक्टर": कॉज़ैलिटी-अवेयर अटेंशन (Causality-Aware Attention)

एक बार जब विशेषज्ञ अपना काम कर लेते हैं, तो मॉडल को यह तय करना होता है कि किसने किसको प्रभावित किया। इसके लिए यह कॉज़ैलिटी-अवेयर सेल्फ-अटेंशन नामक एक विशेष टूल का उपयोग करता है।

  • उपमा: दोस्तों के एक समूह के बारे में सोचें जो यह तय करने की कोशिश कर रहे हैं कि अफवाह किसने शुरू की। सभी एक साथ बात करने के बजाय, यह टूल AI को यह पूछने के लिए मजबूर करता है, "यदि मैं इस व्यक्ति की कहानी बदल दूँ, तो क्या उस व्यक्ति की कहानी बदल जाएगी?"
  • यह AI को बहुत सख्त होने के लिए मजबूर करता है और केवल उन्हीं चरों (variables) के बीच रेखा खींचता है जो वास्तव में एक-दूसरे को प्रभावित करते हैं, जिससे शोर (noise) को अनदेखा किया जा सके। इसके परिणामस्वरूप एक साफ, सरल मानचित्र (एक "स्पार्स ग्राफ") मिलता है, न कि नकली कनेक्शनों का उलझा हुआ जाल।

यह एक बड़ी बात क्यों है?

पेपर का दावा है कि CausalMoE दो मुख्य कारणों से एक बड़ी छलांग है:

  1. यह तब काम करता है जब डेटा कम हो: आमतौर पर, AI को सीखने के लिए हजारों उदाहरणों की आवश्यकता होती है। CausalMoE बहुत कम उदाहरणों के साथ (एक "फ्यू-शॉट" सेटिंग में) नियमों को समझ सकता है क्योंकि यह खाली जगहों को भरने के लिए अपने टेक्स्ट और इमेज विशेषज्ञों के "विश्व ज्ञान" (world knowledge) का उपयोग करता है। यह एक ऐसे जासूस की तरह है जो केवल कुछ सुरागों के साथ अपराध सुलझा सकता है क्योंकि वह पहले से जानता है कि अपराधी आमतौर पर कैसे काम करता है।
  2. यह अराजकता को संभालता है: वास्तविक दुनिया का डेटा अव्यवस्थित होता है और इसका व्यवहार बदलता रहता है। चूंकि CausalMoE अलग-अलग टुकड़ों को अलग-अलग विशेषज्ञों के पास भेजता है, इसलिए यह भ्रमित नहीं होता जब नियम बदलते हैं। यह मौके पर ही खुद को ढाल लेता है।

संक्षेप में: CausalMoE एक बिलियन-पैरामीटर वाला AI है जो बदलती दुनिया पर एक ही नियम थोपने की कोशिश करना बंद कर देता है। इसके बजाय, यह विशेषज्ञों की एक टीम की तरह काम करता है जो नंबरों को कहानियों और चित्रों में अनुवादित करते हैं, डेटा को सही विशेषज्ञ के पास भेजते हैं, और फिर कारण और प्रभाव का एक स्पष्ट, ईमानदार नक्शा बनाते हैं। पेपर दिखाता है कि यह मानक परीक्षणों पर पिछले सभी तरीकों को पछाड़ देता है, विशेष रूप से तब जब डेटा बहुत कम मात्रा में उपलब्ध हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →