← नवीनतम पेपर
🤖 machine learning

Integrating Causal DAGs in Deep RL: Activating Minimal Markovian States with Multi-Order Exposure

यह शोध पत्र MOSE (मल्टी-ऑर्डर स्टेट एक्सपोज़र) को पेश करके डीप रिइन्फोर्समेंट लर्निंग में अनुदैर्ध्य कारण ग्राफों (longitudinal causal graphs) से प्रमाणित रूप से मार्कोवियन अवस्थाओं के निर्माण की चुनौती को संबोधित करता है, जो कि यह दर्शाता है कि नियंत्रित अतिरेक (controlled redundancy), न कि केवल न्यूनतम पर्याप्तता (minimal sufficiency), कारण अवस्था सूचना के प्रदर्शन लाभों को अनलॉक करने के लिए आवश्यक है, और इसके लिए Q-फंक्शन में मल्टी-ऑर्डर ऐतिहासिक अवस्था निर्माणों को फीड किया जाता है।

मूल लेखक: Jiamin Xu, Jacqueline Maasch, Kyra Gan

प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiamin Xu, Jacqueline Maasch, Kyra Gan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम खेलना या भूलभुलैया (maze) से गुजरना सिखा रहे हैं। अच्छे निर्णय लेने के लिए, रोबोट को अपने वर्तमान "अवस्था" (state) का पता होना चाहिए। एक आदर्श दुनिया में, रोबोट को अगला कदम उठाने के लिए केवल अभी के सटीक क्षण को देखने की आवश्यकता होगी। इसे मार्कोव प्रॉपर्टी (Markov property) कहा जाता है।

हालाँकि, वास्तविक दुनिया में चीजें अस्त-व्यस्त होती हैं। रोबोट के सेंसर (जैसे कैमरे) कच्चा डेटा देते हैं, लेकिन वह डेटा पूरी कहानी नहीं बताता। उदाहरण के लिए, यदि एक रोबोट एक गेंद देखता है, तो उसे यह नहीं पता चलेगा कि गेंद उसकी ओर लुढ़क रही है या उससे दूर जा रही है, जब तक कि वह एक सेकंड पहले गेंद कहाँ थी, यह याद न रखे।

यहाँ समस्या यह है: यदि रोबोट अतीत को भूल जाता है, तो वह गलत अनुमान लगाता है। यदि वह सब कुछ याद रखता है (पिछले 100 सेकंड का हर एक पिक्सेल), तो वह अभिभूत हो जाता है और बहुत धीरे सीखता है।

यह शोध पत्र, "Integrating Causal DAGs in Deep RL," इस "गोल्डिलॉक्स" (Goldilocks) समस्या का समाधान करता है: यानी यह पता लगाना कि याद रखने के लिए इतिहास की बिल्कुल सही मात्रा कितनी होनी चाहिए।

मुख्य विचार: "न्यूनतम" बनाम "अनावश्यक" (The "Minimal" vs. The "Redundant")

लेखक इसे दो चरणों में हल करते हैं, जिसमें तर्क (कारणता/causality) और थोड़े "नियंत्रित अराजकता" (redundancy) का मिश्रण उपयोग किया जाता है।

1. "न्यूनतम" अवस्था (एक पूरी तरह से पैक किया गया सूटकेस)

सबसे पहले, लेखक एक कॉज़ल ग्राफ (Causal Graph) (एक मानचित्र जो दिखाता है कि कौन से चर/variables किन अन्य चरों का कारण बनते हैं) का उपयोग यह पता लगाने के लिए करते हैं कि एक आदर्श निर्णय लेने के लिए आवश्यक जानकारी की बिल्कुल न्यूनतम मात्रा कितनी है।

  • उपमा: कल्पना कीजिए कि आप यात्रा के लिए पैकिंग कर रहे हैं। आप जीवित रहने के लिए कपड़ों की बिल्कुल न्यूनतम मात्रा साथ ले जाना चाहते हैं। आप ठीक वही गणना करते हैं जिसकी आपको आवश्यकता है: एक शर्ट, एक पैंट और मोज़े। आप बाकी सब कुछ पीछे छोड़ देते हैं।
  • परिणाम: सैद्धांतिक रूप से, यह "न्यूनतम सूटकेस" उत्तम है। इसमें कोई फालतू चीज़ नहीं है।
  • चुनौती: जब लेखकों ने इस "न्यूनतम सूटकेस" को एक आधुनिक AI (एक डीप न्यूरल नेटवर्क) को खिलाने की कोशिश की, तो यह विफल रहा। AI भ्रमित हो गया। यह पता चलता है कि AI नेटवर्क उन छात्रों की तरह होते हैं जो केवल तथ्यों के बजाय थोड़े अतिरिक्त संदर्भ (context) के साथ बेहतर सीखते हैं। "न्यूनतम" अवस्था बहुत विरल (sparse) थी, जिससे AI के लिए पैटर्न सीखना कठिन हो गया।

2. समाधान: MOSE (Multi-Order State Exposure)

इसे ठीक करने के लिए, लेखकों ने MOSE (Multi-Order State Exposure) का आविष्कार किया।

  • उपमा: छात्र को केवल "न्यूनतम सूटकेस" देने के बजाय, MOSE उन्हें अलग-अलग आकारों के कई सूटकेस देता है।
    • सूटकेस A: केवल वर्तमान क्षण।
    • सूटकेस B: वर्तमान क्षण + पिछला 1 सेकंड।
    • सूटकेस C: वर्तमान क्षण + पिछला 2 सेकंड।
    • ...और इसी तरह।
  • यह कैसे काम करता है: AI इन सभी अलग-अलग सूटकेसों को एक ही समय में देखता है। उसे "न्यूनतम" संस्करण भी देखने को मिलता है, और अतिरिक्त इतिहास वाले संस्करण भी देखने को मिलते हैं।
  • यह क्यों मदद करता है: यह एक "ट्रेनिंग व्हील" की तरह काम करता है। AI सरल, छोटे इतिहास के साथ शुरू कर सकता है और धीरे-धीरे लंबे इतिहास का उपयोग करना सीख सकता है जब वह मददगार हो। यह एक छात्र को संकेत देने, फिर एक बड़ा संकेत देने, फिर एक साथ पूरा उत्तर देने जैसा है, ताकि वह समझ सके कि कौन से सुराग वास्तव में महत्वपूर्ण हैं।

3. "दोनों दुनियाओं का सर्वश्रेष्ठ" (Causal-MOSE)

लेखकों ने Causal-MOSE नामक एक हाइब्रिड दृष्टिकोण भी आज़माया। यह "परफेक्टली पैक किए गए न्यूनतम सूटकेस" (जो कॉज़ल मैप से प्राप्त हुआ है) को "कई सूटकेसों" वाले दृष्टिकोण के साथ जोड़ता है।

  • परिणाम: यह अक्सर विजेता रहा। इसने AI को जानकारी का "परफेक्ट कोर" (जो गणित द्वारा गारंटीकृत है) दिया, लेकिन इसे सीखने की प्रक्रिया में मदद के लिए अतिरिक्त "अनावश्यक" (redundant) जानकारी जोड़ने की अनुमति भी दी।

उनके प्रयोगों ने क्या दिखाया

टीम ने इन पर परीक्षण किया:

  1. सिंथेटिक गेम्स: काल्पनिक दुनिया जहाँ वे सटीक नियम (कॉज़ल ग्राफ) जानते थे।
  2. वास्तविक गेम्स: विशेष रूप से GOPHER नामक एक अटारी (Atari) गेम।

निष्कर्ष:

  • मानक विधि (Frame Stacking): यह वर्तमान उद्योग मानक है, जहाँ आप पिछले 4 वीडियो फ्रेम को एक साथ जोड़ देते हैं। यह ठीक काम करता है, लेकिन यह एक ऐसे सूटकेस को ले जाने जैसा है जिसमें बहुत सारा अनावश्यक सामान भरा है जिसकी आपको ज़रूरत नहीं है।
  • न्यूनतम अवस्था (Minimal State): केवल गणितीय रूप से पूर्ण, न्यूनतम इतिहास का उपयोग करने से AI का प्रदर्शन मानक विधि की तुलना में खराब हो गया।
  • MOSE: नया तरीका मानक विधि और न्यूनतम विधि दोनों को लगातार पीछे छोड़ गया।
  • बड़ा सबक: शोध पत्र निष्कर्ष निकालता है कि "न्यूनतम पर्याप्तता (Minimal sufficiency) पर्याप्त नहीं है।" केवल इसलिए कि किसी अवस्था में सैद्धांतिक रूप से सही होने के लिए जानकारी की न्यूनतम मात्रा है, इसका मतलब यह नहीं है कि वह न्यूरल नेटवर्क के सीखने के लिए सबसे अच्छी है। आपको नियंत्रित अतिरेक (controlled redundancy) (थोड़ा सा अतिरिक्त, अव्यवस्थित इतिहास) की आवश्यकता होती है ताकि AI तेजी से और बेहतर तरीके से सीख सके।

एक वाक्य में सारांश

यह शोध पत्र हमें सिखाता है कि एक स्मार्ट AI को प्रशिक्षित करने के लिए, आपको उसे केवल न्यूनतम तथ्य नहीं देने चाहिए (जो उसे भ्रमित करते हैं); इसके बजाय, आपको कम और अधिक इतिहास का मिश्रण देना चाहिए ताकि वह यह पता लगा सके कि जीतने के लिए उसे क्या याद रखने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →