← नवीनतम पेपर
🤖 machine learning

MDP Planning as Policy Inference

यह शोध पत्र एपिसोडिक मार्कोव निर्णय प्रक्रिया (मार्कोव डिसीजन प्रोसेस) नियोजन को नीतियों पर बेयसियन अनुमान (बेयसियन इन्फरेंस) के रूप में पुनर्गठित करता है, जिसमें इष्टतम व्यवहारों के पश्च वितरण (पोस्टीरियर डिस्ट्रीब्यूशन) का सन्निकटन करने और एंट्रॉपी रेगुलराइजेशन के बजाय पश्च भविष्य कहनेवाला नमूनाकरण (पोस्टीरियर प्रेडिक्टिव सैंपलिंग) के माध्यम से स्टोकेस्टिक नियंत्रण को सक्षम करने के लिए एक वेरिएशनल सीक्वेंशियल मोंटे कार्लो विधि प्रस्तुत की गई है।

मूल लेखक: David Tolpin

प्रकाशित 2026-04-14✓ Author reviewed
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: David Tolpin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को खजाना खोजने के लिए एक पेचीदा भूलभुलैया (maze) में रास्ता दिखाना सिखा रहे हैं।

पुराना तरीका: "एन्ट्रॉपी शेफ" (The Entropy Chef)

अधिकांश आधुनिक AI विधियाँ (जैसे कि इस पेपर में उल्लेखित सॉफ्ट एक्टर-क्रिटिक) एक ऐसे शेफ की तरह काम करती हैं जो बहुत अधिक अनुमानित (predictable) होने से डरता है। रोबोट को एक्सप्लोर करने के लिए प्रेरित करने हेतु, शेफ रेसिपी में "एन्ट्रॉपी" (यानी रैंडमनेस/अनिश्चितता) नामक एक गुप्त सामग्री मिला देता है।

  • समस्या: शेफ को वास्तव में यह नहीं पता होता कि रोबोट को रैंडम क्यों होना चाहिए। वे बस देखने के लिए मिश्रण में "अराजकता" (chaos) की एक निश्चित मात्रा मिला देते हैं कि क्या होता है। यदि रोबोट कहीं फंस जाता है, तो शेफ बस अराजकता की मात्रा को थोड़ा बदल देता है। यह अनुमान लगाने और फिर जांचने का एक खेल है। रोबोट एक ऐसी एकल, धुंधली रणनीति सीखता है जो कई चीजों में "ठीक-ठाक" होती है लेकिन शायद सबसे अच्छी चीज में एकदम सटीक नहीं होती।

नया तरीका: "विशेषज्ञों की परिषद" (The Council of Experts)

यह पेपर एक अलग दृष्टिकोण प्रस्तावित करता है जिसे MDP प्लानिंग ऐज़ पॉलिसी इन्फरेंस कहा जाता है। रैंडम अराजकता जोड़ने के बजाय, लेखक रोबोट की रणनीति को एक रहस्य को सुलझाने की तरह देखते हैं।

इसे इस तरह समझें:

  1. परिषद (The Council): कल्पना कीजिए कि 100 अलग-अलग विशेषज्ञों (पार्टिकल्स) से भरा एक कमरा है। प्रत्येक विशेषज्ञ के पास भूलभुलैया को हल करने का थोड़ा अलग विचार है।
  2. परीक्षण (The Test): हम सभी 100 विशेषज्ञों को एक ही समय में भूलभुलैया में भेजते हैं।
  3. ट्विस्ट (The "Shared Reality"): पुराने तरीके में, यदि दो विशेषज्ञ भूलभुलैया के किसी फिसलन भरे हिस्से में कदम रखते हैं, तो वे केवल बदकिस्मती के कारण अलग-अलग दिशाओं में फिसल सकते हैं। इससे यह बताना मुश्किल हो जाता है कि कौन वास्तव में स्मार्ट था और कौन सिर्फ बदकिस्मत था।
    • नवाचार (The Innovation): लेखक कहते हैं, "आइए हम भूलभुलैया को सभी के लिए एक जैसा व्यवहार करने दें।" यदि विशेषज्ञ A और विशेषज्ञ B दोनों एक ही फिसलन भरी टाइल पर कदम रखते हैं, तो वे दोनों बिल्कुल एक ही दिशा में फिसलेंगे। यह सुनिश्चित करता है कि यदि एक विशेषज्ञ दूसरे से बेहतर प्रदर्शन करता है, तो यह इसलिए है क्योंकि उसने बेहतर चुनाव किया, न कि इसलिए कि ब्रह्मांड उसके प्रति अधिक दयालु था।
  4. वोटिंग (The Voting): दौड़ के बाद, हम देखते हैं कि किसने सबसे ज्यादा खजाना पाया। हम केवल एक "विजेता" को नहीं चुनते और बाकी सबको निकाल नहीं देते। इसके बजाय, हम पूरे समूह को बनाए रखते हैं, लेकिन हम उन विशेषज्ञों को अधिक "वोटिंग पावर" देते हैं जिन्होंने अच्छा प्रदर्शन किया।
  5. निर्णय (The Decision): जब रोबोट को वास्तविक दुनिया में कोई कदम उठाना होता है, तो वह एक कठोर योजना का पालन नहीं करता है। इसके बजाय, वह परिषद से एक विशेषज्ञ को रैंडमली चुनता है (उनके पिछले प्रदर्शन के आधार पर भार देकर) और पूछता है, "आप क्या करेंगे?"

यह बेहतर क्यों है? (रूपक/Metaphors)

1. अनिश्चितता बनाम रैंडमनेस (Uncertainty vs. Randomness)

  • पुराना तरीका: रोबोट रैंडम है क्योंकि हमने उसे रैंडम होने के लिए कहा है (जैसे एक घूमता हुआ लट्टू)।
  • नया तरीका: रोबोट रैंडम है क्योंकि वह अनिश्चित है।
    • उपमा: कल्पना कीजिए कि आप सड़क के एक मोड़ पर खड़े हैं।
      • यदि आप निश्चित हैं कि बायां रास्ता सोने की ओर जाता है, तो आप 100% समय बाएं जाएंगे।
      • यदि आप अनिश्चित हैं (शायद बायां रास्ता सोने का है, या शायद दायां), तो आप सिक्का उछाल सकते हैं।
    • इस नए तरीके में, रोबलेट तभी रैंडम व्यवहार करता है जब वह वास्तव में नहीं जानता कि कौन सा रास्ता सबसे अच्छा है। यदि वह उत्तर जानता है, तो वह 100% निर्णायक बन जाता है। इसे थॉम्पसन सैंपलिंग कहा जाता है।

2. "फिसलन" वाली समस्या (The "Slippery" Problem)
यह पेपर AI ट्रेनिंग की एक विशिष्ट सिरदर्द को हल करता है। कल्पना कीजिए कि आप एक वीडियो गेम पर एक ड्राइवर को प्रशिक्षित कर रहे हैं जहाँ कार कभी-कभी फिसलती है।

  • यदि आप 100 ड्राइवरों को प्रशिक्षित करते हैं और वे हर बार अलग-अलग तरह से फिसलते हैं, तो आप यह नहीं बता सकते कि ड्राइवर A बेहतर ड्राइवर है या ड्राइवर B, या क्या ड्राइवर A केवल सड़क की स्थितियों के कारण भाग्यशाली था।
  • लेखकों की विधि "सड़क की स्थितियों" (फिसलन) को सभी 100 ड्राइवरों के लिए समान बनाने के लिए मजबूर करती है। अब, एकमात्र अंतर ड्राइविंग कौशल का है। यह सीखने की प्रक्रिया को बहुत तेज़ और अधिक सटीक बनाता है।

परिणाम: क्या हुआ?

लेखकों ने ब्लैकजैक (Blackjack) और ग्रिड वर्ल्ड्स (Grid Worlds - भूलभुलैया) जैसे खेलों पर इसका परीक्षण किया।

  • भूलभुलैया में: पुराना तरीका (SAC) कभी-कभी रोबोट को केवल "रैंडम" होने या एक्सप्लोर करने के लिए दीवारों के पास भटकने पर मजबूर करता था। नया तरीका (पॉलिसी इन्फरेंस) रोबोट को लक्ष्य पर केंद्रित रखता है। वह केवल तभी भटकता है जब वह वास्तव में भ्रमित होता है।
  • ब्लैकजैक में: नए तरीके ने रैंडमनेस सेटिंग्स को कम ट्यून किए बिना पुराने तरीके की तुलना में बेहतर रणनीति खोजी।
  • चुनौती (The Catch): नया तरीका इस बात के प्रति बहुत संवेदनशील है कि आप जीतने के लिए कितना "रिवॉर्ड" (इनाम) देते हैं। यदि इनाम बहुत बड़ा है, तो रोबोट बहुत जल्दी आत्मविश्वासी हो जाता है। यदि इनाम छोटा है, तो वह लंबे समय तक अनिश्चित रहता है। पुराना तरीका इन नंबरों के प्रति थोड़ा अधिक उदार है।

मुख्य निष्कर्ष (The Bottom Line)

यह पेपर हमें सिखाता है कि AI को सीखने में मदद करने के लिए उसे रैंडम होने के लिए मजबूर करने के बजाय, हमें AI को अपनी अनिश्चितता को समझने देना चाहिए।

AI की रणनीति को प्रतिस्पर्धी परिकल्पनाओं (hypotheses) के एक समूह के रूप में देखने और उनका निष्पक्ष परीक्षण करने से (सभी के लिए एक ही "मौसम" का उपयोग करके), AI तभी निर्णायक बनता है जब वह उत्तर जानता है और जब वह नहीं जानता तब सावधानीपूर्वक रैंडम होता है। यह एक ऐसे रोबोट के बीच का अंतर है जो "डिजाइन द्वारा भ्रमित" है और एक ऐसे रोबोट के बीच है जो "ईमानदारी से अनिश्चित" है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →