← नवीनतम पेपर
🤖 machine learning

Policy Gradient Methods for Non-Markovian Reinforcement Learning

यह शोधपत्र एक गैर-मार्कोवियन सुदृढीकरण शिक्षण (नॉन-मार्कोवियन रीइन्फोर्समेंट लर्निंग) के लिए एक रिवॉर्ड-केंद्रित ढांचे को प्रस्तुत करता है जो एजेंट स्टेट डायनेमिक्स और कंट्रोल पॉलिसी को संयुक्त रूप से अनुकूलित करता है, एक नवीन पॉलिसी ग्रेडिएंट थ्योरम और ASMPG एल्गोरिदम को स्थापित करता है जिसमें सैद्धांतिक अभिसरण गारंटी और प्रेडिक्टिव बेसलाइन्स की तुलना में बेहतर अनुभवजन्य प्रदर्शन है।

मूल लेखक: Avik Kar, Siddharth Chandak, Rahul Singh, Soumitra Sinhahajari, Eric Moulines, Shalabh Bhatnagar, Nicholas Bambos

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Avik Kar, Siddharth Chandak, Rahul Singh, Soumitra Sinhahajari, Eric Moulines, Shalabh Bhatnagar, Nicholas Bambos

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को भूलभुलैया (maze) में रास्ता खोजना सिखाने की कोशिश कर रहे हैं, लेकिन एक पेंच है: रोबोट की आँखों पर पट्टी बंधी है। वह दीवारों या बाहर निकलने के रास्ते को देख नहीं सकता। उसे केवल वही पता चलता है जो वह सुन सकता है (जैसे फर्श के चरमराने की आवाज़) और जो वह महसूस कर सकता है (जैसे दीवार से टकराना)।

रिनफोर्समेंट लर्निंग (Reinforcement Learning - RL) की दुनिया में, इसे एक नॉन-मार्कोवियन (Non-Markovian) समस्या कहा जाता है। रोबोट की वर्तमान स्थिति केवल "अभी" के बारे में नहीं है; यह पूरी तरह से इस पर निर्भर करती है कि पहले क्या हुआ था। यदि रोबोट किसी दीवार से टकराता है, तो उसे यह नहीं पता चलता कि वह कौन सी दीवार है, जब तक कि उसे यह याद न हो कि उसने कहाँ से शुरुआत की थी और उसने कितने मोड़ लिए थे।

अधिकांश मानक AI तरीके यहाँ संघर्ष करते हैं क्योंकि वे केवल "अभी" के आधार पर भविष्य का अनुमान लगाने की कोशिश करते हैं, या वे अतीत का एक पूर्ण मानचित्र बनाने की कोशिश करते हैं, जो बहुत भारी और जटिल हो जाता है।

यह पेपर इन आँखों पर पट्टी बंधे रोबोटों को सिखाने का एक नया तरीका पेश करता है, जिसे ASMPG (एजेंट स्टेट-मार्कोव पॉलिसी ग्रेडिएंट) कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. समस्या: "भुलक्कड़" बनाम "अत्यधिक सोचने वाला"

  • भुलक्कड़ (Standard MDP): एक ऐसे रोबोट की कल्पना करें जो एक कदम चलते ही सब कुछ भूल जाता है। वह केवल जानता है, "मैं यहाँ हूँ, मुझे भूख लगी है।" यदि वातावरण जटिल है (जैसे कोई बातचीत या भूलभुलैया), तो यह रोबोट विफल हो जाएगा क्योंकि उसे संदर्भ (context) का ज्ञान नहीं होगा।
  • अत्यधिक सोचने वाला (History-Based): एक ऐसे रोबोट की कल्पना करें जो बातचीत के हर एक शब्द या भूलभुलैया के हर एक कदम को याद रखने की कोशिश करता है। हालांकि इसमें सारी जानकारी होती है, लेकिन यादों की सूची अनंत रूप से लंबी होती जाती है। इसे प्रोसेस करना असंभव हो जाता है।

2. समाधान: "स्मार्ट डायरी" (एजेंट स्टेट)

लेखक एक बीच का रास्ता प्रस्तावित करते हैं। रोबोट सब कुछ भूलने या सब कुछ याद रखने के बजाय, एक "स्मार्ट डायरी" (जिसे "एजेंट स्टेट" कहा जाता है) रखता है।

  • यह कैसे काम करता है: हर बार जब रोबलेट कोई क्रिया करता है या कुछ नया देखता है, तो वह अपनी डायरी अपडेट करता है। वह पूरा इतिहास नहीं लिखता; वह केवल एक सारांश (summary) लिखता है।
    • उदाहरण: एक चैटबॉट में, 100 पन्नों की पूरी बातचीत को याद रखने के बजाय, डायरी केवल यह कहेगी: "उपयोगकर्ता अपने ऑर्डर की स्थिति के बारे में पूछ रहा है, और वह अधीर लग रहा है।"
  • ट्विस्ट: पिछले तरीकों में, वैज्ञानिक इस डायरी सारांश को बनाने के लिए यह पूछते थे कि, "क्या आप अनुमान लगा सकते हैं कि उपयोगकर्ता आगे क्या कहेगा?" (एक प्रेडिक्टिव ऑब्जेक्टिव)।
  • नवाचार: यह पेपर कहता है, "भविष्य का अनुमान लगाना बंद करें। बस वह सारांश लिखें जो आपको इनाम (reward) (एक खुश ग्राहक) दिलाने में मदद करे।" वे रोबोट को यह डायरी लिखना और निर्णय लेना, दोनों चीजें एक साथ सिखाते हैं, विशेष रूप से स्कोर को अधिकतम करने के लिए।

3. विधि: "जुड़वां-इंजन" दृष्टिकोण

यह पेपर एक नया एल्गोरिदम पेश करता है जिसे ASMPG कहा जाता है। इसे एक जुड़वां-इंजन वाले विमान की तरह समझें जहाँ दोनों इंजन एक साथ अनुकूलित (optimize) होते हैं:

  1. इंजन A (लेखक/Scribe): नए इनपुट के आधार पर डायरी (एजेंट स्टेट) को अपडेट करता है।
  2. इंजन B (पायलट): डायरी को पढ़ता है और तय करता है कि क्या कार्रवाई करनी है।

पुराने तरीकों में, लेखक (Scribe) को स्थिर रखा जाता था या उन्हें एक "अच्छे भविष्यवक्ता" के रूप में अलग से प्रशिक्षित किया जाता था। ASMPG में, लेखक और पायलट को संयुक्त रूप से (jointly) प्रशिक्षित किया जाता है। यदि पायलट को एक अच्छा निर्णय लेने के लिए डायरी में किसी विशिष्ट विवरण की आवश्यकता है, तो लेखक उस विवरण को शामिल करना सीखता है। यदि पायलट को किसी विवरण की आवश्यकता नहीं है, तो लेखक उसे अनदेखा करना सीख जाता है। वे खेल जीतने के लिए एक टीम के रूप में काम करते हैं।

4. प्रमाण: यह क्यों काम करता है

लेखकों ने गणितीय रूप से सिद्ध किया है कि यह "संयुक्त प्रशिक्षण" दृष्टिकोण मान्य है।

  • उन्होंने एक नया फॉर्मूला (एक "पॉलिसी ग्रेडिएंट थ्योरम") निकाला है जो यह दिखाता है कि लेखक और पायलट को बेहतर स्कोर प्राप्त करने के लिए कैसे समायोजित किया जाए।
  • उन्होंने सिद्ध किया कि यदि आप इस फॉर्मूले के आधार पर छोटे-छोटे समायोजन करते रहते हैं, तो रोबोट अंततः एक बहुत अच्छी रणनीति सीख जाएगा (गणितीय रूप से कन्वर्ज होने की गारंटी है)।

5. परिणाम: खेल जीतना

उन्होंने इस नए "स्मार्ट डायरी" दृष्टिकोण का परीक्षण पांच अलग-अलग कठिन कार्यों पर किया जहाँ रोबोट पूरी तस्वीर नहीं देख सकता था:

  • CheeseMaze: एक भूलभुलैया में पनीर खोजने वाला रोबोट जहाँ अलग-अलग स्थान एक जैसे दिखते हैं।
  • Hall-way Navigation: एक गलियारे में चलना जहाँ आप केवल अपने पास की दीवारों को देख सकते हैं।
  • Healthcare: चिकित्सा उपचारों पर निर्णय लेना जहाँ रोगी की प्रतिक्रिया उनके पिछले उपचारों के छिपे हुए इतिहास (विषाक्तता और प्रतिरोध) पर निर्भर करती है।
  • Machine Repair: एक मशीन को ठीक करना जहाँ आप केवल यह देख सकते हैं कि वह "बीमार" है या "स्वस्थ", लेकिन वास्तविक कारण अतीत का छिपा हुआ घिसाव (wear and tear) है।
  • CartPole: एक कार्ट पर पोल को संतुलित करना जब आप केवल गति देख सकते हैं, स्थिति नहीं।

परिणाम: इन पांचों मामलों में, ASMPG रोबोट (एक संयुक्त रूप से प्रशिक्षित स्मार्ट डायरी वाला रोबोट) ने उन रोबोटों की तुलना में तेजी से सीखा और उच्च स्कोर प्राप्त किया जिन्होंने भविष्य का अनुमान लगाने या निश्चित मेमोरी सिस्टम का उपयोग करने की कोशिश की थी।

सारांश

यह पेपर AI एजेंटों को उन स्थितियों को संभालने के बारे में सिखाने के बारे में है जहाँ निर्णय लेने के लिए "वर्तमान" पर्याप्त नहीं है। भविष्य का अनुमान लगाने या सब कुछ याद रखने के बजाय, लेखक AI को उसके अतीत का एक गतिशील, विकसित होता सारांश बनाए रखने के लिए सिखाते हैं। महत्वपूर्ण रूप से, वे AI को यह सारांश विशेष रूप से खेल जीतने के लिए बनाने के लिए सिखाते हैं, न कि केवल एक अच्छा इतिहासकार बनने के लिए। परिणाम, जटिल, वास्तविक दुनिया की समस्याओं के लिए एक स्मार्ट, अधिक कुशल लर्नर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →