← नवीनतम पेपर
🤖 machine learning

Bayesian policy gradient and actor-critic algorithms

यह शोध पत्र पॉलिसी ग्रेडिएंट और एक्टर-क्रिटिक एल्गोरिदम के लिए एक बेयसियन फ्रेमवर्क का प्रस्ताव करता है जो सैंपल कॉम्प्लेक्सिटी को कम करने, अनिश्चितता अनुमान प्रदान करने और क्लोज्ड-फॉर्म पोस्टीरियर अपडेट प्राप्त करने के लिए गॉसियन प्रोसेस का उपयोग करके ग्रेडिएंट्स और एक्शन-वैल्यू फंक्शन्स को मॉडल करता है, जिससे विभिन्न सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) कार्यों में पारंपरिक मोंटे-कार्लो विधियों से बेहतर प्रदर्शन होता है।

मूल लेखक: Mohammad Ghavamzadeh, Yaakov Engel, Michal Valko

प्रकाशित 2026-05-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mohammad Ghavamzadeh, Yaakov Engel, Michal Valko

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चलना सिखाने की कोशिश कर रहे हैं, या किसी वीडियो गेम के पात्र को भूलभुलैया (maze) में रास्ता खोजने के लिए तैयार कर रहे हैं। रोबोट को दुनिया के नियमों का पता नहीं है; उसे केवल यह पता है कि जब वह कोई क्रिया करता है (जैसे "एक कदम आगे बढ़ना" या "बाएं मुड़ना") तो क्या होता है। इसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) कहा जाता है।

लक्ष्य निर्देशों का एक सर्वोत्तम सेट (एक "पॉलिसी") खोजना है जो रोबोट को उसके लक्ष्य तक यथासंभव कुशलता से पहुँचा सके। ऐसा करने के लिए, रोबोट को यह जानने की आवश्यकता है कि अपने निर्देशों में सुधार करने के लिए किस दिशा में बदलाव करना है। इस दिशा को ग्रेडिएंट (gradient) कहा जाता है।

पुराना तरीका: अंधेरे में अंदाज़ा लगाना

पारंपरिक रूप से, रोबोट इस दिशा का पता लगाने के लिए मोंटे-कार्लो (Monte-Carlo) नामक विधि का उपयोग करते हैं। कल्पना कीजिए कि आप एक धुंधले जंगल में सबसे अच्छा रास्ता खोजने की कोशिश कर रहे हैं। पुराना तरीका यह है कि आप 1,000 खोजकर्ताओं को भेजते हैं, उन्हें यादृच्छिक (random) रास्तों पर चलने देते हैं, और फिर पूछते हैं, "कौन सबसे दूर तक पहुँचा?" आप उनके परिणामों का औसत निकालते हैं ताकि यह अनुमान लगाया जा सके कि "चढ़ाव" किस दिशा में है।

समस्या क्या है? यह अविश्वसनीय रूप से शोर भरा (noisy) है। एक खोजकर्ता भाग्यशाली हो सकता है और उसे कोई छोटा रास्ता मिल सकता है, जबकि दूसरा किसी जड़ से टकराकर गिर सकता है। एक विश्वसनीय उत्तर प्राप्त करने के लिए, आपको हजारों खोजकर्ताओं की आवश्यकता होगी, जिसमें बहुत समय लगता है और बहुत अधिक ऊर्जा (डेटा) बर्बाद होती है।

नया विचार: बेयसियन "स्मार्ट मैप"

यह शोध पत्र एक स्मार्ट तरीके का प्रस्ताव देता है जिसे बेयसियन पॉलिसी ग्रेडिएंट (Bayesian Policy Gradient) कहा जाता है। कच्चे डेटा के आधार पर केवल अंदाज़ा लगाने के बजाय, रोबोट एक स्मार्ट मैप (एक गॉसियन प्रोसेस का उपयोग करके) बनाता है कि उसके निर्देश उसकी सफलता को कैसे प्रभावित करते हैं।

इसे इस प्रकार समझें:

  • पुराना तरीका: आप दिशा-निर्देशों के लिए 1,000 लोगों से पूछते हैं और उनका औसत लेते हैं।
  • नया तरीका: आप 10 लोगों से पूछते हैं, लेकिन आप खाली जगहों को भरने के लिए इलाके (terrain) के अपने पूर्व ज्ञान (मैप) का भी उपयोग करते हैं। आप जानते हैं कि यदि कोई रास्ता कुछ देर के लिए ऊपर की ओर जाता है, तो संभावना है कि वह ऊपर ही जाएगा। आपको यह बताने के लिए 1,000 लोगों की आवश्यकता नहीं है; 10 लोग और आपका मैप पर्याप्त है।

यह "स्मार्ट मैप" रोबोट को बहुत कम नमूनों (samples) के साथ सही दिशा सीखने में सक्षम बनाता है। यह रोबोट को यह भी बताता है कि वह उस दिशा के बारे में कितना आश्वस्त है (अनिश्चितता)। यदि मैप धुंधला है, तो रोबोट को सावधान रहने का संकेत मिलता है; यदि मैप स्पष्ट है, तो वह तेज़ी से आगे बढ़ सकता है।

समस्या के दो दृष्टिकोण

यह शोध पत्र इस स्मार्ट मैप को बनाने के दो विशिष्ट तरीके पेश करता है:

1. "पूरी यात्रा" वाला दृष्टिकोण (बेयसियन पॉलिसी ग्रेडिएंट)

कल्पना कीजिए कि आप एक ट्रैवल एजेंट हैं। इस दृष्टिकोण में, आप यात्री द्वारा की गई पूरी यात्रा को देखते हैं। आप पूछते हैं, "क्या यह पूरी यात्रा सफल रही?"

  • अच्छी खबर: यह तब भी काम करता है जब दुनिया अराजक हो या यदि यात्री सब कुछ देख नहीं पाता है (जैसे भारी कोहरे में गाड़ी चलाना)। आपको सड़क के सटीक नियमों को जानने की आवश्यकता नहीं है; आप बस यात्रा के अंतिम परिणाम को देखते हैं।
  • बुरी खबर: क्योंकि आप पूरी यात्रा को एक बड़े ब्लॉक के रूप में देखते हैं, इसलिए आप हर कदम पर होने वाले छोटे विवरणों को चूक जाते हैं। यदि दुनिया स्पष्ट, अनुमानित नियमों का पालन करती है (जैसे एक मानक वीडियो गेम लेवल), तो यह कम कुशल है।

2. "कदम-दर-कदम" वाला दृष्टिकोण (बेयसियन एक्टर-क्रिटिक)

यह एक अधिक उन्नत विधि है। कल्पना कीजिए कि आपके पास एक कोच (एक्टर) और एक जज (क्रिटिक) है।

  • कोच तय करता है कि कौन सी चाल चलनी है।
  • जज कोच द्वारा किए गए हर एक कदम को देखता है और तुरंत फीडबैक देता है: "यह एक अच्छा कदम था," या "यह एक बुरा कदम था।"
  • जज हर एक कदम (स्टेट-एक्शन-रिवॉर्ड) के मूल्य का अनुमान लगाने के लिए एक "स्मार्ट मैप" का उपयोग करता है।

चूंकि जज हर एक कदम को देखता है, इसलिए यह विधि बहुत अधिक कुशल है जब दुनिया अनुमानित नियमों का पालन करती है। यह "पूरी यात्रा" वाले दृष्टिकोण की तुलना में तेजी से और कम डेटा के साथ सीखती है।

उन्होंने क्या सिद्ध किया?

लेखकों ने यह देखने के लिए प्रयोग चलाए कि क्या उनके "स्मार्ट मैप" तरीके पुराने "अंधेरे में अंदाज़ा लगाने" वाले तरीकों से बेहतर काम करते हैं। उन्होंने इनका परीक्षण किया:

  • सरल खेल: जैसे कि स्लॉट मशीन (बैंडिट समस्या)।
  • कंट्रोल टास्क: जैसे कि एक डंडे को संतुलित करना या जहाज को दिशा देना।

परिणाम:

  • नए तरीके पुराने तरीकों की तुलना में बहुत तेज़ी से और कम डेटा के साथ सीखे।
  • "कदम-दर-कदम" (एक्टर-क्रिटिक) विधि सबसे कुशल थी, विशेष रूप से अनुमानित वातावरण में।
  • ये विधियाँ उन स्थितियों को भी संभालने में सक्षम थीं जहाँ रोबोट पूरी तस्वीर नहीं देख पाता था (पार्शियली ऑब्जर्वेबल समस्याएं), जो कि एक आम वास्तविक दुनिया की समस्या है।

सारांश में

यह शोध पत्र इस बारे में है कि रोबोट को अधिक कुशलता से कैसे सिखाया जाए। अंधेरे में हजारों यादृच्छिक क्रियाओं को आज़माने के बजाय, लेखकों ने रोबोट को एक "स्मार्ट मैप" (बेयसियन इन्फरेंस) दिया जो उन्हें कम प्रयासों के साथ दुनिया को समझने में मदद करता है। उन्होंने दिखाया कि इस मैप को "कोच और जज" प्रणाली के साथ जोड़कर, रोबोट जटिल कार्यों को पहले की तुलना में बहुत तेज़ी से और अधिक विश्वसनीयता के साथ सीख सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →