← नवीनतम पेपर
🤖 machine learning

MDP Planning as Policy Inference

यह शोध पत्र एपिसोडिक मार्कोव निर्णय प्रक्रिया नियोजन (episodic Markov decision process planning) के लिए नीतियों पर बेयसियन अनुमान (Bayesian inference) के रूप में एक वैचारिक ढांचे का प्रस्ताव करता है, जहाँ नीति एक गुप्त चर (latent variable) के रूप में कार्य करती है और अपेक्षित प्रतिफल (expected return) पश्च वितरण (posterior) को परिभाषित करता है, जो प्रक्षेपवक्र-केंद्रित (trajectory-centric) या एंट्रॉपी-नियमित दृष्टिकोणों के एक विशिष्ट विकल्प के रूप में विभिन्न वातावरणों में वेरिएशनल सीक्वेंशियल मोंटे कार्लो विधियों के माध्यम से अपनी प्रभावकारिता प्रदर्शित करता है।

मूल लेखक: David Tolpin

प्रकाशित 2026-08-18✓ Author reviewed
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: David Tolpin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, 'प्लानिंग' (योजना बनाना) के रूप में एक मौलिक चुनौती मौजूद है। कल्पना कीजिए कि एक रोबोट भूलभुलैया से गुजरने की कोशिश कर रहा है, एक प्रोग्राम ताश का खेल खेलने का निर्णय ले रहा है, या एक सिस्टम डिलीवरी ट्रक के लिए सबसे अच्छा रास्ता तय कर रहा है। इन कार्यों को निर्णय लेने की समस्याओं के रूप में मॉडल किया जाता है जहाँ एक एजेंट कार्य करता है, दुनिया प्रतिक्रिया में बदलती है, और एजेंट को पुरस्कार या दंड प्राप्त होता है। लक्ष्य हमेशा एक ही होता है: नियमों का एक सेट, या एक 'पॉलिसी' (नीति) खोजना, जो समय के साथ उच्चतम कुल पुरस्कार की ओर ले जाए। दशकों तक, शोधकर्ताओं ने इसे एक खोज समस्या (सर्च प्रॉब्लम) के रूप में माना है, जिसमें एक ही सर्वोत्तम पथ या निर्देशों के एक ही सर्वोत्तम सेट की तलाश की जाती है। हालाँकि, एक अलग दृष्टिकोण उभरा है, जो यह सुझाव देता है कि एक एकल उत्तर खोजने के बजाय, हमें समस्या को अनिश्चितता के रूप में देखना चाहिए। इस दृष्टिकोण में, एजेंट केवल एक आदर्श योजना नहीं खोजता; बल्कि यह कई संभावित योजनाओं पर विचार करता है, उनके प्रदर्शन के आधार पर उन्हें तौलता है, और फिर सबसे संभावित अच्छे विकल्पों के अनुसार कार्य करता है। यह दृष्टिकोण सांख्यिकी (स्टेटिस्टिक्स) से उधार लिया गया है, जहाँ वैज्ञानिक अक्सर नए डेटा को एकत्र करने के साथ दुनिया के बारे में अपने विश्वासों को अपडेट करते हैं, बजाय इसके कि एक एकल निश्चित सत्य की गणना करने का प्रयास करें।

एक शोधकर्ता ने अनिश्चितता के इस विचार को सीधे मशीनों के योजना बनाने के मूल आधार पर लागू किया है। वे निर्णय लेने के एक नए तरीके का प्रस्ताव करते हैं जहाँ "उत्तर" निर्देशों का एक एकल, कठोर सेट नहीं है, बल्कि संभावनाओं का एक बादल है। उनके ढांचे में, पॉलिसी स्वयं—वह नियम पुस्तिका जिसका एजेंट पालन करता है—एक छिपे हुए चर (हिडन वेरिएबल) के रूप में मानी जाती है जो अनिश्चित है। हर स्थिति के लिए एक विशिष्ट कार्य चुनने के लिए मशीन को मजबूर करने के बजाय, शोधकर्ता मशीन को कई अलग-अलग संभावित नियमपुस्तिकाओं पर एक संभाव्यता वितरण (प्रोबेबिलिटी डिस्ट्रीब्यूशन) बनाए रखने देते हैं। इनमें से कुछ नियमपुस्तकियां बहुत अच्छी होती हैं, जबकि कुछ खराब। मशीन फिर इस वितरण से नमूना (सैंपलिंग) लेकर कार्य करती है, प्रभावी रूप से यह चुनकर कि कौन सी नियमपुस्तकियां सबसे अधिक आशाजनक लग रही हैं। यह विधि मूल लक्ष्य (पुरस्कार को अधिकतम करना) को सुरक्षित रखती है लेकिन एजेंट के मन में कई विकल्पों को जीवित रखकर पर्यावरण की अनिश्चितता को संभालती है, बजाय इसके कि उन्हें एक एकल, संभावित रूप से नाजुक रणनीति में समेट दिया जाए।

शोधकर्ता ने इस विचार का परीक्षण करने के लिए एक सिस्टम बनाया जो इन पॉलिसियों के वितरण का अनुमान लगा सके। उन्होंने 'वेरिएशनल सीक्वेंशियल मोंटे कार्लो' नामक तकनीक का उपयोग किया, जिसे एक साथ कई समानांतर सिमुलेशन चलाने के तरीके के रूप में समझा जा सकता है ताकि विभिन्न परिणामों की संभावना का अनुमान लगाया जा सके। अपने सेटअप में, उन्होंने संभावित पॉलिसियों के स्थान का पता लगाने के लिए हजारों सिमुलेशन, या "पार्टिकल्स" चलाए। उनकी विधि में एक प्रमुख नवाचार यह सुनिश्चित करना था कि यदि एक सिम्युलेटेड एजेंट एक ही स्थान पर दो बार जाता है, तो वह पहली बार लिए गए निर्णय को याद रखेगा। इसने एजेंट को एक ही स्थिति के बारे में मन बदलने से रोका, जो एक सुसंगत योजना बनाए रखने के लिए महत्वपूर्ण है। उन्होंने यह भी सुनिश्चित किया कि वातावरण की यादृच्छिकता (जैसे फिसलन भरा फर्श या ताश की ढली हुई गड्डी), सभी सिमुलेशन में साझा की जाए। इसने सिस्टम को यादृच्छिक संयोग के कारण परिणामों के पक्षपाती हुए बिना, विभिन्न योजनाओं की गुणवत्ता की निष्पक्ष तुलना करने की अनुमति दी।

जब उन्होंने इस विधि को विभिन्न समस्याओं पर लागू किया, तो परिणामों ने उनके दृष्टिकोण और क्षेत्र में उपयोग की जाने वाली मानक विधियों के बीच एक स्पष्ट अंतर प्रकट किया। एक सरल ग्रिड-वर्ल्ड प्रयोग में, जहाँ एक एजेंट लक्ष्य तक पहुँचने के लिए फिसलन भरे फर्श पर नेविगेट करता है, नई विधि ने एक अधिक सतर्क और सुसंगत पॉलिसी बनाई। इसने उन कार्यों से परहेज किया जो केवल अन्वेषण (एक्सप्लोरेशन) के लिए यादृच्छिकता बढ़ा सकते थे, और इसके बजाय योजना की विश्वसनीयता पर ध्यान केंद्रित किया। ब्लैकजैक के एक खेल में, शोधकर्ता ने पाया कि उनकी विधि ने मानक दृष्टिकोण की तुलना में खेलने की एक अलग शैली प्रदर्शित की। हालांकि दोनों विधियाँ जीत सकती थीं, लेकिन नई विधि अक्सर बराबरी (टाई) से बचने की प्रवृत्ति रखती थी और पुरस्कारों के पैमाने के आधार पर जीत और हार के बीच एक अलग संतुलन दिखाती थी। यह सुझाव देता है कि अनिश्चितता का प्रतिनिधित्व करने का तरीका एजेंट द्वारा अपनाई जाने वाली रणनीति की प्रकृति को ही बदल देता है।

अध्ययन ने अधिक जटिल परिदृश्यों का भी पता लगाया, जैसे कि एक खेल जहाँ एक यात्री को त्रिकोणीय मानचित्र पर नेविगेट करना होता है और टायर पंचर होने के जोखिम का सामना करना होता है। इन स्थितियों में, शोधकर्ता ने पाया कि पुरस्कारों का आकार महत्वपूर्ण था। यदि सफलता के लिए पुरस्कार बहुत बड़े थे, तो सिस्टम बहुत आत्मविश्वासी हो गया और एक ही सर्वोत्तम पथ पर केंद्रित हो गया। यदि पुरस्कार छोटे थे, तो सिस्टम अधिक अनिश्चित रहा, जिससे कई तरह की रणनीतियाँ चलन में रहीं। पुरस्कारों के परिमाण के प्रति यह संवेदनशीलता उनके दृष्टिकोण की एक अनूठी विशेषता है, जो इसे अन्य विधियों से अलग करती है जो पुरस्कारों को केवल एक रैंकिंग प्रणाली के रूप में मानती हैं। एक अंतिम परीक्षण में, जिसमें शैक्षणिक परामर्श (अकादमिक एडवाइजिंग) के लिए एक जटिल शेड्यूलिंग समस्या शामिल थी, शोधकर्ता ने देखा कि हालांकि उनकी विधि हमेशा उच्चतम औसत स्कोर नहीं देती थी, लेकिन इसने एक अलग प्रकार का जोखिम प्रोफाइल बनाया। उनके द्वारा खोजी गई रणनीतियाँ वितरण के 'टेल्स' (चरम छोरों) में अधिक मजबूत थीं, जिसका अर्थ है कि उन्होंने मानक विधियों की तुलना में चरम परिणामों को अलग तरह से संभाला।

लेखक इस बात पर जोर देते हैं कि उनका कार्य किसी ऐसे सार्वभौमिक रूप से श्रेष्ठ एल्गोरिदम को खोजने के बारे में नहीं है जो हर खेल में सभी को हरा दे। इसके बजाय, यह प्लानिंग के विषय को देखने के तरीके में एक वैचारिक बदलाव है। पॉलिसी को एक 'लेटेंट वेरिएबल' (छिपे हुए चर) के रूप में मानकर, उन्होंने दिखाया है कि प्लानिंग को स्वाभाविक रूप से 'बेयसियन इन्फरेंस' (अनुमान लगाने की प्रक्रिया) के रूप में प्रस्तुत किया जा सकता है। इसका अर्थ यह है कि कौन सी योजना सबसे अच्छी है, इसकी अनिश्चितता केवल कंप्यूटर की मेमोरी की कमी या बग नहीं है; बल्कि यह एक ऐसी विशेषता है जिसे स्पष्ट रूप से मॉडल किया जा सकता है और व्यवहार को निर्देशित करने के लिए उपयोग किया जा सकता है। एजेंट के कार्यों में स्टोकेस्टिसिटी (यादृच्छिकता) इस तथ्य से आती है कि एजेंट अनिश्चित है कि कई संभावित नियत (डेटरमिनिस्टिक) योजनाओं में से कौन सी सबसे अच्छी है, न कि अन्वेषण को प्रोत्साहित करने के लिए कृत्रिम शोर (नॉइज़) जोड़ने से। यह अंतर अनिश्चितता को संभालने के एक अधिक सिद्धांतवादी तरीके की अनुमति देता है, जहाँ एजेंट का व्यवहार एक बेहतर कार्रवाई के बारे में वास्तविक अनिश्चितता को दर्शाता है, न कि मजबूर यादृच्छिकता को।

ग्रिड वर्ल्ड, कार्ड गेम्स और जटिल प्लानिंग कार्यों के माध्यम से प्रयोगों में, शोधकर्ता ने प्रदर्शित किया कि यह दृष्टिकोण गुणात्मक रूप से भिन्न व्यवहारों की ओर ले जाता है। एजेंट केवल स्कोर को अधिकतम करना नहीं सीखता है; बल्कि यह संभावित योजनाओं के स्थान को नेविगेट करना सीखता है, और प्रत्येक के लिए साक्ष्य का वजन करता है। इसके परिणामस्वरूप एक ऐसा सिस्टम मिलता है जो अपने विकल्पों में अधिक सुसंगत, पुरस्कारों के पैमाने के प्रति अधिक संवेदनशील, और वातावरण की वास्तविक अनिश्चितता का प्रतिनिधित्व करने में अधिक सक्षम हो सकता है। निष्कर्ष बताते हैं कि प्लानिंग को पॉलिसियों पर 'इन्फरेंस' (अनुमान) के रूप में देखकर, हम ऐसे एजेंट बना सकते हैं जो न केवल नंबरों की गणना करने में स्मार्ट हैं, बल्कि अज्ञात को संभालने के तरीके में अधिक विचारशील भी हैं। उनका कार्य एक अनुस्मारक है कि आर्टिफिशियल इंटेलिजेंस की खोज में, अनिश्चितता की समस्या को देखने का तरीका उतना ही महत्वपूर्ण हो सकता है जितना कि उसे हल करने के लिए उपयोग किए जाने वाले उपकरण।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →