← नवीनतम पेपर
📊 statistics

Statistical analysis of Inverse Entropy-regularized Reinforcement Learning

यह शोध पत्र इनवर्स एंट्रॉपी-रेगुलराइज्ड रीइन्फोर्समेंट लर्निंग के लिए एक सांख्यिकीय ढांचा प्रस्तुत करता है जो एंट्रॉपी रेगुलराइजेशन को लीस्ट-स्क्वायर रिकंस्ट्रक्शन के साथ जोड़कर शास्त्रीय IRL में रिवॉर्ड रिकवरी की गैर-विशिष्टता (non-uniqueness) को हल करता है, जिससे अनुमानित रिवॉर्ड फंक्शन के लिए गैर-एसिम्प्टोटिक मिनिमैक्स ऑप्टिमल कन्वर्जेंस रेट्स स्थापित होते हैं और बिहेवियर क्लोनिंग को आधुनिक सांख्यिकीय शिक्षण सिद्धांत के साथ जोड़ा जाता है।

मूल लेखक: Denis Belomestny, Alexey Naumov, Artemy Rubtsov, Sergey Samsonov

प्रकाशित 2026-09-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Denis Belomestny, Alexey Naumov, Artemy Rubtsov, Sergey Samsonov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, एक मौलिक चुनौती है जिसे 'इनवर्स रिइन्फोर्समेंट लर्निंग' (प्रतिलोम सुदृढीकरण शिक्षण) के रूप में जाना जाता है। कल्पना कीजिए कि एक छात्र एक कुशल शिल्पकार को काम करते हुए देख रहा है। छात्र उन गतिविधियों, विकल्पों और अंतिम परिणामों को देखता है, लेकिन वह उन आंतरिक नियमों या पुरस्कारों (रिवॉर्ड्स) को नहीं जानता जो शिल्पकार के हाथों का मार्गदर्शन कर रहे थे। इनवर्स रिइन्फोर्समेंट लर्निंग का लक्ष्य उन छिपे हुए नियमों को रिवर्स-इंजीनियर करना है। यह बताने के बजाय कि क्या करना है, कंप्यूटर यह समझने की कोशिश करता है कि विशेषज्ञ के कार्यों का अवलोकन करके वह क्या हासिल करने की कोशिश कर रहा था। यह मशीनों को मनुष्यों की तरह व्यवहार करना सिखाने के लिए अत्यंत महत्वपूर्ण है, चाहे वह कार चलाना हो या जटिल प्रणालियों का प्रबंधन करना हो। हालाँकि, लंबे समय तक, यह प्रक्रिया एक भ्रमित करने वाली समस्या से ग्रस्त रही है: कई अलग-अलग नियमों के सेट एक ही व्यवहार की व्याख्या कर सकते हैं। जिस प्रकार एक ही पथ तक कई अलग-अलग मानचित्रों का अनुसरण करके पहुँचा जा सकता है, उसी प्रकार एक विशेषज्ञ के कार्यों को अनगिनत विभिन्न पुरस्कार प्रणालियों द्वारा उचित ठहराया जा सकता है। इस अस्पष्टता ने विशेषज्ञ के निर्णयों के पीछे के वास्तविक प्रेरणा को सटीक रूप से पकड़ना कठिन बना दिया, जिससे कंप्यूटर के पास एक स्पष्ट उत्तर के बजाय संभावनाओं की एक सूची रह जाती थी।

शोधकर्ताओं डेनिस बेलोमेस्तनी, एलेक्सी नौमोव, आर्टेमी रुबत्सोव और सर्गेई सैमसनोव ने इस विशिष्ट भ्रम को हल करने के लिए एक नया सांख्यिकीय ढांचा विकसित किया है। उनका कार्य इस समस्या के एक संस्करण पर केंद्रित है जहाँ कंप्यूटर को केवल सबसे स्पष्ट विकल्प पर टिके रहने के बजाय अपने विकल्पों को तलाशने के लिए प्रोत्साहित किया जाता है, जिसे 'एंट्रॉपी रेगुलराइजेशन' नामक तकनीक के रूप में जाना जाता है। जबकि इस पद्धति ने विशेषज्ञ के व्यवहार को अधिक सहज और यथार्थवादी बनाया, इसने पहले कई संभावित पुरस्कार स्पष्टीकरणों की समस्या को हल नहीं किया था। टीम ने इस अन्वेषण-अनुकूल दृष्टिकोण को 'लीस्ट-स्क्वायर रिकंस्ट्रक्शन' नामक एक सटीक गणितीय पद्धति के साथ जोड़ा। कंप्यूटर द्वारा अनुमानित और विशेषज्ञ द्वारा वास्तव में किए गए कार्यों के बीच के अंतर को एक मापने योग्य त्रुटि के रूप में मानकर, उन्होंने एक ऐसी प्रणाली बनाई जो कई संभावनाओं में से एक अद्वितीय, मानक पुरस्कार कार्य (रिवॉर्ड फंक्शन) का चयन करती है। यह नया पुरस्कार केवल एक अनुमान नहीं है; यह वह एकल सर्वोत्तम फिट, या "कैनोनिकल रिप्रेजेंटेटिव" है, जो प्रणाली के विशिष्ट नियमों के तहत विशेषज्ञ के देखे गए व्यवहार के साथ संरेखित होता है, यह स्वीकार करते हुए कि वास्तविक अंतर्निहित पुरस्कार आंशिक रूप से पहचानने योग्य बना रह सकता है।

शोधकर्ताओं ने विशेषज्ञ के व्यवहार को घटनाओं के एक यादृच्छिक संग्रह के बजाय, जुड़े हुए घटनाओं के एक अनुक्रम के रूप में मॉडल किया, जो आपस में जुड़ी निर्णयों की एक श्रृंखला के समान है। उन्होंने पहले विशेषज्ञ की 'पॉलिसी' का अनुमान लगाने के लिए एक सांख्यिकीय तकनीक का उपयोग किया, जो अनिवार्य रूप से एक मानचित्र है कि विशेषज्ञ विभिन्न स्थितियों में कार्यों का चयन कैसे करता है। एक बार जब इस मानचित्र का अनुमान लग गया, तो उन्होंने पुरस्कार कार्य को पुनर्गठित करने के लिए इसका उपयोग किया। उनकी सफलता का एक प्रमुख हिस्सा यह सिद्ध करना था कि यह दो-चरणीय प्रक्रिया विश्वसनीय रूप से काम करती है, भले ही डेटा सीमित हो और प्रणाली जटिल हो। उन्होंने दिखाया कि जैसे-जैसे विशेषज्ञ के व्यवहार के अधिक उदाहरण प्रदान किए जाते हैं, अनुमानित पुरस्कार इस विशिष्ट कैनोनिकल लीस्ट-स्क्यर्स रिवॉर्ड के करीब पहुंचता जाता है। उन्होंने इस सुधार की गति पर सख्त गणितीय सीमाएं भी स्थापित कीं, जिससे यह सुनिश्चित हुआ कि यह पद्धति केवल एक सैद्धांतिक विचार नहीं है बल्कि एक मजबूत उपकरण है जो वास्तविक दुनिया के डेटा के साथ अनुमानित रूप से व्यवहार करता है।

इस पद्धति को व्यवहार में उपयोगी बनाने के लिए, जहाँ वातावरण के पूर्ण नियम अक्सर अज्ञात होते हैं, टीम ने एक गणना योग्य एल्गोरिदम डिजाइन किया। यह एल्गोरिदम जटिल समस्या को छोटे, प्रबंधनीय टुकड़ों में तोड़ देता है जिन्हें उपलब्ध डेटा का उपयोग करके चरण-दर-चरण हल किया जा सकता है। उन्होंने यह भी सिद्ध किया कि उनके इस व्यावहारिक संस्करण के अपने स्वयं के गारंटी मानक हैं, जिसका अर्थ है कि यह एक अनुमानित समय सीमा के भीतर सही कैनोनिकल रिप्रेजेंटेटिव तक पहुँचेगा। उनका कार्य केवल विशेषज्ञ के कार्यों की नकल करने और उनके पीछे के कारणों को वास्तव में समझने के बीच के अंतर को पाटता है। उस अस्पष्टता को सुलझाकर जिसने लंबे समय से इस क्षेत्र को बाधित किया है, वे मशीनों को न केवल यह सीखने का एक स्पष्ट मार्ग प्रदान करते हैं कि क्या करना है, बल्कि यह भी कि क्यों वह सही है, जो कि सिद्धांतों के एक एकल, सुपरिभाषित सेट पर आधारित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →