← नवीनतम पेपर
🤖 machine learning

Emergence of Exploration in Policy Gradient Reinforcement Learning via Retrying

यह शोध पत्र ReMax को प्रस्तुत करता है, जो एक पॉलिसी ग्रेडिएंट ऑब्जेक्टिव है जो अन्वेषण (exploration) को कई प्रयासों के अपेक्षित अधिकतम प्रतिफल (expected maximum return) के रूप में औपचारिक रूप देता है, जिससे RePPO का विकास होता है—एक PPO वेरिएंट जो इस ऑब्जेक्टिव को एक निरंतर पुन: प्रयास पैरामीटर (continuous retry parameter) के साथ अनुकूलित करके बिना किसी स्पष्ट बोनस टर्म के प्रभावी, उभरते हुए स्टोकेस्टिक अन्वेषण को प्राप्त करता है।

मूल लेखक: Soichiro Nishimori, Paavo Parmas, Sotetsu Koyamada, Tadashi Kozuno, Toshinori Kitamura, Shin Ishii, Yutaka Matsuo

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Soichiro Nishimori, Paavo Parmas, Sotetsu Koyamada, Tadashi Kozuno, Toshinori Kitamura, Shin Ishii, Yutaka Matsuo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसे शहर में एक नए कॉफी शॉप तक पहुँचने का सबसे अच्छा रास्ता खोजने की कोशिश कर रहे हैं जिसे आपने पहले कभी नहीं देखा है। आपके पास एक नक्शा है, लेकिन वह अधूरा है।

पुराना तरीका (Standard RL):
अधिकांश रीइन्फोर्समेंट लर्निंग (RL) एजेंट एक घबराए हुए पर्यटक की तरह व्यवहार करते हैं। वे एक रास्ता आज़माते हैं, बुरा परिणाम मिलता है, और तुरंत घबरा जाते हैं। उन्हें एक ही जगह फंसने से रोकने के लिए, शोधकर्ता आमतौर पर उन्हें नए, अजीब रास्ते आज़माने के लिए एक "बोनस" या "इनाम" देते हैं। यह एक माता-पिता की तरह है जो कहते हैं, "अगर तुम एक अलग गली आज़माओगे, तो मैं तुम्हें एक कुकी दूँगा," भले ही वह गली किसी बंद गली (dead end) की ओर ले जाए। एजेंट केवल "कुकी" के कारण खोज (explore) करता है, इसलिए नहीं कि वह समझदार है।

नया विचार (ReMax):
यह पेपर ReMax नामक एक अलग दृष्टिकोण प्रस्तावित करता है। एक "कुकी" देने के बजाय कि नई चीज़ें आज़माने के लिए इनाम दिया जाए, ReMax इस बात को बदल देता है कि एजेंट सफलता के बारे में कैसे सोचता है।

मूल विचार सरल है: अपने निर्णय का आकलन केवल एक प्रयास के आधार पर न करें; इसे कई प्रयासों में से अपने सबसे अच्छे प्रयास के आधार पर परखें।

"रिट्राय" (दोबारा प्रयास) का रूपक

कल्पना कीजिए कि आप एक बहुविकल्पीय (multiple-choice) परीक्षा दे रहे हैं।

  • Standard RL: आप एक उत्तर चुनते हैं, और बस हो गया। यदि आपने गलत चुना, तो आपको शून्य अंक मिलते हैं। आप अनुमान लगाने से डरते हैं, इसलिए आप केवल वही उत्तर चुनते हैं जिसके बारे में आप 100% सुनिश्चित हैं (भले ही वह गलत हो)।
  • ReMax: कल्पना कीजिए कि शिक्षक कहते हैं, "आपको एक उत्तर चुनने का मौका मिलता है, लेकिन अगर आप गलत होते हैं, तो आपको 5 बार तक दोबारा प्रयास (retry) करने का मौका मिलता है। आपका स्कोर उन 5 प्रयासों में से आपके सबसे अच्छे उत्तर पर आधारित होगा।"

अचानक, रणनीति बदल जाती है!

  • यदि आप 100% सुनिश्चित हैं, तो आप हर बार वही उत्तर चुनते हैं।
  • लेकिन यदि आप अनिश्चित हैं (शायद दो उत्तरों के बीच 50/50 का अंतर है), तो आप केवल एक को चुनकर उम्मीद नहीं करते। आप अपने दांव फैलाते हैं। आप एक विकल्प आज़माते हैं, और यदि वह विफल हो जाता है, तो आप दूसरा विकल्प आज़माते हैं। क्योंकि आपको अपना सबसे अच्छा परिणाम रखने का मौका मिलता है, इसलिए एक जोखिम भरा विकल्प आज़माना एक स्मार्ट कदम बन जाता है। आप "कुकी" के कारण खोज (explore) नहीं कर रहे हैं; आप खोज रहे हैं क्योंकि दोबारा प्रयास करना जोखिम भरे रास्ते को सुरक्षित बनाता है।

पेपर में यह कैसे काम करता है

लेखकों ने, जिनका नेतृत्व सोइचिरो निशिमोरी और पावो पारमास ने किया है, इस "रिट्राय" अंतर्ज्ञान को ReMax नामक एक गणितीय सूत्र में औपचारिक रूप दिया।

  1. "M" कारक: उन्होंने एक संख्या पेश की, M, जो यह दर्शाती है कि आपको कितनी बार "दोबारा प्रयास" करने या एक्शन लेने का मौका मिलता है।

    • यदि M = 1, तो यह पुराना तरीका है: एक शॉट, एक स्कोर। एजेंट लालची हो जाता है और खोज करना बंद कर देता है।
    • यदि M > 1, तो एजेंट को एहसास होता है कि यदि वह कुछ अलग चीजें आज़माता है, तो वह भाग्यशाली हो सकता है और उच्च इनाम प्राप्त कर सकता है। यह स्वाभाविक रूप से एजेंट को बिना किसी अतिरिक्त "बोनस" अंकों के, अलग-अलग क्रियाएं आज़माने (explore करने) के लिए प्रोत्साहित करता है।
  2. "कंटीन्यूअस" (सतत) मोड़: वास्तविक दुनिया में, आप हमेशा ठीक 2 या 3 बार दोबारा प्रयास नहीं कर सकते। इसलिए, उन्होंने रिट्राय काउंट को एक स्मूथ डायल (एक निरंतर संख्या m) में बदल दिया।

    • डायल को ऊपर घुमाने से (उच्च m) एजेंट अधिक साहसी और अजीब चीजें आज़माने के लिए तैयार हो जाता है।
    • डायल को नीचे घुमाने से (कम m) एजेंट अधिक सतर्क और जो वह पहले से जानता है उस पर केंद्रित हो जाता है।
    • यह AI को जिज्ञासा के लिए एक "बारीक नियंत्रण" (fine-grained control) वाला नॉब देता है।
  3. "RePPO" इंजन: जटिल वीडियो गेम (जैसे MinAtar और Craftax) में इसे काम करने के लिए, उन्होंने एक लोकप्रिय AI एल्गोरिदम का एक नया संस्करण बनाया, जिसे उन्होंने RePPO नाम दिया।

    • केवल एक "जिज्ञासा बोनस" (जैसे नई जगहों पर जाने के लिए नकली इनाम) जोड़ने के बजाय, RePPO केवल "M प्रयासों में से सर्वश्रेष्ठ" के लिए अनुकूलित (optimize) होता है।
    • परिणाम: उनके प्रयोगों में, RePPO ने मानक तरीकों की तुलना में गेम खेलने में बेहतर प्रदर्शन किया। इसने अपनी "जिज्ञासा" (चुनावों में उच्च यादृच्छिकता/randomness) को स्वाभाविक रूप से बनाए रखा, बिना उन अतिरिक्त "कुकी" बोनस के जिन पर अन्य तरीके निर्भर करते हैं।

मुख्य निष्कर्ष

पेपर का दावा है कि खोज (exploration) को बाहरी पुरस्कारों के साथ मजबूर करने की आवश्यकता नहीं है। यदि आप केवल लक्ष्य को बदलकर "कुछ प्रयासों में से अपने सर्वश्रेष्ठ संभव परिणाम को अधिकतम करना" कर देते हैं, तो एजेंट स्वाभाविक रूप से यह समझ जाता है कि जीत हासिल करने का सबसे स्मार्ट तरीका अलग-अलग चीजें आज़माना है।

यह एक बच्चे को बताने जैसा है, "आपको पहली बार में सही होने की ज़रूरत नहीं है; बस कुछ प्रयासों के बाद मुझे अपना सबसे अच्छा प्रयास दिखाओ।" बच्चा स्वाभाविक रूप से पहेली को हल करने के विभिन्न तरीकों के साथ प्रयोग करना शुरू कर देता है, इसलिए नहीं कि आपने उसे रिश्वत दी, बल्कि इसलिए क्योंकि खेल के नियम प्रयोग करने को जीतने की रणनीति बनाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →