← नवीनतम पेपर
🤖 machine learning

Proximal Policy Optimization with Evolutionary Mutations

यह शोध पत्र POEM को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो ठहराव का पता लगाने से प्रेरित अनुकूलनशील विकासवादी उत्परिवर्तनों (adaptive evolutionary mutations) को एकीकृत करके प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (Proximal Policy Optimization) को उन्नत करता है, जिसके परिणामस्वरूप चार में से तीन परीक्षण किए गए OpenAI Gym वातावरणों पर मानक PPO की तुलना में सांख्यिकीय रूप से महत्वपूर्ण प्रदर्शन सुधार प्राप्त होते हैं।

मूल लेखक: Casimir Czworkowski, Stephen Hornish, Alhassan S. Yasin

प्रकाशित 2026-01-22
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Casimir Czworkowski, Stephen Hornish, Alhassan S. Yasin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना, रस्सी पर चलना या अंतरिक्ष यान को लैंड करना सिखा रहे हैं। आप एक स्मार्ट लर्निंग सिस्टम का उपयोग करते हैं जिसे PPO (प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है। PPO को एक बहुत ही सावधान और सतर्क छात्र के रूप में समझें। यह अपने व्यवहार में बहुत छोटे, सुरक्षित बदलाव करके सीखता है। यदि यह कुछ नया आज़माता है और परिणाम बुरा आता है, तो यह तुरंत पीछे हट जाता है।

समस्या: "कंफर्ट ज़ोन" का जाल
पेपर बताता है कि PPO स्थिर तो है, लेकिन इसमें एक दोष है: यह एक "कंफर्ट ज़ोन" में फंस जाता है। क्योंकि यह बड़ी गलतियाँ करने से बहुत डरता है, इसलिए यह बहुत जल्दी नई चीज़ें आज़माना बंद कर देता है। यह एक "काफी हद तक ठीक" समाधान पर समझौता कर लेता है और कभी भी परफेक्ट समाधान नहीं खोज पाता। यह उस ड्राइवर की तरह है जिसने सीधी सड़क पर धीरे-धीरे गाड़ी चलाना तो सीख लिया, लेकिन वह कभी यह नहीं सीख पाया कि तेज़ मोड़ कैसे लिया जाए, इसलिए जब भी वह रेस लगाने की कोशिश करता है, तो दुर्घटनाग्रस्त हो जाता है।

समाधान: POEM (द "इवोल्यूशनरी" स्टूडेंट)
लेखकों ने इसका एक नया संस्करण बनाया जिसे POEM (प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन विद इवोल्यूशनरी म्यूटेशन्स) कहा जाता है। उन्होंने इस छात्र को एक विशेष "वेक-अप कॉल" तंत्र दिया जो प्रकृति में प्रजातियों के विकसित होने (evolution) से प्रेरित है।

POEM कैसे काम करता है, इसके लिए एक सरल उपमा यहाँ दी गई है:

  1. मेमोरी बुक: POEM ने हाल ही में सीखी गई हर चीज़ का एक "मेमोरी बुक" रखता है (यह उसके पिछले स्वरूप का एक मूविंग एवरेज है)।
  2. बोरडम मीटर (ऊब का मीटर): समय-समय पर, यह जाँचता है: "क्या मैं कुछ भी अलग कर रहा हूँ जो मैंने एक क्षण पहले किया था?" यह KL Divergence नामक एक गणितीय टूल का उपयोग करके इसे मापता है।
    • यदि संख्या अधिक है, तो इसका मतलब है कि रोबोट नई चीज़ें आज़मा रहा है। यह अच्छा है!
    • यदि संख्या कम है, तो इसका मतलब है कि रोबोट एक लूप में फंस गया है, बार-बार बिल्कुल एक ही चीज़ कर रहा है। वह ऊब चुका है और स्थिर हो गया है।
  3. "इवोल्यूशनरी" जंप: जब रोबोट फंस जाता है (जब बोरडम मीटर शून्य हो जाता है), तो POEM एक म्यूटेशन (उत्परिवर्तन) को ट्रिगर करता है। कल्पना कीजिए कि रोबोट अचानक अपने पूरे शरीर को हिला देता है या अपने मस्तिष्क की सेटिंग्स को बेतरतीब ढंग से बदल देता है। यह खुद को एक पूरी तरह से अलग, थोड़ी अराजक चाल आज़माने के लिए मजबूर करता है।
    • यदि यह रैंडम जंप बेहतर काम करता है, तो रोबोट इसे अपना लेता है।
    • यदि यह विफल हो जाता है, तो रोबोट वापस सावधान हो जाता है।

प्रयोग: चार चुनौतियाँ
शोधकर्ताओं ने इस नए "POEM" रोबोट का परीक्षण चार अलग-अलग वीडियो गेम जैसी दुनिया में पुराने "PPO" रोबोट के खिलाफ किया:

  • कार रेसिंग: PPO रोबोट मोड़ों पर फंस जाता था और दुर्घटनाग्रस्त हो जाता था। POEM रोबोट ने अपने "शेक-अप्स" (झटकों) की मदद से ट्रैक पर सुचारू रूप से नेविगेट करना सीख लिया और लगभग हर रेस पूरी की।
  • माउंटेन कार: PPO रोबोट घाटी से बाहर निकलने के लिए पर्याप्त गति नहीं बना सका। POEM रोबोट ने घाटी से बाहर निकलने के लिए आगे-पीछे डोलना सीख लिया।
  • बाइपेडल वॉकर (चलने वाला रोबोट): PPO रोबोट बार-बार गिर जाता था। POEM रोबोट ने स्थिरता से चलना और कोर्स पूरा करना सीख लिया।
  • लूनर लैंडर: यह पेचीदा था। दोनों रोबोटों ने ठीक-ठाक प्रदर्शन किया, लेकिन POEM औसतन थोड़ा बेहतर था। दिलचस्प बात यह है कि POEM ने जल्दी नीचे की ओर गोता लगाकर और ज़मीन के पास अपना रास्ता ठीक करके लैंड किया, जबकि PPO ऊपर हवा में मंडराता रहा, जिससे कभी-कभी उसका ईंधन खत्म हो जाता और वह क्रैश हो जाता।

परिणाम
पेपर का दावा है कि POEM चार में से तीन खेलों में स्पष्ट विजेता था। इसने साबित कर दिया कि जब रोबोट बहुत सहज महसूस करने लगता है, तो उसे बीच-बीच में "चीजों को बदलने" के लिए मजबूर करने से, आप उस स्थिरता को खोए बिना जो PPO को लोकप्रिय बनाती है, बेहतर समाधान पा सकते हैं।

संक्षेप में
POEM एक ऐसे शिक्षक की तरह है जो छात्र से कहता है: "तुम एक घंटे से एक ही होमवर्क समस्या को एक ही तरीके से हल कर रहे हो। तुम अब सीख नहीं रहे हो। रुको, एक गहरी सांस लो, और इसे एक पूरी तरह से अलग, अजीब तरीके से हल करने की कोशिश करो। यदि यह काम करता है, तो बहुत अच्छा! यदि नहीं, तो अपने सामान्य तरीके पर वापस जाओ।" इस सरल तरकीब ने AI को स्थानीय जाल (local traps) से बचने और तेज़ी से सीखने में मदद की।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →