← नवीनतम पेपर
🤖 machine learning

EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games

यह शोध पत्र EMAgnet को प्रस्तुत करता है, जो एक नवीन पॉलिसी ग्रेडिएंट सेल्फ-प्ले पद्धति है जो पिछले पॉलिसी मापदंडों के एक्सपोनेंशियल मूविंग एवरेज का उपयोग करके एक एडेप्टिव रेगुलराइजेशन टारगेट के रूप में यूनिफॉर्म रेगुलराइजेशन में सुधार करती है, जिससे प्रभावी रूप से डोमिनेटेड स्ट्रैटेजीज़ वाले बड़े खेलों में कम एक्सप्लोिटेबिलिटी और बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Tristan Maidment, JB Lanier, Chase McDonald, Nathan Tsang, Eugene Vinitsky, Roy Fox, Albert Wang, Wesley N. Kerr

प्रकाशित 2026-06-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tristan Maidment, JB Lanier, Chase McDonald, Nathan Tsang, Eugene Vinitsky, Roy Fox, Albert Wang, Wesley N. Kerr

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अपने ही खिलाफ एक जटिल कार्ड गेम खेलना सिखा रहे हैं। लक्ष्य एक आदर्श रणनीति (जिसे "नैश इक्विलिब्रियम" कहा जाता है) खोजना है जहाँ रोबोट को हराया न जा सके।

अतीत में, शोधकर्ताओं ने एक विधि का उपयोग किया था जिसे PPO (AI को प्रशिक्षित करने का एक मानक तरीका) कहा जाता है, जिसमें एक विशेष ट्रिक थी: उन्होंने रोबोट को बताया, "एक ही चाल के साथ बहुत सहज न हों; हर चीज़ को समान रूप से आज़माएँ।" उन्होंने यह करने के लिए रोबोट को मजबूर किया कि वह हर संभावित क्रिया (action) के साथ ऐसा व्यवहार करे जैसे कि वे सभी समान रूप से संभावित हों। इसे एक सख्त कोच की तरह समझें जो चिल्ला रहा है, "तुम्हें हर चाल का अभ्यास करना ही होगा, यहाँ तक कि उन बुरी चालों का भी जिन्हें तुम अच्छी चालों के समान ही बार-बार दोहराते हो!"

यह पेपर एक नई विधि पेश करता है जिसे EMAgnet (एक्सपोनेंशियल मूविंग एवरेज मैग्नेट) कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

पुराने तरीके के साथ समस्या (द "यूनिफॉर्म मैग्नेट")

कल्पना कीजिए कि रोबोट रॉक-पेपर-सिज़र्स (पत्थर-कागज़-कैंची) खेलना सीख रहा है, लेकिन इसमें एक छिपा हुआ जाल है: एक चाल वास्तव में "हार मान लेना" (Forfeit) बटन है जो आपको तुरंत हरा देता है।

  • पुराना कोच (यूनिफॉर्म मैग्नेट): यह कोच रोबोट को "हार मान लेने" वाले बटन का भी उतना ही अभ्यास करने के लिए ज़ोर देता है जितना कि रॉक, पेपर या सिज़र्स का। शुरुआत में, यह सहायक होता है क्योंकि यह रोबोट को "हार मान लेने" वाले बटन को पूरी तरह से अनदेखा करने से रोकता है। लेकिन जैसे-जैसे रोबोट स्मार्ट होता जाता है और समझ जाता है कि "हार मान लेना" एक बुरा विचार है, कोच अभी भी उसे उस खराब चाल का अभ्यास करने के लिए मजबूर करता रहता है। यह उन रणनीतियों पर रोबोट का समय और ऊर्जा बर्बाद करता है जो काम नहीं करतीं।
  • परिणाम: रोबोट भ्रमित हो जाता है। वह खराब चालों पर बहुत अधिक समय बिताता है, या एक बार जब कोच उसे उन चालों का अभ्यास करने के लिए मजबूर करना बंद कर देता है, तो रोबोट अपनी अच्छी चालों को सही ढंग से मिलाने (mix करने) का तरीका भूल जाता है और बस एक रैंडम चाल चुनकर उसी पर टिक जाता है।

नया समाधान: EMAgnet (द "एडैप्टिव मैग्नेट")

EMAgnet कोच के दृष्टिकोण को बदल देता है। हर चीज़ का समान रूप से अभ्यास करने के बजाय, कोच एक चलते-फिरते लक्ष्य (moving target) का उपयोग करता है।

  1. रोबोट का "भूत" (Ghost): कोच रोबोट के दिमाग का एक "भूत" संस्करण रखता है। यह भूत रोबोट ने अब तक जो कुछ भी सीखा है, उसका एक औसत (average) है।
  2. चुंबक (Magnet): कोच रोबोट के वर्तमान दिमाग को इस "भूत" के करीब रखने की कोशिश करता है।
  3. जादू:
    • यदि रोबोट यह समझ जाता है कि "हार मान लेना" एक बुरा विचार है और वह इसे करना बंद कर देता है, तो भूत भी इसे करना बंद कर देता है।
    • क्योंकि भूत खराब चाल को करना बंद कर देता है, इसलिए कोच भी रोबोट को उस खराब चाल का अभ्यास करने के लिए मजबूर करना बंद कर देता है।
    • हालाँकि, कोच इस बात पर दबाव बनाए रखता है कि रोबोट अपने अच्छे मूव्स (रॉक, पेपर, सिज़र्स) को मिलाता रहे ताकि वह केवल एक ही मूव पर न अटक जाए।

संक्षेप में: पुराना तरीका एक ऐसे शिक्षक की तरह था जो आपसे तब भी आपकी सबसे खराब लिखावट का अभ्यास करवाता रहता था जब आप अच्छी तरह लिखना सीख चुके थे। EMAgnet एक ऐसे शिक्षक की तरह है जो कहता है, "अच्छी बात है कि तुमने उस बुरी आदत को छोड़ दिया! अब, अपनी अच्छी लिखावट का अभ्यास जारी रखो ताकि तुम आलसी न हो जाओ।"

पेपर ने क्या पाया

शोधकर्ताओं ने कई खेलों पर इस नई विधि का परीक्षण किया:

  • मानक खेल (Standard Games): सामान्य खेलों पर, EMAgnet पुराने तरीकों की तरह ही अच्छा काम करता है।
  • "जाल" वाले खेल (Strictly Dominated Strategies): उन्होंने ऐसे खेल जोड़े जहाँ अधिकांश चालें भयानक जाल थीं (जैसे "हार मान लेना" बटन या एक भूलभुलैया में घूमना जहाँ अधिकांश रास्ते बंद रास्तों की ओर ले जाते हैं)।
    • पुराने तरीके संघर्ष करते रहे। या तो वे जाल पर समय बर्बाद करते थे या जीतने वाली रणनीति खोजने में विफल रहते थे।
    • EMAgnet जीत गया। इसने बहुत तेज़ी से सीखा और बेहतर रणनीतियाँ खोजीं क्योंकि इसने स्वाभाविक रूप से खराब चालों को "भूलना" और अच्छी चालों को याद रखना सीख लिया।

बड़ी तस्वीर

जैसे-जैसे खेल अधिक जटिल होते जाते हैं (जैसे वास्तविक दुनिया के रणनीति वाले खेल), खराब चालों की संख्या विस्फोट की तरह बढ़ती है। पुराना तरीका खराब चालों को सीखने में ऊर्जा बर्बाद करता है। EMAgnet अधिक स्मार्ट है: यह रोबोट के कौशल स्तर के अनुसार अपनी शिक्षण शैली को अनुकूलित करता है, और केवल उन्हीं रणनीतियों पर ध्यान केंद्रित करता है जो वास्तव में मायने रखती हैं।

पेपर निष्कर्ष निकालता है कि यह सरल बदलाव—रोबोट के अपने पिछले स्वरूप के "मूविंग एवरेज" का उपयोग गाइड के रूप में करना—AI को मुख्य प्रशिक्षण एल्गोरिदम को बदले बिना जटिल, कठिन खेलों को हल करने में बहुत बेहतर बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →