← नवीनतम पेपर
🤖 machine learning

GAE Falls Short in Imperfect-Information Self-Play Reinforcement Learning

यह शोध पत्र वेरिएन्स-रिड्यूस्ड पॉलिसी ऑप्टिमाइज़ेशन (VRPO) को प्रस्तुत करता है, जो एक नया एल्गोरिदम है जो अपूर्ण-सूचना वाले स्व-खेल (self-play) के लिए मानक जनरलाइज्ड एडवांटेज एस्टीमेशन में निहित उच्च वेरिएन्स से निपटने हेतु QQ-बूस्टिंग वेरिएन्स-रिड्यूस्ड एडवांटेज एस्टीमेटर का उपयोग करता है, जिससे डौ डिज़ु (Dou Dizhu) और हेड्स-अप नो-लिमिट टेक्सस होल्डम (Heads-Up No-Limit Texas Hold'em) जैसे प्रतिस्पर्धी मल्टी-एजेंट खेलों में बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Zhiyuan Fan, Gabriele Farina

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhiyuan Fan, Gabriele Farina

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रोबोटों के एक समूह को एक जटिल कार्ड गेम जैसे कि पोकर या Dou Dizhu (एक लोकप्रिय चीनी कार्ड गेम) खेलना सिखा रहे हैं। पेच यह है कि वे एक-दूसरे के कार्ड नहीं देख सकते, और वे उन विरोधियों के खिलाफ खेल रहे हैं जो उन्हें धोखा देने की कोशिश कर रहे हैं। जीतने के लिए, रोबोटों को एक ऐसी रणनीति सीखने की आवश्यकता है जो इतनी संतुलित और अप्रत्याशित हो कि कोई भी प्रतिद्वंद्वी उनका फायदा न उठा सके। इसे "इक्विलिब्रियम" (equilibrium) या संतुलन खोजना कहा जाता है।

लंबे समय से, रोबोटों को सिखाने का सबसे अच्छा तरीका सेल्फ-प्ले (Self-Play) रहा है—आप रोबोटों को अपने ही स्वरूपों (copies) के खिलाफ लाखों बार खेलने देते हैं। सबसे लोकप्रिय शिक्षक एक एल्गोरिदम है जिसे PPO (प्रॉक्सिमल पॉलिसी ऑप्टिमिization) कहा जाता है।

हालाँकि, इस शोध पत्र के लेखकों ने खोजा है कि गुप्त-कार्ड वाले खेलों में PPO रोबोटों को कैसे सिखाता है, इसमें एक छिपा हुआ "ग्लिच" (glitch) है। यहाँ समस्या और उनके समाधान का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:

समस्या: भीड़ भरे कमरे में "शोर भरी फुसफुसाहट" (The "Noisy Whisper" in a Crowded Room)

मानक PPO में, रोबोट अतीत में लिए गए किसी रास्ते को देखकर सीखता है और पूछता है, "क्या वह एक अच्छा कदम था?" इसका उत्तर देने के लिए, यह GAE (जनरलाइज्ड एडवांटेज एस्टीमेशन) नामक टूल का उपयोग करता है।

GAE को एक खिलाड़ी को खेल के रीप्ले के आधार पर सलाह देने वाली फुसफुसाहट वाले कोच की तरह समझें।

  • एक सरल खेल में (जैसे शतरंज): भविष्य अनुमानित है। यदि कोच कहता है, "आपने यहाँ प्यादा चला, और इससे जीत मिली," तो खिलाड़ी ठीक जानता है कि ऐसा क्यों हुआ।
  • एक गुप्त-कार्ड वाले खेल में (जैसे पोकर): भविष्य अनिश्चितता से भरा है। कोच की फुसफुसाहट धुंधली हो जाती है क्योंकि रोबोट को यह अनुमान लगाना पड़ता है कि अन्य रोबोट आगे क्या कर सकते हैं। चूंकि रोबोट रैंडम तरीके से खेल रहे हैं (ताकि वे अपने विरोधियों को भ्रमित रख सकें), इसलिए कोच की सलाह एक "शोर भरी फुसफुसाहट" बन जाती है।

उपमा: कल्पना कीजिए कि आप एक ऐसे कमरे में डांस रूटीन सीखना चाह रहे हैं जहाँ हर कोई बेतरतीब ढंग से घूम रहा है।

  • पुराना तरीका (GAE): कोच आपको बताने की कोशिश करता है, "यदि आप बाईं ओर कदम रखते हैं, तो आप सुरक्षित रहेंगे।" लेकिन क्योंकि बाकी सब पागलों की तरह घूम रहे हैं, कोच की आवाज़ शोर में दब जाती है। रोबोट सुनता है, "बाईं ओर कदम रखें... शायद? या शायद दाईं ओर? यह बताना मुश्किल है!" यह "शोर" रोबोट के सीखने की प्रक्रिया को अस्थिर और धीमा बना देता है।
  • पेपर की खोज: भले ही कोच एकदम सटीक हो (खेल का पूर्ण ज्ञान रखता हो), फिर भी शोर इस तथ्य से आता है कि अन्य डांसर रैंडम तरीके से घूम रहे हैं। रोबोट यह अंतर नहीं कर पाता कि यह एक बुरा कदम था या अन्य खिलाड़ियों की रैंडमनेस के कारण मिली केवल एक बुरी किस्मत।

समाधान: "Q-बूस्टिंग" (The Crystal Ball)

लेखकों ने इस शोर को ठीक करने के लिए Q-Boosting नामक एक नया टूल बनाया है।

एक एकल रैंडम रीप्ले के आधार पर भविष्य का अनुमान लगाने के बजाय, Q-Boosting कोच से कहता है कि वह एक साथ सभी संभावित भविष्यों को देखे और उनका औसत निकाल ले।

  • उपमा: कोच यह कहने के बजाय कि, "मैंने देखा कि आपने बाईं ओर कदम रखा, और उस एक बार कोई आपसे टकरा गया था," नया कोच कहता है, "मैंने गणना की है कि यदि आप बाईं ओर कदम रखते हैं, तो 50% समय आप सुरक्षित रहेंगे, 30% समय आप बाधित होंगे, और 20% समय आप लड़खड़ा जाएंगे। औसत रूप से, बाईं ओर कदम रखना एक अच्छा विचार है।"

सलाह देने से पहले रैंडमनेस का औसत निकालने के लिए गणित का उपयोग करके, कोच इस "शोर" को हटा देता है। रोबोट को एक स्पष्ट, शांत संकेत मिलता है: "यह कदम औसतन अच्छा है," न कि "यह कदम इस विशेष समय पर अच्छा था लेकिन उस समय बुरा हो सकता था।"

वे इस नई शिक्षण पद्धति को VRPO (वैरिएंस-रिड्यूस्ड पॉलिसी ऑप्टिमिization) कहते हैं।

परिणाम: स्मार्ट रोबोट, तेज़ जीत

शोध पत्र में इस नए तरीके (VRPO) का परीक्षण कई खेलों में किया गया:

  1. छोटे खेल (टेस्ट किचन): उन्होंने "लायर्स डाइस" (Liar's Dice) और "फैंटम टिक-टैक-टो" (Phantom Tic-Tac-Toe) जैसे खेल खेले। इन खेलों में, वे गणितीय रूप से सिद्ध कर सकते थे कि रोबोट कितना अच्छा था।

    • परिणाम: VRPO ने PPO की तुलना में बहुत अधिक मजबूत रणनीति सीखी। इसे धोखा देना कठिन था, जिसका अर्थ है कि यह पूर्ण "इक्विलिब्रियम" रणनीति के बहुत करीब था।
  2. मध्यम खेल (एरिना): उन्होंने Dou Dizhu (एक जटिल 3-प्लेयर कार्ड गेम) खेला।

    • परिणाम: VRPO ने आमने-सामने के मैचों में पिछले सर्वश्रेष्ठ AI (जिसे PerfectDou कहा जाता है) को हरा दिया, भले ही उन्होंने समान मात्रा में कंप्यूटिंग पावर का उपयोग किया था। इसने अधिक बार जीतने के लिए बेहतर तरीके से सीखा।
  3. बड़े खेल (चैंपियनशिप): उन्होंने Heads-Up No-Limit Texas Hold'em (एक उच्च-दांव वाला पोकर वेरिएंट) आजमाया।

    • परिणाम: VRPO ने एक मजबूत पोकर बॉट 'Slumbot' के खिलाफ बहुत अच्छा प्रदर्शन किया। यह एक लंबे सत्र में पैसा जीतने में सफल रहा, बिना किसी "चीटिंग" के जैसे कि भविष्य के कार्ड देखना या खेल के दौरान जटिल गणित करना। इसने बस प्रशिक्षण के माध्यम से एक बेहतर रणनीति सीखी।

सारांश

यह पेपर तर्क देता है कि जब रोबोटों को गुप्त-कार्ड वाले खेल खेलने के लिए सिखाया जाता है, तो सीखने का पुराना तरीका (GAE) अन्य खिलाड़ियों की रैंडमनेस (अनिश्चितता) से भ्रमित हो जाता है। नया तरीका (Q-Boosting के साथ VRPO) एक सुपर-स्मार्ट कोच की तरह काम करता है जो सलाह देने से पहले सभी संभावनाओं का औसत निकाल लेता है। यह भ्रम को दूर करता है, जिससे रोबोट तेजी से सीख सकते हैं, अधिक स्थिरता से खेल सकते हैं, और उन्हें हराना बहुत कठिन हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →