← नवीनतम पेपर
🤖 machine learning

Superhuman AI for Generals.io Using Self-Play Reinforcement Learning

यह शोध पत्र 'Generals.io' नामक रियल-टाइम स्ट्रैटेजी गेम के लिए एक सुपरह्यूमन एआई एजेंट प्रस्तुत करता है, जो सेल्फ-प्ले रीइन्फोर्समेंट लर्निंग के माध्यम से विजन ट्रांसफार्मर पॉलिसी के कुशल एंड-टू-एंड प्रशिक्षण को सक्षम करने के लिए 10,000x की गति वृद्धि वाले एक JAX-नेटिव सिम्युलेटर का लाभ उठाकर सार्वजनिक लीडरबोर्ड पर #1 रैंकिंग प्राप्त करता है।

मूल लेखक: Matej Straka, Viliam Lisý, Martin Schmid

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Matej Straka, Viliam Lisý, Martin Schmid

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक डिजिटल युद्धक्षेत्र है जिसे Generals.io कहा जाता है। यह एक रियल-टाइम स्ट्रैटेजी गेम है जहाँ दो कमांडर (या टीमें) एक ग्रिड पर अपनी सेनाओं का संचालन करते हैं। वे एक साथ पूरे मानचित्र को नहीं देख सकते; वे केवल उस भूमि को देख पाते हैं जो उनके स्वामित्व में है और उनके सैनिकों के आसपास का तत्काल क्षेत्र। बाकी सब "फॉग ऑफ वॉर" (युद्ध के कोहरे) में छिपा हुआ है। लक्ष्य सरल है: अपने जनरल (मुख्यालय) की रक्षा करते हुए दुश्मन के जनरल को कब्जा करना।

यह शोध पत्र बताता है कि कैसे एक टीम के शोधकर्ताओं ने एक ऐसा AI बनाया जो दुनिया के बेहतरीन मानव खिलाड़ियों को भी हरा सका। यहाँ बताया गया है कि उन्होंने इसे कैसे किया, जिसे सरल अवधारणाओं में विभाजित किया गया है।

1. "सुपर-स्पीड" सिम्युलेटर

AI को प्रशिक्षित करने से पहले, उन्हें अभ्यास करने के लिए एक तरीके की आवश्यकता थी। अतीत में, इस गेम पर AI को प्रशिक्षित करना ऐसा था जैसे किसी कार को एक घंटे में एक इंच चलते हुए देखकर गाड़ी चलाना सीखने की कोशिश करना। यह बहुत धीमा था।

शोधकर्ताओं ने एक विशेष टूल जिसका नाम JAX है, का उपयोग करके एक नया "सिम्युलेटर" (गेम का डिजिटल संस्करण) बनाया। इसे एक साइकिल से अपग्रेड करके सुपरसोनिक जेट बनाने जैसा समझें।

  • पुराना तरीका: पिछला संस्करण एक मानक कंप्यूटर पर प्रति सेकंड लगभग 3,500 गेम स्टेप्स चला सकता था।
  • नया तरीका: उनका नया संस्करण एक सिंगल ग्राफिक्स कार्ड पर 5 करोड़ (50 मिलियन) स्टेप्स प्रति सेकंड चलाता है।
  • परिणाम: यह 10,000 गुना तेज़ है। इसका मतलब है कि AI एक इंसान द्वारा एक गेम खेलने के समय में लाखों गेम खेल सकता है। इस गति ने सबसे बड़ी बाधा को हटा दिया: AI आखिरकार इतना तेज़ सीख सकता था कि वह वास्तव में अच्छा बन सके।

2. "सेल्फ-प्ले" ट्रेनिंग कैंप

AI को मानव विशेषज्ञों के वीडियो दिखाकर सिखाने के बजाय (जो कि एक शतरंज खिलाड़ी को केवल ग्रैंडमास्टर के खेल दिखाकर सिखाने जैसा है), उन्होंने AI को खुद के खिलाफ खेलने दिया।

  • विधि: AI अपने ही نسخों (copies) के खिलाफ लाखों गेम खेलता है।
  • पुरस्कार (Reward): गेम बहुत सरल है: या तो आप जीतते हैं (+1 अंक) या आप हारते हैं (-1 अंक)। कोई "भागीदारी ट्रॉफी" या कुछ दुश्मन सैनिकों को मारने के लिए अंक नहीं मिलते। आपको पुरस्कार तभी मिलता है जब आप दुश्मन के जनरल पर कब्जा कर लेते हैं।
  • चुनौती: क्योंकि पुरस्कार बहुत दुर्लभ है (आप एक लंबे गेम के अंत में ही इसे प्राप्त करते हैं), इसलिए यह समझना कठिन है कि AI ने क्या सही किया। यह केक बनाने की कोशिश करने जैसा है जहाँ आप केवल अंतिम उत्पाद को चख सकते हैं, और आपको यह फीडबैक नहीं मिलता कि आपने बहुत अधिक चीनी डाली या बहुत कम आटा।

3. सीक्रेट सॉस: वास्तव में क्या काम आया

शोधकर्ताओं ने कई अलग-अलग "रेसिपी" का परीक्षण किया यह देखने के लिए कि क्या चीज़ उन्हें सुपरह्यूमन बनाती है। उन्होंने पाया कि कुछ चीजें जिन्हें लोग आवश्यक समझते थे वे वास्तव में बेकार थीं, जबकि कुछ सरल तरकीबों ने सारा अंतर पैदा किया।

  • "चीट शीट्स" की आवश्यकता नहीं: उन्हें AI को जटिल नियम या "अच्छे" काम करने के लिए हाथ से बनाए गए पुरस्कार (जैसे किला कब्जाना) देने की आवश्यकता नहीं थी। तेज़ सिम्युलेटर की मदद से, केवल साधारण "जीत या हार" का संकेत ही पर्याप्त था।
  • "औसत" छात्र (EMA): कई AI सिस्टम में, आप प्रशिक्षण समाप्त करने वाले AI के बिल्कुल अंतिम संस्करण का उपयोग करते हैं। शोधकर्ताओं ने पाया कि समय के साथ AI के मस्तिष्क का एक्सपोनेंशियल मूविंग एवरेज (EMA) लेना बेहतर काम करता है।
    • उपमा: कल्पना करें कि एक छात्र हर दिन एक परीक्षा देता है। "लास्ट इटरेट" केवल उसके अंतिम दिन के स्कोर की तरह है। "EMA" पूरे महीने के उसके प्रदर्शन के औसत को लेने जैसा है। शोधकर्ताओं ने पाया कि "औसत छात्र" उस छात्र की तुलना में अधिक सुसंगत और स्मार्ट था जो अपने सबसे अच्छे (या सबसे खराब) एकल दिन पर आधारित था।
  • "अच्छे" गेम्स को फ़िल्टर करना (Top-Advantage Filtering): AI ने लाखों गेम खेले, लेकिन उनमें से अधिकांश उबाऊ या रैंडम थे। शोधकर्ताओं ने महसूस किया कि उन्हें हर गेम से सीखने की ज़रूरत नहीं है। उन्होंने केवल उन शीर्ष 25% गेम्स को रखा जहाँ AI का स्पष्ट लाभ था और उन्हीं से सीखा।
    • उपमा: यदि आप तैरना सीखने की कोशिश कर रहे हैं, तो आपको हर उस बार को देखने की ज़रूरत नहीं है जब आप पानी में हाथ-पैर मार रहे थे। आपको केवल उन समयों का अध्ययन करने की आवश्यकता है जब आपने सुचारू रूप से और कुशलता से तैराकी की। इसने प्रशिक्षण को बहुत तेज़ और कुशल बना दिया।
  • छोटी शुरुआत: उन्होंने AI को एक बड़े मानचित्र पर शुरू नहीं किया। उन्होंने जेनरल को एक-दूसरे के बहुत करीब रखा ताकि AI जल्दी जीतना सीख सके। फिर, उन्होंने धीरे-धीरे जेनरल को एक-दूसरे से दूर किया, जिससे AI चरण-दर चरण दीर्घकालिक रणनीति सीख सके।

4. परिणाम: इंसानों को हराना

शक्तिशाली कंप्यूटरों पर चार दिनों तक प्रशिक्षण के बाद, AI (जिसका उपनाम "Average Joe" है) सार्वजनिक लीडरबोर्ड पर गया।

  • रैंकिंग: इसने 5,000 से अधिक मानव खिलाड़ियों में से #1 स्थान प्राप्त किया।
  • अंतर: इसने दूसरे स्थान पर रहने वाले इंसान को बहुत बड़े अंतर से हराया। वास्तव में, AI और दूसरे स्थान के इंसान के बीच का अंतर, दूसरे स्थान के इंसान और 25वें स्थान के इंसान के बीच के अंतर के बराबर था।
  • आमने-सामने: जब उन्होंने शीर्ष दो मानव खिलाड़ियों के खिलाफ सीधे खेला, तो AI ने 199 गेम जीते और केवल 70 गेम हारे।
  • पुराने बॉट्स के खिलाफ: इसने पिछले सर्वश्रेष्ठ AI और सबसे अच्छे "रूल-बेस्ड" बॉट (जो लर्निंग के बजाय गणितीय सूत्रों का उपयोग करता है) को 100% जीत दर के साथ भी कुचल दिया।

5. AI ने क्या "देखा"

शोधकर्ताओं ने यह देखने के लिए AI के मस्तिष्क के अंदर झाँका कि क्या वह इंसान की तरह सोच रहा है।

  • "फॉग" डिटेक्टर: उन्होंने पाया कि AI के मस्तिष्क का एक विशिष्ट हिस्सा था जो इस बात को ट्रैक करता था कि दुश्मन का जनरल कहाँ छिपा है।
  • उपमा: कल्पना कीजिए कि आप अंधेरे में लुका-छिपी खेल रहे हैं। शुरू में, आपको लगता है कि व्यक्ति कहीं भी हो सकता है। जैसे-जैसे आप कोई आवाज़ सुनते हैं या कोई छाया देखते हैं, आप उसे कुछ जगहों तक सीमित कर देते हैं। अंत में, आप उन्हें देख लेते हैं। AI के मस्तिष्क ने बिल्कुल यही किया: उसने एक अनुमान के साथ शुरुआत की, सुराग इकट्ठा करते हुए उसे सीमित किया, और अंततः दुश्मन के जनरल के स्थान को "लॉक ऑन" किया, भले ही वह उसे सीधे देख नहीं पा रहा था।

सारांश

यह शोध पत्र साबित करता है कि आपको स्ट्रैटेजी गेम्स के लिए सुपरह्यूमन AI बनाने के लिए जटिल, हाथ से बनाए गए नियमों या भारी मात्रा में मानव डेटा की आवश्यकता नहीं है। यदि आपके पास एक पर्याप्त तेज़ सिम्युलेटर है और एक सरल "जीत या हार" का पुरस्कार है, तो एक मानक लर्निंग एल्गोरिदम बाकी सब खुद समझ सकता है। मुख्य सामग्रियां गति, धैर्य (परिणामों का औसत लेना), और केवल सबसे सूचनात्मक खेलों पर ध्यान केंद्रित करना थीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →