← नवीनतम पेपर
🤖 AI

JaxMARL: Multi-Agent RL Environments and Algorithms in JAX

यह शोध पत्र JaxMARL को प्रस्तुत करता है, जो एक ओपन-सोर्स पायथन लाइब्रेरी है जो JAX का लाभ उठाकर GPU-त्वरित, बड़े पैमाने पर समानांतर मल्टी-एजेंट सुदृढीकरण शिक्षण (multi-agent reinforcement learning) वातावरण और एल्गोरिदम प्रदान करती है, जो मौजूदा दृष्टिकोणों की तुलना में महत्वपूर्ण गति प्राप्त करती है और स्टारक्राफ्ट मल्टी-एजेंट चैलेंज (StarCraft Multi-Agent Challenge) का एक लचीला, इंजन-मुक्त पुनर्रचना प्रदान करती है।

मूल लेखक: Alexander Rutherford, Benjamin Ellis, Matteo Gallici, Jonathan Cook, Andrei Lupu, Gardar Ingvarsson, Timon Willi, Ravi Hammond, Akbir Khan, Christian Schroeder de Witt, Alexandra Souly, Saptarashmi Ba
प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alexander Rutherford, Benjamin Ellis, Matteo Gallici, Jonathan Cook, Andrei Lupu, Gardar Ingvarsson, Timon Willi, Ravi Hammond, Akbir Khan, Christian Schroeder de Witt, Alexandra Souly, Saptarashmi Bandyopadhyay, Mikayel Samvelyan, Minqi Jiang, Robert Tjarko Lange, Shimon Whiteson, Bruno Lacerda, Nick Hawes, Tim Rocktaschel, Chris Lu, Jakob Nicolaus Foerster

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रोबोटों की एक टीम को एक साथ काम करना सिखाने की कोशिश कर रहे हैं। आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इसे मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग (MARL) कहा जाता है। आमतौर पर, इन रोबोटों को सिखाने के लिए शोधकर्ताओं को हजारों सिमुलेशन चलाने पड़ते हैं।

इस पारंपरिक तरीके को एक फुटबॉल टीम को सिखाने के रूप में सोचें, जहाँ एक अकेला, धीमा कोच है जिसे मैदान पर पैदल ही दौड़ना पड़ता है और एक समय में एक खिलाड़ी को निर्देश देना पड़ता है। यह काम तो करता है, लेकिन इसमें बहुत समय लगता है। यदि आप 100 अलग-अलग कोचिंग रणनीतियों का परीक्षण करना चाहते हैं, तो आप केवल परिणामों का इंतजार करने में महीनों बिता सकते हैं। यह वह "बाधा" (bottleneck) है जिसका वर्णन पेपर में किया गया है: इन सिमुलेशन को चलाने के लिए उपयोग किए जाने वाले कंप्यूटर (CPUs) एजेंटों की टीमों को प्रभावी ढंग से प्रशिक्षित करने के लिए आवश्यक भारी अभ्यास को संभालने के लिए बहुत धीमे हैं।

पेश है JaxMARL।

लेखकों ने JaxMARL नामक एक नया टूल बनाया है। आप इसे एक अकेले, धीमे कोच को अपग्रेड करके एक सुपर-ऑर्केस्ट्रा कंडक्टर और 10,000 ड्रोनों के बेड़े में बदलने के रूप में देख सकते हैं।

यहाँ बताया गया है कि उन्होंने यह कैसे किया और उन्हें क्या मिला, जिसे सरल भाषा में विभाजित किया गया है:

1. स्पीड बूस्ट (द "ड्रोन बेड़ा")

एक मानक कंप्यूटर प्रोसेसर पर एक-एक करके सिमुलेशन चलाने के बजाय, JaxMARL एक विशेष प्रोग्रामिंग लाइब्रेरी JAX का उपयोग करता है जो कंप्यूटर को शक्तिशाली ग्राफिक्स कार्ड (GPUs) का उपयोग करने की अनुमति देता है—वही चिप्स जिनका उपयोग गेमिंग के लिए किया जाता है—ताकि गणितीय गणनाएं की जा सकें।

  • उपमा (Analogy): कल्पना कीजिए कि आपको 10,000 दीवारें पेंट करनी हैं। पुराना तरीका (CPU) एक पेंटर को काम पर रखने जैसा है जो एक दीवार पेंट करता है, उसे सूखने देता है, फिर अगली दीवार पेंट करता है। JaxMARL का तरीका एक ऐसी मशीन की तरह है जो एक ही समय में सभी 10,000 दीवारों पर स्प्रे-पेंट कर सकती है।
  • परिणाम: पेपर दावा करता है कि उनका सिस्टम एक एकल प्रशिक्षण रन के लिए 14 गुना तेज़ है। लेकिन जब वे एक साथ कई प्रयोग चलाते हैं (जो शोधकर्ता अक्सर करते हैं), तो यह 12,500 गुना तक तेज़ होता है। यह एक ऐसी प्रक्रिया को जो पहले हफ्तों लेती थी, घंटों या मिनटों में बदल देता है।

2. नए खेल के मैदान (Environments)

इन AI एजेंटों को प्रशिक्षित करने के लिए, आपको "खेलों" या वातावरणों की आवश्यकता होती है। पेपर कई अलग-अलग खेलों का परिचय देता है, जिन्हें इस सुपर-फास्ट सिस्टम पर चलाने के लिए फिर से लिखा गया है।

  • SMAX (स्टारक्राफ्ट का विकल्प): AI टीमों को प्रशिक्षित करने के लिए सबसे लोकप्रिय खेलों में से एक वीडियो गेम StarCraft II पर आधारित है। हालाँकि, मूल गेम भारी और धीमा है क्योंकि इसे AI को प्रशिक्षित करने के लिए पूरा 3D ग्राफिक्स इंजन चलाना पड़ता है।
    • समाधान: लेखकों ने SMAX बनाया है। इसे StarCraft के "कंकाल संस्करण" (skeleton version) के रूप में समझें। यह StarCraft के सभी नियमों और रणनीति को बनाए रखता है लेकिन फैंसी 3D ग्राफिक्स को हटा देता है। क्योंकि यह केवल GPU पर चलने वाला लॉजिक है, यह मूल गेम इंजन की तुलना में 40,000 गुना तेज़ है।
  • STORM (ग्रिड वर्ल्ड): उन्होंने STORM नामक खेलों का एक नया सेट भी बनाया है। कल्पना कीजिए कि एक बोर्ड गेम है जहाँ खिलाड़ी सिक्के इकट्ठा करने के लिए ग्रिड पर घूमते हैं, लेकिन नियम इस तरह बनाए गए हैं कि वे यह परीक्षण कर सकें कि वे कितनी अच्छी तरह सहयोग करते हैं या एक-दूसरे को धोखा देते हैं। यह शोधकर्ताओं को यह अध्ययन करने में मदद करता है कि एजेंट कैसे मिलकर काम करना या एक-दूसरे को छकाना सीखते हैं।

3. कोच (Algorithms)

सिर्फ एक तेज़ खेल के मैदान का होना ही काफी नहीं है; आपको अच्छे प्रशिक्षण तरीकों की भी आवश्यकता है। पेपर ने कई प्रसिद्ध "कोचिंग रणनीतियों" (जैसे PPO और QMIX जैसे एल्गोरिदम) को भी इस नए तेज़ सिस्टम के साथ काम करने के लिए फिर से लिखा है। उन्होंने सत्यापित किया कि ये नए तेज़ कोच पुराने, धीमे कोचों की तरह ही स्मार्ट परिणाम देते हैं, बस बहुत तेज़ी से।

4. यह क्यों मायने रखता है (द "इवैल्यूएशन क्राइसिस")

पेपर एक समस्या की ओर इशारा करता है: क्योंकि प्रशिक्षण बहुत धीमा है, शोधकर्ता अक्सर अपने नए विचारों का परीक्षण केवल एक या दो खेलों पर ही करते हैं। यह एक शेफ की तरह है जो केवल एक प्रकार के पास्ता पर अपनी नई रेसिपी का परीक्षण करता है। यदि रेसिपी स्पैगेटी पर काम करती है लेकिन पेन्ने (penne) पर विफल हो जाती है, तो शेफ को पता नहीं चलेगा।

चूंकि JaxMARL बहुत तेज़ है, इसलिए शोधकर्ता अब एक ही परीक्षण करने में लगने वाले समय में दर्जनों अलग-अलग खेलों पर अपने विचारों का परीक्षण कर सकते हैं। यह सुनिश्चित करने में मदद करता है कि AI वास्तव में स्मार्ट और सामान्य है, न कि केवल एक विशिष्ट खेल को "रट" रहा है।

सारांश

संक्षेप में, JaxMARL एक मुफ्त, ओपन-सोर्स टूलबॉक्स है जो शोधकर्ताओं को आधुनिक ग्राफिक्स कार्ड की विशाल शक्ति का उपयोग करके AI एजेंटों की टीमों को प्रशिक्षित करने की अनुमति देता है। यह धीमे, भारी वीडियो गेम इंजनों को हल्के, बिजली की तरह तेज़ संस्करणों से बदल देता है, जिससे वैज्ञानिकों को पहले की तुलना में हजारों गुना तेज़ी से प्रयोग करने की अनुमति मिलती है। यह उन्हें यह समझने में मदद करता है कि AI बेहतर तरीके से कैसे सहयोग कर सकता है, प्रतिस्पर्धा कर सकता है और जटिल समस्याओं को हल कर सकता है, बिना कंप्यूटर के पीछे रहने का इंतज़ार किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →