← नवीनतम पेपर
🤖 AI

Distributionally Robust Cooperative Multi-Agent Reinforcement Learning via Robust Value Factorization

यह शोध पत्र डिस्ट्रीब्यूशनली रोबस्ट IGM (DrIGM) प्रस्तुत करता है, जो एक नवीन सिद्धांत और संबंधित वैल्यू-फैक्टरिज़ेशन फ्रेमवर्क है जो अनिश्चित वातावरण में सहकारी मल्टी-एजेंट सुदृढीकरण शिक्षण की विश्वसनीयता को बढ़ाने के लिए विकेंद्रीकृत ग्रीडी कार्यों को रोबस्ट टीम-इष्टतम संयुक्त कार्यों के साथ संरेखित करता है, जिससे बिना किसी प्रति-एजेंट रिवॉर्ड शेपिंग की आवश्यकता के आउट-ऑफ-डिस्ट्रीब्यूशन प्रदर्शन में सुधार होता है।

मूल लेखक: Chengrui Qu, Christopher Yeh, Kishan Panaganti, Eric Mazumdar, Adam Wierman

प्रकाशित 2026-02-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chengrui Qu, Christopher Yeh, Kishan Panaganti, Eric Mazumdar, Adam Wierman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सॉकर टीम के कोच हैं। आपका लक्ष्य चैंपियनशिप जीतना है। एक आदर्श दुनिया में, आप एक शानदार, धूप वाले मैदान पर अभ्यास करते हैं जहाँ घास एकदम सही है, कोई हवा नहीं है, और रेफरी कभी गलती नहीं करते। आप अपने खिलाड़ियों को गेंद को एक विशिष्ट तरीके से पास करने के लिए प्रशिक्षित करते हैं जो गोल करना सुनिश्चित करता है।

लेकिन जब खेल का दिन आता है, तो वास्तविक दुनिया अव्यवस्थित होती है। बारिश हो सकती है, घास कीचड़ भरी हो सकती है, हवा तिरछी चल सकती है, और रेफरी थोड़े विचलित हो सकते हैं। यह "सिम-टू-रियल गैप" (Sim-to-Real Gap) है।

आर्टिफिशियल इंटेलिजेंस की दुनिया में, विशेष रूप से मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग (MARL) में, हमारे पास AI एजेंटों (जैसे रोबोट या सॉफ्टवेयर प्रोग्राम) की टीमें हैं जो सहयोग करने की कोशिश कर रही हैं। वे आमतौर पर एक आदर्श कंप्यूटर सिमुलेशन ("सिम") में प्रशिक्षण लेते हैं और फिर वास्तविक दुनिया में प्रदर्शन करने का प्रयास करते हैं। समस्या यह है कि जब वास्तविक दुनिया सिमुलेशन से थोड़ी भी अलग होती है, तो टीम अक्सर बिखर जाती है। वे समन्वय करना बंद कर देते हैं, गलत चालें चलते हैं, और हार जाते हैं।

यह पेपर इन AI टीमों को प्रशिक्षित करने का एक नया तरीका पेश करता है ताकि वे केवल एक आदर्श अभ्यास मैदान को याद न करें, बल्कि यह सीखें कि खराब मौसम में भी कैसे जीतना है।

पुराना तरीका: "परफेक्ट प्रैक्टिस" का जाल

अधिकांश वर्तमान AI टीमें वैल्यू फैक्टराइजेशन (Value Factorization) नामक एक विधि का उपयोग करती हैं। इसे ऐसे समझें जैसे एक कोच प्रत्येक खिलाड़ी को एक व्यक्तिगत निर्देश पत्र देता है।

  • नियम: "यदि आप गेंद देखते हैं, तो वह करें जो आपके लिए सबसे अच्छा है।"
  • जादू: सैद्धांतिक रूप से, यदि प्रत्येक खिलाड़ी वह करता है जो उसके लिए सबसे अच्छा है, तो पूरी टीम स्वतः ही समूह के लिए सबसे अच्छा करती है। इसे IGM सिद्धांत (Individual-Global-Maximum) कहा जाता है।

समस्या: यह सिमुलेशन में बहुत अच्छा काम करता है। लेकिन वास्तविक दुनिया में, यदि खिलाड़ी A सोचता है कि हवा बाईं ओर चल रही है (एक सेंसर त्रुटि के कारण) और खिलाड़ी B सोचता है कि हवा दाईं ओर चल रही है, तो वे दोनों गेंद को विपरीत दिशाओं में किक करने की कोशिश कर सकते हैं। "परफेक्ट प्रैक्टिस" की रणनीति इसलिए टूट जाती है क्योंकि खिलाड़ी अब इस बात पर सहमत नहीं हैं कि "सबसे अच्छा" मूव क्या है।

नया विचार: "DrIGM" (साझा सबसे खराब स्थिति)

लेखक डिस्ट्रीब्यूशनली रोबस्ट IGM (DrIGM) नामक एक नया सिद्धांत प्रस्तावित करते हैं।

कल्पना कीजिए कि अपने खिलाड़ियों को एक आदर्श मैदान पर प्रशिक्षित करने के बजाय, आप उन्हें एक सिम्युलेटेड तूफान में प्रशिक्षित करते हैं। आप उनसे कहते हैं: "ठीक है, हवा के झोंके आ सकते हैं, घास फिसलन भरी हो सकती है, और गेंद अजीब तरह से उछल सकती है। आइए वह सबसे अच्छा मूव खोजें जो पूर्णतः सबसे खराब स्थिति (worst-case scenario) में भी काम करे।"

यहाँ उनके तरीके में एक चतुर मोड़ है:

  1. व्यक्तिगत सबसे खराब स्थितियों की चिंता न करें: यदि आप खिलाड़ी A से पूछते हैं, "आपके लिए सबसे बुरा क्या हो सकता है?" और खिलाड़ी B से, "आपके लिए सबसे बुरा क्या हो सकता है?", तो वे अलग-अलग डरावनी स्थितियाँ बता सकते हैं। खिलाड़ी A को बारिश का डर हो सकता है; खिलाड़ी B को कीचड़ का डर हो सकता है। यदि वे इन अलग-अलग डरों पर काम करते हैं, तो वे समन्वय नहीं कर पाएंगे।
  2. टीम की सबसे खराब स्थिति की चिंता करें: इसके बजाय, टीम एक ही साझा सबसे खराब स्थिति पर सहमत होती है। शायद सबसे खराब स्थिति एक "सुपर स्टॉर्म" है जहाँ गेंद अप्रत्याशित रूप से उछलती है।
  3. सहमति: प्रत्येक खिलाड़ी सीखता है: "यदि हम इस सुपर स्टॉर्म में हैं, तो टीम को बचाने वाला एक ही मूव यहाँ है।"

चूंकि वे सभी एक ही सबसे खराब स्थिति के लिए योजना बना रहे हैं, इसलिए उनके व्यक्तिगत "सर्वश्रेष्ठ मूव" स्वाभाविक रूप से एक सीध में आ जाते हैं। उन्हें खेल के दौरान एक-दूसरे से बात करने की आवश्यकता नहीं होती है; वे बस अपने प्रशिक्षण का पालन करते हैं, और वे स्वचालित रूप से समन्वय करते हैं।

उन्होंने इसे कैसे किया (नुस्खा)

यह पेपर तीन प्रसिद्ध AI प्रशिक्षण विधियों (VDN, QMIX, और QTRAN) को लेता है और उनमें एक "रोबस्टनेस स्पाइस" (Robustness Spice) जोड़ता है।

  • मसाला (The Spice): वे गणित को इस तरह बदलते हैं कि AI केवल औसत परिणाम को न देखे। यह अनिश्चितता की एक निश्चित सीमा के भीतर "सबसे खराब संभावित परिणाम" को देखता है।
  • परिणाम: उन्होंने एक नए प्रकार का "रोबस्ट बेलमैन ऑपरेटर" बनाया। सरल शब्दों में, यह एक गणितीय नियम है जो AI को बताता है: "केवल धूप वाले दिन जीतने के लिए न सीखें। यह भी सीखें कि अगर हवा गेंद को रास्ते से 10% भटका दे, तब भी कैसे जीतना है।"

प्रमाण: क्या यह काम कर गया?

लेखकों ने दो बहुत अलग चीजों पर इसका परीक्षण किया:

  1. स्मार्ट बिल्डिंग्स (HVAC कंट्रोल): एक इमारत की कल्पना करें जिसमें कई कमरे हैं। प्रत्येक कमरे में एक थर्मोस्टेट (एक AI एजेंट) है जो ऊर्जा बचाने के साथ-साथ तापमान को आरामदायक बनाए रखने की कोशिश करता है।

    • परीक्षण: उन्होंने AI को एक गर्म, शुष्क रेगिस्तान (टक्सन) के सिमुलेशन में प्रशिक्षित किया। फिर उन्होंने इसे एक नम, बारिश वाले स्थान (न्यूयॉर्क) और विभिन्न मौसमों के दौरान टेस्ट किया।
    • परिणाम: पुराने AI टीमें भ्रमित हो गईं और ऊर्जा बर्बाद की या कमरों को बहुत गर्म/ठंडा कर दिया। नए "रोबस्ट" टीमों ने मौसम के बदलावों को बखूबी संभाला, जिससे इमारत आरामदायक और कुशल बनी रही।
  2. StarCraft II (वीडियो गेम): यह एक जटिल रणनीति गेम है जहाँ आप इकाइयों की एक सेना को नियंत्रित करते हैं।

    • परीक्षण: उन्होंने गेम में "नॉइज़" (noise) जोड़ा, जिससे इकाइयों का विजन थोड़ा धुंधला या अस्थिर हो गया (जो सेंसर त्रुटियों का अनुकरण करता है)।
    • परिणाम: रोबस्ट टीमों ने फिर भी युद्ध जीते, जबकि मानक टीमें बेवकूफी भरी गलतियाँ करने लगीं और हार गईं।

मुख्य निष्कर्ष

आमतौर पर, जब हम किसी AI को "रोबस्ट" (त्रुटियों के विरुद्ध सुरक्षित) बनाते हैं, तो वह "रूढ़िवादी" (जोखिम लेने से डरने वाला) हो जाता है और सामान्य स्थितियों में भी खराब प्रदर्शन करता है।

इस पेपर का आश्चर्यजनक निष्कर्ष: एक टीम सेटिंग में, रोबस्ट होना वास्तव में टीम को समन्वय करने में बेहतर बनाता है, यहाँ तक कि सामान्य स्थितियों में भी। एक साझा "सबसे खराब स्थिति की योजना" पर सहमत होकर, एजेंट एक-दूसरे पर संदेह करना बंद कर देते हैं। वे एक अधिक सुदृढ़, विश्वसनीय इकाई बन जाते हैं।

संक्षेप में: यह पेपर AI टीमों को एक आदर्श दिन के लिए अभ्यास करना छोड़कर तूफान के लिए प्रशिक्षण लेना सिखाता है। तूफान कैसा दिखेगा, इस पर सहमत होकर, वे एक-दूसरे के पैरों पर पैर रखे बिना बारिश में एक साथ नृत्य करना सीख जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →