← नवीनतम पेपर
💻 computer science

A Comprehensive Survey on Multi-Agent Cooperative Decision-Making: Scenarios, Approaches, Challenges and Perspectives

यह शोध पत्र मल्टी-एजेंट सहकारी निर्णय लेने (multi-agent cooperative decision-making) का एक व्यापक सर्वेक्षण प्रस्तुत करता है, जो सिमुलेशन वातावरण के विश्लेषण और मुख्यधारा के दृष्टिकोणों के वर्गीकरण से शुरू होता है, और फिर डीप मल्टी-एजेंट सुदृढीकरण लर्निंग (deep multi-agent reinforcement learning) तथा लार्ज लैंग्वेज मॉडल-आधारित तकनीकों की कार्यप्रणालियों, लाभों और चुनौतियों पर गहन ध्यान केंद्रित करते हुए भविष्य की अनुसंधान दिशाओं को रेखांकित करता है।

मूल लेखक: Weiqiang Jin, Hongyang Du, Shixiang Tang, Biao Zhao, Guang Yang

प्रकाशित 2026-09-01
📖 10 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weiqiang Jin, Hongyang Du, Shixiang Tang, Biao Zhao, Guang Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, एक एकल प्रतिभाशाली मस्तिष्क और एक समन्वित टीम के बीच एक स्पष्ट अंतर है। दशकों तक, शोधकर्ताओं ने एक कंप्यूटर को एक समस्या हल करना सिखाने पर ध्यान केंद्रित किया, जैसे कि शतरंज का ग्रैंडमास्टर खेलना या भूलभुलैया में रास्ता खोजना। इन प्रणालियों ने प्रयास और त्रुटि (trial and error) के माध्यम से सीखा, पुरस्कारों या दंडों के आधार पर अपने कार्यों को तब तक समायोजित किया जब तक कि उन्होंने एक विशिष्ट कार्य में महारत हासिल नहीं कर ली। हालाँकि, वास्तविक दुनिया शायद ही कभी ऐसी समस्याएं प्रस्तुत करती है जिन्हें एक अकेले अभिनेता द्वारा अलग-थलग रहकर हल किया जा सके। यातायात का प्रवाह, बचाव मिशन और कारखानों के फर्श कई स्वतंत्र अभिनेताओं को एक साथ चलते हुए शामिल करते हैं, जिनमें से प्रत्येक ऐसे निर्णय लेता है जो दूसरों को प्रभावित करते हैं। यह मल्टी-एजेंट सिस्टम (बहु-अभिकर्ता प्रणाली) का क्षेत्र है, जहाँ लक्ष्य केवल व्यक्तिगत बुद्धिमत्ता नहीं, बल्कि सामूहिक सहयोग है। चुनौती इन स्वतंत्र संस्थाओं को बिना किसी केंद्रीय कमांडर के हर चाल को निर्देशित किए, एक साथ काम करने के लिए प्रेरित करने में निहित है, विशेष रूप से तब जब वातावरण अराजक हो, नियम अस्पष्ट हों और दांव ऊंचे हों।

शोधकर्ता वेइक्वांग जिन, होंगयांग डु, शिशियांग तांग, बियाओ झाओ और गुआंग यांग द्वारा किया गया एक नया व्यापक सर्वेक्षण इस जटिल क्षेत्र के वर्तमान परिदृश्य का मानचित्रण करता है। लेखकों ने एजेंटों के समूहों को सहयोग करना सिखाने के लिए उपयोग की जाने वाली प्रमुख विधियों को एकत्र और विश्लेषित किया है, जो कठोर नियमपुस्तिकाओं से लेकर लचीली, सीखने पर आधारित रणनीतियों तक फैली हुई हैं। उनका कार्य उन विभिन्न उपकरणों और वातावरणों के माध्यम से एक मार्गदर्शक के रूप में कार्य करता है जिनका उपयोग वैज्ञानिक इन विचारों का परीक्षण करने के लिए करते हैं, वीडियो गेम सिमुलेशन से लेकर स्वायत्त ड्राइविंग और आपदा प्रतिक्रिया में वास्तविक दुनिया के अनुप्रयोगों तक। यह सर्वेक्षण इस बात पर प्रकाश डालता है कि इन प्रणालियों को बनाने के तरीके में एक महत्वपूर्ण बदलाव आया है। जबकि पुराने तरीके पूर्व-निर्धारित निर्देशों या प्रतिस्पर्धा के गणितीय मॉडलों पर निर्भर थे, सबसे आशाजनक दृष्टिकोणों में अब ऐसे एजेंट शामिल हैं जो अनुभव से सीखते हैं और हाल ही में, ऐसे एजेंट जो मनुष्यों की तरह तर्क करने और संवाद करने के लिए उन्नत भाषा मॉडल का उपयोग करते हैं।

शोधकर्ताओं ने सबसे पहले इस बात का वर्गीकरण किया कि इन प्रणालियों को कैसे डिजाइन किया जाता है। उन्होंने निर्णय लेने की पांच मुख्य श्रेणियों की पहचान की। पहली निश्चित नियमों पर आधारित है, जहाँ एजेंट निर्देशों के एक सख्त सेट का पालन करते हैं, ठीक वैसे ही जैसे ट्रैफिक लाइट समय के अनुसार रंग बदलती है। दूसरी गेम थ्योरी (खेल सिद्धांत) का उपयोग करती है, जो अंतःक्रियाओं को रणनीतिक चालों के रूप में मानती है जहाँ एजेंट एक स्थिर परिणाम तक पहुँचने के लिए एक-दूसरे को मात देने या सहयोग करने का प्रयास करते हैं। तीसरी श्रेणी विकासवादी एल्गोरिदम (evolutionary algorithms) का उपयोग करती है, जो एक रणनीति के कई संस्करणों का परीक्षण करके और जो सबसे अच्छा काम करते हैं उन्हें बनाए रखकर प्राकृतिक चयन की नकल करती है। जबकि ये पारंपरिक विधियाँ उपयोगी हैं, सर्वेक्षण बताता है कि वे अक्सर तब संघर्ष करती हैं जब वातावरण तेजी से बदलता है या जब एजेंटों की संख्या बहुत अधिक हो जाती है। वे एक कठोर पटकथा की तरह हैं जो अनुकूलित नहीं हो सकती यदि अभिनेता अपनी लाइनें भूल जाएं या यदि मंच अचानक बदल जाए।

इसके विपरीत, सर्वेक्षण दो नए, अधिक गतिशील दृष्टिकोणों पर सबसे अधिक जोर देता है: मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग और लार्ज लैंग्वेज मॉडल्स। मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग में, एजेंट एक-दूसरे और अपने वातावरण के साथ अंतःक्रिया करके सीखते हैं। वे एक मैनुअल के साथ शुरुआत नहीं करते हैं; इसके बजाय, वे बार-बार किए गए प्रयासों के माध्यम से प्रभावी रणनीतियों की खोज करते हैं, और इस पर फीडबैक प्राप्त करते हैं कि क्या उनके कार्यों ने समूह को सफल होने में मदद की। लेखक विस्तार से बताते हैं कि इन प्रानों को कैसे प्रशिक्षित किया जाता है, अक्सर एक ऐसी विधि का उपयोग करते हुए जहाँ एजेंट सर्वोत्तम रणनीतियों को सीखने के लिए एक केंद्रीय केंद्र में एक साथ अभ्यास करते हैं, लेकिन फिर वास्तविक दुनिया में स्वतंत्र रूप से कार्य करते हैं, केवल उसी पर निर्भर रहते हैं जो वे देख और सुन सकते हैं। यह उन्हें एक केंद्रीय मस्तिष्क के साथ निरंतर संबंध की आवश्यकता के बिना समन्वय करने की अनुमति देता है।

दूसरा प्रमुख फोकस लार्ज लैंग्वेज मॉडल्स द्वारा संचालित प्रणालियों पर है, जो आधुनिक चैटबॉट्स के पीछे की समान तकनीक है। ये एजेंट कार्यों को समझने, चरणों की योजना बनाने और एक-दूसरे से बात करने के लिए प्राकृतिक भाषा का उपयोग करते हैं। तत्काल पुरस्कारों पर केवल प्रतिक्रिया देने के बजाय, वे एक जटिल निर्देश पढ़ सकते हैं, उसे छोटे लक्ष्यों में तोड़ सकते हैं, और अपने साथियों के साथ आगे बढ़ने के सर्वोत्तम तरीके पर चर्चा कर सकते हैं। सर्वेक्षण नोट करता है कि यह दृष्टिकोण उन कार्यों को संभालने में विशेष रूप से अच्छा है जिनमें तर्क या संदर्भ को समझने की आवश्यकता होती है, जैसे कि एक संरचना बनाने के लिए मिलकर काम करने वाले रोबोटों की एक टीम या एक सामाजिक परिदृश्य को निभाने वाले आभासी पात्रों का एक समूह। हालाँकि, लेखक यह भी बताते हैं कि ये भाषा-आधारित प्रणालियाँ अभी भी विकसित हो रही हैं और भ्रमित या अक्षम हुए बिना बड़े समूहों तक विस्तार करने में चुनौतियों का सामना करती हैं।

इन विचारों का परीक्षण करने के लिए, शोधकर्ता भारी रूप से सिमुलेशन वातावरण पर भरोसा करते हैं, जो डिजिटल प्रशिक्षण मैदान के रूप में कार्य करते हैं। सर्वेक्षण इन प्लेटफार्मों में से सबसे लोकप्रिय की समीक्षा करता है, जो सरल कण सिमुलेशन (जहाँ बिंदु स्क्रीन पर घूमते हैं) से लेकर स्टारक्राफ्ट II जैसे जटिल, यथार्थवादी वातावरण तक फैले हुए हैं, जो सैन्य-शैली के समन्वय का परीक्षण करने के लिए उपयोग किया जाने वाला एक रियल-टाइम स्ट्रैटेजी गेम है। ये वातावरण वैज्ञानिकों को ऐसे परिदृश्य बनाने की अनुमति देते हैं जो वास्तविक दुनिया में परीक्षण करने के लिए बहुत खतरनाक, महंगे या धीमे होते। लेखक इस बात पर जोर देते हैं कि सिमुलेशन का चुनाव महत्वपूर्ण है; एक प्रणाली जो एक सरल, नियंत्रित खेल में अच्छी तरह काम करती है, वह एक अव्यवस्थित, अप्रत्याशित वास्तविक दुनिया की स्थिति में पूरी तरह विफल हो सकती है। वे नए प्लेटफार्मों पर भी प्रकाश डालते हैं जो विशेष रूप से भाषा-आधारित एजेंटों के लिए डिज़ाइन किए गए हैं, जहाँ ध्यान केवल भौतिक गति के बजाय संचार और सामाजिक संपर्क पर है।

लेख फिर व्यावहारिक अनुप्रयोगों की ओर बढ़ता है, यह दिखाता है कि इन सिद्धांतों को वास्तविक समस्याओं पर कैसे लागू किया जा रहा है। स्वायत्त ड्राइविंग में, मल्टी-एजेंट सिस्टम कारों को अन्य वाहनों के कार्यों का अनुमान लगाकर चौराहों को पार करने और राजमार्गों पर विलय करने में मदद करते हैं। आपदा बचाव में, ड्रोन की टीमें जीवित बचे लोगों की तलाश के लिए बड़े क्षेत्रों को खोजने के लिए समन्वय कर सकती हैं, जिससे वे एक एकल ड्रोन की तुलना में अधिक कुशलता से जमीन कवर करने के लिए जानकारी साझा कर सकती हैं। कृषि में, रोबोट फसलों की निगरानी करने और संसाधनों का प्रबंधन करने के लिए मिलकर काम कर सकते हैं। सर्वेक्षण यह भी देखता है कि इन प्रणालियों का उपयोग गेमिंग और सामाजिक सिमुलेशन में कैसे किया जाता है, जहाँ आभासी पात्र एक-दूसरे के साथ और मानव खिलाड़ियों के साथ स्वाभाविक और उत्तरदायी तरीकों से बातचीत करते हैं।

इन प्रगति के बावजूद, शोधकर्ता पहचान करते हैं कि अभी भी महत्वपूर्ण बाधाएं शेष हैं। एक प्रमुख चुनौती मल्टी-एजेंट वातावरण की "नॉन-स्टेशनरी" (अस्थिर) प्रकृति है। क्योंकि प्रत्येक एजेंट एक ही समय में सीख रहा है और अपना व्यवहार बदल रहा है, वातावरण लगातार बदल रहा है, जिससे किसी भी एकल एजेंट के लिए यह अनुमान लगाना कठिन हो जाता है कि आगे क्या होगा। यह एक नृत्य दिनचर्या सीखने की तरह है जहाँ प्रत्येक साथी चलते समय अपने नए कदम खुद बना रहा है। एक अन्य मुद्दा "क्रेडिट असाइनमेंट" की समस्या है: जब एक टीम सफल या विफल होती है, तो यह बताना कठिन होता है कि किस विशिष्ट एजेंट ने परिणाम में सबसे अधिक योगदान दिया। यह जानना मुश्किल बनाता है कि किन व्यवहारों को प्रोत्साहित किया जाना चाहिए और किन्हें हतोत्साहित किया जाना चाहिए। इसके अलावा, जैसे-जैसे एजेंटों की संख्या बढ़ती है, उनके समन्वय की जटिलता तेजी से बढ़ती है, जो अक्सर वर्तमान कंप्यूटिंग संसाधनों को अभिभूत कर देती है।

सर्वेक्षण भाषा-आधारित दृष्टिकोणों की सीमाओं को भी संबोधित करता है। जबकि ये एजेंट तर्क करने और संचार करने में उत्कृष्ट हैं, वे कभी-कभी "हैलुसिनेट" (भ्रम उत्पन्न करना) कर सकते हैं, यानी गलत जानकारी उत्पन्न कर सकते हैं जो समूह में फैल जाती है और खराब निर्णयों की ओर ले जाती है। वे उन कार्यों के साथ संघर्ष करते हैं जिनमें सटीक स्थानिक जागरूकता या तीव्र शारीरिक प्रतिक्रिया की आवश्यकता होती है, ऐसे क्षेत्र जहाँ पारंपरिक शिक्षण विधियाँ अभी भी उत्कृष्ट हैं। लेखक सुझाव देते हैं कि भविष्य इन विभिन्न शक्तियों को मिलाने में निहित है। भाषा मॉडलों की तर्क शक्ति को रीइन्फोर्समेंट लर्निंग की अनुकूलन क्षमता के साथ एकीकृत करके, शोधकर्ता ऐसी प्रणालियाँ बनाने की आशा करते हैं जो स्मार्ट और मजबूत दोनों हों।

आगे देखते हुए, लेखक भविष्य के अनुसंधान के लिए कई आशाजनक दिशाओं को रेखांकित करते हैं। वे सुझाव देते हैं कि अगली पीढ़ी के मल्टी-एजेंट सिस्टम संभवतः विभिन्न तकनीकों का मिश्रण होंगे, जो एजेंटों को जटिल निर्देशों को समझने और दीर्घकालिक लक्ष्यों की योजना बनाने में मदद करने के लिए भाषा मॉडल का उपयोग करेंगे, जबकि उन योजनाओं को कुशलतापूर्वक निष्पादित करने के लिए रीइन्फोर्समेंट लर्निंग का उपयोग करेंगे। वे इन प्रणालियों के मूल्यांकन के लिए बेहतर तरीकों की भी आवश्यकता देखते हैं, जो केवल सफलता दर से आगे बढ़कर यह माप सकें कि एजेंट कितनी अच्छी तरह सहयोग करते हैं, संवाद करते हैं और नई स्थितियों के अनुकूल होते हैं। अंत में, वे नैतिक विचारों पर भी स्पर्श करते हैं, यह नोट करते हुए कि जैसे-जैसे ये प्रणालियाँ समाज में अधिक एकीकृत होती जा रही हैं, यह सुनिश्चित करना कि वे सुरक्षित, पारदर्शी और निष्पक्ष हों, उन्हें स्मार्ट बनाने जितना ही महत्वपूर्ण होगा।

यह सर्वेक्षण इस दावे के साथ नहीं आता कि इसने मल्टी-एजेंट सहयोग की समस्याओं को हल कर दिया है। इसके बजाय, यह एक स्पष्ट और विस्तृत मानचित्र प्रदान करता है कि यह क्षेत्र आज कहाँ खड़ा है। यह दिखाता है कि हालांकि हमने मशीनों को एक साथ काम करना सिखाने में उल्लेखनीय प्रगति की है, लेकिन हमें यह सीखने के लिए अभी भी बहुत कुछ सीखना है कि इन टीमों को मानवीय दुनिया की अव्यवस्थित वास्तविकता में विश्वसनीय, स्केलेबल और प्रभावी कैसे बनाया जाए। नवीनतम विधियों, वातावरणों और अनुप्रयोगों को एक साथ लाकर, लेखक खोजों की अगली लहर के लिए एक आधार प्रदान करते हैं, जो शोधकर्ताओं को एक ऐसे भविष्य की ओर मार्गदर्शन करता है जहाँ कृत्रिम एजेंट हमारे समय की जटिल चुनौतियों को हल करने के लिए निर्बाध रूप से सहयोग कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →