← नवीनतम पेपर
🤖 machine learning

LLM-Guided Communication for Cooperative Multi-Agent Reinforcement Learning

यह शोध पत्र LMAC का प्रस्ताव करता है, जो एक नवीन फ्रेमवर्क है जो संचार प्रोटोकॉल को पुनरावृत्ति (iteratively) के माध्यम से डिजाइन और परिष्कृत करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे सहकारी मल्टी-एजेंट सिस्टम को अंतर्निहित अवस्थाओं (underlying states) को अधिक सटीक और समान रूप से पुनर्निर्मित करने में सक्षम बनाया जा सके, जिससे यह विविध बेंचमार्क पर मौजूदा बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Sangjun Bae, Yisak Park, Sanghyeon Lee, Seungyul Han

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sangjun Bae, Yisak Park, Sanghyeon Lee, Seungyul Han

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि दोस्तों का एक समूह एक अंधेरे कमरे में एक जटिल पहेली को सुलझाने की कोशिश कर रहा है। वे पूरी तस्वीर नहीं देख सकते; प्रत्येक व्यक्ति केवल एक छोटा सा, धुंधला कोना देख पाता है। पहेली को सुलझाने के लिए, उन्हें एक-दूसरे से बात करने की आवश्यकता है। लेकिन समस्या यह है: यदि वे बस बेतरतीब ढंगते चिल्लाते हैं ("मुझे एक नीला टुकड़ा दिख रहा है!" "नहीं, मुझे एक लाल वाला दिख रहा है!"), तो वे एक-दूसरे के ऊपर चिल्ला सकते हैं, महत्वपूर्ण विवरणों को मिस कर सकते हैं, या अंततः सभी के पास पहेली के बारे में एक अलग और भ्रमित विचार हो सकता है।

यह मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग (MARL) की मूल चुनौती है, जहाँ कंप्यूटर "एजेंट्स" (जैसे रोबोट या गेम कैरेक्टर्स) को पूरी दुनिया को देखे बिना एक साथ काम करना होता है।

यह पेपर एक नई विधि पेश करता है जिसे LMAC (LLM-ड्रिवन मल्टी-एजेंट कम्युनिकेशन) कहा जाता है। LMAC को एक सुपर-स्मार्ट "कोच" या "अनुवादक" के रूप में समझें जो टीम को यह समझने में मदद करता है कि पहेली को कुशलतापूर्वक हल करने के लिए उन्हें एक-दूसरे से ठीक-ठीक क्या कहने की आवश्यकता है।

यह कैसे काम करता है, यहाँ सरल चरणों में दिया गया है:

1. समस्या: "चिल्लाने का मुकाबला" (The Shouting Match)

पारंपरिक तरीकों में, एजेंट अक्सर वह सब कुछ प्रसारित करते हैं जो वे देखते हैं (जैसे कि वे जो भी शब्द देखते हैं उसे चिल्लाना) या बातचीत के लिए कठोर, पूर्व-निर्धारित नियमों का उपयोग करते हैं।

  • परिणाम: या तो बहुत अधिक शोर (ऊर्जा की बर्बादी) या अपर्याप्त जानकारी (एजेंट्स का भ्रमित होना)। कुछ एजेंटों को दुश्मन का स्थान पता हो सकता है, जबकि अन्य केवल अनुमान लगा रहे होते हैं, जिससे एक अस्त-व्यस्त टीम प्रयास होता है।

2. समाधान: "स्मार्ट कोच" (The LLM)

लेखक एक लार्ज लैंग्वेज मॉडल (LLM) का उपयोग करते हैं—वही तरह का AI जो निबंध लिखता है या आपसे चैट करता है—जो एक संचार डिजाइनर (communication designer) के रूप में कार्य करता है।

  • उपमा: कल्पना करें कि LLM अंधेरे कमरे के बाहर खड़ा एक कोच है। कोच "नियम पुस्तिका" (कार्य का विवरण) और "सेंसर" (जो एजेंट देख सकते हैं) दोनों को पढ़ सकता है। कोच खेल नहीं खेलता; इसके बजाय, वे खिलाड़ियों के लिए एक स्क्रिप्ट लिखते हैं।
  • स्क्रिप्ट: यह स्क्रिप्ट खिलाड़ियों को बताती है: "सब कुछ मत चिल्लाओ। बस अपने साथी को बताओ, 'दुश्मन मेरे बाईं ओर 5 कदम दूर है,' और 'मैं वर्तमान में उत्तर की ओर बढ़ रहा हूँ।'"

3. प्रक्रिया: "प्रयास करें, आलोचना करें और सुधारें" (Try, Critique, and Improve)

कोच पहली बार में स्क्रिप्ट को सही नहीं करता है। LMAC एक चतुर लूप का उपयोग करता है जिसे रिफ्लेक्शन (Reflexion) कहा जाता है (जो अपनी गलतियों से सीखने जैसा है):

  • चरण 1: पहला ड्राफ्ट (प्रारंभिक प्रोटोकॉल)
    कोच नियमों के आधार पर एक बुनियादी स्क्रिप्ट लिखता है। एजेंट उस स्क्रिप्ट का उपयोग करके खेल खेलने की कोशिश करते हैं।
  • चरण 2: "रियलिटी चेक" (फीडबैक)
    सिस्टम जाँचता है: क्या एजेंटों ने दुश्मन का पता लगा लिया? क्या सभी ने दुश्मन के स्थान पर सहमति जताई?
    • यदि कोई एजेंट दुश्मन को खोजने में विफल रहा, तो सिस्टम नोट करता है: "आपने दुश्मन की स्थिति मिस कर दी।"
    • यदि एक एजेंट को स्थिति पता थी लेकिन दूसरे को नहीं, तो सिस्टम नोट करता है: "आपके पास सूचना का अंतर (information gap) है; आपको अधिक साझा करने की आवश्यकता है।"
  • चरण 3: कोच का संशोधन
    कोच (LLM) इन नोट्स को पढ़ता है और स्क्रिप्ट को फिर से लिखता है।
    • उदाहरण: "ठीक है, पहले स्क्रिप्ट में कहा गया था 'दुश्मन की दिशा बताएं।' लेकिन खिलाड़ी यह नहीं बता सके कि वे खुद कहाँ खड़े थे। नया नियम: 'दुश्मन की दिशा और अपना स्थान भी बताएं।'"
  • चरण 4: दोहराना
    यह कुछ बार (आमतौर पर दो राउंड) होता है। स्क्रिप्ट अधिक सटीक हो जाती है, और केवल पहेली को हल करने के लिए आवश्यक महत्वपूर्ण जानकारी पर ध्यान केंद्रित करती है।

4. परिणाम: एक सुव्यवस्थित मशीन

एक बार जब कोच स्क्रिप्ट को अंतिम रूप दे देता है, तो एजेंट वास्तविक खेल के दौरान उसका उपयोग करते हैं।

  • क्या होता है: एक अराजक चिल्लाने के मुकाबले के बजाय, एजेंट सटीक और उच्च-मूल्य वाले संदेशों का आदान-प्रदान करते हैं।
  • परिणाम:
    • सटीकता (Accuracy): प्रत्येक एजेंट दुनिया की एक स्पष्ट तस्वीर बना लेता है (जैसे, दुश्मन ठीक कहाँ है)।
    • एकरूपता (Uniformity): कोई भी एजेंट अंधेरे में नहीं रहता; सभी के पास ज्ञान का समान स्तर होता है।
    • प्रदर्शन (Performance): टीम पुराने संचार तरीकों का उपयोग करने वाली टीमों की तुलना में अधिक बार जीतती है और तेजी से सीखती है।

पेपर से वास्तविक दुनिया के उदाहरण

शोधकर्ताओं ने इसे वीडियो गेम जैसे वातावरण में परखा:

  • स्टारक्राफ्ट (रणनीति गेम): छोटे यूनिट्स (Banelings) के एक समूह को एक बड़े दुश्मन यूनिट को घेरना और नष्ट करना था। "ओवरसीयर" (एक स्काउट) दुश्मन को देख सकता था लेकिन अन्य नहीं। LMAC ने ओवरसीयर को ठीक से सिखाया कि दुश्मन के स्थान का वर्णन कैसे करना है ताकि अन्य पूरी तरह से तालमेल के साथ हमला कर सकें।
  • फोरेजिंग (सामान इकट्ठा करना): एजेंटों को भारी सामान उठाने के लिए मिलकर काम करना था। LMAC ने उन्हें अपनी स्थितियों के समन्वय में मदद की ताकि वे एक-दूसरे से न टकराएं या सामान मिस न करें।

यह विशेष क्यों है?

आमतौर पर, यदि आप चाहते हैं कि कोई AI बेहतर संवाद करे, तो आपको इसे क्या कहना है यह "सीखने" के लिए लंबे समय तक प्रशिक्षित करना पड़ता है। LMAC अलग है क्योंकि यह "कोच" के तर्क का उपयोग करके पहले भाषा के नियमों को डिजाइन करता है, और फिर एजेंटों को उन नियमों का पालन करना सिखाता है। यह टीम को खेल शुरू होने से पहले एक मैनुअल देने जैसा है, बजाय इसके कि यह उम्मीद की जाए कि वे ट्रायल और एरर (try and error) से इसे समझ लेंगे।

संक्षेप में: LMAC एक स्मार्ट AI कोच का उपयोग करके संचार के लिए एक आदर्श "चीट शीट" तैयार करता है, यह सुनिश्चित करता है कि टीम के प्रत्येक सदस्य को समस्या को एक साथ हल करने के लिए क्या कहना है, ताकि अनावश्यक बातचीत में समय बर्बाद न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →