Closed-Loop Vision-Language Planning for Multi-Agent Coordination
यह शोध पत्र COMPASS को प्रस्तुत करता है, जो एक नवीन मल्टी-एजेंट फ्रेमवर्क है जो कोड-आधारित कौशल परिशोधन और संरचित संचार के साथ विकेंद्रीकृत, क्लोज्ड-लूप प्लानिंग के लिए विजन-लैंग्वेज मॉडल्स का लाभ उठाता है, और पारंपरिक MARL बेसलाइन्स से काफी बेहतर प्रदर्शन करते हुए SMACv2 बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप पाँच दोस्तों के एक समूह को StarCraft जैसे एक जटिल, तेज़ गति वाले वीडियो गेम खेलने के लिए सिखाने की कोशिश कर रहे हैं, जो पाँच विरोधियों की एक टीम के खिलाफ है। पेच यह है कि प्रत्येक मित्र केवल अपने चारों ओर एक छोटा सा घेरा देख सकता है। वे पूरे मानचित्र को नहीं देख सकते, वे बिना भ्रमित हुए स्वतंत्र रूप से बात नहीं कर सकते, और उन्हें जीतने के लिए पलक झपकते ही निर्णय लेने होंगे।
यही वह चुनौती है जिसे यह शोध पत्र (paper) हल करता है। पारंपरिक AI विधियाँ (जैसे "मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग") इन दोस्तों को सिखाने जैसी हैं जहाँ आप उन्हें लाखों बार गेम खिलाते हैं, इस उम्मीद में कि वे अंततः एक जीतने वाली रणनीति खोज लेंगे। यह धीमा, बर्बादी भरा और यह समझना कठिन है कि उन्होंने एक विशिष्ट चाल क्यों चली।
लेखक एक नई प्रणाली पेश करते हैं जिसे COMPASS कहा जाता है। COMPASS को पाँच दोस्तों की एक टीम के रूप में समझें जिन्हें एक सुपर-स्मार्ट, विजुअल-सवी कोच (एक विजन-लैंग्वेज मॉडल) द्वारा निर्देशित किया जा रहा है, जो गेम स्क्रीन देख सकता है और टेक्स्ट लॉग पढ़ सकता है। यहाँ बताया गया है कि COMPASS कैसे काम करता है, जिसे तीन सरल भागों में विभाजित किया गया है:
1. "स्किल बुक" के साथ कोच (द प्लानर एंड स्किल लाइब्रेरी)
कोच द्वारा "बाएँ जाओ!" या "हमला करो!" जैसे रैंडम निर्देश चिल्लाने के बजाय, कोच के पास एक स्किल लाइब्रेरी होती है। यह विशिष्ट रणनीतियों (जैसे "फोकस फायर" - सभी का एक ही दुश्मन पर हमला करना, या "काइटिंग" - गोली चलाते हुए पीछे हटना) के लिए पहले से लिखे गए व्यंजनों (पायथन कोड) की एक कुकबुक की तरह है।
- यह कैसे सीखता है: कोच शून्य से शुरुआत नहीं करता है। यह पहले एक मानव विशेषज्ञ द्वारा गेम खेलने के "वीडियो रीप्ले" को पढ़ता है (यह "वार्म स्टार्ट" है)। यह उन विशेषज्ञ चालों को कोड में बदल देता है और उन्हें कुकबुक में रख देता है।
- यह कैसे अनुकूलित होता है: गेम के दौरान, यदि कोच देखता है कि वर्तमान रेसिपी काम नहीं कर रही है, तो वह तुरंत एक नई रेसिपी लिखता है। उदाहरण के लिए, यदि टीम एक विशिष्ट लड़ाई में हार रही है, तो कोच "आक्रामक फ्लैंक" (Aggressive Flank) नामक एक नया स्क्रिप्ट लिख सकता है और उसे तुरंत किताब में जोड़ सकता है।
- लूप (The Loop): कोच स्क्रीन को देखता है, एक रेसिपी चुनता है, एजेंट उसे निष्पादित करते हैं, और फिर कोच परिणाम की जाँच करता है। यदि यह विफल रहा, तो कोच आत्मचिंतन करता है, एक बेहतर रेसिपी लिखता है, और फिर से प्रयास करता है। यह "क्लोज्ड-लूप" वाला हिस्सा है—यह वास्तविक समय में समायोजन करता रहता है।
2. "विस्पर नेटवर्क" (स्ट्रक्चर्ड कम्युनिकेशन)
कई खेलों में, यदि एजेंट बेतरतीब ढंग से चैट करते हैं, तो वे भ्रमित हो जाते हैं या कुछ भी बना लेते हैं (हैलुसिनेशन)। COMPASS एक सख्त "विस्पर नेटवर्क" का उपयोग करता है।
- समस्या: एजेंट A एक दुश्मन को देखता है। एजेंट B एक दीवार के पीछे है और उसे देख नहीं सकता।
- समाधान: एजेंट A, एजेंट C को फुसफुसाता है, जो फिर एजेंट B को फुसफुसाता है। इसे मल्टी-हॉप प्रोपेगेशन कहा जाता है।
- उपमा: "टेलीफोन" के खेल की कल्पना करें, लेकिन संदेश को बिगाड़ने के बजाय, एजेंट सटीक तथ्य साझा करते हैं: "दुश्मन #1, 5 मीटर पूर्व में है।" यह पूरी टीम को युद्ध के मैदान का एक साझा मानसिक मानचित्र बनाने की अनुमति देता है, भले ही कोई भी एकल एजेंट सब कुछ न देख सके।
3. "सेल्फ-करेक्शन" (रिफ्लेक्शन)
हर चाल के बाद, कोच खुद से पूछता है: "क्या यह काम आया?"
- यदि टीम ने सफलतापूर्वक एक दुश्मन को घेर लिया, तो कोच कहता है, "बहुत बढ़िया, उस रेसिपी को सुरक्षित रखें।"
- यदि टीम पूरी तरह खत्म हो गई, तो कोच कहता है, "यह बहुत आक्रामक था। अगली बार अधिक सावधान रहने के लिए एक नया नियम लिखते हैं।"
यह निरंतर आत्म-चिंतन टीम को स्मार्ट बनाता है, जिससे वे केवल एक ही गलती को दोहराने के बजाय जैसे-जैसे गेम आगे बढ़ता है, और अधिक बुद्धिमान होते जाते हैं।
परिणाम: वे कितने सफल रहे?
टीम ने SMACv2 नामक StarCraft चुनौती के एक बहुत कठिन संस्करण पर COMPASS का परीक्षण किया।
- बड़ी जीत: एक विशिष्ट परिदृश्य में जहाँ दोनों टीमों के पास 5 प्रोटोस (Protoss) यूनिट्स थे (एक संतुलित लड़ाई), COMPASS 57% बार जीता। सबसे अच्छा पिछला AI तरीका (QMIX) केवल 27% बार जीता। यह एक बहुत बड़ी छलांग है।
- सीमा (Limitation): सिस्टम "ज़र्ग" (Zerg) रेस के साथ संघर्ष करता है (तेज़, कमजोर इकाइयों का झुंड)। क्योंकि कोच स्क्रीन को देखता है और गेम के समय में हर 10-20 सेकंड में नया कोड लिखता है, इसलिए यह ज़र्ग इकाइयों के लिए बहुत धीमा था, जिन्हें पलक झपकते ही प्रतिक्रिया देने की आवश्यकता होती है। यह एक झुंड को नियंत्रित करने के लिए एक धीमे ट्रैफिक पुलिसकर्मी के उपयोग करने जैसा है; मधुमक्खियां इतनी तेज़ चलती हैं कि निर्देशों का उनके साथ तालमेल नहीं बैठ पाता।
संक्षेप में
COMPASS एक ऐसी प्रणाली है जो AI एजेंटों को सहयोग करने में सक्षम बनाती है:
- मानव की तरह गेम को पढ़ना (दृष्टि और टेक्स्ट का उपयोग करके)।
- खेलते समय अपने स्वयं के निर्देश मैनुअल (कोड) लिखना, विशेषज्ञ उदाहरणों से शुरू करना।
- सूचना को एक संरचित श्रृंखला के माध्यम से साझा करना ताकि हर कोई जान सके कि क्या हो रहा है, भले ही वे उसे देख न सकें।
यह साबित करता है कि बड़े AI मॉडल की तर्क शक्ति को सूचना साझा करने और कोड लिखने के एक संरचित तरीके के साथ जोड़कर, रोबोट (या गेम एजेंट) पहले की तुलना में बहुत तेज़ी से और अधिक बुद्धिमानी से सहयोग करना सीख सकते हैं—बशर्ते गेम इतना तेज़ न हो कि AI उसका मुकाबला न कर सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।