Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs
यह शोध पत्र विजुअल इंस्पेक्शन ऑफ पॉलिसीज (VIP) को प्रस्तुत करता है, जो एक नवीन ओपन-एंडेड मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो पॉलिसी वीडियो का विश्लेषण करने और प्रभावी करिकुलम उत्पन्न करने के लिए एक वीडियो लैंग्वेज मॉडल का लाभ उठाता है, जो स्टारक्राफ्ट मल्टी-एजेंट चैलेंज पर टेक्स्ट-आधारित और स्केलर-स्कोर-आधारित दोनों विधियों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप वीडियो गेम के पात्रों की एक टीम को StarCraft में एक अराजक युद्ध जीतने के लिए सिखाने की कोशिश कर रहे हैं। अतीत में, कोचों (एल्गोरिदम) को यह अनुमान लगाने के लिए कि उन्हें आगे क्या सिखाना है, एक साधारण स्कोरकार्ड पर निर्भर रहना पड़ता था: "क्या वे जीते? हाँ या नहीं।" यदि वे हार गए, तो कोच ने मान लिया कि कार्य बहुत कठिन था। यदि वे जीत गए, तो कोच ने मान लिया कि वे अगले स्तर के लिए तैयार हैं।
लेकिन यहाँ एक समस्या है: कभी-कभी एक टीम युद्ध हार जाती है भले ही वे लगभग पूरी तरह से खेल रहे हों। शायद उनके पास संख्या में भारी बढ़त थी, लेकिन उनकी एक इकाई घबरा गई और भाग खड़ी हुई, जिससे एक ऐसी श्रृंखला शुरू हो गई जिससे वे खेल हार गए। एक कोच जो केवल "जीत/हार" के स्कोरकार्ड को देखता है, वह सोचेगा, "ओह, वे इस मैप पर बहुत खराब हैं," और उन्हें एक आसान, उबाऊ मैप पर भेज देगा। वह इस तथ्य को अनदेखा कर देगा कि टीम वास्तव में एक सफल रणनीति के कितने करीब थी।
यहीं पर नया तरीका, जिसे विजुअल इंस्पेक्शन ऑफ पॉलिसीज़ (VIP) कहा जाता है, काम आता है। केवल रिपोर्ट कार्ड पढ़ने के बजाय, VIP एक सुपर-स्मार्ट AI कोच को काम पर रखता है जो वास्तव में खेल का वीडियो देख सकता है।
"स्पोर्ट्स कोच" की उपमा
पुराने तरीके को एक ऐसे कोच की तरह समझें जो केवल समाचार पत्र की हेडलाइन पढ़ता है: "टीम हार गई।" कोच को पता ही नहीं चलता कि वे क्यों हारे। क्या वे बुरा खेले? क्या रेफरी ने गलती की? या मौसम खराब था?
VIP एक ऐसे कोच की तरह है जो टीम के साथ बैठता है और गेम टेप (वीडियो) देखता है। कोच वीडियो देखता है और कहता है, "हे, देखो! भले ही वे हार गए, लेकिन टीम पहले भाग में वास्तव में एक शानदार रणनीति का उपयोग कर रही थी। वे बस अंत में घबरा गए। आइए इसी विशिष्ट मैप का अभ्यास जारी रखें ताकि वे शांत रहना सीख सकें।"
वीडियो देखकर, VIP कोच उन "उम्मीद जगाने वाले" क्षणों को पहचान लेता है जिन्हें एक साधारण स्कोरकार्ड मिस कर देता है। यह देखता है कि एजेंट सीख रहे हैं, भले ही स्कोरबोर्ड कह रहा हो कि वे हार गए।
यह कैसे काम करता है (जादुई रेसिपी)
शोधकर्ताओं ने इस विचार का परीक्षण स्टारक्राफ्ट मल्टी-एजेंट चैलेंज (SMAC) में किया, जो एक जटिल खेल है जहाँ डिजिटल सैनिकों की टीमें एक-दूसरे से लड़ती हैं। यहाँ वह रेसिपी दी गई है जिसका उन्होंने उपयोग किया:
- खेल: AI एजेंट StarCraft का एक राउंड खेलते हैं।
- रिकॉर्डिंग: सिस्टम युद्ध का एक वीडियो रिकॉर्ड करता है (लगभग 1 से 10 सेकंड लंबा)।
- कोच: इस वीडियो को, एक छोटे टेक्स्ट नोट के साथ जिसमें लिखा है "जीत की दर: 10%", एक वीडियो लैंग्वेज मॉडल (VLM) में डाला जाता है। इस VLM को एक ऐसे रोबोट के रूप में सोचें जो वीडियो देख सकता है और युद्ध की कहानी समझ सकता है।
- सिफारिश: रोबोट वीडियो देखता है और कहता है, "मैं देख रहा हूँ कि वे 'काइटिंग' (शूट करते हुए पीछे हटना) में बेहतर हो रहे हैं, लेकिन संख्या में कम होने पर वे घबरा जाते हैं। आइए उन्हें इसी मैप पर रखें लेकिन इसे थोड़ा कठिन बनाएं," या "आइए एक नया मैप बदलें जो इस विशिष्ट कमजोरी को चुनौती दे।"
- चेक: क्योंकि रोबट कभी-कभी नकली मैप के नाम बना लेते हैं (हैलुसिनेशन), एक सरल "स्पेल-चेकर" (सेंटेंस सिमिलरिटी मॉड्यूल) रोबोट के सुझाव की दोबारा जांच करता है ताकि यह सुनिश्चित हो सके कि वह एक वास्तविक मैप है जो गेम में मौजूद है।
उन्हें क्या मिला (परिणाम)
टीम ने यह देखने के लिए सिमुलेशन चलाए कि क्या यह "वीडियो-देखने वाला" कोच पुराने "स्कोरकार्ड-मात्र" कोचों से बेहतर है।
- स्कोरकार्ड कोच विफल रहे: जब उन्होंने केवल नंबरों (जैसे "पॉजिटिव वैल्यू लॉस" या "मैक्स मोंटे कार्लो") को देखने वाले तरीकों का उपयोग किया, तो एजेंट अक्सर फंस गए। सबसे कठिन मैप्स पर, इन एजेंटों की जीत की दर बहुत कम (जीत की दर 0% के करीब) रही। वे गलत कार्यों पर भेजे जाते रहे क्योंकि नंबरों ने पूरी कहानी नहीं बताई।
- टेक्स्ट-ओनली कोच ठीक था: उन्होंने एक संस्करण आज़माया जहाँ रोबोट केवल खेल का टेक्स्ट सारांश पढ़ता था (वीडियो के बिना)। यह स्कोरकार्ड से बेहतर था, लेकिन फिर भी संघर्ष कर रहा था।
- VIP कोच जीता: जब रोबोट वीडियो देख सकता था, तो एजेंट बहुत तेज़ी से सीखे।
- 3s vs 4z नामक एक कठिन मैप पर, VIP एजेंट फाइन-ट्यूनिंग के बाद ~84% की जीत दर तक पहुँच गए।
- 3s5z पर, वे ~76% तक पहुँचे।
- इसके विपरीत, टेक्स्ट-ओनली संस्करण (बिना वीडियो के) 3s vs 4z मैप पर 0% पर अटक गया।
शोध का सुझाव है कि वीडियो ही "सीक्रेट सॉस" था। इसने सिस्टम को यह देखने की अनुमति दी कि एजेंट जीत की रणनीति के कितने करीब थे, भले ही वे मैच हार रहे थे।
उन्होंने किसे खारिज किया
पेपर बहुत स्पष्ट है कि VIP की तुलना में क्या काम नहीं करता है:
- केवल नंबर देखना: वे तरीके जो केवल स्केलर स्कोर (जैसे "उन्हें कितने अंक मिले?") पर निर्भर करते हैं, बहुत सतही होते हैं। वे इस बारीकी को मिस कर देते हैं कि एजेंट कैसे खेल रहे हैं।
- केवल टेक्स्ट पढ़ना: खेल को शब्दों में सारांशित करना (वीडियो दिखाए बिना) पर्याप्त नहीं है। घबराहट, समन्वय या चतुर रणनीति के दृश्य संकेत एक टेक्स्ट सारांश में खो जाते हैं।
- भविष्य का अनुमान लगाना: पेपर उन तरीकों के विरुद्ध तर्क देता है जो वास्तव में एजेंट के व्यवहार को देखे बिना "सीखने की क्षमता" (learning potential) का अनुमान लगाने की कोशिश करते हैं।
वे कितने आश्वस्त हैं?
लेखक इन परिणामों को लेकर आश्वस्त हैं, लेकिन वे सावधानी बरतते हुए कहते हैं कि ये सिमुलेशन हैं।
- उन्होंने प्रत्येक विधि के लिए 5 स्वतंत्र परीक्षण (सीड्स) चलाए ताकि यह सुनिश्चित हो सके कि परिणाम केवल किस्मत नहीं थे।
- उन्होंने एक हल्के, ओपन-सोर्स रोबोट ब्रेन (VideoLLaMa2-7B) का उपयोग किया जो केवल ~1% कंप्यूटर समय लेता था। बाकी 99% केवल गेम ट्रेनिंग थी। यह साबित करता है कि वीडियो-देखने वाले हिस्से ने चीजों को धीमा नहीं किया।
- उन्होंने VIP की तुलना एक "सुपरवाइज्ड" विधि से की जिसने एक विशाल ग्रिड सर्च (1,700 अलग-अलग सेटिंग्स आज़माना) का उपयोग करके परफेक्ट टीचर पाया। भले ही ग्रिड सर्च विधि (MAPPO*) दो मैप पर थोड़ा बेहतर था, VIP सीखने के चरणों के मामले में 100 गुना अधिक कुशल था। VIP ने बहुत कम प्रयासों के साथ एक मैप (3s5z) पर समान परिणाम प्राप्त किए।
निचोड़
पेपर सुझाव देता है कि यदि आप चाहते हैं कि AI एजेंट जटिल, मल्टी-एजेंट खेलों में वास्तव में अच्छे बनें, तो आपको केवल स्कोरबोर्ड नहीं देखना चाहिए। आपको खेल को देखना होगा। AI "कोच" को एजेंट के व्यवहार के वीडियो का निरीक्षण करने देकर, आप एक ऐसा करिकुलम (सीखने का रास्ता) बना सकते हैं जो पूरी तरह से उन चीज़ों के अनुरूप हो जो एजेंट वास्तव में करने में सक्षम हैं, जिससे उन्हें उन जीतने वाली रणनीतियों को खोजने में मदद मिलती है जो अन्यथा छिपी रह जातीं।
यह एक ऐसे कोच के बीच का अंतर है जो केवल अंतिम स्कोर जानता है और एक ऐसे कोच के बीच का अंतर है जो फिल्म देखता है, क्षमता देखता है, और जानता है कि आगे कौन सा अभ्यास चलाना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।