← नवीनतम पेपर
🤖 machine learning

Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs

यह शोध पत्र विजुअल इंस्पेक्शन ऑफ पॉलिसीज (VIP) को प्रस्तुत करता है, जो एक नवीन ओपन-एंडेड मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो पॉलिसी वीडियो का विश्लेषण करने और प्रभावी करिकुलम उत्पन्न करने के लिए एक वीडियो लैंग्वेज मॉडल का लाभ उठाता है, जो स्टारक्राफ्ट मल्टी-एजेंट चैलेंज पर टेक्स्ट-आधारित और स्केलर-स्कोर-आधारित दोनों विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Lorenzo Pantè, Andrea Fanti, Roberto Capobianco

प्रकाशित 2026-07-10
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lorenzo Pantè, Andrea Fanti, Roberto Capobianco

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप वीडियो गेम के पात्रों की एक टीम को StarCraft में एक अराजक युद्ध जीतने के लिए सिखाने की कोशिश कर रहे हैं। अतीत में, कोचों (एल्गोरिदम) को यह अनुमान लगाने के लिए कि उन्हें आगे क्या सिखाना है, एक साधारण स्कोरकार्ड पर निर्भर रहना पड़ता था: "क्या वे जीते? हाँ या नहीं।" यदि वे हार गए, तो कोच ने मान लिया कि कार्य बहुत कठिन था। यदि वे जीत गए, तो कोच ने मान लिया कि वे अगले स्तर के लिए तैयार हैं।

लेकिन यहाँ एक समस्या है: कभी-कभी एक टीम युद्ध हार जाती है भले ही वे लगभग पूरी तरह से खेल रहे हों। शायद उनके पास संख्या में भारी बढ़त थी, लेकिन उनकी एक इकाई घबरा गई और भाग खड़ी हुई, जिससे एक ऐसी श्रृंखला शुरू हो गई जिससे वे खेल हार गए। एक कोच जो केवल "जीत/हार" के स्कोरकार्ड को देखता है, वह सोचेगा, "ओह, वे इस मैप पर बहुत खराब हैं," और उन्हें एक आसान, उबाऊ मैप पर भेज देगा। वह इस तथ्य को अनदेखा कर देगा कि टीम वास्तव में एक सफल रणनीति के कितने करीब थी।

यहीं पर नया तरीका, जिसे विजुअल इंस्पेक्शन ऑफ पॉलिसीज़ (VIP) कहा जाता है, काम आता है। केवल रिपोर्ट कार्ड पढ़ने के बजाय, VIP एक सुपर-स्मार्ट AI कोच को काम पर रखता है जो वास्तव में खेल का वीडियो देख सकता है।

"स्पोर्ट्स कोच" की उपमा

पुराने तरीके को एक ऐसे कोच की तरह समझें जो केवल समाचार पत्र की हेडलाइन पढ़ता है: "टीम हार गई।" कोच को पता ही नहीं चलता कि वे क्यों हारे। क्या वे बुरा खेले? क्या रेफरी ने गलती की? या मौसम खराब था?

VIP एक ऐसे कोच की तरह है जो टीम के साथ बैठता है और गेम टेप (वीडियो) देखता है। कोच वीडियो देखता है और कहता है, "हे, देखो! भले ही वे हार गए, लेकिन टीम पहले भाग में वास्तव में एक शानदार रणनीति का उपयोग कर रही थी। वे बस अंत में घबरा गए। आइए इसी विशिष्ट मैप का अभ्यास जारी रखें ताकि वे शांत रहना सीख सकें।"

वीडियो देखकर, VIP कोच उन "उम्मीद जगाने वाले" क्षणों को पहचान लेता है जिन्हें एक साधारण स्कोरकार्ड मिस कर देता है। यह देखता है कि एजेंट सीख रहे हैं, भले ही स्कोरबोर्ड कह रहा हो कि वे हार गए।

यह कैसे काम करता है (जादुई रेसिपी)

शोधकर्ताओं ने इस विचार का परीक्षण स्टारक्राफ्ट मल्टी-एजेंट चैलेंज (SMAC) में किया, जो एक जटिल खेल है जहाँ डिजिटल सैनिकों की टीमें एक-दूसरे से लड़ती हैं। यहाँ वह रेसिपी दी गई है जिसका उन्होंने उपयोग किया:

  1. खेल: AI एजेंट StarCraft का एक राउंड खेलते हैं।
  2. रिकॉर्डिंग: सिस्टम युद्ध का एक वीडियो रिकॉर्ड करता है (लगभग 1 से 10 सेकंड लंबा)।
  3. कोच: इस वीडियो को, एक छोटे टेक्स्ट नोट के साथ जिसमें लिखा है "जीत की दर: 10%", एक वीडियो लैंग्वेज मॉडल (VLM) में डाला जाता है। इस VLM को एक ऐसे रोबोट के रूप में सोचें जो वीडियो देख सकता है और युद्ध की कहानी समझ सकता है।
  4. सिफारिश: रोबोट वीडियो देखता है और कहता है, "मैं देख रहा हूँ कि वे 'काइटिंग' (शूट करते हुए पीछे हटना) में बेहतर हो रहे हैं, लेकिन संख्या में कम होने पर वे घबरा जाते हैं। आइए उन्हें इसी मैप पर रखें लेकिन इसे थोड़ा कठिन बनाएं," या "आइए एक नया मैप बदलें जो इस विशिष्ट कमजोरी को चुनौती दे।"
  5. चेक: क्योंकि रोबट कभी-कभी नकली मैप के नाम बना लेते हैं (हैलुसिनेशन), एक सरल "स्पेल-चेकर" (सेंटेंस सिमिलरिटी मॉड्यूल) रोबोट के सुझाव की दोबारा जांच करता है ताकि यह सुनिश्चित हो सके कि वह एक वास्तविक मैप है जो गेम में मौजूद है।

उन्हें क्या मिला (परिणाम)

टीम ने यह देखने के लिए सिमुलेशन चलाए कि क्या यह "वीडियो-देखने वाला" कोच पुराने "स्कोरकार्ड-मात्र" कोचों से बेहतर है।

  • स्कोरकार्ड कोच विफल रहे: जब उन्होंने केवल नंबरों (जैसे "पॉजिटिव वैल्यू लॉस" या "मैक्स मोंटे कार्लो") को देखने वाले तरीकों का उपयोग किया, तो एजेंट अक्सर फंस गए। सबसे कठिन मैप्स पर, इन एजेंटों की जीत की दर बहुत कम (जीत की दर 0% के करीब) रही। वे गलत कार्यों पर भेजे जाते रहे क्योंकि नंबरों ने पूरी कहानी नहीं बताई।
  • टेक्स्ट-ओनली कोच ठीक था: उन्होंने एक संस्करण आज़माया जहाँ रोबोट केवल खेल का टेक्स्ट सारांश पढ़ता था (वीडियो के बिना)। यह स्कोरकार्ड से बेहतर था, लेकिन फिर भी संघर्ष कर रहा था।
  • VIP कोच जीता: जब रोबोट वीडियो देख सकता था, तो एजेंट बहुत तेज़ी से सीखे।
    • 3s vs 4z नामक एक कठिन मैप पर, VIP एजेंट फाइन-ट्यूनिंग के बाद ~84% की जीत दर तक पहुँच गए।
    • 3s5z पर, वे ~76% तक पहुँचे।
    • इसके विपरीत, टेक्स्ट-ओनली संस्करण (बिना वीडियो के) 3s vs 4z मैप पर 0% पर अटक गया।

शोध का सुझाव है कि वीडियो ही "सीक्रेट सॉस" था। इसने सिस्टम को यह देखने की अनुमति दी कि एजेंट जीत की रणनीति के कितने करीब थे, भले ही वे मैच हार रहे थे।

उन्होंने किसे खारिज किया

पेपर बहुत स्पष्ट है कि VIP की तुलना में क्या काम नहीं करता है:

  • केवल नंबर देखना: वे तरीके जो केवल स्केलर स्कोर (जैसे "उन्हें कितने अंक मिले?") पर निर्भर करते हैं, बहुत सतही होते हैं। वे इस बारीकी को मिस कर देते हैं कि एजेंट कैसे खेल रहे हैं।
  • केवल टेक्स्ट पढ़ना: खेल को शब्दों में सारांशित करना (वीडियो दिखाए बिना) पर्याप्त नहीं है। घबराहट, समन्वय या चतुर रणनीति के दृश्य संकेत एक टेक्स्ट सारांश में खो जाते हैं।
  • भविष्य का अनुमान लगाना: पेपर उन तरीकों के विरुद्ध तर्क देता है जो वास्तव में एजेंट के व्यवहार को देखे बिना "सीखने की क्षमता" (learning potential) का अनुमान लगाने की कोशिश करते हैं।

वे कितने आश्वस्त हैं?

लेखक इन परिणामों को लेकर आश्वस्त हैं, लेकिन वे सावधानी बरतते हुए कहते हैं कि ये सिमुलेशन हैं।

  • उन्होंने प्रत्येक विधि के लिए 5 स्वतंत्र परीक्षण (सीड्स) चलाए ताकि यह सुनिश्चित हो सके कि परिणाम केवल किस्मत नहीं थे।
  • उन्होंने एक हल्के, ओपन-सोर्स रोबोट ब्रेन (VideoLLaMa2-7B) का उपयोग किया जो केवल ~1% कंप्यूटर समय लेता था। बाकी 99% केवल गेम ट्रेनिंग थी। यह साबित करता है कि वीडियो-देखने वाले हिस्से ने चीजों को धीमा नहीं किया।
  • उन्होंने VIP की तुलना एक "सुपरवाइज्ड" विधि से की जिसने एक विशाल ग्रिड सर्च (1,700 अलग-अलग सेटिंग्स आज़माना) का उपयोग करके परफेक्ट टीचर पाया। भले ही ग्रिड सर्च विधि (MAPPO*) दो मैप पर थोड़ा बेहतर था, VIP सीखने के चरणों के मामले में 100 गुना अधिक कुशल था। VIP ने बहुत कम प्रयासों के साथ एक मैप (3s5z) पर समान परिणाम प्राप्त किए।

निचोड़

पेपर सुझाव देता है कि यदि आप चाहते हैं कि AI एजेंट जटिल, मल्टी-एजेंट खेलों में वास्तव में अच्छे बनें, तो आपको केवल स्कोरबोर्ड नहीं देखना चाहिए। आपको खेल को देखना होगा। AI "कोच" को एजेंट के व्यवहार के वीडियो का निरीक्षण करने देकर, आप एक ऐसा करिकुलम (सीखने का रास्ता) बना सकते हैं जो पूरी तरह से उन चीज़ों के अनुरूप हो जो एजेंट वास्तव में करने में सक्षम हैं, जिससे उन्हें उन जीतने वाली रणनीतियों को खोजने में मदद मिलती है जो अन्यथा छिपी रह जातीं।

यह एक ऐसे कोच के बीच का अंतर है जो केवल अंतिम स्कोर जानता है और एक ऐसे कोच के बीच का अंतर है जो फिल्म देखता है, क्षमता देखता है, और जानता है कि आगे कौन सा अभ्यास चलाना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →