← नवीनतम पेपर
💬 NLP

Automata-Conditioned Cooperative Multi-Agent Reinforcement Learning

यह शोध पत्र ऑटोमेटा-कंडीशन्ड कोऑपरेटिव मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग (ACC-MARL) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो मल्टी-एजेंट टीमों के लिए जटिल टेम्पोरल उद्देश्यों को बिना पुन: प्रशिक्षण के संभालने हेतु कार्य-आधारित विकेंद्रीकृत नीतियों के कुशल, सैंपल-इष्टतम शिक्षण को सक्षम बनाता है, साथ ही परीक्षण के समय इष्टतम कार्य असाइनमेंट की सुविधा भी प्रदान करता है।

मूल लेखक: Beyazit Yalcinkaya, Marcell Vazquez-Chanlatte, Ameesh Shah, Hanna Krasowski, Sanjit A. Seshia

प्रकाशित 2026-06-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Beyazit Yalcinkaya, Marcell Vazquez-Chanlatte, Ameesh Shah, Hanna Krasowski, Sanjit A. Seshia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि रोबोट्स की एक टीम एक विशाल, जटिल पहेली को हल करने की कोशिश कर रही है। प्रत्येक रोबोट के पास अपना विशिष्ट निर्देश कार्ड (एक "कार्य") है, लेकिन खेल जीतने के लिए, उन्हें अपने कार्ड भी पूरे करने होंगे और मिलकर काम भी करना होगा। समस्या यह है कि निर्देश लंबे और जटिल हैं, जैसे कि कई अध्यायों वाली एक कहानी: "पहले लाल कमरे में जाओ, फिर नीला बटन दबाओ, फिर अपने दोस्त के दरवाजा खोलने का इंतज़ार करो।"

यह शोध पत्र इस बारे में बताता है कि कैसे रोबट टीमों को इन जटिल कहानियों को सीखने के लिए प्रशिक्षित किया जा सकता है, बिना हर बार कहानी बदलने पर उन्हें फिर से प्रशिक्षित किए। वे अपने तरीके को ACC-MARL कहते हैं।

यह यहाँ कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:

1. स्क्रिप्ट के बजाय "कहानी की किताब" (Storybook)

आमतौर पर, यदि आप किसी रोबोट को नया कार्य सिखाना चाहते हैं, तो आपको उसे शुरुआत से सिखाना पड़ता है। लेकिन यहाँ, लेखक एक DFA (डिटरमिनिस्टिक फाइनाइट ऑटोमेटन) का उपयोग करते हैं। DFA को एक गणितीय सूत्र के रूप में नहीं, बल्कि एक फ्लोचार्ट वाली कहानी की किताब के रूप में समझें।

  • इस कहानी की किताब में पन्ने (states) और तीर (transitions) होते हैं।
  • जब रोबोट कुछ करता है (जैसे बटन दबाना), तो वह पन्ना पलट देता है।
  • रोबोट को पूरी कहानी याद रखने की ज़रूरत नहीं है; उसे बस यह जानने की ज़रूरत है कि वह वर्तमान में किस पन्ने पर है।

2. तीन बड़ी बाधाएं

लेखकों ने पहचान की कि रोबोट टीमों को इस तरह सिखाना आमतौर पर कठिन क्यों होता है, और उन्होंने प्रत्येक बाधा के ऊपर एक पुल बनाया है:

  • बाधा 1: "भूलने की बीमारी" की समस्या (इतिहास निर्भरता - History Dependency)

    • समस्या: यदि कोई रोबोट भूल जाता है कि उसने पाँच मिनट पहले क्या किया था, तो उसे पता नहीं चलेगा कि वह कहानी की किताब के किस पन्ने पर है। उसे पूरा इतिहास याद रखने की आवश्यकता होती है, जो कंप्यूटर के लिए कुशलतापूर्वक सीखना कठिन है।
    • समाधान: रोबोट को अतीत याद रखने के लिए कहने के बजाय, सिस्टम वास्तविक समय में कहानी की किताब को अपडेट करता है। जैसे-जैसे रोबोट आगे बढ़ता है, सिस्टम स्वचालित रूप से कहानी की किताब का पन्ना पलट देता है और रोबोट को वर्तमान पन्ना दिखाता है। अब, रोबोट को अगला कदम जानने के लिए केवल वर्तमान क्षण को देखने की आवश्यकता है। यह एक GPS होने जैसा है जो तुरंत आपके स्थान को अपडेट करता है, ताकि आपको उस पूरे रास्ते को याद न रखना पड़े जहाँ से आप आए थे।
  • बाधा 2: "क्रेडिट किसे मिले?" की समस्या (क्रेडिट असाइनमेंट - Credit Assignment)

    • समस्या: एक टीम गेम में, आपको आमतौर पर तभी इनाम मिलता है जब सभी जीत जाते हैं। यदि रोबोट A बटन दबाता है और रोबोट B दरवाजा खोलता है, लेकिन वे बाद में विफल हो जाते हैं, तो रोबोट A को यह नहीं पता चलेगा कि बटन दबाना एक अच्छा विचार था या बुरा। यह एक रिले रेस की तरह है जहाँ आपको पदक तभी मिलता है जब पूरी टीम समाप्त करती है, लेकिन आपको यह नहीं पता होता कि आपका हिस्सा तेज़ था या धीमा।
    • समाधान: लेखक रोबोटों को हर बार अपनी कहानी का एक छोटा अध्याय पूरा करने पर छोटे "हाई-फाइव" (इनाम) देते हैं। यदि रोबोट A बटन दबाता है और इससे उसका विशिष्ट भाग पूरा हो जाता है, तो उसे तुरंत थोड़ा इनाम मिलता है। यह रोबोट को यह समझने में मदद करता है कि, "अरे, वह बटन दबाना वास्तव में मददगार था!" बिना पूरी टीम के खत्म होने का इंतज़ार किए।
  • बाधा 3: "बहुत सारी कहानियाँ" की समस्या (रिप्रेजेंटेशन बॉटलनेक - Representation Bottleneck)

    • समस्या: लाखों संभावित कहानी की किताबें हो सकती हैं। यदि रोबोटों को खेलते समय हर एक अनूठी कहानी की किताब को शुरू से समझना सीखना पड़ता है, तो वे अभिभूत हो जाते हैं और बहुत धीरे सीखते हैं।
    • समाधान: वे एक पूर्व-प्रशिक्षित "अनुवादक" (RAD एम्बेडिंग्स) का उपयोग करते हैं। कल्पना कीजिए कि एक पुस्तकालय है जहाँ हर कहानी की किताब को एक अनूठे "ID कार्ड" में संक्षिप्त किया गया है जो कहानी के सार को पकड़ता है। खेलने से पहले ही, उन्हें एक शब्दकोश दिया जाता है जो कहता है, "इस ID कार्ड का अर्थ है 'लाल कमरे में जाओ', और उस ID कार्ड का अर्थ है 'नीले कमरे में जाओ'।" क्योंकि रोबोट पहले से ही ID कार्ड के अर्थ को समझते हैं, उन्हें हर नई कहानी आने पर बुनियादी बातें फिर से सीखने की आवश्यकता नहीं होती है। वे बस ID कार्ड देख सकते हैं और जान सकते हैं कि क्या करना है।

3. "टीम कप्तान" की तकनीक

इस शोध पत्र की सबसे शानदार विशेषताओं में से एक यह है कि रोबोट्स के सीखने के बाद, सिस्टम एक स्मार्ट टीम कप्तान की तरह कार्य कर सकता है।

  • क्योंकि रोबोटों ने सीखा है कि वे विभिन्न कार्यों में कितने अच्छे हैं, सिस्टम टीम की वर्तमान स्थिति को देख सकता है और कह सकता है, "रोबोट A दरवाजे खोलने में बहुत अच्छा है, और रोबोट B टोकन खोजने में माहिर है। आइए उनके कार्यों को बदल दें ताकि वे तेज़ी से जीत सकें।"
  • शोध पत्र दिखाता है कि रोबोटों के अपने "कॉन्फिडेंस स्कोर" (वैल्यू फंक्शन्स) का उपयोग करके, सिस्टम स्वचालित रूप से टीम की सफलता को अधिकतम करने के लिए सर्वश्रेष्ठ रोबोटों को सर्वश्रेष्ठ कार्य सौंप सकता है।

4. उन्होंने वास्तव में क्या किया?

लेखकों ने TokenEnv नामक एक वीडियो-गेम जैसी दुनिया में इसका परीक्षण किया।

  • खेल: रोबोटों को एक विशिष्ट क्रम में विशिष्ट रंग के टोकन (जैसे आइटम एकत्र करना) पर जाना होता है। कमरों के बीच जाने के लिए, उन्हें बटन दबाना होता है जो दरवाजे खोलते हैं।
  • परिणाम:
    • रोबोटों ने स्वाभाविक रूप से सहयोग करना सीखा। उदाहरण के लिए, एक रोबोट दरवाजा खोलने के लिए बटन दबाएगा, और दूसरा रोबोट दरवाजा खुला रखेगा ताकि पहला रोबोट गुजर सके।
    • उन्होंने स्मार्ट तरीके से "सिस्टम को चकमा देना" सीखा: यदि किसी रोबोट का कार्य दो टोकन पर जाना था, लेकिन एक सहायक रोबोट ने शॉर्टकट खोल दिया, तो रोबोट तेज़ी से काम पूरा करने के लिए शॉर्टकट लेगा।
    • सिस्टम 2 रोबोटों के साथ अच्छी तरह से काम करता है और बिना टूटे 4 रोबोटों तक स्केल (बढ़) सकता है।

सारांश

संक्षेप में, यह शोध पत्र रोबोट टीमों को जटिल, सहयोगात्मक खेलों को कैसे खेलना सिखाता है जिनके नियम बदलते रहते हैं:

  1. उन्हें एक लाइव-अपडेटिंग मैप देकर (ताकि वे भूलें नहीं)।
  2. उन्हें छोटी जीत के लिए तत्काल फीडबैक देकर (ताकि उन्हें पता चले कि क्या करना है)।
  3. उन्हें कार्य के अर्थों का एक शब्दकोश देकर (ताकि उन्हें सब कुछ फिर से न सीखना पड़े)।

परिणामस्वरूप, एजेंटों की एक ऐसी टीम तैयार होती है जो सहयोग करना, कार्य साझा करना और पहेलियाँ सुलझाना सीखती है, भले ही हर बार खेलने पर विशिष्ट पहेलियाँ बदल जाएँ।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →