← नवीनतम पेपर
💻 computer science

R3DM: Enabling Role Discovery and Diversity Through Dynamics Models in Multi-agent Reinforcement Learning

यह शोध पत्र R3DM को प्रस्तुत करता है, जो एक नवीन मल्टी-एजेंट सुदृढीकरण लर्निंग फ्रेमवर्क है जो भूमिकाओं, पिछले प्रक्षेप पथों और भविष्य के व्यवहारों के बीच पारस्परिक सूचना को अधिकतम करने के लिए एक डायनेमिक्स मॉडल के माध्यम से उभरती हुई भूमिकाओं को सीखकर समन्वय को बढ़ाता है, जिससे अत्याधुनिक तरीकों की तुलना में जटिल कार्यों में बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Harsh Goel, Mohammad Omama, Behdad Chalaki, Vaishnav Tadiparthi, Ehsan Moradi Pari, Sandeep Chinchali

प्रकाशित 2026-05-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Harsh Goel, Mohammad Omama, Behdad Chalaki, Vaishnav Tadiparthi, Ehsan Moradi Pari, Sandeep Chinchali

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि ड्रोन्स का एक समूह दो अलग-अलग आग बुझाने की कोशिश कर रहा है। एक मानक परिदृश्य में, यदि ड्रोन्स एक ही शुरुआती बिंदु को देखते हैं, तो वे दोनों यह तय कर सकते हैं कि, "मैं बाईं ओर की आग पर जाऊँगा!" और "मैं भी बाईं ओर की आग पर जाऊँगा!" वे दोनों एक ही आग पर भीड़ लगा देते हैं जबकि दूसरी तरफ आग जलती रहती है, क्योंकि वे केवल वही कॉपी कर रहे होते हैं जो उन्होंने पहले किया है या जो वे अभी देख रहे हैं। उन्होंने वास्तव में यह नहीं समझा है कि टीम में उन्हें कौन होना चाहिए।

यह शोध पत्र AI एजेंटों (जैसे कि ये ड्रोन्स) के लिए बेहतर तरीके से मिलकर काम करने के लिए एक नया तरीका पेश करता है। लेखक इस विधि को R3DM (Role Discovery and Diversity through Dynamics Models) कहते हैं।

यहाँ मुख्य विचार दिया गया है, जिसे सरल उपमाओं के माध्यम से समझाया गया है:

समस्या: "पीछे देखना" बनाम "आगे देखना"

अधिकांश वर्तमान AI टीमें अपने अतीत को देखकर भूमिकाएँ सीखती हैं। यह एक कोच की तरह है जो कहता है, "तुमने पिछले गेम में रक्षा (defense) अच्छी की थी, इसलिए तुम डिफेंडर हो।" समस्या यह है कि यदि सभी का अतीत एक जैसा था, तो वे सभी एक ही भूमिका अपना लेंगे और वे सभी एक ही काम करेंगे। उनमें विविधता की कमी होती है।

शोध पत्र का तर्क है कि एक भूमिका केवल इतिहास पर आधारित लेबल नहीं होनी चाहिए; बल्कि एक भूमिका भविष्य के लिए एक योजना होनी चाहिए। यदि आप "स्काउट" हैं, तो आपका भविष्य का रास्ता "टैंक" से अलग दिखना चाहिए।

समाधान: "क्रिस्टल बॉल" दृष्टिकोण

R3DM एजेंटों को एक "क्रिस्टल बॉल" (एक Dynamics Model) देता है। केवल यह पूछने के बजाय कि "मैंने क्या किया?", सिस्टम पूछता है, "यदि मैं यह विशिष्ट भूमिका अपनाता हूँ, तो मेरा भविष्य कैसा दिखेगा?"

  1. क्रिस्टल बॉल (Dynamics Model): AI यह अनुमान लगाना सीखता है कि इसके वर्तमान कार्यों के आधार पर आगे क्या होगा। यह भविष्य का अनुकरण (simulate) करता है।
  2. परीक्षण: सिस्टम जाँचता है: "यदि एजेंट A भूमिका X लेता है, तो क्या क्रिस्टल बॉल एक अनूठा भविष्य का रास्ता दिखाती है? और यदि एजेंट B भूमिका Y लेता है, तो क्या यह एक अलग अनूठा रास्ता दिखाता है?"
  3. पुरस्कार: यदि एजेंट ऐसी भूमिकाएँ चुनते हैं जो अलग और गैर-अतिव्यापी (non-overlapping) भविष्य की ओर ले जाती हैं, तो उन्हें एक विशेष "बोनस पॉइंट" (एक intrinsic reward) मिलता है। यदि वे ऐसी भूमिकाएँ चुनते हैं जिनसे वे बिल्कुल एक जैसा काम करते हैं, तो उन्हें कोई बोनस नहीं मिलता।

दो-चरणीय नृत्य (Two-Step Dance)

इसे काम करने के लिए, R3DM एक दो-चरणीय प्रक्रिया का उपयोग करता है, जो एक नृत्य की तरह है:

  • चरण 1: दर्पण (Contrastive Learning): सबसे पहले, एजेंट अपने पिछले व्यवहार को देखते हैं और खुद को "टीमों" या भूमिकाओं में वर्गीकृत करते हैं जो उन्होंने अब तक किया है। यह खिलाड़ियों को उनकी जर्सी के रंगों के आधार पर समूहों में छाँटने जैसा है।
  • चरण 2: भविष्य का विजन (The Dynamics Model): इसके बाद, सिस्टम क्रिस्टल बॉल का उपयोग यह देखने के लिए करता है कि क्या वे समूह वास्तव में अलग भविष्य की ओर ले जाते हैं। यह एजेंटों को ऐसी भूमिकाएँ चुनने के लिए प्रोत्साहित करता है जो उन्हें मैप के अलग-अलग हिस्सों को खोजने या अलग-अलग कार्यों को संभालने के लिए मजबूर करती हैं।

यह क्यों काम करता है (आग बुझाने की उपमा)

आइए वापस उन दो ड्रोन्स और दो आगों पर चलते हैं।

  • पुराना तरीका: दोनों ड्रोन्स आग देखते हैं। दोनों सोचते हैं, "मैं बाईं ओर जाऊँगा।" वे बाईं ओर की आग पर एक-दूसरे से टकरा जाते हैं।
  • R3DM तरीका: सिस्टम कहता है, "ड्रोन A, यदि तुम 'बाईं-आग' की भूमिका चुनते हो, तो तुम्हारा भविष्य का रास्ता अद्वितीय होगा। ड्रोन B, यदि तुम 'दाईं-आग' की भूमिका चुनते हो, तो तुम्हारा भविष्य का रास्ता भी अद्वितीय होगा।"
  • क्योंकि सिस्टम उन्हें अलग-अलग भविष्य के रास्ते रखने के लिए पुरस्कृत करता है, ड्रोन A स्वाभाविक रूप से बायां रोल चुनता है, और ड्रोन B दायां रोल चुनता है। वे बिना किसी मानवीय निर्देश के पूरी तरह से विभाजित हो जाते हैं।

परिणाम

लेखकों ने जटिल वीडियो गेम युद्ध परिदृश्यों (विशेष रूप से StarCraft मैप्स) पर इनका परीक्षण किया।

  • उन्होंने पाया कि R3DM ने AI टीमों को मौजूदा सर्वोत्तम तरीकों की तुलना में 20% अधिक बार जीतने में मदद की।
  • AI ने बेहतर समन्वय करना सीखा, जिससे वह इस गलती से बच गया कि सभी एक ही समय में एक ही चीज़ करें।

संक्षेप में

R3DM AI टीमों को केवल अपने अतीत की नकल करना बंद करने और अपने भविष्य की योजना बनाना सिखाता है। एक "क्रिस्टल बॉल" का उपयोग करके कि आगे क्या होने वाला है, यह टीम के सदस्यों को ऐसी अनूठी भूमिकाएँ खोजने के लिए मजबूर करता है जो एक-दूसरे की पूरक हों, जिससे एक अराजक भीड़ एक सुव्यवस्थित टीम में बदल जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →