← नवीनतम पेपर
🤖 machine learning

Generalized Intention Modeling in Multi-Agent Reinforcement Learning

यह शोध पत्र एक कार्य-अनुकूलित प्रतिद्वंद्वी मॉडलिंग ढांचे (task-adaptive opponent modeling framework) का प्रस्ताव करता है जो इरादे के प्रदर्शन-संचालित मिश्रण (performance-driven mixture of intent representations) को सीखता है और प्रतिद्वंद्वी की उस जानकारी को पकड़ने के लिए एक नए पारस्परिक सूचना-आधारित प्रतिनिधित्व (mutual information-based representation) को पेश करता है जो ईगो-एजेंट के भविष्य के प्रतिफल (future returns) के लिए सबसे अधिक प्रासंगिक है, जिससे विविध मल्टी-एजेंट सुदृढीकरण शिक्षण (multi-agent reinforcement learning) कार्यों में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Mateusz Odrowaz-Sypniewski, Jasmine Bayrooti, Ajay Shankar, Amanda Prorok

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mateusz Odrowaz-Sypniewski, Jasmine Bayrooti, Ajay Shankar, Amanda Prorok

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप कंप्यूटर के खिलाफ शतरंज, रॉक-पेपर-सिज़र्स, या यहाँ तक कि कोई वीडियो गेम खेल रहे हैं। जीतने के लिए, आपको यह अनुमान लगाना होगा कि वे आगे क्या करने वाले हैं। आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इसे मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग (Multi-Agent Reinforcement Learning) कहा जाता है। AI (जिसे "ईगो-एजेंट" कहा जाता है) खेलने के माध्यम से सीखने की कोशिश करता है, लेकिन यदि वह दूसरे खिलाड़ियों के इरादों को नहीं समझ पाता है, तो वह अटक जाता है।

लंबे समय तक, शोधकर्ताओं ने इसे हल करने के लिए एक "क्रिस्टल बॉल" बनाने की कोशिश की जो केवल एक विशिष्ट चीज़ पर ध्यान केंद्रित करके प्रतिद्वंद्वी की चालों की भविष्यवाणी करती थी। कुछ क्रिस्टल बॉल केवल प्रतिद्वंद्वी की अगली चाल पर ध्यान देती थीं। अन्य केवल बोर्ड की भविष्य की स्थिति पर ध्यान देती थीं।

समस्या यह है कि इस शोध पत्र के अनुसार, एक आकार सभी के लिए उपयुक्त नहीं होता (one size does not fit all)।

समस्या: "एक-उपकरण" का भ्रम (The "One-Tool" Fallacy)

इसे एक मैकेनिक की तरह सोचें जो दुनिया की हर कार को केवल एक हथौड़े से ठीक करने की कोशिश कर रहा है।

  • यदि आप रॉक-पेपर-सिज़र्स खेल रहे हैं, तो खेल तुरंत होता है। आपको केवल यह जानने की आवश्यकता है कि प्रतिद्वंद्वी अभी क्या कर रहा है। एक हथौड़ा (अगली चाल की भविष्यवाणी करना) यहाँ बहुत अच्छा काम करता है।
  • यदि आप शतरंज खेल रहे हैं, तो खेल दीर्घकालिक रणनीति के बारे में है। केवल प्रतिद्वंद्वी की अगली चाल जानना पर्याप्त नहीं है; आपको यह समझने की आवश्यकता है कि पांच चालों के बाद मोहरे कहाँ होंगे। यहाँ हथौड़ा बेकार है; आपको एक रिंच (wrench) की आवश्यकता है (भविष्य की स्थिति की भविष्यवाणी करना)।

पिछले AI तरीकों ने माना कि हर खेल के लिए "हथौड़ा" ही सबसे अच्छा उपकरण है। इस शोध पत्र के लेखकों ने महसूस किया कि सबसे अच्छा उपकरण पूरी तरह से इस बात पर निर्भर करता है कि आप कौन सा खेल खेल रहे हैं।

समाधान: "स्विस आर्मी नाइफ" (MIX)

लेखकों ने MIX (मिक्सर ऑफ इंटेंशन एक्सपर्ट्स) नामक एक नया फ्रेमवर्क बनाया है। AI को प्रतिद्वंद्वी को समझने के केवल एक तरीके तक सीमित करने के बजाय, उन्होंने इसे एक स्विस आर्मी नाइफ दिया जिसमें चार ब्लेड हैं, और एक स्मार्ट हैंडल जो काम के अनुसार सही ब्लेड चुनता है।

यहाँ चार "ब्लेड" (या प्रतिद्वंद्वी को मॉडल करने के तरीके) दिए गए हैं जिनका उपयोग AI कर सकता है:

  1. "नेक्स्ट मूव" ब्लेड: भविष्यवाणी करता है कि प्रतिद्वंद्वी तुरंत क्या करेगा।
  2. "करेंट व्यू" ब्लेड: भविष्यवाणी करता है कि प्रतिद्वंद्वी वर्तमान में क्या देख रहा है।
  3. "फ्यूचर स्टेट" ब्लेड: भविष्यवाणी करता है कि खेल का बोर्ड बाद में कैसा दिखेगा।
  4. "फ्यूचर रिवॉर्ड" ब्लेड (नया सितारा): यह एक विशेष नया ब्लेड है जिसे लेखकों ने बनाया है। प्रतिद्वंद्वी की चालों का अनुमान लगाने के बजाय, यह अनुमान लगाता है कि प्रतिद्वंद्वी की क्रियाओं के आधार पर AI भविष्य में कितना जीतेगा या हारेगा।

"स्मार्ट हैंडल" कैसे काम करता है

MIX की प्रतिभा एक "गेटिंग नेटवर्क" (हैंडल) में है। यह एक ट्रैफिक पुलिसकर्मी की तरह कार्य करता है।

  • रॉक-पेपर-सिज़र्स में, हैंडल "नेक्स्ट मूव" ब्लेड की ओर इशारा करता है और बाकी को अनदेखा कर देता है।
  • शतरंज या जटिल वीडियो गेम में, हैंडल "फ्यूचर रिवॉर्ड" ब्लेड की ओर इशारा कर सकता है, क्योंकि यह AI को जीतने के बारे में सबसे अधिक बताता है।
  • हैंडल खुद खेलते समय यह सीख जाता है। इसे यह बताने की आवश्यकता नहीं है कि कौन सा उपकरण उपयोग करना है; यह खुद समझ जाता है कि, "हे, इस विशिष्ट खेल में, भविष्य के पुरस्कारों (rewards) को देखना मुझे जीतने में सबसे अधिक मदद करता है।"

"फ्यूचर रिवॉर्ड" ब्लेड क्यों विशेष है

लेखक तर्क देते हैं कि AI के लिए सबसे महत्वपूर्ण बात केवल यह जानना नहीं है कि प्रतिद्वंद्वी क्या करता है, बल्कि यह जानना है कि प्रतिद्वंद्वी की क्रियाएं AI के स्कोर को कैसे प्रभावित करती हैं।

कल्पना कीजिए कि आप पकड़म-पकड़ाई (tag) का खेल खेल रहे हैं।

  • पुराना तरीका: "मैं देख रहा हूँ कि पकड़ने वाला (tagger) बाईं ओर भाग रहा है। मैं दाईं ओर भागूँगा।"
  • MIX का नया तरीका: "यदि पकड़ने वाला बाईं ओर भागता है, तो मेरा स्कोर कम हो जाएगा क्योंकि मैं पकड़ा जाऊँगा। यदि वे दाईं ओर भागते हैं, तो मेरा स्कोर उच्च रहेगा। मुझे परिणाम (स्कोर) पर ध्यान केंद्रित करने की आवश्यकता है, न कि केवल हलचल पर।"

AI को अपने भविष्य के पुरस्कारों (rewards) की भविष्यवाणी करने के लिए प्रशिक्षित करके, यह "शोर" (noise) को छान देता है और केवल प्रतिद्वंद्वी के उस व्यवहार पर ध्यान केंद्रित करता है जो वास्तव में जीतने के लिए मायने रखता है।

परिणाम: अधिक खेल जीतना

टीम ने चार अलग-अलग खेलों में अन्य AI तरीकों के खिलाफ इस स्विस आर्मी नाइफ का परीक्षण किया:

  1. कुहन पोकर (Kuhn Poker): एक सरल कार्ड गेम।
  2. प्रिडेटर-प्रे (Predator-Prey): एक खेल जहाँ शिकार (prey) शिकारियों से बचने की कोशिश करता है।
  3. लेवल-बेस्ड फोरेजिंग (Level-Based Foraging): एक खेल जहाँ एजेंटों को भोजन इकट्ठा करने के लिए मिलकर काम करना होता है।
  4. गूगल रिसर्च फुटबॉल (Google Research Football): छह विरोधियों के साथ एक जटिल सॉकर सिमुलेशन।

निष्कर्ष स्पष्ट थे:

  • पुराने "एक-उपकरण" वाले तरीके कुछ खेलों में अच्छा काम करते थे लेकिन अन्य में बुरी तरह विफल रहे।
  • MIX ने हर खेल में मौजूदा सर्वोत्तम तरीकों के बराबर या उनसे बेहतर प्रदर्शन किया।
  • सबसे महत्वपूर्ण बात यह है कि MIX केवल भाग्यशाली नहीं था; इसने वास्तव में उपकरण बदलना सीख लिया था। कार्ड गेम में, इसने प्रतिद्वंद्वी के कार्डों पर ध्यान केंद्रित किया। सॉकर गेम में, इसने भविष्य के स्कोर पर ध्यान केंद्रित किया।

मुख्य निष्कर्ष (The Bottom Line)

यह शोध पत्र हमें सिखाता है कि एक महान AI प्रतिद्वंद्वी बनने के लिए, आपको केवल सोचने के एक तरीके को याद रखने की आवश्यकता नहीं है। आपको अनुकूलन योग्य (adaptable) होने की आवश्यकता है। AI को एक "टूलबॉक्स" देकर और उसे स्थिति के आधार पर यह तय करने देने के बाद कि कौन सा उपकरण उपयोग करना है, और उसे अपनी भविष्य की सफलता के लिए सोचने के लिए सिखाकर, AI एक बहुत अधिक स्मार्ट और मजबूत खिलाड़ी बन जाता है।

संक्षेप में: घड़ी ठीक करने के लिए हथौड़े का उपयोग न करें। AI को एक स्विस आर्मी नाइफ दें, और उसे यह तय करने दें कि कौन सा उपकरण खेल जीतता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →