← नवीनतम पेपर
🤖 AI

Dreaming Of Others: Latent Teammate Modeling In World Models For Multi-Agent Reinforcement Learning

यह शोध पत्र एक नवीन मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग फ्रेमवर्क प्रस्तावित करता है जो लेटेंट स्टेट्स को एनवायरनमेंट और टीममेट घटकों में विभाजित करके और पार्टनर की मंशा का अनुमान लगाने के लिए 'थ्योरी-ऑफ-माइंड' हेड का उपयोग करके ड्रीमर-शैली के वर्ल्ड मॉडल्स को बेहतर बनाता है, जिससे एजेंट सामाजिक व्यवहार के सिमुलेशन के माध्यम से ज़ीरो-शॉट और फ्यू-शॉट कोआर्डिनेशन प्राप्त करने में सक्षम होते हैं।

मूल लेखक: Tomas Leroy-Stone

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tomas Leroy-Stone

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: अपने साथियों के बारे में सपने देखना

कल्प Imagine कीजिए कि आप एक साथी के साथ एक जटिल वीडियो गेम खेल रहे हैं। आप गेम की दुनिया को देख सकते हैं, लेकिन आप अपने साथी की स्क्रीन, उनके विचार या उनकी गुप्त योजना को नहीं देख सकते। आप केवल वही देखते हैं जो वे करते हैं।

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, यह एक बहुत बड़ी समस्या है। अधिकांश AI सिस्टम जो गेम खेलने के लिए सीखते हैं (जिन्हें "वर्ल्ड मॉडल्स" कहा जाता है) वे पर्यावरण कैसे बदलता है (जैसे गुरुत्वाकर्षण या दीवारें) इसकी भविष्यवाणी करने में माहिर होते हैं। लेकिन जब बात एक साथी के क्या करने की आती है, तो वे आमतौर पर साथी को रैंडम शोर (static noise) या खराब मौसम की तरह मानते हैं। वे बस अनुमान लगाते हैं, "शायद वे बाएं जाएंगे, शायद दाएं," बिना वास्तव में यह समझे कि वे ऐसा क्यों कर रहे हैं।

यह पेपर इन AI दिमागों को बनाने का एक नया तरीका प्रस्तावित करता है। साथियों को रैंडम शोर मानने के बजाय, लेखक सुझाव देते हैं कि हमें AI को यह सिखाना चाहिए कि वह साथियों को अनुमान लगाने योग्य, संरचित पात्रों (structured characters) के रूप में देखे, जिनके अपने व्यक्तित्व और लक्ष्य होते हैं।

"ड्रिमर" (Dreamer) इंजन

इसे समझने के लिए, आपको पहले "ड्रिमर" के बारे में जानना होगा। ड्रिमर को एक ऐसे AI के रूप में सोचें जो सपनों (daydreaming) के माध्यम से सीखता है।

  • वास्तविक जीवन में लाखों बार गेम खेलने के बजाय (जिसमें बहुत समय लगता है), AI दुनिया का एक मानसिक मानचित्र (mental map) बनाता है।
  • यह अपनी आँखें बंद करता है और हजारों परिदृश्यों की कल्पना करता है: "अगर मैं यहाँ कूदता हूँ, तो दीवार गिर जाएगी। अगर मैं बाईं ओर जाता हूँ, तो दुश्मन दिखाई देगा।"
  • यह केवल परीक्षण और त्रुटि (trial and error) के माध्यम से नहीं, बल्कि अपनी कल्पना में अभ्यास करके गेम के नियमों को सीखता है।

समस्या: "घोस्ट" (Ghost) साथी

समस्या यह है कि टीम गेम में, "नियम" बदल जाते हैं क्योंकि आपका साथी अपना मन बदल देता है।

  • पुराना तरीका: AI सोचता है, "मेरा साथी अप्रत्याशित है। मैं बस अच्छे की उम्मीद करूँगा।" यह कार चलाने की कोशिश करने जैसा है जहाँ आप मान लेते हैं कि दूसरा ड्राइवर अचानक बिना किसी कारण के बाएं या दाएं मुड़ सकता है।
  • नया तरीका (यह पेपर): AI महसूस करता है, "मेरा साथी रैंडम नहीं है। उनका एक 'स्टाइल' है। शायद वे सतर्क हैं, या शायद वे आक्रामक हैं। मुझे उन्हें समझने के लिए उनके स्टाइल को समझना होगा।"

समाधान: "टीममेट डिकोडर" (Teammate Decoder)

लेखक एक नया आर्किटेक्चर प्रस्तावित करते हैं जो AI के मानसिक मानचित्र को दो अलग-अलग हिस्सों में विभाजित करता है, जैसे कि एक दो-लेन वाला हाईवे:

  1. एनवायरनमेंट लेन (Environment Lane): यह हिस्सा भौतिक दुनिया (दीवारें, लक्ष्य, गुरुत्वाकर्षण) को ट्रैक करता है।
  2. टीममेट लेन (Teammate Lane): यह नया आविष्कार है। यह साथी की छिपी हुई स्थिति (hidden state) को ट्रैक करता है।

AI एक विशेष उपकरण का उपयोग करता है जिसे "थ्योरी ऑफ माइंड" (ToM) हेड कहा जाता है। इसे एक "शरलॉक होम्स मॉड्यूल" के रूप में सोचें।

  • यह साथी के कार्यों को देखता है (जैसे, "उन्होंने एक चाबी उठाई लेकिन उसका उपयोग नहीं किया")।
  • यह एक छिपे हुए "लेटेंट कोड" (एक डिजिटल फिंगरप्रिंट) का अनुमान लगाता है जो साथी के इरादे (intent) या चरित्र का प्रतिनिधित्व करता है।
  • यह पूछता है: "क्या यह साथी 'रश' (Rush) प्रकार का है? या 'स्ट्रेटजी' (Strategy) प्रकार का?"

व्यवहार में यह कैसे काम करता है

एक बार जब AI के पास यह "टीममेट लेन" और "शरलॉक होम्स" मॉड्यूल आ जाता है, तो यह अपने सपनों (daydreaming) को बदलने का तरीका बदल देता है:

  • पहले: AI सपने देखता है, "अगर मैं यहाँ जाता हूँ, तो दुनिया बदल जाती है।"
  • अब: AI सपने देखता है, "अगर मैं यहाँ जाता हूँ, और मेरा साथी 'रश' प्रकार का है, तो वे मेरे पीछे आएंगे। यदि वे 'स्ट्रेटजी' प्रकार के हैं, तो वे प्रतीक्षा करेंगे।"

अपनी कल्पना में अपने साथी के विभिन्न संस्करणों का अनुकरण करके, AI किसी के भी साथ काम करने के लिए तैयार हो सकता है।

  • ज़ीरो-शॉट कोऑर्डिनेशन (Zero-Shot Coordination): AI एक नया साथी मिल सकता है जिसे उसने पहले कभी नहीं देखा है और फिर भी तुरंत उसके साथ अच्छी तरह काम कर सकता है, क्योंकि वह कुछ ही चालों से उनके स्टाइल का अनुमान लगा सकता है।
  • फ्यू-शॉट अडैप्टेशन (Few-Shot Adaptation): यदि साथी गेम के बीच में अपना इरादा बदल देता है, तो AI अपने "शरलॉक होम्स" अनुमान को अपडेट करता है और तुरंत अपनी योजना को समायोजित करता है।

यह पेपर वास्तव में क्या दावा करता है

यह ध्यान रखना महत्वपूर्ण है कि यह पेपर अभी तक क्या नहीं करता है:

  • कोई परिणाम नहीं: लेखक स्वीकार करते हैं कि यह एक प्रस्ताव (proposal) है। उन्होंने ब्लूप्रिंट और गणित तो तैयार कर दिया है, लेकिन उन्होंने अभी तक पूरा रोबोट नहीं बनाया है और न ही इसका परीक्षण किया है।
  • कोई वास्तविक दुनिया के अनुप्रयोग नहीं: वे यह दावा नहीं कर रहे हैं कि यह अभी ट्रैफिक को ठीक करेगा या बीमारियों का इलाज करेगा। वे सख्ती से सहकारी वीडियो गेम और सिमुलेशन में AI को बेहतर बनाने के बारे में बात कर रहे हैं।

लक्ष्य

अंतिम लक्ष्य एक ऐसा AI बनाना है जो न केवल दुनिया को समझता है, बल्कि दुनिया के भीतर मौजूद मस्तिष्कों को भी समझता है। साथियों को रैंडम शोर के बजाय संरचित, सीखने योग्य पात्रों के रूप में मानकर, AI मनुष्यों और अन्य AI के लिए एक बेहतर, अधिक अनुकूलन योग्य साथी बन सकता है।

संक्षेप में: यह पेपर सुझाव देता है कि AI को यह सीखना चाहिए कि अपने साथी के क्या करने का अनुमान लगाना छोड़ दें और उन्हें मॉडल (model) करना शुरू करें, ताकि वह उनके साथ मिलकर भविष्य की कल्पना कर सके, न कि केवल उनके आसपास।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →