← नवीनतम पेपर
🤖 machine learning

Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition

यह शोध पत्र एक नवीन ऑफलाइन मल्टी-एजेंट सुदृढीकरण शिक्षण (मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग) ढांचे का प्रस्ताव करता है जो अनुक्रमिक स्कोर अपघटन विधि (सीक्वेंशियल स्कोर डिकंपोजिशन मेथड) को डिफ्यूजन-आधारित जनरेटिव मॉडल्स के साथ संयोजित करके सहयोगात्मक कार्यों में वितरण संबंधी बदलावों (डिस्ट्रीब्यूशनल शिफ्ट्स) और मल्टीमॉडल समन्वय की चुनौतियों का समाधान करता है, ताकि नीति अपडेट को उच्च-पुरस्कार वाले, इन-डिस्ट्रीब्यूशन क्षेत्रों की ओर निर्देशित किया जा सके, जिससे विविध बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Dan Qiao, Wenhao Li, Shanchao Yang, Hongyuan Zha, Baoxiang Wang

प्रकाशित 2026-05-29✓ Author reviewed
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dan Qiao, Wenhao Li, Shanchao Yang, Hongyuan Zha, Baoxiang Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रोबोटों के एक समूह को सेब उठाने के लिए मिलकर काम करना सिखाने की कोशिश कर रहे हैं। आपके पास एक विशाल वीडियो लाइब्रेरी (एक डेटासेट) है जो दिखाती है कि अतीत में रोबोटों की विभिन्न टीमों ने यह काम कैसे किया। कुछ टीमों ने मिलकर लाल सेब उठाया, कुछ ने हरा वाला, और कुछ बस बिना किसी उद्देश्य के इधर-उधर घूमते रहे।

चुनौती यह है कि आप अब रोबोटों को वास्तविक दुनिया में अभ्यास करने की अनुमति नहीं दे सकते; आप उन्हें केवल इन पुराने वीडियो को देखकर ही सिखा सकते हैं। इसे ऑफलाइन मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग (Offline Multi-Agent Reinforcement Learning) कहा जाता है।

समस्या: "भ्रमित गायक दल" (The "Confused Choir")

अतीत में, जब शोधकर्ताओं ने इन मिले-जुले वीडियो से रोबोटों को सिखाने की कोशिश की, तो उन्होंने एक बड़ी गलती की। उन्होंने प्रत्येक रोबोट के साथ ऐसा व्यवहार किया जैसे वह अकेले सीख रहा हो, इस बात को नजरअंदाज करते हुए कि दूसरे कैसे चल रहे हैं।

एक गायक दल (choire) की कल्पना करें जहाँ हर कोई एक ही शीट म्यूजिक से अलग-अलग गाने गा रहा है। यदि आप सोप्रानो को कहें कि वह "गीत A" गाए और बास को कहें कि वह "गीत B" गाए, तो परिणाम एक भयानक, अराजक शोर होगा। रोबोट की दुनिया में, इससे गलत समन्वय (miscoordination) होता है। रोबोट एक ही समय में दो अलग-अलग सेब उठाने की कोशिश कर सकते हैं, या वे उस सेब को पकड़ने की कोशिश कर सकते हैं जिसे वीडियो में किसी ने भी सफलतापूर्वक नहीं पकड़ा था। वे ऐसी चीजें करते हैं जो एक रोबोट के लिए तो "ठीक" लग सकती हैं, लेकिन टीम के लिए विनाशकारी होती हैं।

पेपर इसे "कॉम्बिनेटोरियल मोड शिफ्ट" (Combinatorial Mode Shift) कहता है। यह एक महल, एक तंबू और एक गगनचुंबी इमारत के ब्लूप्रिंट को मिलाकर एक घर बनाने की कोशिश करने जैसा है। परिणाम एक घर नहीं, बल्कि बेमेल ईंटों का ढेर होता है।

समाधान: OMSD ("कंडक्टर की छड़ी")

लेखकों ने एक नई विधि प्रस्तावित की है जिसे OMSD (सीक्वेंशियल स्कोर डिकंपोजिशन के माध्यम से ऑफलाइन मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग) कहा जाता है।

यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

1. "लाइन-अप" रणनीति (सीक्वेंशियल डिकंपोजिशन)
हर रोबोट से उसकी अपनी याददाश्त के आधार पर पूछने के बजाय, OMSD उनसे एक विशिष्ट क्रम में पूछता है, जैसे कि कमरे में प्रवेश करने के लिए कतार में खड़े लोग।

  • रोबोट A पहले जाता है और निर्णय लेता है, "मैं लाल सेब की ओर जा रहा हूँ।"
  • रोबोट B रोबोट A का निर्णय देखता है और सोचता है, "ठीक है, चूंकि रोबोट A लाल सेब की ओर जा रहा है, इसलिए मुझे भी मदद करने के लिए लाल सेब की ओर जाना चाहिए।"
  • रोबोट C दोनों को देखता है और उनके पदचिन्हों पर चलता है।

पिछले रोबोटों द्वारा लिए गए निर्णयों को देखकर, प्रत्येक रोबोट टीम की योजना के संदर्भ (context) को समझ जाता है। यह उन्हें गलती से दूसरा सेब चुनने या भटकने से रोकता है।

2. "डिफ्यूजन" का जादू (स्कोर फंक्शन)
इसे काम करने के लिए, शोधकर्ता एक विशेष प्रकार के AI का उपयोग करते हैं जिसे डिफ्यूजन मॉडल (Diffusion Model) कहा जाता है। इसे एक "शोर-हटाने वाले" या "धुंधलापन-साफ़ करने वाले" के रूप में सोचें।

  • कल्पना करें कि पुराने वीडियो थोड़े धुंधले और स्टेटिक (static) से भरे हुए हैं।
  • डिफ्यूजन मॉडल एक स्मार्ट फिल्टर की तरह काम करता है जो जानता है कि डेटा को ठीक से कैसे "डीनॉइज़" (denoise) करना है। यह केवल एक रैंडम एक्शन का अनुमान नहीं लगाता; यह एक "स्कोर" या "दिशा" की गणना करता है जो उन कार्यों की ओर इशारा करती है जो टीम ने वास्तव में किए थे।
  • यह रोबोट को बताता है: "उस तरफ मत जाओ (वह एक गलती है); इस तरफ जाओ (यहीं टीम सफल हुई थी)।"

3. "केंद्रीय कोच" (क्रिटिक)
जबकि रोबोट अपनी लाइन में अपने विशिष्ट मूव्स सीखते हैं, एक "केंद्रीय कोच" (सेंट्रलाइज्ड क्रिटिक) पूरी टीम को देख रहा होता है। यह कोच जानता है कि टीम का कुल स्कोर क्या है। यह रोबोटों को बताता है, "हे, वह लाल सेब वाली रणनीति उच्च स्कोर प्राप्त करती है, उसे जारी रखें!"

यह बेहतर क्यों है?

पिछली विधियों ने रोबोटों को उनके व्यक्तिगत व्यवहार को अलग-थलग करके सिखाने की कोशिश की। यदि हर कोई एक ही काम कर रहा था तो यह ठीक था, लेकिन जब वीडियो में कई अलग-अलग सफल रणनीतियाँ दिखाई गईं (मल्टीमॉडल डेटा), तो यह बुरी तरह विफल रहा।

OMSD इसे इस प्रकार ठीक करता है:

  • श्रृंखला का सम्मान करता है: यह समझता है कि रोबोट B का मूव, रोबोट A के मूव पर निर्भर करता है।
  • अपनी लेन में रहता है: यह रोबोटों को वास्तव में वीडियो में दिखाए गए कार्यों तक सीमित रखता है, जिससे वे जोखिम भरे, काल्पनिक मूव्स आज़माने से बच जाते हैं जो डेटा में मौजूद नहीं हैं।
  • सर्वश्रेष्ठ पथ खोजता है: यह टीम को उस विशिष्ट "मोड" या रणनीति (जैसे लाल सेब बनाम हरा सेब) को खोजने में मदद करता है जो उच्चतम रिवॉर्ड देती है, बिना वीडियो लाइब्रेरी की अन्य रणनीतियों से भ्रमित हुए।

परिणाम

लेखकों ने सरल खेलों से लेकर जटिल भौतिक सिमुलेशन (जैसे रोबोट का दौड़ना या शिकार पकड़ना) तक विभिन्न रोबोट कार्यों पर इसका परीक्षण किया।

  • सरल परीक्षणों में: OMSD ने पूरी तरह से समन्वय करना सीखा, जबकि अन्य विधियाँ योजना बनाने में सहमत होने में विफल रहीं।
  • जटिल परीक्षणों में: OMSD ने लगातार मौजूदा सर्वोत्तम विधियों से बेहतर प्रदर्शन किया, विशेष रूप से तब जब प्रशिक्षण डेटा अव्यवस्थित था या उसमें सफल होने के कई अलग-अलग तरीके दिखाए गए थे।

संक्षेप में, OMSD एक स्मार्ट कंडक्टर की तरह है जो न केवल प्रत्येक संगीतकार को अपना हिस्सा बजाने के लिए नहीं कहता, बल्कि उन्हें अपने से पहले वाले व्यक्ति को सुनने और उनके नेतृत्व का पालन करने के माध्यम से पूरे ऑर्केस्ट्रा को सामंजस्य में बजाने के लिए निर्देशित करता है, जिससे यह सुनिश्चित होता है कि अंतिम प्रदर्शन एक आपदा के बजाय एक हिट हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →