← नवीनतम पेपर
🤖 machine learning

Zero Shot Coordination for Sparse Reward Tasks with Diverse Reward Shapings

यह शोध पत्र रैंडमाइज्ड रिवॉर्ड शेपिंग (randomized reward shapings) के साथ एक एनसेंबल ट्रेनिंग पद्धति का प्रस्ताव देकर स्पार्स रिवॉर्ड मल्टी-एजेंट सुदृढीकरण शिक्षण (sparse reward Multi-Agent Reinforcement Learning) में ज़ीरो-शॉट कोऑर्डिनेशन चुनौती को संबोधित करता है, जो ओवरकुक्ड (Overcooked) वातावरण में विभिन्न रिवॉर्ड शेपिंग रणनीतियों का उपयोग करने वाले पार्टनर्स के साथ एजेंट सहयोग में महत्वपूर्ण सुधार करता है।

मूल लेखक: Keenan Powell, Peihong Yu, Pratap Tokekar

प्रकाशित 2026-04-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Keenan Powell, Peihong Yu, Pratap Tokekar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रोबोटों के एक समूह को एक व्यस्त रसोई में मिलकर खाना बनाना सिखा रहे हैं। लक्ष्य सरल है: समय समाप्त होने से पहले अधिक से अधिक सूप बनाना। हालाँकि, इसमें एक पेच है। आप उन्हें किसी ऐसे विशिष्ट साथी के साथ काम करने के लिए प्रशिक्षित नहीं कर रहे हैं जिसे आप जानते हैं, बल्कि आप उन्हें किसी भी ऐसे रोबोट के साथ काम करने के लिए प्रशिक्षित कर रहे हैं जिससे वे भविष्य में मिल सकते हैं, भले ही उस रोबोट को किसी अलग कंपनी द्वारा, एक अलग कंप्यूटर के साथ, या नियमों के थोड़े अलग सेट के साथ प्रशिक्षित किया गया हो।

यह ज़ीरो-शॉट कोऑर्डिनेशन (ZSC) की समस्या है। यह किसी अजनबी के साथ नृत्य करने की कोशिश करने जैसा है जिसके साथ आपने कभी अभ्यास नहीं किया है। यदि आप दोनों ने बिल्कुल एक ही नृत्य के स्टेप्स सीखे होते, तो आप एकदम सटीक होते। लेकिन यदि आपके साथी ने थोड़ा अलग संस्करण सीखा होता, तो आप एक-दूसरे के पैरों पर पैर रख सकते थे।

समस्या: "एक ही लक्ष्य, अलग-अलग प्रेरणाएँ"

अतीत में, शोधकर्ताओं ने इस समस्या को हल करने का प्रयास किया था जिसमें सभी रोबोट्स को एक ही "स्कोरकार्ड" (रिवॉर्ड फंक्शन) दिया जाता था। यदि कोई रोबोट बर्तन में प्याज डालता है, तो उसे एक अंक मिलता है। यदि वह एक प्लेट उठाता है, तो उसे एक अंक मिलता है।

लेकिन वास्तविक दुनिया में, रोबोट (या स्वायत्त कारें, या ड्रोन) एक ही बड़े लक्ष्य (गंतव्य तक पहुँचना या सूप बनाना) को साझा कर सकते हैं, लेकिन वे चरणों को अलग तरह से महत्व दे सकते हैं।

  • रोबोट A सोच सकता है: "गति ही सब कुछ है! मुझे तेज़ चलने के लिए अंक मिलते हैं।"
  • रोबोट B सोच सकता है: "सुरक्षा ही सब कुछ है! मुझे सावधान रहने के लिए अंक मिलते हैं।"

यदि आप अपने रोबोट को केवल "स्पीड" वाले रोबोट्स के साथ काम करने के लिए प्रशिक्षित करते हैं, तो वह "सेफ्टी" वाले रोबोट के साथ जुड़ने पर बुरी तरह विफल हो जाएगा। यह शोध पत्र तर्क देता है कि मौजूदा तरीकों ने इस बात पर ध्यान नहीं दिया। उन्होंने यह मान लिया था कि सभी का आंतरिक "स्कोरकार्ड" एक समान है।

समाधान: "विविध प्रशिक्षण शिविर" (Diverse Training Camp)

लेखक इन रोबोटों को प्रशिक्षित करने का एक नया तरीका प्रस्तावित करते हैं। उन्हें केवल एक ही स्कोरकार्ड के साथ प्रशिक्षित करने के बजाय, वे एक विविध प्रशिक्षण शिविर बनाते हैं।

वे रोबोटों को विभिन्न प्रकार के "स्कोरकार्ड" (जिसे रिवॉर्ड शेपिंग कहा जाता है) प्रदान करने के लिए चार अलग-अलग तरीकों का उपयोग करते हैं:

  1. "LLM-आधारित" कोच: वे एक अत्यंत बुद्धिमान AI (एक लार्ज लैंग्वेज मॉडल) से पूछते हैं कि क्या काम कर रहा है और क्या नहीं, और फिर एक नया नियम सेट लिखवाते हैं जो विभिन्न प्रकार के रोबोटों का मिश्रण तैयार करेगा।
  2. "सरोगेट नेटवर्क" कोच: वे यह अनुमान लगाने के लिए एक छोटा, सरल AI प्रशिक्षित करते हैं कि कौन से नियम सबसे अच्छे परिणाम देंगे। इसके बाद यह उपलब्ध नियमों की एक विशाल सूची में से सर्वश्रेष्ठ नियमों को चुनता है।
  3. "स्ट्रैटिफाइड ग्रिड" कोच: यह एक सूक्ष्म व्यवस्थापक की तरह है। वे हर संभव नियम (जैसे "गति को कितना महत्व देना है" या "सुरक्षा को कितना महत्व देना है") को लेते हैं और उस रेंज को समान हिस्सों में विभाजित करते हैं। वे सुनिश्चित करने के लिए कि वे बिना कुछ छोड़े पूरे स्पेक्ट्रम को कवर करें, हर हिस्से से एक नियम चुनते हैं।
  4. "रैंडम" कोच: वे पूरी तरह से रैंडम तरीके से नियम चुनते हैं। (यह एक कंट्रोल ग्रुप है, जैसे पासा फेंकना)।

द एंसेम्बल: "ऑल-स्टार टीम"

एक बार जब वे इन विभिन्न नियमपुस्तिकाओं का उपयोग करके कई अलग-अलग रोबोटों को प्रशिक्षित कर लेते हैं, तो वे उनमें से किसी एक को चुनते नहीं हैं। इसके बजाय, वे एक एंसेम्बल (Ensemble) बनाते हैं।

इसे एक सुपर-टीम के रूप में सोचें। जब रोबोट किसी अजनबी के साथ काम करने के लिए रसोई में प्रवेश करता है, तो वह केवल "रोबोट A" या "रोबोट B" के रूप में कार्य नहीं करता है। वह एक समिति (कमेटी) के रूप में कार्य करता है। वह अपने स्वयं के सभी विभिन्न संस्करणों (जिन्हें अलग-अलग नियमों पर प्रशिक्षित किया गया था) से पूछता है कि वे क्या करेंगे, और फिर वह सबसे लोकप्रिय उत्तर के साथ आगे बढ़ता है।

यह रोबोट को अविश्वसनीय रूप से अनुकूलनीय बनाता है। उसने समस्या के बारे में सोचने के हर संभावित तरीके को देखा है, इसलिए वह किसी भी अजनबी के साथ सहयोग कर सकता है, चाहे वह अजनबी कैसे भी सोचता हो।

परिणाम: सफलता का निर्माण

शोधकर्ताओं ने इसका परीक्षण ओवरकुक्ड (Overcooked) गेम (एक लोकप्रिय सहकारी कुकिंग गेम) में किया। उन्होंने अपनी "ऑल-स्टार टीम" को पूरी तरह से अज्ञात नियमों के साथ प्रशिक्षित रोबोट्स के खिलाफ उतारा।

  • परिणाम: उनकी विधि एक बड़ी सफलता रही। पुराने तरीकों की तुलना में, उनके रोबोटों के प्रदर्शन में 62% से 119% तक सुधार हुआ।
  • विजेता: "स्ट्रैटिफाइड ग्रिड" (सूक्ष्म व्यवस्थापक) और "सरोगेट नेटवर्क" (अनुमान लगाने वाला) सबसे अच्छे कोच थे। उन्होंने ऐसी टीमें बनाईं जो अजनबियों को सबसे प्रभावी ढंग से संभाल सकती थीं।
  • आश्चर्य: यहाँ तक कि "रैंडम" कोच (जो पासा फेंककर नियम चुनता था) ने भी पुराने मानक तरीकों से बेहतर प्रदर्शन किया, जिससे यह सिद्ध हुआ कि केवल कुछ विविधता होना भी बिना किसी विविधता के होने से बेहतर है।

मुख्य निष्कर्ष

यह शोध पत्र दिखाता है कि रोबोटों को अजनबियों के साथ सहयोग करना सिखाने के लिए, आपको उन्हें केवल एक तरह से सोचना नहीं सिखाना चाहिए। आपको उन्हें अलग-अलग "स्कोरकार्ड" देकर सोचने के विभिन्न तरीकों के माध्यम से प्रशिक्षित करना चाहिए। फिर, उन सभी अलग-अलग दृष्टिकोणों को एक स्मार्ट टीम में मिलाकर, वे किसी भी साथी के साथ तालमेल बिठा सकते हैं, भले ही वह साथी पूरी तरह से अलग नियमों के अनुसार खेलता हो।

संक्षेप में: यदि आप किसी के लिए भी एक अच्छा डांस पार्टनर बनना चाहते हैं, तो केवल एक नृत्य न सीखें। थोड़ा-थोड़ा सब कुछ सीखें, और फिर अपने भीतर की समिति को तय करने दें कि फ्लोर पर उतरते समय सबसे अच्छा मूव क्या होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →