← नवीनतम पेपर
🤖 machine learning

Wonder Wins Ways: Curiosity-Driven Exploration through Multi-Agent Contextual Calibration

यह शोध पत्र CERMIC का प्रस्ताव करता है, जो एक नवीन मल्टी-एजेंट सुदृढीकरण शिक्षण (multi-agent reinforcement learning) ढांचा है जो शोर को फ़िल्टर करने और उच्च-सूचना वाले अवस्था संक्रमणों को प्राथमिकता देने के लिए पीयर-ऑब्जर्व्ड कॉन्टेक्स्ट (peer-observed context) के माध्यम से आंतरिक जिज्ञासा को गतिशील रूप से कैलिब्रेट करके स्पार्स-रिवॉर्ड एक्सप्लोरेशन को बढ़ाता है, जिससे अत्याधुनिक एल्गोरिदम की तुलना में बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Yiyuan Pan, Zhe Liu, Hesheng Wang

प्रकाशित 2026-02-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yiyuan Pan, Zhe Liu, Hesheng Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Wonder Wins Ways: Curiosity-Driven Exploration through Multi-Agent Contextual Calibration" (CERMIC) का सरल, रोजमर्रा की भाषा और रचनात्मक उपमाओं के साथ अनुवाद दिया गया है।

बड़ी समस्या: "नॉइज़ी टीवी" (Noisy TV) और अकेला खोजकर्ता

कल्पना कीजिए कि आप रोबोटों के एक समूह को एक जटिल फुटबॉल गेम खेलना सिखा रहे हैं, लेकिन आप उन्हें केवल तभी अंक देते हैं जब वे गोल करते हैं। गोलों के बीच में, उन्हें शून्य फीडबैक मिलता है। इसे "स्पार्स रिवॉर्ड" (sparse reward) वातावरण कहा जाता है।

सीखने के लिए, इन रोबोटों को जिज्ञासु होने की आवश्यकता है। उन्हें कुछ नया करने की कोशिश करनी चाहिए, सिर्फ यह देखने के लिए कि क्या होता है। इसे आर्टिफिशियल क्यूरियोसिटी (कृत्रिम जिज्ञासा) कहा जाता है।

हालाँकि, एक पेंच है। एक अराजक दुनिया में, चीजें समय-समय पर बेतरतीब ढंग से होती रहती हैं। एक रोबोट देख सकता है कि गेंद दीवार से अजीब तरीके से टकराकर वापस आई और वह सोच सकता है, "वाह, यह नया है! मुझे इसका अध्ययन करने की ज़रूरत है!" लेकिन वह केवल रैंडम शोर (random noise) था। इसे "नॉइज़ी टीवी" (Noisy TV) समस्या के रूप में जाना जाता है: रोबोट वास्तविक खेल सीखने के बजाय रैंडम स्टैटिक (शोर) से विचलित हो जाता है।

इसके अलावा, अधिकांश वर्तमान जिज्ञासा प्रणालियाँ प्रत्येक रोबोट को एक अकेले भेड़िये (lone wolf) की तरह मानती हैं। वे अपने साथियों के कार्यों पर ध्यान नहीं देती हैं। यदि कोई साथी कोई अजीब चाल चलता है, तो एक मानक रोबोट सोच सकता है, "यह एक आश्चर्य है! मैं जाकर इसकी जांच करूँगा!" भले ही वह साथी केवल एक गलती कर रहा हो। इससे अराजकता और समय की बर्बादी होती है।

समाधान: CERMIC ("सामाजिक रूप से जागरूक" जिज्ञासा)

लेखकों ने CERMIC नामक एक नई प्रणाली प्रस्तावित की है। इसे समझने के लिए, बच्चों के एक समूह की कल्पना करें जो खेल के मैदान में एक नया खेल सीख रहे हैं।

  1. पुराना तरीका (नाइव क्यूरियोसिटी - Naive Curiosity): एक बच्चा देखता है कि उसका दोस्त पत्थर से टकराकर गिर गया। बच्चा सोचता है, "ओह! गिरना नया है! मुझे भी पत्थरों से टकराकर गिरने की कोशिश करनी चाहिए!" वे शोर से विचलित हो जाते हैं।
  2. CERMIC का तरीका (कॉन्टेक्स्टुअल कैलिब्रेशन - Contextual Calibration): एक बच्चा देखता है कि उसका दोस्त गिरा। गिरने के बजाय, वह सोचता, "रुको, मेरा दोस्त इसलिए गिरा क्योंकि वहाँ जमीन फिसलन भरी थी। यह उपयोगी जानकारी है। लेकिन हवा के झोंके से एक पत्ता उड़ गया? वह तो बस शोर है, मैं उसे अनदेखा कर दूँगा।"

CERMIC एजेंटों को उनके साथियों के कार्यों को देखकर अपनी जिज्ञासा को कैलिब्रेट (समायोजित) करना सिखाता है। यह "शोर" को फ़िल्टर करता है और "सिग्नल" (महत्वपूर्ण सूचना) पर ध्यान केंद्रित करता है।

यह कैसे काम करता है: तीन जादुई सामग्रियाँ

1. "सोशल रडार" (इरादों को समझना)

CERMIC प्रत्येक एजेंट को एक "सोशल रडार" देता है। यह केवल दुनिया को नहीं देखता; यह अनुमान लगाने की कोशिश करता है कि उसके साथी क्या सोच रहे हैं या क्या योजना बना रहे हैं।

  • उपमा: कल्पना कीजिए कि आप एक पार्टी में हैं। एक सामान्य व्यक्ति केवल लोगों को इधर-उधर घूमते हुए देखता है। एक "सोशल रडर" वाला व्यक्ति नोटिस करता है, "ओह, सारा दरवाजे की ओर देख रही है, वह शायद बाहर जाना चाहती है," या "माइक ने ड्रिंक पकड़ी हुई है, वह शायद बातचीत के लिए किसी को ढूंढ रहा है।"
  • शोध पत्र में: सिस्टम अन्य एजेंटों के स्थान और उनकी संभावित गतिविधियों को ट्रैक करने के लिए एक गतिशील "ग्राफ" (संबंधों का मानचित्र) बनाता है।

2. "ट्रस्ट फ़िल्टर" (संदर्भ अंशांकन)

एक बार जब रोबोट के पास अपने दोस्तों के बारे में एक अनुमान होता है, तो वह उसका उपयोग अपनी जिज्ञासा को समायोजित करने के लिए करता है।

  • उपमा: यदि आपका दोस्त एक विशेषज्ञ ड्राइवर है और वह अचानक गाड़ी मोड़ता है, तो आप उन पर भरोसा करते हैं और आप भी गाड़ी मोड़ते हैं (उच्च विश्वास)। यदि आपका दोस्त एक छोटा बच्चा है और वह गाड़ी मोड़ता है, तो आपको एहसास होता है कि वह बस अराजक व्यवहार कर रहा है और आप उसे अनदेखा कर देते हैं (कम विश्वास)।
  • शोध पत्र में: CERMIC एक "ट्रस्ट स्कोर" की गणना करता है। यदि टीम का व्यवहार रैंडम और अविश्वसनीय लगता है, तो रोबोट विचलित होने से बचने के लिए अपनी जिज्ञासा को कम कर देता है। यदि टीम समन्वित और सार्थक तरीके से कार्य कर रही है, तो रोबोट उनसे सीखने के लिए अपनी जिज्ञासा को बढ़ा देता है।

3. "सीखने के लिए इनाम" (आंतरिक प्रेरणा)

यह प्रणाली रोबोट को केवल जीतने के लिए नहीं, बल्कि टीम के बारे में कुछ नया सीखने के लिए एक छोटा "बोनस पॉइंट" (आंतरिक इनाम) देती है।

  • उपमा: एक वीडियो गेम की कल्पना करें जहाँ आपको अपने साथियों के चलने के तरीके के बारे में पता लगाने के लिए XP (अनुभव अंक) मिलते हैं। यदि आप उनके खेलने के पैटर्न में एक नया पैटर्न खोज लेते हैं, तो आपको बोनस मिलता है। यह रोबोट को खेल के "सामाजिक" पक्ष को खोजने के लिए प्रेरित रखता है, भले ही मुख्य खेल (गोल करना) शांत हो।

यह गेम चेंजर क्यों है

शोध पत्र ने कई कठिन परिदृश्यों (जैसे रोबोट सॉकर, नेविगेशन और रणनीति के खेल) पर इसका परीक्षण किया जहाँ पुरस्कार बहुत दुर्लभ होते हैं।

  • परिणाम: CERMIC का उपयोग करने वाले रोबोटों ने मानक जिज्ञासा का उपयोग करने वाले रोबोटों की तुलना में बहुत तेज़ी से सीखा और बेहतर प्रदर्शन किया।
  • सीक्रेट सॉस (गुप्त मंत्र): वे केवल अंधे होकर अन्वेषण नहीं कर रहे थे। वे साथ मिलकर अन्वेषण कर रहे थे। उन्होंने "दिलचस्प आश्चर्यों" (जैसे एक साथी द्वारा नई रणनीति आज़माना) और "परेशान करने वाले शोर" (जैसे रैंडम ग्लिच) के बीच अंतर करना सीख लिया।

निष्कर्ष

मल्टी-एजेंट सुदृढीकरण लर्निंग (Multi-Agent Reinforcement Learning - समूहों को एक साथ काम करना सिखाना) की दुनिया में, जिज्ञासा एक शक्तिशाली उपकरण है, लेकिन इसे एक फ़िल्टर की आवश्यकता है।

CERMIC अन्वेषकों के एक समूह को एक सामाजिक दिशा-सूचक (social compass) देने जैसा है। हर उस चीज़ की ओर भागने के बजाय जो नयी दिखती है, वे अपने दोस्तों को देखते हैं, यह समझते हैं कि वास्तव में क्या महत्वपूर्ण है, और फिर उन चीजों का अन्वेषण करते हैं जो वास्तव में मायने रखती हैं। यह उन्हें जटिल और कठिन समस्याओं को बहुत तेज़ी से हल करने की अनुमति देता है, भले ही उन्हें लगातार प्रशंसा या पुरस्कार न मिलें।

संक्षेप में: CERMIC एजेंटों को केवल शोर के प्रति नहीं, बल्कि एक-दूसरे के प्रति जिज्ञासु होना सिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →