← नवीनतम पेपर
🤖 AI

ARMS: Automatic Reward Shaping for Sparse-Reward Multi-Agent Reinforcement Learning

यह शोध पत्र ARMS का प्रस्ताव करता है, जो मल्टी-एजेंट सुदृढीकरण शिक्षण (multi-agent reinforcement learning) के लिए एक स्व-पर्यवेक्षित ढांचा है जो प्रक्षेपवक्र रैंकिंग (trajectory ranking) के माध्यम से विरल पुरस्कारों (sparse rewards) से स्वतः ही सघन पुरस्कार संकेतों (dense reward signals) को उत्पन्न करता है, और साथ ही सशर्त सर्वोत्तम-प्रतिक्रिया तर्क (conditional best-response reasoning) के माध्यम से नैश इक्विलिब्रियम (Nash equilibria) के संरक्षण की सैद्धांतिक गारंटी देता है, जिससे विरल-पुरस्कार वाले वातावरण में नमूनाकरण दक्षता (sampling efficiency) और स्थिरता में सुधार होता है।

मूल लेखक: Elie Abboud, Oren Gal

प्रकाशित 2026-05-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Elie Abboud, Oren Gal

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप कुत्तों के एक समूह को रिले रेस (relay race) दौड़ना सिखा रहे हैं। एक आदर्श दुनिया में, हर बार जब कोई कुत्ता सही दिशा में कदम बढ़ाता है, तो आप उसे एक ट्रीट (treat) देते हैं। लेकिन वास्तविक दुनिया में (और आर्टिफिशियल इंटेलिजेंस की जटिल दुनिया में), आप हर कदम पर ट्रीट नहीं दे सकते। इसके बजाय, आपको ट्रीट तभी मिलता है जब कुत्ता अंततः फिनिश लाइन पार कर लेता है।

यह स्पार्स रिवॉर्ड्स (Sparse Rewards) की समस्या है। यदि कुत्ते को एक लंबी दूरी तय करनी है और उसे केवल अंत में ही ट्रीट मिलता है, तो उसे पता ही नहीं चलेगा कि कौन से कदम अच्छे थे और कौन से बुरे। यह एक नई भाषा सीखने जैसा है जहाँ आपको वाक्य पूरा करने के एक साल बाद केवल "सही!" या "गलत!" बताया जाता है।

मल्टी-एजेंट रिइन्फोर्समेंट लर्निंग (MARL) की दुनिया में, यह और भी कठिन हो जाता है। कल्पना कीजिए कि केवल एक कुत्ता नहीं, बल्कि कुत्तों का एक पूरा झुंड है। उन सभी को एक साथ सीखना है, और उन्हें एक-दूसरे के साथ तालमेल बिठाना है। यदि एक कुत्ता अपनी रणनीति बदलता है, तो वह अन्य सभी कुत्तों के लिए वातावरण बदल देता है। इससे एक अराजक और अस्थिर परिदृश्य बन जाता है, जहाँ सीखना अविश्वसनीय रूप से कठिन हो जाता है।

समस्या: "मौन" कोच (The "Silent" Coach)

पेपर का तर्क है कि जब कई एजेंट (जैसे हमारे कुत्ते) स्पार्स रिवॉर्ड्स के साथ मिलकर सीखते हैं, तो वे अक्सर फंस जाते हैं। वे गोल-गोल घूम सकते हैं, एक-दूसरे से टकरा सकते हैं, या बस स्थिर खड़े रह सकते हैं क्योंकि निरंतर फीडबैक के बिना उन्हें समझ नहीं आता कि क्या करना है।

पारंपरिक तरीके इसे ठीक करने के लिए एक मानव विशेषज्ञ द्वारा एक "चीट शीट" (जिसे रिवॉर्ड शेपिंग/Reward Shaping कहा जाता है) डिजाइन करने का प्रयास करते हैं, जो एजेंटों को रास्ते में छोटे संकेत देती है। लेकिन यह जोखिम भरा है। यदि मानव गलत संकेत देता है, तो एजेंट "सिस्टम को गेम करने" (game the system) के लिए सीख सकते हैं—वे एक ऐसा शॉर्टकट ढूंढ सकते हैं जो उन्हें बहुत सारे अंक देता है लेकिन वास्तव में समस्या को हल नहीं करता (जैसे कि दौड़ने के बजाय इनाम पाने के लिए गोल-गोल घूमते रहना)।

समाधान: ARMS (स्व-शिक्षण कोच)

लेखकों ने ARMS (Automatic Reward-shaping in Multi-agent Systems) नामक एक नया सिस्टम प्रस्तावित किया है। इसमें मानव द्वारा संकेतों को डिजाइन करने के बजाय, ARMS एक स्मार्ट कोच की तरह काम करता है जो स्वचालित रूप से संकेत देना सीखता है

यह कैसे काम करता है, इसके लिए एक सरल उपमा यहाँ दी गई है:

  1. अवलोकन (The Observation): कोच कुत्तों को कई बार दौड़ते हुए देखता है। भले ही कुत्तों को फिनिश लाइन पर ही ट्रीट मिलता है, कोच पूरी दौड़ देख सकता है।
  2. रैंकिंग (The Ranking): कोच दो अलग-अलग दौड़ के प्रयासों को देखता है। "देखो," कोच कहता है, "दौड़ A में, कुत्ते तेजी से दौड़े और टकराए नहीं। दौड़ B में, वे टकरा गए और उन्हें अधिक समय लगा। इसलिए, दौड़ A बेहतर है और दौड़ B बदतर है।"
  3. सबक (The Lesson): कोच केवल "अच्छा काम किया" या "बुरा काम किया" नहीं कहता। यह इन रैंकिंग्स का उपयोग करके एक नया रिवॉर्ड सिस्टम बनाता है। यह एक 'डेंस सिग्नल' (छोटे संकेतों का एक निरंतर प्रवाह) बनाता है जो कुत्तों को बताता है, "यह कदम अच्छा था क्योंकि यह जीतने वाली दौड़ के कदमों जैसा दिखता है," या "यह कदम बुरा था क्योंकि यह हारने वाली दौड़ के कदमों जैसा दिखता है।"
  4. सुरक्षा जाल (The Safety Net): ARMS का सबसे महत्वपूर्ण हिस्सा यह है कि यह गणितीय रूप से सुरक्षित (safe) है। लेखक दिखाते हैं कि भले ही कोच संकेत देने के लिए नए नियम बना रहा है, लेकिन यह खेल के अंतिम लक्ष्य को कभी नहीं बदलता है। यह गारंटी देता है कि "जीतने वाली रणनीतियाँ" (जिसे पेपर में नैश इक्विलिब्रियम/Nash Equilibria कहा गया है) वही रहती हैं। एजेंट तेजी से सीख सकते हैं, लेकिन वे गलत चीज़ नहीं सीखेंगे।

"ऑसिलेशन" का जाल (The "Oscillation" Trap)

पेपर ने एक मजेदार और खतरनाक गड़बड़ी (glitch) की खोज की जो तब होती है जब बहुत अधिक एजेंट होते हैं और पर्याप्त अन्वेषण (exploration) नहीं होता।

कल्पना कीजिए कि कुत्ते इतने भ्रमित हैं कि वे सभी एक ही तरह का अजीब नृत्य शुरू कर देते हैं। वे एक-दूसरे से टकराते हैं, रुकते हैं, फिर से नाचते हैं, और फिर टकराते हैं। क्योंकि वे सभी एक ही चीज़ कर रहे हैं, "कोच" (रिवॉर्ड सिस्टम) इस पैटर्न को बार-बार देखता है और सोचता है, "ओह, यह आगे बढ़ने का सबसे अच्छा तरीका है!" यह खराब व्यवहार को बढ़ावा देता है, और कुत्ते टकराने और नाचने के अंतहीन लूप में फंस जाते हैं।

पेपर ने पाया कि यदि आप एजेंटों को थोड़ा अधिक जिज्ञासु (exploration बढ़ाना) होने के लिए कहते हैं, तो वे रैंडम और अजीब हरकतें करेंगे। यह लूप को तोड़ देता है, जिससे कोच यह देख पाता है कि "नाचना" वास्तव में एक बुरा विचार है और दौड़ने के सही तरीके को सिखाना शुरू कर पाता है।

परिणाम

लेखकों ने एक वर्चुअल दुनिया में इसका परीक्षण किया जहाँ एजेंटों (जैसे छोटे रोबोट) को बाधाओं से बचते हुए और एक-दूसरे से टकराए बिना लक्ष्यों तक पहुँचना था।

  • तेजी से सीखना: जब रिवॉर्ड्स बहुत स्पार्स (सीखना कठिन) थे, तो ARMS ने एजेंटों को बिना किसी मदद या पुराने, हाथ से डिजाइन किए गए संकेतों की तुलना में बहुत तेजी से सीखने में मदद की।
  • बेहतर टीमवर्क: एजेंट बेहतर समन्वय करना सीख गए, जिससे वे एक-दूसरे से कम टकराते थे।
  • सामान्यीकरण (Generalization): ARMS के साथ प्रशिक्षित एजेंटों ने नए मानचित्रों (maps) पर बेहतर ढंग से नेविगेट किया जिन्हें उन्होंने पहले कभी नहीं देखा था, जो यह साबित करता है कि उन्होंने वास्तव में "दौड़ दौड़ने" की अवधारणा सीखी है, न कि केवल एक विशिष्ट ट्रैक को रटा है।

सारांश

संक्षेप में, ARMS एक ऐसा सिस्टम है जो एजेंटों के एक समूह को यह सिखाने में मदद करता है कि वे आपस में कैसे काम करें, जब उन्हें बहुत कम फीडबैक मिलता है। यह उनके अपने पिछले प्रयासों को देखकर, अच्छे और बुरे प्रयासों की रैंकिंग करके, और उन्हें गाइड करने के लिए स्वचालित रूप से एक सहायक "चीट शीट" बनाकर किया जाता है। महत्वपूर्ण रूप से, यह खेल के नियमों को तोड़े बिना किया जाता है, यह सुनिश्चित करते हुए कि वे केवल एक चालाक ट्रिक नहीं, बल्कि सही समाधान सीखते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →