← नवीनतम पेपर
🤖 AI

ASALT: Adaptive State Alignment for Lateral Transfer in Multi-agent Reinforcement Learning

यह शोध पत्र ASALT को प्रस्तुत करता है, जो एक मल्टी-एजेंट सुदृढीकरण शिक्षण (मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग) विधि है जो अवलोकन-स्तर (ऑब्जर्वेशन-लेवल) और अवस्था-स्तर (स्टेट-लेवल) के एडेप्टरों का उपयोग करती है ताकि बेमेल स्रोत और लक्ष्य डोमेन को एक साझा एम्बेडिंग स्पेस में मैप किया जा सके, जिससे प्रभावी ज्ञान हस्तांतरण संभव हो सके और भिन्न अवस्था-स्थान विमाओं (स्टेट-स्पेस डाइमेंशनलिटीज़) वाले वातावरणों में नकारात्मक हस्तांतरण को कम किया जा सके।

मूल लेखक: Anurag Akula, Satheesh K. Perepu, Abhishek Sarkar, Kaushik Dey

प्रकाशित 2026-06-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anurag Akula, Satheesh K. Perepu, Abhishek Sarkar, Kaushik Dey

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सॉकर टीम के कोच हैं। आपके पास खिलाड़ियों का एक ऐसा समूह है जिसने एक छोटे, 5-ए-साइड पिच पर एक विशिष्ट प्लेबुक में महारत हासिल करने में वर्षों बिताए हैं। अब, आपको उन्हें एक विशाल, 11-ए-साइड पेशेवर मैदान पर तैनात करना है, या शायद आपको उन्हें पूरी तरह से अलग खेल में बदलना है जहाँ नियम और खिलाड़ियों की संख्या बिल्कुल अलग है।

आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग (MARL) कहा जाता है। यह इस बारे में है कि AI "एजेंटों" के समूहों को एक साथ काम करना कैसे सिखाया जाए। समस्या यह है कि यदि आप एक छोटे मैदान के लिए प्रशिक्षित टीम को एक बड़े मैदान पर ले जाते हैं, तो वे भ्रमित हो जाते हैं। उनकी "आंखें" (सेंसर) अलग संख्या में चीजों को देखती हैं, और उनका "दिमाग" (पॉलिसी) यह नहीं जानता कि नए टीम आकार के साथ समन्वय कैसे किया जाए।

यह पेपर एक नई विधि पेश करता है जिसे ASALT (एडैप्टिव स्टेट अलाइनमेंट फॉर लेटरल ट्रांसफर) कहा जाता है ताकि इसी समस्या को हल किया जा सके। यह कैसे काम करता है, इसे सरल भाषा में यहाँ समझाया गया है:

समस्या: "वन-साइज़-फिट्स-नोन" ट्रैप (एक ही आकार सबके लिए नहीं)

पहले, यदि आप एक प्रशिक्षित AI टीम (स्रोत/Source) के ज्ञान का पुन: उपयोग एक नई टीम (लक्ष्य/Target) के लिए करना चाहते थे, तो दोनों टीमों को लगभग समान होना पड़ता था। उन्हें खिलाड़ियों की बिल्कुल समान संख्या की आवश्यकता थी, और प्रत्येक खिलाड़ी को जानकारी की बिल्कुल समान मात्रा देखनी होती थी।

यदि नई टीम में अधिक खिलाड़ी होते या वे दुनिया को अलग तरह से देखते, तो पुराने ज्ञान का उपयोग नहीं किया जा सकता था। यह एक छोटे बच्चे के जूते को एक विशाल व्यक्ति के पैर में जबरदस्ती फिट करने जैसा था; वह फिट नहीं बैठता था। अधिकांश मौजूदा विधियाँ नई टीम को सब कुछ शून्य से सीखने के लिए मजबूर करती थीं, जिससे बहुत अधिक समय और ऊर्जा बर्बाद होती थी।

समाधान: ASALT का "यूनिवर्सल ट्रांसलेटर"

ASALT एक यूनिवर्सल ट्रांसलेटर और एक स्मार्ट एडॉप्टर की तरह कार्य करता है। नई टीम को बिल्कुल पुराने जैसा दिखने के लिए मजबूर करने के बजाय, ASALT उनके बीच एक सेतु बनाता है।

यह दो मुख्य उपकरणों का उपयोग करता है, जिन्हें लेखक एडैप्टर (Adapters) कहते हैं:

  1. ऑब्जर्वेशन एडॉप्टर (द "ट्रांसलेटर"):
    कल्पना कीजिए कि नई टीम 11 लोगों की एक अराजक भीड़ को देखती है, लेकिन पुरानी टीम केवल 3 को संभालने के लिए जानी जाती है। ऑब्जर्वेशन एडॉप्टर नई टीम के दुनिया के अस्त-व्यस्त दृश्य को एक साफ, संक्षिप्त "भाषा" में अनुवादित करता है जिसे पुराने टीम का दिमाग समझ सके। यह केवल डेटा को छोटा नहीं करता है; यह एक विशेष अटेंशन मैकेनिज्म (जैसे कि स्पॉटलाइट) का उपयोग करता है ताकि खिलाड़ियों के बीच सबसे महत्वपूर्ण संबंधों पर ध्यान केंद्रित किया जा सके और शोर (noise) को अनदेखा किया जा सके।

  2. स्टेट एडॉप्टर (द "कॉन्टेक्स्टुअलाइज़र"):
    कभी-कभी, टीम को "बड़ी तस्वीर" (ग्लोबल स्टेट) जानने की आवश्यकता होती है, जैसे कि पूरे मैदान के सापेक्ष गेंद कहाँ है। यदि नया मैदान बड़ा या अलग आकार का है, तो स्टेट एडॉप्टर इस बड़ी-चित्र वाली दृष्टि को फिर से आकार देता है ताकि वह पुरानी टीम की रणनीति के अनुकूल हो सके।

यह ट्रांसफर कैसे होता है: "लेटरल" लर्निंग

एक बार जब नई टीम का दृश्य अनुवादित हो जाता है, तो ASALT केवल पुराने टीम के अंतिम कदमों की नकल नहीं करता है। इसके बजाय, यह एक तकनीक का उपयोग करता है जिसे लेटरल ट्रांसफर कहा जाता है।

इसे एक मास्टर शेफ (स्रोत) द्वारा एक नए प्रशिक्षु (लक्ष्य) को सिखाने के रूप में सोचें।

  • पुराना तरीका: मास्टर अंतिम रेसिपी लिख देता है, और प्रशिक्षु उसे याद करने की कोशिश करता है। यदि सामग्री बदल जाती है, तो रेसिपी विफल हो जाती है।
  • ASALT का तरीका: मास्टर प्रशिक्षु को खाना बनाते दौरान देखते रहने देता है। प्रशिक्षु देखता है कि मास्टर हर चरण में कैसे काटता है, मिलाता है और चखता है (मस्तिष्क की मध्यवर्ती परतें)। प्रशिक्षु खाना बनाने के सिद्धांतों को सीखता है, न कि केवल अंतिम व्यंजन को।

ASALT में, नई टीम अनुवादित डेटा के माध्यम से पुराने (प्री-ट्रेन्ड) टीम को काम करते हुए "देखती" है। नई टीम पुराने टीम की आंतरिक विचार प्रक्रियाओं (दोनों "एक्टर" जो निर्णय लेता है, और "क्रिटिक" जो चाल का मूल्यांकन करता है) से सीखती है। यह नई टीम को बहुत तेज़ी से सीखने में सक्षम बनाता है।

प्रयोगों ने क्या दिखाया

शोधकर्ताओं ने तीन अलग-अलग "खेलों" पर इसका परीक्षण किया:

  1. स्टारक्राफ्ट II (SMAC): एक जटिल रणनीति गेम जहाँ आप इकाइयों (units) को कमांड देते हैं। उन्होंने 3 इकाइयों से 8 इकाइयों में और यहाँ तक कि इकाइयों के प्रकार बदलने का परीक्षण किया।
  2. गूगल रिसर्च फुटबॉल: एक सॉकर सिमुलेशन। उन्होंने एक छोटे प्रशिक्षण अकादमी गेम से पूर्ण 11-बनाम-11 मैच में जाने का परीक्षण किया।
  3. मल्टी-पार्टिकल एनवायरनमेंट्स: सरल भौतिकी वाले खेल जहाँ एजेंटों को फैलना होता है या एक-दूसरे को टैग करना होता है।

परिणाम:

  • गति: नई टीमों ने पुराने तरीके की तुलना में काफी तेज़ी से जीतना सीखा (कभी-कभी उन्हें केवल 20-30% अभ्यास समय की आवश्यकता पड़ी)।
  • लचीलापन: यह तब भी काम कर गया जब खिलाड़ियों की संख्या बदल गई या नियम थोड़े अलग थे।
  • "बुरी आदतों" से बचना: कभी-कभी पुराना ज्ञान हानिकारक हो सकता है (जिसे "नेगेटिव ट्रांसफर" कहा जाता है)। उदाहरण के लिए, छोटे मैदान के लिए एक रणनीति बड़े मैदान पर बहुत खराब हो सकती है। ASALT खराब हिस्सों को छानने और केवल उपयोगी समन्वय पैटर्न को रखने में कुशल था, जिससे नई टीम भ्रमित होने से बच गई।

निचोड़

ASALT एक ऐसी विधि है जो AI टीमों को एक वातावरण में प्रशिक्षित किए जाने के बाद दूसरे, अलग वातावरण में जल्दी से ढलने में मदद करती है। यह नए वातावरण की "भाषा" को उस प्रारूप में अनुवादित करके करता है जिसे पुराना टीम समझ सके, और फिर नई टीम को पुराने टीम की आंतरिक निर्णय लेने की प्रक्रिया को देखकर सीखने की अनुमति देता है।

पेपर का दावा है कि यह प्रशिक्षण को बहुत अधिक कुशल बनाता है और AI को वास्तविक दुनिया के बदलावों (जैसे टीम के सदस्यों को जोड़ने या हटाने) को बिना शून्य से फिर से सीखे संभालने में मदद करता है। यह दावा नहीं करता है कि इसका उपयोग चिकित्सा या नैदानिक उद्देश्यों के लिए किया जाएगा, बल्कि यह सुधारने के लिए है कि AI सिस्टम गेम, ट्रैफ़िक या फ्लीट मैनेजमेंट में समन्वय कैसे सीखते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →