← नवीनतम पेपर
🤖 AI

Adaptive Value Decomposition: Coordinating a Varying Number of Agents in Urban Systems

यह शोध पत्र एडेप्टिव वैल्यू डिकंपोजिशन (AVD) का प्रस्ताव करता है, जो एक सहकारी मल्टी-एजेंट सुदृढीकरण लर्निंग फ्रेमवर्क है जो एसिंक्रोनस निर्णय लेने और एक्शन होमोजेनाइजेशन जैसी चुनौतियों का समाधान करके शहरी प्रणालियों में गतिशील रूप से परिवर्तनशील संख्या वाले एजेंटों को प्रभावी ढंग से समन्वित करता है, और वास्तविक दुनिया के बाइक-शेयरिंग पुनर्वितरण कार्यों में उत्कृष्ट प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Yexin Li, Jinjin Guo, Haoyu Zhang, Yuhan Zhao, Yiwen Sun, Zihao Jiao

प्रकाशित 2026-02-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yexin Li, Jinjin Guo, Haoyu Zhang, Yuhan Zhao, Yiwen Sun, Zihao Jiao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक हलचल भरे शहर की कल्पना एक विशाल, जीवित जीव के रूप में करें। इस जीव में, हजारों "कोशिकाएं" (बाइक स्टेशन) हैं जिन्हें "रक्त" (बाइकों) की निरंतर आपूर्ति के साथ स्वस्थ रहना आवश्यक है। कभी-कभी, एक स्टेशन खाली हो जाता है क्योंकि हर कोई बाइक लेकर निकल जाता है; दूसरी ओर, यह तब भर जाता है जब हर कोई बाइक वापस लौटा देता है।

इसे ठीक करने के लिए, शहर "नर्सों" (पुनर्वितरण ट्रकों) का एक बेड़ा तैनात करता है ताकि भरी हुई स्टेशनों से खाली स्टेशनों तक बाइक पहुँचाई जा सकें। यह सुनने में सरल लगता है, लेकिन इन नर्सों को प्रबंधित करना एक कंप्यूटर के लिए एक दुःस्वप्न है जो यह सीखने की कोशिश कर रहा है कि यह कैसे किया जाए।

यह शोध पत्र AVD (एडेप्टिव वैल्यू डिकंपोजिशन) नामक एक नई स्मार्ट प्रणाली पेश करता है ताकि उन तीन विशिष्ट सिरदर्दों को हल किया जा सके जो इन नर्सों को प्रबंधित करना इतना कठिन बनाते हैं:

1. "गिरगिट" की समस्या: टीम का आकार बदलता रहता है

समस्या: एक वास्तविक शहर में, आपके पास हमेशा समान संख्या में ट्रक नहीं होते हैं। मंगलवार की एक बरसाती सुबह, आपको 10 ट्रकों की आवश्यकता हो सकती है। रविवार की एक धूप वाली दोपहर में, आपको केवल 3 की आवश्यकता हो सकती है। अधिकांश पुराने कंप्यूटर प्रोग्राम कठोर रोबोटों की तरह होते हैं; उन्हें ठीक 5 ट्रकों को प्रबंधित करने के लिए प्रशिक्षित किया जाता है। यदि आप उन्हें 3 देते हैं, तो वे भ्रमित हो जाते हैं। यदि आप उन्हें 7 देते हैं, तो वे क्रैश हो जाते हैं।

AVD समाधान: AVD को एक ऑर्केस्ट्रा के लचीले कंडक्टर के रूप में सोचें।

  • पुराना तरीका: कंडक्टर केवल 5-सदस्यीय बैंड का नेतृत्व करना जानता है। यदि एक वायलिन वादक चला जाता है, तो संगीत रुक जाता है।
  • AVD तरीका: कंडक्टर तुरंत अनुकूलित हो सकता है। यदि कोई संगीतकार कमरे में आता है या बाहर जाता है, तो कंडक्टर तुरंत चलते-फिरते शीट म्यूजिक को व्यवस्थित कर देता है। AVD समन्वय की एक "सार्वभौमिक भाषा" सीखता है जो तब भी काम करती है जब वहां 2 ट्रक हों या 20। इसे इस बात की परवाह नहीं है कि कमरे में कितने एजेंट हैं; यह बस जानता है कि उन्हें मिलकर काम करने के लिए कैसे प्रेरित करना है।

2. "क्लोन" की समस्या: हर कोई एक ही काम कर रहा है

समस्या: इन ट्रकों को कुशलतापूर्वक सिखाने के लिए, कंप्यूटर वैज्ञानिक अक्सर उन्हें बिल्कुल एक जैसा "मस्तिष्क" (साझा नीति/shared policy) देते हैं। यह सीखने की गति के लिए तो अच्छा है, लेकिन इसका एक दुष्प्रभाव है: समरूपता (Homogenization)
क्लोनों के एक समूह की कल्पना करें। यदि वे सभी कॉफी शॉप पर लोगों की भीड़ देखते हैं, तो वे सभी एक ही समय में उसी कॉफी शॉप की ओर दौड़ने का निर्णय लेते हैं। वे अंततः एक-दूसरे से टकराते हैं, दरवाजे को अवरुद्ध करते हैं, और एक-दूसरे के रास्ते में बाधा बनते हैं। वे इतने समान होते हैं कि वे एक टीम के बजाय एक ट्रैफिक जाम बन जाते हैं।

AVD समाधान: AVD एक "अराजकता की चिंगारी" (Spark of Chaos) पेश करता है।

  • यह प्रत्येक ट्रक को उसके निर्णय लेने की प्रक्रिया में एक छोटा, यादृच्छिक (random) "धक्का" देता है।
  • कल्पना करें कि सभी ट्रक एक ही तरह की वर्दी पहनते हैं, लेकिन AVD गुप्त रूप से उन्हें थोड़ी अलग रंग की टोपियाँ देता है।
  • जब वे एक ही भीड़ को देखते हैं, तो लाल टोपी वाला ट्रक सोच सकता है, "मैं कॉफी शॉप जाऊंगा," जबकि नीली टोपी वाला ट्रक सोच सकता है, "वास्तव में, मैं पास की बेकरी देख लूंगा।"
  • यह सूक्ष्म अंतर उन्हें एक ही स्थान पर झपटकर भीड़ लगाने से रोकता है, जिससे यह सुनिश्चित होता है कि वे फैल जाएं और अधिक कुशलता से क्षेत्र को कवर करें।

3. "ट्रैफिक जाम" की समस्या: कार्यों में अलग-अलग समय लगता है

समस्या: वास्तविक जीवन में, बाइक पहुँचाना तत्काल नहीं होता है। एक ट्रक शायद 1 मील दूर एक स्टेशन पर 5 बाइक ले जा रहा हो (जिसमें 10 मिनट लगते हैं)। दूसरा शायद 5 मील दूर 2 बाइक ले जा रहा हो (जिसमें 30 मिनट लगते हैं)।
पुराने सिस्टम आमतौर रूप से अगले कदम उठाने से पहले सभी को रुकने और प्रतीक्षा करने के लिए मजबूर करते हैं। यह एक रिले रेस की तरह है जहाँ दौड़ खत्म होने तक बैटन (baton) नहीं दिया जा सकता जब तक कि सभी अपना चक्कर पूरा न कर लें, भले ही कुछ धावक पहले ही समाप्त कर चुके हों।

AVD समाधान: AVD एक "निरंतर प्रवाह" (Continuous Flow) रणनीति का उपयोग करता है।

  • सभी के समाप्त होने की प्रतीक्षा करने के बजाय, सिस्टम ट्रकों को मुक्त होते ही निर्णय लेने की अनुमति देता है।
  • यदि ट्रक A अपना काम 10 मिनट में पूरा कर लेता है, तो उसे तुरंत एक नया कार्य मिल जाता है। ट्रक B, अभी भी ड्राइविंग कर रहा है, ड्राइविंग जारी रखता है।
  • सिस्टम उन्हें एसिंक्रोनस (asynchronously) रूप से समन्वित करता है, जैसे एक व्यस्त रसोई जहाँ शेफ डिश को प्लेट करने से पहले डिशवॉशर के पूरे लोड को समाप्त करने की प्रतीक्षा नहीं करता है। वे बस प्रवाह को चालू रखते हैं।

परिणाम: एक सुचारू शहर

शोधकर्ताओं ने इस प्रणाली का परीक्षण लंदन और वाशिंगटन, डी.सी. के बाइक-शेयरिंग कार्यक्रमों के वास्तविक डेटा का उपयोग करके किया।

  • परीक्षण: उन्होंने बाइक किराए पर लेने और वापस करने के हजारों दिनों का अनुकरण किया।
  • विजेता: AVD ने अन्य किसी भी विधि की तुलना में वहां अधिक बाइक पहुँचाईं जहाँ उनकी आवश्यकता थी।
  • सुपरपावर: जब उन्होंने सिस्टम को 4 ट्रकों के साथ प्रशिक्षित किया और फिर बिना पुन: प्रशिक्षण के इसे केवल 3 ट्रकों के साथ परीक्षण किया, तब भी यह अद्भुत रूप से काम करता रहा। इसने केवल टीम के विशिष्ट संख्या को नहीं, बल्कि टीम वर्क की अवधारणा को सीखा।

संक्षेप में

यह शोध पत्र संसाधनों को प्रबंधित करने का एक स्मार्ट तरीका प्रस्तुत करता है। यह कंप्यूटर को ऐसी टीमें प्रबंधित करना सिखाता है जो आकार बदलती रहती हैं, क्लोन की तरह व्यवहार करने से बचती हैं, और काम में अलग-अलग समय लगने के बावजूद चलते रहते हैं। यह एक कठोर, रुक-रुक कर चलने वाले ट्रैफिक लाइट सिस्टम से एक स्मार्ट, बहती हुई नदी में अपग्रेड करने जैसा है जो इलाके के अनुसार खुद को ढाल लेती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →