← नवीनतम पेपर
💻 computer science

GAT-MAPPO-EIG: A Graph Attention Multi-Agent Reinforcement Learning Framework for Escape Interdiction Games on Dynamic Transportation Networks

यह शोध पत्र GAT-MAPPO-EIG प्रस्तावित करता है, जो एक ग्राफ अटेंशन मल्टी-एजेंट प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन फ्रेमवर्क है, जो पारंपरिक रूप से महंगी अनुकूलन विधियों पर निर्भर हुए बिना समन्वित इंटरसेप्शन रणनीतियों को सीखने के माध्यम से बड़े पैमाने के, गतिशील एस्केप इंटरडिक्शन गेम्स को कुशलतापूर्वक हल करने के लिए डीप रिइन्फोर्समेंट लर्निंग का लाभ उठाता है।

मूल लेखक: Sukanya Samanta

प्रकाशित 2026-09-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sukanya Samanta

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक आधुनिक शहर की हलचल भरी धमनियों में, जहाँ सड़कें एक विशाल, परस्पर जुड़े जाल का निर्माण करती हैं, उन लोगों के बीच एक निरंतर तनाव बना रहता है जो स्वतंत्र रूप से घूमना चाहते हैं और उन्हें रोकने के लिए तैनात किए गए लोगों के बीच। यह 'एस्केप इंटरडिक्शन' (पलायन अवरोधन) का क्षेत्र है, जो शहरी सुरक्षा के लिए एक महत्वपूर्ण चुनौती है जहाँ कानून प्रवर्तन को यह निर्णय लेना होता है कि वे सीमित गश्ती इकाइयों को कैसे तैनात करें ताकि अपराधी के नेटवर्क के माध्यम से निकल भागने से पहले उसे पकड़ा जा सके। दशकों तक, इस पहेली को सुलझाने के लिए भारी गणितीय यंत्रों पर निर्भर रहना पड़ा, जिसमें शहर को एक स्थिर मानचित्र माना जाता था और अपराधी द्वारा लिए जाने वाले हर संभावित मार्ग की गणना की जाती थी। ये पारंपरिक तरीके आदर्श रणनीति तो खोज सकते थे, लेकिन वे इतने गणनात्मक रूप से कठिन थे कि जब शहर बड़ा हो जाता या स्थिति वास्तविक समय में बदल जाती, तो वे अक्सर विफल हो जाते थे। वे एक विशाल जिग्सॉ पहेली को हर एक टुकड़े को हर एक स्थान पर रखकर परीक्षण करने की कोशिश करने के समान थे, एक ऐसी प्रक्रिया जो टुकड़ों की संख्या बढ़ने के साथ असंभव हो जाती थी।

इन सीमाओं को दूर करने के लिए, टोक्यो विश्वविद्यालय के एक शोधकर्ता, सुकन्या सामंत ने एक नया दृष्टिकोण विकसित किया है जो कंप्यूटर को केवल गणना करने के बजाय खेल को सीखना सिखाता है। यह नया ढांचा, जिसे GAT-MAPPO-EIG कहा जाता है, शहर को केवल निर्देशांकों की एक सूची के रूप में नहीं, बल्कि एक जीवित ग्राफ के रूप में देखता है जहाँ चौराहे और सड़कें संबंधों और महत्व रखते हैं। कंप्यूटर को हर नए परिदृश्य के लिए जटिल समीकरणों को हल करने के लिए मजबूर करने के बजाय, यह प्रणाली एक प्रकार के कृत्रिम बुद्धिमत्ता (AI) का उपयोग करती है जो नेटवर्क के आकार का अवलोकन करती है और अनुभव से सीखती है। यह एक सिम्युलेटेड अपराधी को पुलिस अधिकारियों की एक टीम के विरुद्ध खड़ा करती है, जिससे वे हजारों परिदृश्यों को तब तक खेलते हैं जब तक कि अधिकारी अपनी गतिविधियों के समन्वय के सबसे प्रभावी तरीकों को नहीं सीख लेते और अपराधी पकड़ से बचने के सर्वोत्तम तरीकों को नहीं सीख लेता। इसका परिणाम यह है कि इस प्रणाली को हर बार निर्णय लेने की आवश्यकता होने पर पूरे शहर के मानचित्र की पुनर्गणना करने की आवश्यकता नहीं होती है; इसके बजाय, यह उन पैटर्न पर निर्भर करती है जिन्हें इसने पहले ही सीख लिया है, जिससे यह शहर के पैमाने पर वास्तविक समय में काम करने के लिए पर्याप्त तेज़ हो जाती है।

इस नवाचार का मूल इस बात में निहित है कि कंप्यूटर शहर को कैसे समझता है। पारंपरिक तरीके अक्सर प्रत्येक सड़क खंड को समान मानते हैं, जिससे इस तथ्य की अनदेखी हो जाती है कि कुछ चौराहे अन्य की तुलना में कहीं अधिक महत्वपूर्ण होते हैं। यह नया ढांचा एक विशेष उपकरण का उपयोग करता है जिसे 'ग्राफ अटेंशन नेटवर्क' कहा जाता है, जो प्रणाली को मानचित्र के सबसे महत्वपूर्ण हिस्सों पर ध्यान केंद्रित करने की अनुमति देता है। नेटवर्क को कनेक्शनों के एक जाल के रूप में कल्पना करें; प्रणाली कुछ कनेक्शनों को दूसरों की तुलना में अधिक भार देने के लिए सीखती है, जिससे यह पहचान पाती है कि कौन से चौराहे रणनीतिक बाधाएं या संभावित पलायन मार्ग हैं। इन प्रमुख क्षेत्रों पर ध्यान केंद्रित करके, प्रणाली शहर की वास्तविक संरचना को पकड़ने वाली एक मानसिक प्रस्तुति बनाती है। इस प्रस्तुति को फिर एक मल्टी-एजेंट लर्निंग सिस्टम में फीड किया जाता है, जहाँ कई पुलिस अधिकारी एक टीम के रूप में कार्य करते हैं। उन्हें एक केंद्रीय वातावरण में एक साथ प्रशिक्षित किया जाता है जहाँ वे जानकारी साझा कर सकते हैं, लेकिन जब कार्य करने का समय आता है, तो प्रत्येक अधिकारी केवल वही निर्णय लेता है जो वह स्थानीय रूप से देख सकता है। यह उन्हें निरंतर संचार करने की आवश्यकता के बिना पूर्ण समन्वय में कार्य करने की अनुमति देता है, ठीक वैसे ही जैसे एक अच्छी तरह से प्रशिक्षित टीम जो एक-दूसरे की चालों का अनुमान लगाती है।

शोधकर्ताओं ने इस दृष्टिकोण का परीक्षण सिंथेटिक ग्रिड नेटवर्क और कोलकाता के मध्य भाग के एक वास्तविक परिवहन मानचित्र पर किया, जो जटिल सड़क पैटर्न वाला एक घना शहरी वातावरण है। उन्होंने अपने नए लर्निंग-आधारित सिस्टम की तुलना पुराने, भारी गणितीय तरीकों और अन्य सरल लर्निंग एल्गोरिदम से की। परिणामों ने दिखाया कि नया ढांचा सिम्युलेटेड अपराधी को लगभग उतनी ही बार पकड़ सकता है जितना कि आदर्श गणितीय समाधान, फिर भी इसने बहुत कम समय में ऐसा किया। जबकि विशिष्ट सटीक अनुकूलन बेसलाइन (MILP-EIGS) को कोलकाता नेटवर्क के लिए एक एकल रणनीति की गणना करने में बारह घंटे से अधिक का समय लगा, इस नई प्रणाली ने अपना निर्णय मात्र पांच मिलीसेकंड में ले लिया। गति का यह विशाल अंतर यह सुनिश्चित करता है कि इस प्रणाली को सैद्धांतिक रूप से वास्तविक समय में तैनात किया जा सकता है, जो बदलते यातायात की स्थितियों या नई अपराध रिपोर्टों के अनुसार तुरंत अनुकूलित हो सकता है। इसके अलावा, इस प्रणाली ने पिछले लर्निंग तरीकों की तुलना में अपने रक्षकों की टीम को बहुत बेहतर ढंग से समन्वय करना सीखा, जिससे इसकी सफलता दर आदर्श गणितीय समाधान के एक प्रतिशत के भीतर रही।

महत्वपूर्ण रूप से, यह शोध पत्र प्रदर्शित करता है कि इस दृष्टिकोण के लिए कंप्यूटर को हर बार स्थिति बदलने पर अंतर्निहित गणितीय समस्या को लगातार हल करने की आवश्यकता नहीं होती है। एक बार प्रशिक्षित होने के बाद, यह प्रणाली शहर के एक नए विन्यास को देख सकती है और तुरंत सुझाव दे सकती है कि अधिकारियों को कहाँ जाना चाहिए, जिससे धीमी और दोहराव वाली गणनाओं की आवश्यकता समाप्त हो जाती है। अध्ययन पुष्टि करता है कि नेटवर्क संरचनाओं को समझने की क्षमता और अनुभव से सीखने की शक्ति को जोड़कर, ऐसी सुरक्षा रणनीतियाँ बनाना संभव है जो अत्यधिक प्रभावी और आधुनिक शहरों की गतिशील वास्तविकता के लिए पर्याप्त तेज़ हों। निष्कर्ष बताते हैं कि यह विधि बड़े पैमाने पर शहरी सुरक्षा के लिए एक व्यावहारिक मार्ग प्रदान करती है, जो कठोर गणनाओं से हटकर अनुकूलन योग्य, बुद्धिमान प्रणालियों की ओर बढ़ती है जो वास्तविक दुनिया के परिवहन नेटवर्क की जटिलता को संभाल सकती हैं। जबकि वर्तमान कार्य एक एकल अपराधी और रक्षकों की एक टीम पर केंद्रित है, शोधकर्ता नोट करते हैं कि भविष्य के अध्ययन इसे कई अपराधियों या अधिक जटिल, अप्रत्याशित यातायात स्थितियों को संभालने के लिए विस्तारित कर सकते हैं, जिससे इस उपकरण को वास्तविक दुनिया में तैनात करने के लिए और अधिक परिष्कृत किया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →