← नवीनतम पेपर
⚡ electrical engineering

Human-Centric Traffic Signal Control for Equity: A Multi-Agent Action Branching Deep Reinforcement Learning Approach

यह शोध पत्र MA2B-DDQN का प्रस्ताव करता है, जो एक मानव-केंद्रित मल्टी-एजेंट डीप रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो ट्रैफिक सिग्नल नियंत्रण को विघटित करने और यात्री-स्तर की समानता को अनुकूलित करने के लिए एक एक्शन-ब्रांचिंग आर्किटेक्चर का उपयोग करता है, जो मेलबर्न के विविध शहरी परिदृश्यों में विलंबित व्यक्तियों की संख्या में महत्वपूर्ण कमी प्रदर्शित करता है।

मूल लेखक: Xiaocai Zhang, Neema Nassir, Lok Sang Chan, Milad Haghani

प्रकाशित 2026-02-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaocai Zhang, Neema Nassir, Lok Sang Chan, Milad Haghani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक व्यस्त शहर की सड़क की कल्पना करें जो एक विशाल, जटिल डांस फ्लोर है। अभी, ट्रैफिक लाइट एक कठोर, प्री-रिकॉर्डेड प्लेलिस्ट बजाने वाले डीजे (DJ) की तरह है। वे एक टाइमर के अनुसार बदलते हैं, इस बात की परवाह किए बिना कि डांस फ्लोर लोगों से भरा हुआ है या लगभग खाली है। इससे अक्सर अराजकता पैदा होती है: कारें इंतज़ार में फंसी रहती हैं जबकि खाली लेन खाली पड़ी रहती है। और पैदल यात्री फुटपाथ पर फंसे रह जाते हैं।

आपके द्वारा साझा किया गया पेपर एक नए, स्मार्ट डीजे MA2B-DDQN को पेश करता है। एक निश्चित टाइमर का पालन करने के बजाय, यह डीजे वास्तविक समय में कमरे की आवाज़ सुनता है और इस आधार पर संगीत (ट्रैफिक सिग्नल) तय करता है कि वास्तव में वहां कौन मौजूद है और वे कितनी देर से इंतज़ार कर रहे हैं।

यहाँ बताया गया है कि यह नया सिस्टम कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. लक्ष्य: सभी के लिए निष्पक्षता, न कि केवल कारों के लिए

अधिकांश ट्रैफिक सिस्टम उन पार्टियों की तरह हैं जहाँ केवल वीआईपी (कारों) को ही ध्यान दिया जाता है। यदि एक कार फंसी हुई है, तो लाइट बदल जाती है। यदि एक पैदल यात्री इंतज़ार कर रहा है, तो उन्हें अक्सर अनदेखा कर दिया जाता है।

यह नया सिस्टम एक निष्पक्ष पार्टी होस्ट की तरह है। यह कमरे में हर किसी को गिनता है: कारों में बैठे लोग, बसों में बैठे लोग, साइकिल चालक और पैदल चलने वाले लोग। यदि 50 लोगों से भरी एक बस इंतज़ार कर रही है, तो सिस्टम इसे एक अकेले ड्राइवर वाली कार की तुलना में एक बड़ा "विलंब" (delay) मानेगा। लक्ष्य केवल कारों को तेज़ी से चलाना नहीं है; बल्कि यह सुनिश्चित करना है कि लोगों की कुल संख्या जो इंतज़ार कर रही है, वह यथासंका कम हो।

2. समस्या: बहुत सारे विकल्प

ट्रैफिक लाइट को नियंत्रित करना कठिन है क्योंकि एक साथ बहुत सारे निर्णय लेने होते हैं।

  • पुराना तरीका: कल्पना करें कि आप एक ही समय में 3 अलग-अलग चौराहों को नियंत्रित करने की कोशिश कर रहे हैं। प्रत्येक चौराहे के लिए, आपको निर्णय लेना होगा: "क्या लाइट लाल होनी चाहिए या हरी?" और "इसे कितनी देर तक हरा रहना चाहिए?" यदि आप एक साथ ये सभी निर्णय लेने की कोशिश करते हैं, तो यह रूबिक क्यूब (Rubik's cube) को सुलझाने और जग्लिंग करने के एक साथ प्रयास करने जैसा है। कंप्यूटर अभिभूत हो जाता है और गलतियाँ करता है।

3. समाधान: "ब्रांचिंग" रणनीति

लेखकों ने एक्शन ब्रांचिंग (Action Branching) नामक एक चतुर तकनीक का आविष्कार किया है। इसे एक जनरल (General) और उनके लेफ्टिनेंट (Lieutenants) के रूप में सोचें।

  • ग्लोबल एक्शन (द जनरल): एक "जनरल" होता है जो अगले दो चरणों (phases) की कुल अवधि तय करता है (जैसे, "अगले दो लाइटों का कुल समय 60 सेकंड होगा")। यह एक एकल, बड़ा निर्णय है जो सभी पर लागू होता है।
  • लोकल एक्शन्स (द लेफ्टिनेंट्स): एक बार जब जनरल कुल समय निर्धारित कर देता है, तो "लेफ्टिनेंट" (प्रत्येक विशिष्ट चौराहे पर एजेंट) उस समय को बांटने का निर्णय लेते हैं। उदाहरण के लिए, चौराहे A को कारों के लिए 40 सेकंड और पैदल यात्रियों के लिए 20 सेकंड मिल सकते हैं, जबकि चौराहे B को 30 और 30 सेकंड मिल सकते हैं।

निर्णय को "पूरा ब्लॉक कितना लंबा है?" और "हम उस समय को कैसे विभाजित करते हैं?" में विभाजित करके, सिस्टम अभिभूत होना बंद कर देता है। यह जटिल गणित को प्रबंधनीय बनाता है, जिससे AI तेज़ी से सीख पाता है और बेहतर निर्णय ले पाता है।

4. प्रशिक्षण: परीक्षण और त्रुटि से सीखना

यह सिस्टम डीप रीइन्फोर्समेंट लर्निंग (Deep Reinforcement Learning) नामक एक विधि का उपयोग करता है। एक छात्र की कल्पना करें जो वीडियो गेम खेलना सीख रहा है।

  • शुरुआत में, छात्र (AI) यादृच्छिक (random) चालें चलता है।
  • यदि वे ट्रैफिक में फंस जाते हैं, तो उन्हें "नकारात्मक स्कोर" (दंड) मिलता है।
  • यदि वे ट्रैफिक को सुचारू रूप से चलाते रहते हैं, तो उन्हें "सकारात्मक स्कोर" (पुरस्कार) मिलता है।
  • हजारों प्रयासों के बाद, छात्र सर्वोत्तम चालें सीख जाता है ताकि दंड से बचा जा सके।

इस पेपर में, "स्कोर" मानवीय विलंब (human delay) पर आधारित है। यदि किसी एक व्यक्ति (चाहे वह कार में हो या पैदल) को बहुत लंबे समय तक इंतज़ार करना पड़ता है, तो AI को भारी दंड दिया जाता है।

5. परिणाम: एक सुगम यात्रा

शोधकर्ताओं ने मेलबर्न, ऑस्ट्रेलिया में सात अलग-अलग ट्रैफिक परिदृश्यों में इस नए "जनरल और लेफ्टिनेंट" सिस्टम का परीक्षण किया। ये परिदृश्य शांत ऑफ-पीक समय से लेकर रश ऑवर, स्कूल ड्रॉप-ऑफ और यहाँ तक कि जाम जैसी स्थितियों तक फैले हुए थे।

उन्होंने इसकी तुलना निम्नलिखित से की:

  • फिक्स्ड टाइमर्स: पुराने ज़माने की लाइटें जो कभी नहीं बदलतीं।
  • अन्य AI सिस्टम: अन्य स्मार्ट ट्रैफिक सिस्टम जो "ब्रांचिंग" ट्रिक का उपयोग नहीं करते हैं या निष्पक्षता पर ध्यान केंद्रित नहीं करते हैं।

निष्कर्ष:

  • विजेता: MA2B-DDQN (नया सिस्टम) में लगातार लोगों के लिए सबसे कम कुल विलंब देखा गया। इसने किसी भी अन्य तरीके की तुलना में अधिक लोगों को चौराहे से तेज़ी से निकाला।
  • स्थिरता: यह सबसे विश्वसनीय भी था। जहाँ अन्य AI सिस्टम में कभी-कभी ट्रैफिक जाम के बड़े उछाल (जैसे रोलरकोस्टर) आते थे, वहीं इस सिस्टम ने ट्रैफिक प्रवाह को स्थिर और सुचारू रखा।
  • "डबल" बूस्ट: शोधकर्ताओं ने पाया कि एक विशिष्ट "डबल क्यू-नेटवर्क" (Double Q-Network) फीचर (अपने स्वयं के गणित की दोबारा जांच करने का एक तरीका) जोड़ने से सिस्टम और भी बेहतर हो गया, जिससे समान प्रणालियों की तुलना में त्रुटियां कम हुईं और प्रदर्शन में 16% तक सुधार हुआ।

सारांश

यह पेपर ट्रैफिक लाइट को नियंत्रित करने का एक नया तरीका प्रस्तुत करता है जो हर यात्री के साथ—चाहे वह कार में हो, बस में हो, या पैदल चल रहा हो—समान व्यवहार करता है। कई चौराहों को नियंत्रित करने के जटिल कार्य को "जनरल" (कुल समय निर्धारित करना) और "लेफ्टिनेंट" (समय को विभाजित करना) में तोड़कर, यह सिस्टम ट्रैफिक को बहुत अधिक कुशलता से प्रबंधित करना सीखता है। परिणाम एक अधिक निष्पक्ष, सुचारू और सड़क पर सभी के लिए कम निराशाजनक यात्रा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →