← नवीनतम पेपर
🤖 machine learning

DGLight: DQN-Guided GRPO Fine-Tuning of Large Language Models for Traffic Signal Control

यह शोध पत्र DGLight को प्रस्तुत करता है, जो एक नवीन ढांचा है जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (Group Relative Policy Optimization) को निर्देशित करने के लिए डीप क्यू-नेटवर्क (Deep Q-Network) क्रिटिक का लाभ उठाकर ट्रैफिक सिग्नल नियंत्रण के लिए एक प्रीट्रेन्ड लार्ज लैंग्वेज मॉडल को फाइन-ट्यून करता है, जिसके परिणामस्वरूप एक ऐसी प्रणाली प्राप्त होती है जो व्याख्या योग्य तर्क ट्रेसेस (interpretable reasoning traces) प्रदान करते हुए LLM-आधारित नियंत्रकों के बीच अत्याधुनिक प्रदर्शन प्राप्त करती है।

मूल लेखक: Chenbo Yu

प्रकाशित 2026-04-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenbo Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक व्यस्त शहर के चौराहे की कल्पना एक अराजक डांस फ्लोर के रूप में करें। कारें नर्तकों की तरह हैं जो अंदर आने और बाहर जाने की कोशिश कर रही हैं, लेकिन यदि हर कोई एक साथ नाचने की कोशिश करता है, तो वे आपस में टकरा सकते हैं, जिससे ट्रैफिक जाम लग सकता है। "ट्रैफिक सिग्नल कंट्रोलर" वह डीजे (DJ) है जो तय करता है कि किसे नाचना है (जाना) और किसे इंतज़ार करना है (रुकना)।

लंबे समय तक, डीजे दो मुख्य तरीकों का उपयोग करते थे:

  1. मेट्रोनोम डीजे (फिक्स्ड-टाइम): वे हर 30 सेकंड में एक ही बीट बजाते हैं, चाहे फ्लोर पर कितने भी लोग हों। यह सरल है, लेकिन यदि भीड़ बहुत बड़ी हो जाती है, तो वे खुद को ढाल नहीं पाते।
  2. अनुभवी मानव डीजे (पारंपरिक आरएल - Traditional RL): यह डीजे भीड़ को देखता है और गलतियों से सीखता है। वे समय के साथ बेहतर होते हैं, लेकिन वे अक्सर "ब्लैक बॉक्स" होते हैं। आप उनसे पूछ नहीं सकते कि उन्होंने एक विशिष्ट बीट क्यों चुनी, और यदि आप उन्हें एक अलग क्लब (एक अलग शहर) में ले जाते हैं, तो वे भ्रमित हो सकते हैं क्योंकि उन्होंने पहले क्लब के विशिष्ट माहौल को सीखा था।

DGLight से मिलिए: एक "अनुभवी कोच" के साथ "स्मार्ट इंटर्न"

यह पेपर एक लार्ज लैंग्वेज मॉडल (LLM) का उपयोग करके ट्रैफिक सिग्नल कंट्रोलर को प्रशिक्षित करने का एक नया तरीका, DGLite पेश करता है—जो मूल रूप से एक सुपर-स्मार्ट एआई (AI) है जो लिखने और तर्क करने में माहिर है।

यहाँ बताया गया है कि DGLight कैसे काम करता है, एक सरल उपमा का उपयोग करते हुए:

1. छात्र (The LLM)

LLM को एक प्रतिभाशाली इंटर्न के रूप में समझें जो यह समझाने के लिए एक विस्तृत रिपोर्ट लिख सकता है कि उन्होंने एक निर्णय क्यों लिया। "मैं देख रहा हूँ कि पूर्व दिशा वाली लेन जाम है, इसलिए मैं पूर्व दिशा के ट्रैफिक को जाने दूँगा।" यह बहुत अच्छा है क्योंकि, "ब्लैक बॉक्स" डीजे के विपरीत, आप इंटर्न के नोट्स पढ़ सकते हैं और उनके तर्क को समझ सकते हैं। हालाँकि, यह इंटर्न ट्रैफिक के मामले में नया है; वे लिखना जानते हैं लेकिन वे शहर चलाना नहीं जानते।

2. कोच (The DQN Critic)

इंटर्न को सिखाने के लिए, शोधकर्ताओं ने एक "अनुभवी कोच" को काम पर रखा है। यह कोच एक पारंपरिक एआई (CoLight नामक विधि पर आधारित एक डीप क्यू-नेटवर्क - Deep Q-Network) है जिसने एक विशिष्ट शहर (हांग्जो) में वर्षों तक ट्रैफिक को देखा है। यह कोच इस बात का विशेषज्ञ है कि ठीक अभी कौन सा सिग्नल चरण भीड़ को कम करेगा।

3. ट्रेनिंग कैंप (दो चरणों वाली प्रक्रिया)

DGLight का जादू दो चरणों में होता है:

  • चरण 1: कोच को प्रमाणित किया जाता है। सबसे पहले, अनुभवी कोच को वास्तविक ट्रैफिक डेटा पर प्रशिक्षित किया जाता है जब तक कि वह यह अनुमान लगाने में विशेषज्ञ न बन जाए कि कौन सा सिग्नल विकल्प सबसे अच्छा है।
  • चरण 2: इंटर्न कोच से सीखता है। अब, इंटर्न (LLM) अभ्यास करना शुरू करता है।
    • इंटर्न ट्रैफिक की स्थिति को देखता है और एक योजना लिखता है: "मुझे लगता कि हमें उत्तर दिशा के ट्रैफिक को जाने देना चाहिए क्योंकि..."
    • यह देखने के बजाय कि क्या वास्तव में ट्रैफिक कम हो जाता है (जिसमें बहुत समय लगता है और सीखना धीमा होता है), कोच तुरंत इंटर्न की योजना को देखता है और उसे एक स्कोर देता है। "अच्छा प्लान, +10 अंक!" या "खराब प्लान, -5 अंक।"
    • इंटर्न इन स्कोर का उपयोग करके सीखता है। क्योंकि कोच हर संभावित चाल के लिए एक स्कोर देता है (न कि केवल उस चाल के लिए जो हुई), इंटर्न बहुत तेज़ी से और गहराई से सीखता है।

यह विशेष क्यों है?

1. यह मानव भाषा बोलता है (व्याख्यात्मकता - Interpretability)
अधिकांश ट्रैफिक एआई केवल एक नंबर आउटपुट करते हैं (जैसे, "फेज 2 पर स्विच करें")। DGLight एक वाक्य आउटपुट करता है: "मैं फेज 2 पर स्विच कर रहा हूँ क्योंकि पूर्व दिशा वाली लेन में लंबी कतार है।" यह एक ट्रैफिक कंट्रोलर की तरह है जो अपने तर्क को सरल अंग्रेजी (या भाषा) में समझाता है।

2. यह एक स्मार्ट जनरलिस्ट है (स्थानांतरणीयता - Transferability)
आमतौर पर, यदि आप एक ट्रैफिक एआई को शहर A में प्रशिक्षित करते हैं, तो वह शहर B में विफल हो जाता है। लेकिन क्योंकि DGLight ट्रैफिक के तर्क (कि कतारों और देरी के बारे में कैसे तर्क किया जाए) को सीखता है न कि केवल शहर A की सड़कों को रटता है, यह पूरी तरह से नए शहरों (जैसे जिनान) में आश्चर्यजनक रूप से अच्छा काम करता है जिसे कोच ने कभी देखा भी नहीं था। यह एक ऐसे इंटर्न की तरह है जो भीड़ नियंत्रण के सिद्धांतों को सीखता है, ताकि वह एक नए शहर में पार्टी का प्रबंधन करने के लिए सब कुछ फिर से सीखने की आवश्यकता के बिना कर सके।

3. यह पुराने दिग्गजों से बेहतर है
पेपर ने "मेट्रोनोम" विधियों और "अनुभवी मानव डीजे" विधियों के विरुद्ध DGLight का परीक्षण किया।

  • परिणाम: भाषा का उपयोग करने वाले सभी एआई तरीकों में से DGLight सबसे अच्छा था।
  • परिणाम: यह सबसे मजबूत पारंपरिक ट्रैफिक एआई के बराबर था, और कभी-कभी उससे भी बेहतर था, जिसमें निर्णय समझाने की अतिरिक्त क्षमता भी थी।

उन्होंने क्या नहीं किया?

पेपर बहुत सावधानी से कहता है कि यह क्या नहीं है।

  • यह एक जादुई छड़ी नहीं है जो ट्रैफिक को हमेशा के लिए हल कर देगी।
  • इसका परीक्षण अभी वास्तविक दुनिया के लाइव ट्रैफिक पर नहीं किया जा रहा है (केवल सिमुलेशन में)।
  • "कोच" को एक शहर पर प्रशिक्षित किया गया था, लेकिन "इंटर्न" ने सामान्यीकरण (generalize) करना सीखा। पेपर नोट करता है कि हालांकि इंटर्न नए शहरों में अच्छा है, लेकिन वह पूर्ण नहीं है, और सिस्टम अभी भी कोच के प्रारंभिक प्रशिक्षण पर निर्भर करता है।

निचोड़ (The Bottom Line)

DGLight एक ऐसा सिस्टम है जो एक स्मार्ट, बोलने वाले एआई को एक पारंपरिक ट्रैफिक विशेषज्ञ की देखरेख में अभ्यास कराकर ट्रैफिक लाइट को नियंत्रित करना सिखाता है। परिणाम एक ऐसा कंट्रोलर है जो विशेषज्ञों जितना स्मार्ट है लेकिन साथ ही आपको बता भी सकता है कि उसने अपने चुनाव क्यों किए, जिससे यह शहर के ट्रैफिक को प्रबंधित करने के लिए एक अधिक विश्वसनीय और अनुकूलनीय उपकरण बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →