← नवीनतम पेपर
🤖 AI

OracleTSC: Oracle-Informed Reward Hurdle and Uncertainty Regularization for Traffic Signal Control

OracleTSC एक नवीन ढांचा है जो रिवॉर्ड हर्डल मैकेनिज्म और अनिश्चितता नियमितीकरण (uncertainty regularization) को पेश करके बड़े भाषा मॉडलों का उपयोग करके ट्रैफिक सिग्नल नियंत्रण के लिए सुदृढीकरण फाइन-ट्यूनिंग (reinforcement fine-tuning) को स्थिर करता है, जिससे पारदर्शी, प्राकृतिक भाषा निर्णय लेने की क्षमता बनाए रखते हुए यातायात दक्षता और क्रॉस-इंटरसेक्शन सामान्यीकरण में महत्वपूर्ण सुधार प्राप्त होता है।

मूल लेखक: Darryl Jacob, Xinyu Liu, Muchao Ye, Xiaoyong Yuan, Pan He

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Darryl Jacob, Xinyu Liu, Muchao Ye, Xiaoyong Yuan, Pan He

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, सुशिक्षित रोबोट (एक लार्ज लैंग्वेज मॉडल) को ट्रैफिक लाइट कंट्रोलर बनना सिखाने की कोशिश कर रहे हैं। वह रोबोट कहानियाँ लिखने और सवालों के जवाब देने में माहिर है, लेकिन जब बात ट्रैफिक कंट्रोल करने की आती है, तो यह वैसा ही है जैसे किसी लाइब्रेरियन को स्टीयरिंग व्हील थमा देना: उसे नियम तो पता हैं, लेकिन उसे वास्तविक समय (real-time) में गाड़ी चलाना नहीं आता।

समस्या यह है कि ट्रैफिक कंट्रोल करना एक "लंबी अवधि का खेल" (long game) है। अगर रोबोट कोई गलत निर्णय लेता है, तो ट्रैफिक जाम तुरंत नहीं होता; यह मिनटों में धीरे-धीरे बनता है। जब तक रोबोट को एहसास होता है, "ओह नहीं, मैंने बैकअप पैदा कर दिया," तब तक नुकसान हो चुका होता है। इस वजह से रोबोट के लिए यह सीखना मुश्किल हो जाता है कि क्या काम करता है और क्या नहीं।

इस शोध पत्र के लेखकों ने, OracleTSC, इस रोबोट को सिखाने की दो मुख्य समस्याओं को ठीक करने के लिए एक नया प्रशिक्षण सिस्टम बनाया है:

1. "शोर" (Noise) की समस्या: कमजोर संकेतों को फ़िल्टर करना

उपमा: कल्पना कीजिए कि आप एक कोच की बात सुनकर गोल्फ सीखना चाह रहे हैं जो तब भी "अच्छा शॉट" फुसफुसाता है जब आपने गेंद को रेत के गड्ढे (sand trap) में मार दिया हो, और "बुरा शॉट" कहता है जब आपने होल-इन-वन किया हो। आप कभी नहीं सीख पाएंगे!

ट्रैफिक में, सिग्नल में अधिकांश बदलाव केवल बहुत मामूली अंतर पैदा करते हैं (शायद 1 या 2 कारें तेज़ चलें)। सीखने वाले रोबोट के लिए, ये छोटे बदलाव रैंडम शोर की तरह दिखते हैं। रोबोट भ्रमित हो जाता है और बार-बार वही छोटी, अप्रभावी चीजें करता रहता है।

समाधान: "रिवॉर्ड हर्डल" (Reward Hurdle)
लेखकों ने एक "हर्डल" (बाधा/ऊँची कूद की छड़) पेश की है। इसे एक ऊँची कूद की छड़ की तरह समझें।

  • यदि रोबलेट का एक्शन एक बहुत छोटा हर्डल पार करता है (यानी ट्रैफिक में बहुत मामूली सुधार), तो सिस्टम कहता है, "यह काफी नहीं है। और बेहतर प्रयास करो।" यह वास्तव में रोबोट को कमजोर चालें चलने के लिए दंडित (penalize) करता है।
  • केवल तभी जब रोबोट एक ऊँचा हर्डल पार करता है (जैसे कि कारों की एक बड़ी कतार को हटा देना), तो उसे "अच्छा काम किया!" वाला रिवॉर्ड मिलता है।
  • परिणाम: रोबोट छोटे, बेकार बदलावों पर समय बर्बाद करना बंद कर देता है और साहसी, प्रभावी कदम उठाना सीख जाता है जो वास्तव में ट्रैफिक को साफ करते हैं।

2. "भ्रम" (Confusion) की समस्या: रोबोट को खुद पर संदेह करने से रोकना

उपमा: कल्पना कीजिए कि एक रोबोट यह तय करने की कोशिश कर रहा है कि कौन सा दरवाजा खोलना है।

  • पहले: वह सोचता है, "शायद दरवाजा A? नहीं, शायद दरवाजा B? रुको, फिर से दरवाजा A? वास्तव में, दरवाजा C?" वह खुद से ही गोल-गोल बातें करता है, हर सेकंड अपना मन बदलता रहता है। इसे "रीजनिंग ड्रिफ्ट" (reasoning drift) कहा जाता है।
  • बाद में: वह स्थिति को देखता है, दरवाजा A चुनता है, और उसी पर टिका रहता है।

समाधान: "कॉन्फिडेंस पेनल्टी" (Confidence Penalty)
शोधकर्ताओं ने देखा कि जब रोबोट अनिश्चित होता था, तो वह एक ही ट्रैफिक स्थिति के लिए अलग-अलग स्पष्टीकरण (explanations) उत्पन्न करता था (जैसे, एक विचार में "उत्तर की ओर जाओ" और अगले में "दक्षिण की ओर जाओ")। यह असंगति रोबोट को अस्थिर बनाती है।

उन्होंने एक नियम जोड़ा जो रोबोट को दंडित करता है यदि वह खुद से सहमत नहीं हो पाता।

  • वे रोबोट को एक ही ट्रैफिक जाम के लिए 8 अलग-अलग उत्तर उत्पन्न करने के लिए कहते हैं।
  • यदि उत्तर इधर-उधर बिखरे हुए हैं (उच्च "एंट्रॉपी" या भ्रम), तो रोबोट को दंड मिलता है।
  • यदि रोबोट लगातार एक ही फेज (चरण) चुनता है (कम एंट्रॉपी), तो उसे बोनस मिलता है।
  • परिणाम: रोबोट निर्णायक बनना सीख जाता है। वह डगमगाना बंद कर देता है और एक स्पष्ट, सुसंगत योजना चुनता है।

बड़े परिणाम

जब उन्होंने इस नए सिस्टम (OracleTSC) का परीक्षण वास्तविक दुनिया के ट्रैफिक सिमुलेशन पर किया:

  • यह तेज़ी से काम कर गया: उन्होंने एक अपेक्षाकृत छोटा, कॉम्पैक्ट रोबोट ब्रेन (LLaMA3-8B) इस्तेमाल किया और इसने कई विशेष, "ब्लैक बॉक्स" AI सिस्टमों की तुलना में बेहतर ट्रैफिक कंट्रोल करना सीखा, जो अपने निर्णयों की व्याख्या नहीं कर सकते।
  • ट्रैफिक बेहतर हुआ: बिना प्रशिक्षित रोबोट की तुलना में यात्रा के समय में 75% की कमी आई, और कारों की कतारों (queues) की लंबाई में 67% की गिरावट आई।
  • यह अनुकूलन में स्मार्ट था: उन्होंने रोबोट को एक विशिष्ट चौराहे (जैसे एक साधारण क्रॉसरोड) पर प्रशिक्षित किया और फिर उसे पूरी तरह से अलग, जटिल चौराहे (जैसे एक व्यस्त जर्मन शहर का चौक) पर भेजा। बिना किसी अतिरिक्त प्रशिक्षण के, रोबोट ने उस नए स्थान को लगभग उतना ही अच्छा संभाला जितना कि उसे वहां विशेष रूप से प्रशिक्षित किया गया होता।

यह क्यों महत्वपूर्ण है

आज के अधिकांश ट्रैफिक AI "ब्लैक बॉक्स" हैं—वे काम तो करते हैं, लेकिन कोई नहीं जानता कि उन्होंने एक विशिष्ट सिग्नल क्यों चुना। यदि वे कोई गलती करते हैं, तो हम उनसे पूछ नहीं सकते, "आपने ऐसा क्यों किया?"

OracleTSC अलग है। क्योंकि यह एक लार्ज लैंग्वेज मॉडल का उपयोग करता है, यह अपने निर्णयों के बारे में बात कर सकता है।

  • प्रशिक्षण से पहले: रोबोट का तर्क अव्यवस्थित, विरोधाभासी और "रुको, शायद..." से भरा था।
  • प्रशिक्षण के बाद: रोबोट स्पष्ट, चरण-दर-चरण स्पष्टीकरण देता है: "चरण 1: उत्तर दिशा की ओर 38 कारें प्रतीक्षा कर रही हैं। चरण 2: मैं कतार को साफ करने के लिए उत्तर की ओर की लाइट हरी करूँगा।"

संक्षेप में: OracleTSC ट्रैफिक कंट्रोल करने वाले रोबोटों को साहसी (छोटे, कमजोर सुधारों को अनदेखा करके) और आत्मविश्वासी (खुद पर संदेह करने से रुककर) बनना सिखाता है, जिसके परिणामस्वरूप सुचारू ट्रैफिक और एक ऐसा रोबोट मिलता है जिससे आप वास्तव में पूछ सकते हैं, "आपने ऐसा क्यों किया?"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →