← नवीनतम पेपर
💻 computer science

Learning High-Level Decision Making with an Interaction-Aware Attention-Based Network in Autonomous Driving

यह शोध पत्र DecisionPerceiver का प्रस्ताव करता है, जो Perceiver IO से प्रेरित एक इंटरेक्शन-अवेयर अटेंशन-आधारित नेटवर्क है, जो जटिल, नेगोशिएशन-इंटेंस परिदृश्यों में स्वायत्त ड्राइविंग के लिए स्केलेबल, उच्च-प्रदर्शन निर्णय लेने हेतु डायनेमिक एजेंट फीचर्स को एक फिक्स्ड-साइज़ लेटेंट स्पेस में प्रोजेक्ट करता है।

मूल लेखक: Marcelo Contreras, Willi Poh, Christoph Stiller, Ehsan Hashemi

प्रकाशित 2026-07-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Marcelo Contreras, Willi Poh, Christoph Stiller, Ehsan Hashemi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सेल्फ-ड्राइविंग कार के कप्तान हैं, लेकिन आपके पास स्टीयरिंग व्हील के बजाय एक सुपर-स्मार्ट दिमाग है जिसे तय करना होता है: "क्या मैं रफ्तार बढ़ाऊं? क्या मैं लेन बदलूं? क्या मैं इंतजार करूं?" पेच यह है कि आपके आसपास का ट्रैफिक बहुत ही अस्त-व्यस्त है। कभी दो कारें होती हैं, तो कभी बीस, और वे सभी अलग-अलग गति से चल रही होती हैं।

लंबे समय तक, AI शोधकर्ताओं ने इसे "DeepSet" दृष्टिकोण का उपयोग करके हल करने की कोशिश की। इसे ऐसे समझें जैसे एक शिक्षक एक कक्षा में हर छात्र से उसका नाम चिल्लाकर बोलने को कहता है और फिर शिक्षक निर्णय लेने के लिए उन सभी नामों का औसत (average) ले लेता है। यह सरल है और छात्रों की किसी भी संख्या को संभाल सकता है, लेकिन यह थोड़ा अनाड़ी है। यह छात्रों के बीच हो रही विशिष्ट बातचीत को मिस कर देता है। यदि पीछे बैठा बच्चा आगे बैठे बच्चे पर चिल्ला रहा है, तो शिक्षक को केवल "शोर" सुनाई देता है और वह उस ड्रामे को नहीं समझ पाता। यह पेपर तर्क देता है कि इंटरसेक्शन (चौराहों) जैसे कठिन स्थितियों के लिए, जहाँ कारों को यह तय करने के लिए "नेगोशिएट" करना पड़ता है कि पहले कौन जाएगा, सब कुछ औसत निकालना काफी नहीं है।

दूसरी ओर, "Attention" मॉडल होते हैं। ये एक सुपर-फोकस्ड जासूस की तरह हैं जो हर एक कार और उनके बीच होने वाली हर एक बातचीत को एक साथ देखते हैं। यह ड्रामे को समझने के लिए बहुत अच्छा है, लेकिन यह थका देने वाला है। यदि आप कुछ और कारें जोड़ देते हैं, तो जासूस के दिमाग को बहुत अधिक काम करना पड़ता है—इतना अधिक कि वह धीमा और बोझिल हो जाता है। यह एक लाइब्रेरी में एक साथ हर किताब को पढ़ने की कोशिश करने जैसा है; यदि लाइब्रेरी का आकार दोगुना हो जाता है, तो आपका पढ़ने का समय चार गुना बढ़ जाता है। एक वास्तविक कार के लिए, जिसे तुरंत प्रतिक्रिया देने की आवश्यकता होती है, यह बहुत धीमा है।

यहाँ आता है पेपर का नया विचार: DecisionPerceiver।

लेखकों ने एक ऐसा सिस्टम बनाया है जो एक शानदार अनुवादक (translator) की तरह काम करता है। हर एक कार को सीधे सुनने (जो धीमा है) या उन सभी का औसत निकालने (जो बेवकूफी भरा है) के बजाय, कार आसपास के ट्रैफिक को एक विशेष, निश्चित आकार की "गुप्त भाषा" या लेटेंट स्पेस (latent space) में प्रोजेक्ट करती है। कल्पना कीजिए कि कार के पास एक छोटा, जादुई नोटबुक है जिसमें निश्चित संख्या में पन्ने हैं (मान लीजिए 4 पन्ने)। बाहर चाहे 5 कारें हों या 20, कार सबसे महत्वपूर्ण अंतःक्रियाओं (interactions) को उन 4 पन्नों पर जल्दी से सारांशित कर लेती है।

यह एक गेम-चेंजर है क्योंकि:

  1. यह ड्रामे को बनाए रखता है: यह अभी भी समझता है कि कारें आपस में कैसे व्यवहार कर रही हैं, जैसा कि "औसत निकालने" वाले तरीके में होता है।
  2. यह तेज़ रहता है: क्योंकि नोटबुक का आकार हमेशा एक जैसा रहता है, ट्रैफिक भारी होने पर कार धीमी नहीं होती। "जासूस" को और अधिक किताबें नहीं पढ़नी पड़तीं; वे बस उन 4 पन्नों को अपडेट करते हैं।

पेपर कार के "एक्शन मेनू" में भी एक चतुर बदलाव का सुझाव देता है। केवल "बाएं मुड़ें" या "तेज़ चलें" जैसे बड़े, अनाड़ी बटन रखने के बजाय, उन्होंने "आधा बाएं मुड़ें" या "थोड़ा तेज़ चलें" जैसे छोटे, सटीक बटन जोड़े हैं। इसे एक वीडियो गेम कैरेक्टर के अंतर के रूप में सोचें जो केवल बड़े, झटकेदार कदमों में चलता है बनाम वह जो सुचारू रूप से ग्लाइड कर सकता है। यह कार की गतिविधियों को बहुत अधिक सहज बनाता है, जिससे पहियों को चलाने वाले लो-लेवल कंट्रोल्स पर तनाव कम होता है।

उन्हें क्या पता चला?
शोधकर्ताओं ने कंप्यूटर सिमुलेशन (एक वर्चुअल दुनिया, अभी असली सड़कों पर नहीं) में हाईवे, एक जटिल इंटरसेक्शन और एक राउंडअबाउट के तीन अलग-अलग परिदृश्यों में इसका परीक्षण किया।

  • हाईवे पर: नया सिस्टम पुराने तरीकों की तुलना में बहुत तेज़ी से गाड़ी चलाना और दूसरों को ओवरटेक करना सीख गया। इसने अपने प्रशिक्षण के बहुत शुरुआती चरण में ही 28.5 m s⁻¹ की स्थिर गति प्राप्त कर ली, जबकि अन्य तरीकों को पकड़ बनाने में बहुत अधिक समय लगा।
  • इंटरसेक्शन पर: यहाँ "नेगोशिएशन" मायने रखता है। नया सिस्टम सबसे तेज़ था, जिसकी औसत गति 8.243 m s⁻¹ थी, जो विशेष रूप से LFFDS विधि से लगभग 15.4% तेज़ है। इसने ट्रैफिक के बीच से बिना टकराए निकलने का तरीका ढूंढ लिया।
  • राउंडअबाउट में: यहाँ ट्रैफिक थोड़ा सरल है। नया सिस्टम कुछ पुराने तरीकों की तुलना में कच्ची गति (raw speed) में थोड़ा धीमा (लगभग 9.951 m s⁻¹) था, लेकिन यह बहुत सुरक्षित था। अन्य तरीकों की तुलना में इसमें क्रैश होने या फंस जाने (early termination) की दर 5 गुना कम थी।

पेपर ने यह भी जांचा कि क्या यह सिस्टम भीड़ को संभाल सकता है। उन्होंने कारों की संख्या 5 से बढ़ाकर 20 कर दी। हालांकि कार थोड़ी धीमी हुई (गति में 15%–30% की गिरावट आई) क्योंकि ट्रैफिक अधिक घना और कठिन था, लेकिन सिस्टम विफल नहीं हुआ। यह लगातार काम करता रहा, जिससे साबित हुआ कि यह बिना क्रैश हुए स्केल (scale up) हो सकता है।

संक्षेप में, लेखक सुझाव देते हैं कि ट्रैफिक इंटरैक्शन को सारांशित करने के लिए इस "अनुवादक" नोटबुक का उपयोग करके और कार को दबाने के लिए अधिक सटीक बटन देकर, हम ऐसे सेल्फ-ड्राइविंग पॉलिसी बना सकते हैं जो जटिल ट्रैफिक को संभालने के लिए स्मार्ट और वास्तविक समय में प्रतिक्रिया देने के लिए तेज़ दोनों हो। यह एक प्रॉमिसिंग कदम है, लेकिन याद रखें, ये सभी परिणाम सिमुलेशन से आए हैं, अभी वास्तविक दुनिया के ड्राइविंग टेस्ट से नहीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →