← नवीनतम पेपर
💻 computer science

Test-Time Trajectory Optimization for Autonomous Driving

TOAD एक प्लग-एंड-प्ले, टेस्ट-टाइम ट्रैजेक्टरी ऑप्टिमाइज़ेशन विधि है जो सीखे गए ट्रैजेक्टरी-स्तरीय रिवॉर्ड्स को खोजने और उन्हें अधिकतम करने के लिए क्रॉस-एन्ट्रॉपी मेथड का लाभ उठाती है, जो बिना पुन: प्रशिक्षण (retraining) के मौजूदा एंड-टू-एंड स्वायत्त ड्राइविंग प्लानर्स के प्रदर्शन में महत्वपूर्ण सुधार करती है।

मूल लेखक: Yihong Xu, Eloi Zablocki, Yuan Yin, Elias Ramzi, Ellington Kirby, Alexandre Boulch, Matthieu Cord

प्रकाशित 2026-06-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yihong Xu, Eloi Zablocki, Yuan Yin, Elias Ramzi, Ellington Kirby, Alexandre Boulch, Matthieu Cord

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सेल्फ-ड्राइविंग कार को व्यस्त शहर में नेविगेट करना सिखा रहे हैं। वर्तमान "स्टेट-ऑफ-द-आर्ट" दृष्टिकोण में, कार का मस्तिष्क एक जल्दबाज हायरिंग मैनेजर की तरह काम करता है।

यहाँ पुराना सिस्टम कैसे काम करता है:

  1. रेज़्यूमे पूल: कार का न्यूरल नेटवर्क जल्दी से, मान लीजिए 100 संभावित ड्राइविंग पथों (ट्रैजेक्टरीज) की एक निश्चित सूची बनाता है जो वह ले सकती है।
  2. इंटरव्यूअर: एक अलग "स्कोरर" प्रोग्राम इन 100 पथों को देखता है और सुरक्षा एवं आराम के आधार पर सबसे अच्छा एक चुनता है।
  3. समस्या: यदि शुरुआती 100 पथों की सूची खराब है (जैसे, उन सभी में दीवार से टकराना शामिल है), तो "इंटरव्यूअर" को सबसे कम बुरा विकल्प चुनने के लिए मजबूर होना पड़ता है। सिस्टम खराब विकल्पों के सेट में फंसा रहता है, चाहे इंटरव्यूअर कितना भी अच्छा क्यों न हो।

नया विचार: TOAD (टेस्ट-टाइम ट्रैजेक्टरी ऑप्टिमाइज़ेशन)

इस पेपर के लेखकों ने, Valeo.ai के साथ मिलकर, एक नई विधि पेश की जिसे TOAD कहा जाता है। केवल ढेर में से सबसे अच्छा रेज़्यूमे चुनने के बजाय, TOAD इंटरव्यूअर को मौके पर ही बेहतर उम्मीदवारों को खोजने की अनुमति देता है।

इसे इस तरह सोचें:

  • पुराना तरीका: आप अपने दोस्त से 10 रेसिपी आइडिया मांगते हैं, सबसे अच्छे को चुनते हैं और उसे पकाते हैं। यदि आपका दोस्त केवल जला हुआ टोस्ट बनाना जानता है, तो आप जला हुआ टोस्ट ही खाते हैं।
  • TOAD का तरीका: आप अपने दोस्त से शुरुआत करने के लिए 10 आइडिया मांगते हैं। फिर, आप उस "सबसे अच्छे आइडिया" को लेते हैं और उसमें बदलाव करना शुरू करते हैं—यहाँ एक चुटकी नमक डालना, वहाँ आंच कम करना—और लगातार चखते रहते हैं कि क्या यह बेहतर हो रहा है। आप रेसिपी को तब तक रिफाइन करते हैं जब तक कि आपको एक स्वादिष्ट भोजन न मिल जाए जो आपके दोस्त ने मूल रूप से नहीं सोचा था।

TOAD कैसे काम करता है ("क्रॉस-एंट्रॉपी" सर्च)

यह पेपर एक गणितीय उपकरण का उपयोग करता है जिसे क्रॉस-एंट्रॉपी मेथड (CEM) कहा जाता है। यहाँ उपमा दी गई है:

  1. वार्म स्टार्ट: TOAD उस "सबसे अच्छे" पथ को लेता है जिसे कार ने मूल रूप से सुझाया था और उसे एक शुरुआती बिंदु (एंकर) के रूप में उपयोग करता है।
  2. सर्च लूप:
    • कल्पना कीजिए कि कार एक धुंधले खेत में खड़ी है। वह अपनी वर्तमान स्थिति के चारों ओर एक घेरा बनाती है।
    • यह उस घेरे के पास कई नए पथ बनाती है (सैंपलिंग)।
    • यह इन नए पथों को अपने "स्कोरर" (टेस्ट-टेस्टर) के माध्यम से चलाती है।
    • यह उन शीर्ष कुछ पथों को रखती है जिनका स्कोर सबसे अधिक रहा (एलीट्स)।
    • फिर यह उस घेरे को थोड़ा छोटा करती है और उन्हें उन एलीट पथों के केंद्र में रखती है, और प्रक्रिया को दोहराती है।
  3. परिणाम: कुछ त्वरित लूपों के बाद (जो मिलीसेकंड में होते हैं), कार ने एक ऐसा पथ खोज लिया है जो उसके मूल सूची में मौजूद किसी भी पथ की तुलना में अधिक सुचारू और सुरक्षित है।

गुप्त सामग्री: "जनरलाइजिंग" (सामान्यीकरण करने वाला) स्कोरर

पेपर एक महत्वपूर्ण खोज करता है: सभी इंटरव्यूअर यह काम नहीं कर सकते।

  • खराब इंटरव्यूअर: कुछ स्कोरर्स को केवल एक विशिष्ट, निश्चित सूची वाले पूर्व-लिखित पथों को रैंक करने के लिए प्रशिक्षित किया जाता है। यदि आप उनसे एक नया पथ आंकने के लिए कहते हैं जिसे उन्होंने पहले कभी नहीं देखा है, तो वे भ्रमित हो जाते हैं और गलत सलाह देते हैं। TOAD के साथ इन स्कोरर्स का उपयोग करने से कार वास्तव में खराब चलती है।
  • अच्छा इंटरव्यूअर: पेपर ने पाया कि उन्हें एक विशिष्ट प्रकार के स्कोरर (एक सिस्टम से जिसका नाम DrivoR है) की आवश्यकता थी जिसे किसी भी पथ को आंकने के लिए प्रशिक्षित किया गया था, न कि केवल एक निश्चित सूची को। यह "जनरलाइजिंग" स्कोरर एक वास्तविक विशेषज्ञ की तरह कार्य करता है जो एक नए व्यंजन को चख सकता है और तुरंत जान सकता है कि वह अच्छा है या नहीं, भले ही उसने वह रेसिपी पहले कभी न देखी हो।

परिणाम

टीम ने वास्तविक दुनिया के ड्राइविंग सिमुलेशन (NAVSIM और HUGSIM) का उपयोग करके छह अलग-अलग सेल्फ-ड्राइविंग सिस्टम पर TOAD का परीक्षण किया।

  • प्लग-एंड-प्ले: उन्हें कारों को फिर से प्रशिक्षित करने की आवश्यकता नहीं पड़ी। उन्होंने बस मौजूदा सिस्टम के साथ TOAD को जोड़ दिया।
  • बड़ी जीत: कमजोर ड्राइविंग सिस्टम के लिए, TOAD ने उनके प्रदर्शन में भारी सुधार किया (43% तक बेहतर)।
  • स्टेट-ऑफ-द-आर्ट: सबसे मजबूत मौजूदा सिस्टम (DrivoR) के लिए भी, TOAD ने थोड़ा अतिरिक्त प्रदर्शन निकाला, जिससे यह एक "प्रिविलेज्ड" सिस्टम के लगभग बराबर हो गया जिसके पास सटीक, ग्राउंड-ट्रुथ जानकारी (जैसे कि अन्य कारों की सटीक स्थिति जानना) तक पहुंच है।
  • सुरक्षा: क्लोज्ड-लूप टेस्ट में (जहाँ कार वास्तव में एक सिम्युलेटर में चलती है), कारें अधिक सुरक्षित और आरामदायक हो गईं, हालांकि वे कभी-कभी थोड़ी अधिक सतर्क (जोखिमों से बचने के लिए धीरे गाड़ी चलाना) हो गईं।

मुख्य निष्कर्ष

पेपर का तर्क है कि सेल्फ-ड्राइविंग में बाधा "स्कोरर" (जज) नहीं है, बल्कि वह उम्मीदवारों की सूची है जिसे कार जेनरेट करती है। एक स्मार्ट सर्च एल्गोरिदम (TOAD) का उपयोग करके उन उम्मीदवारों को रीयल-टाइम में रिफाइन करके, और एक ऐसे जज का उपयोग करके जो नए विचारों का मूल्यांकन करने में सक्षम है, सेल्फ-ड्राइविंग कारें बिना स्क्रैच से पुन: प्रशिक्षित हुए बेहतर, सुरक्षित पथ खोज सकती हैं।

संक्षेप में: TOAD एक "एक निश्चित सूची में से सबसे अच्छा चुनें" वाले सिस्टम को "तब तक सुधारते रहें जब तक कि वह परफेक्ट न हो जाए" वाले सिस्टम में बदल देता है, और यह सब तब होता है जब कार चल रही होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →