← नवीनतम पेपर
🤖 AI

Driving on Registers

यह शोध पत्र DrivoR को पेश करता है, जो एंड-टू-एंड स्वायत्त ड्राइविंग के लिए एक प्योर-ट्रांसफॉर्मर आर्किटेक्चर है जो मल्टी-कैमरा फीचर्स को एक संक्षिप्त प्रतिनिधित्व में संकुचित करने के लिए कैमरा-अवेयर रजिस्टर टोकन का उपयोग करता है, जिससे व्याख्यात्मक सब-स्कोर के साथ कुशल प्रक्षेपवक्र (ट्रैजेक्टरी) जनरेशन और स्कोरिंग सक्षम होती है और यह कई बेंचमार्क पर अत्याधुनिक बेसलाइन के मुकाबले बेहतर प्रदर्शन करता है या उनके बराबर रहता है।

मूल लेखक: Ellington Kirby, Alexandre Boulch, Yihong Xu, Yuan Yin, Gilles Puy, Éloi Zablocki, Andrei Bursuc, Spyros Gidaris, Renaud Marlet, Florent Bartoccioni, Anh-Quan Cao, Nermin Samet, Tuan-Hung VU, Matthieu
प्रकाशित 2026-02-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ellington Kirby, Alexandre Boulch, Yihong Xu, Yuan Yin, Gilles Puy, Éloi Zablocki, Andrei Bursuc, Spyros Gidaris, Renaud Marlet, Florent Bartoccioni, Anh-Quan Cao, Nermin Samet, Tuan-Hung VU, Matthieu Cord

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। पारंपरिक रूप से, आप रोबोट को हजारों पन्नों का एक विशाल निर्देश मैनुअल दे सकते हैं, जिसमें हर संभव स्थिति में उसे क्या करना है, यह विस्तार से बताया गया हो। यह शोध पत्र (paper) इस रोबोट को सिखाने का एक नया तरीका पेश करता है, जिसे DrivoR कहा जाता है, जो बहुत अधिक स्मार्ट, तेज़ और सरल है।

यहाँ बताया गया है कि यह कैसे काम करता है, रोजमर्रा के उदाहरणों का उपयोग करते हुए:

1. समस्या: बहुत अधिक जानकारी

कल्पना कीजिए कि आप गाड़ी चला रहे हैं और छह अलग-अलग खिड़कियों (कैमरों) से देख रहे हैं। एक मानक कंप्यूटर विज़न सिस्टम हर खिड़की में मौजूद हर एक पिक्सेल को देखने की कोशिश करता है, जिससे डेटा का एक पहाड़ खड़ा हो जाता है। यह गाड़ी चलाते समय एक लाइब्रेरी की किताबें पढ़ने की कोशिश करने जैसा है; कंप्यूटर यह तय करने से पहले कि मुड़ना है या रुकना है, उस सारी जानकारी को प्रोसेस करने में अभिभूत (overwhelmed) हो जाता है। यह सिस्टम को धीमा और महंगा बना देता है।

2. समाधान: "रजिस्टर" नोट लेने वाले (Note-Takers)

DrivoR के लेखकों ने महसूस किया कि रोबोट को पूरी लाइब्रेरी पढ़ने की ज़रूरत नहीं है। उसे बस कुछ मुख्य नोट्स की आवश्यकता है।

उन्होंने "रजिस्टर टोकन" (Register Tokens) नामक चीज़ पेश की है। इन्हें एक छोटी टीम के रूप में सोचें जो प्रत्येक कैमरे के लिए बगल वाली सीट पर बैठे विशेषज्ञ नोट-लेने वाले (specialized note-takers) हैं।

  • पूरे चित्र को प्रोसेस करने के बजाय, ये नोट-लेकर दृश्य को स्कैन करते हैं और केवल सबसे महत्वपूर्ण विवरण लिखते हैं (जैसे "आगे कार है," "लाल बत्ती," या "खाली सड़क")।
  • वे एक विशाल, अव्यवस्थित छवि को एक छोटे, साफ-सुथरे सारांश में संकुचित (compress) कर देते हैं।
  • परिणाम: अब कंप्यूटर को पूरी किताब पढ़ने के बजाय बस कुछ वाक्य पढ़ने पड़ते हैं। यह सिस्टम को खतरे को देखने की क्षमता खोए बिना अविश्वसनीय रूप से तेज़ और कुशल बनाता है।

3. दो-चरणीय निर्णय प्रक्रिया

एक बार जब नोट-लेने वालों ने दृश्य का सारांश तैयार कर लिया, तो रोबोट को यह निर्णय लेना होता है कि क्या करना है। DrivoR इस काम को दो अलग-अलग टीमों में विभाजित करता है, जैसे एक कोच (Coach) और एक रेफरी (Referee)

  • कोच (ट्रैजेक्टरी जनरेटर): यह टीम सारांश को देखती है और कहती है, "अगले कुछ सेकंडों के लिए हमारे पास 100 अलग-अलग तरीके हैं जिनसे हम गाड़ी चला सकते हैं।" वे बहुत तेज़ी से कई संभावित पथ (trajectories) तैयार करते हैं।
  • रेफरी (स्कोरिंग सिस्टम): यह टीम उन 100 पथों को देखती है और उन्हें ग्रेड देती है। लेकिन सबसे दिलचस्प बात यह है कि रेफरी केवल एक स्कोर (जैसे "अच्छा" या "बुरा") नहीं देता। यह एक रिपोर्ट कार्ड देता है जिसमें विशिष्ट ग्रेड होते हैं:
    • सुरक्षा (Safety): "हमारे टकराने की कितनी संभावना है?"
    • आराम (Comfort): "क्या यात्रियों को चक्कर या घबराहट महसूस होगी?"
    • दक्षता (Efficiency): "हम कितनी तेज़ी से वहां पहुँच रहे हैं?"

4. "व्यक्तित्व" के साथ ड्राइविंग

क्योंकि रेफरी सुरक्षा, आराम और गति के लिए अलग-अलग ग्रेड देता है, इसलिए आप रोबोट को फिर से प्रशिक्षित (retrain) किए बिना उसका व्यक्तित्व बदल सकते हैं।

  • "सेफ" मोड: आप कंप्यूटर को बताते हैं, "मुझे सुरक्षा और आराम की 100% परवाह है।" रोबोट उस पथ को चुनता है जिसमें सुरक्षा स्कोर सबसे अधिक होता है, भले ही वह थोड़ा धीमा हो।
  • "स्पोर्टी" मोड: आप कंप्यूटर को कहते हैं, "मैं जल्दी पहुँचना चाहता हूँ।" रोबोट उस पथ को चुनता है जो प्रगति (progress) को अधिकतम करता है, भले ही वह थोड़ा झटकेदार हो।

यह एक ऐसी कार होने जैसा है जो बस एक डायल घुमाकर तुरंत "दादी माँ ड्राइवर" से "रेसिंग ड्राइवर" में बदल सकती है।

5. परिणाम

इस सिस्टम का परीक्षण कुछ कठिन ड्राइविंग सिमुलेशन (जैसे कि एक वीडियो गेम जो वास्तविक जीवन से भी कठिन है) पर किया गया।

  • प्रदर्शन: DrivoR ने वर्तमान में उपलब्ध सबसे जटिल सिस्टम के बराबर या उनसे बेहतर प्रदर्शन किया।
  • गति: क्योंकि यह डेटा को संकुचित करने के लिए उन "नोट-लेने वालों" का उपयोग करता है, यह समान प्रणालियों की तुलना में 3 गुना तेज़ चलता है।
  • सरलता: इसे पहले से लिखे गए ड्राइविंग मूव्स के विशाल शब्दकोश या जटिल 3D मानचित्रों की आवश्यकता नहीं है। यह सीधे कैमरा छवियों और "नोट-लेने वालों" से सीखता है।

सारांश

DrivoR खुद को चलाने का एक नया तरीका है जो एक स्मार्ट नोट-लेने वालों की टीम को सड़क का सारांश बनाने, एक कोच को कई ड्राइविंग विकल्प सुझाने और एक रेफरी को आपके द्वारा चुनी गई चीज़ों (सुरक्षा बनाम गति) के आधार पर उन विकल्पों को ग्रेड देने के रूप में काम करता है। यह साबित करता है कि अच्छी तरह से गाड़ी चलाने के लिए आपको सुपर-कंप्यूटर की नहीं, बल्कि जानकारी को प्रोसेस करने के एक स्मार्ट और कुशल तरीके की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →