← नवीनतम पेपर
🤖 AI

TerraTransfer: Learning End-to-End Driving Policies Without Expert Demonstrations

TerraTransfer एक एंड-टू-एंड स्वायत्त ड्राइविंग फ्रेमवर्क पेश करता है जो पॉलिसी लर्निंग को विजुअल परसेप्शन से अलग करके विशेषज्ञ प्रदर्शनों की आवश्यकता को समाप्त करता है, जो वेक्टरकृत सिम्युलेटर्स में सेल्फ-प्ले का उपयोग करके एक ड्राइविंग पॉलिसी उत्पन्न करता है जिसे बाद में केवल युग्मित (इमेज, सीन-स्टेट) डेटा का उपयोग करके एक प्री-ट्रेन्ड विजन बैकबोन के साथ संरेखित किया जाता है।

मूल लेखक: Zikang Xiong, Weixin Li, Zhouchonghao Wu, Akshay Rangesh, Saarth Bonde, Grantland Hall, Chen Tang, Yihan Hu, Wei Zhan

प्रकाशित 2026-06-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zikang Xiong, Weixin Li, Zhouchonghao Wu, Akshay Rangesh, Saarth Bonde, Grantland Hall, Chen Tang, Yihan Hu, Wei Zhan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सेल्फ-ड्राइविंग कार को गाड़ी चलाना सिखा रहे हैं। आमतौर पर, इंडस्ट्री का मानक एक ऐसे मानव ड्राइविंग इंस्ट्रक्टर को काम पर रखने जैसा है जिसने लाखों मील की यात्रा की हो। आप उनकी हर हरकत को रिकॉर्ड करते हैं, डेटा को लेबल करते हैं (उन्होंने क्या देखा, उन्होंने क्या किया), और फिर एआई (AI) को उन्हें कॉपी करने के लिए सिखाने की कोशिश करते हैं। यह महंगा और धीमा है, और एआई केवल इंसानों के "परफेक्ट" पलों से सीखता है, उन उलझे हुए और खतरनाक "नज़दीकी हादसों" (near-misses) को छोड़ देता है जो वास्तव में सड़क पर होते हैं।

TerraTransfer कार को गाड़ी चलाना सिखाने का एक बिल्कुल अलग तरीका प्रस्तावित करता है, जिसमें किसी भी मानव ड्राइविंग लॉग की आवश्यकता नहीं होती। इसे दो चरणों वाली प्रक्रिया के रूप में सोचें: पहला, एक वीडियो गेम में गाड़ी चलाना सीखें। दूसरा, वास्तविक दुनिया को देखना सीखें।

यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:

चरण 1: "वीडियो गेम" ड्राइवर (सेल्फ-प्ले)

एक वीडियो गेम की कल्पना करें जहाँ हजारों कारें एक आभासी शहर में घूम रही हैं। इस खेल में, कारों को इंसान नियंत्रित नहीं कर रहे हैं; वे एक एकल एआई मस्तिष्क द्वारा नियंत्रित हैं जो बार-बार खुद के खिलाफ खेलकर सीखता है।

  • सुपरपावर: क्योंकि यह एक वीडियो गेम ("वेक्टराइज्ड सिम्युलेटर") है, इसलिए एआई एक सेकंड में 2 मिलियन स्टेप्स चला सकता है। यह दुर्घटना कर सकता है, संभल सकता है, और सिम्युलेशन में एक इंसान द्वारा एक मील चलाने के समय में लाखों बार 'नियर-मिस' (होने वाली दुर्घटनाओं) से सीख सकता है।
  • परिणाम: यह एआई एक मास्टर ड्राइवर बन जाता है। इसे पता होता है कि हर स्थिति में क्या करना है क्योंकि इसने सिम्युलेशन में हर संभव आपदा और सफलता को जिया है।
  • कैच (कमी): यह मास्टर ड्राइवर वास्तविक दुनिया के प्रति "अंधा" है। यह कैमरा इमेजेस नहीं देखता; यह केवल नंबरों की एक सूची देखता है (जैसे "सामने वाली कार 50 मीटर दूर है")। यह एक शतरंज के ग्रैंडमास्टर की तरह है जो शतरंज तो खेल सकता है, लेकिन केवल तभी जब आप उसे बोर्ड के निर्देशांक (coordinates) बताएं, लेकिन वह वास्तव में बोर्ड को देख नहीं सकता।

चरण 2: "आंखें" (विज़न अलाइनमेंट)

अब, हमें एक असली कार (जिसमें कैमरे हैं) को उस मास्टर गेमर की तरह गाड़ी चलाना सिखाना होगा। आमतौर पर, आपको वास्तविक कार को मानव ड्राइविंग दिखाने के लिए लाखों घंटों के मानव ड्राइविंग डेटा की आवश्यकता होगी। TerraTransfer कुछ अधिक स्मार्ट करता है।

  • सेटअप: हम चरण 1 के "अंधे" मास्टर ड्राइवर को लेते हैं और उसके मस्तिष्क को फ्रीज (freeze) कर देते हैं। वह अब सीख नहीं सकता; वह केवल "शिक्षक" (Teacher) के रूप में कार्य करता है।
  • छात्र (Student): हम एक नया एआई बनाते हैं जिसके पास कैमरे (आंखें) हैं लेकिन ड्राइविंग का कोई अनुभव नहीं है।
  • पाठ: हम छात्र को सड़क की एक तस्वीर दिखाते हैं और "शिक्षक" (जो उसी सड़क को नंबरों की एक सूची के रूप में देखता है) छात्र को बताता है: "यदि मैंने यह नंबरों की सूची देखी होती, तो मैं बाईं ओर मुड़ता। तुम, इस तस्वीर को देखते हुए, भी बाईं ओर मुड़ना चाहिए।"
  • जादुई ट्रिक: पेपर एक विशेष "स्ट्रक्चरल लॉस" (structural loss) पेश करता है। कल्पना कीजिए कि शिक्षक का मस्तिष्क ड्राइविंग स्थितियों को एक लाइब्रेरी की तरह व्यवस्थित करता है। छात्र को हर एक किताब का शीर्षक (हर विशिष्ट नंबर) याद करने के लिए मजबूर करने के बजाय, छात्र लाइब्रेरी के लेआउट को सीखता है। वह सीखता है कि "बारिश वाला दिन और एक धीमी ट्रक" शिक्षक के दिमाग में "कोहरे वाला दिन और एक धीमी ट्रक" जैसा ही महसूस होता है। इन संबंधों के आंतरिक मानचित्र (map) को मैच करके, छात्र बिना किसी मानव ड्राइविंग लॉग को देखे सही ढंग से गाड़ी चलाना सीख जाता है।

यह एक बड़ी बात क्यों है

  1. मानव लॉग की आवश्यकता नहीं: आपको ड्राइवर रखने, उनके मील रिकॉर्ड करने या महंगे डेटा लेबलिंग के लिए भुगतान करने की आवश्यकता नहीं है। "शिक्षक" ने पूरी तरह से सिम्युलेशन में खेलकर सीखा है।
  2. सस्ता और तेज़: "शिक्षक" को प्रशिक्षित करने में शक्तिशाली कंप्यूटरों पर 96 घंटे लगे। "छात्र" (कैमरा कार) को अलाइन करने में केवल 10 घंटे लगे।
  3. अजीब स्थितियों में बेहतर: चूंकि शिक्षक ने गेम में दुर्घटनाग्रस्त होने और संभलने से सीखा है, इसलिए वह स्वाभाविक रूप से दुर्लभ, खतरनाक स्थितियों (लॉन्ग टेल) को संभालने में अच्छा है, जिन्हें मानव लॉग अक्सर छोड़ देते हैं।

परिणाम

जब उन्होंने इस नए "छात्र" कार का परीक्षण एक यथार्थवादी, फोटो-रियलिस्टिक सिम्युलेशन (3D गॉसियन स्प्लैटिंग का उपयोग करके, जो आभासी दुनिया को एक वास्तविक वीडियो जैसा बनाता है) में किया, तो इसने मौजूदा सर्वश्रेष्ठ सेल्फ-ड्राइविंग सिस्टम के समान या उनसे बेहतर प्रदर्शन किया जो मानव डेटा पर निर्भर हैं।

वर्तमान सीमाएं

पेपर ईमानदार है कि यह अभी क्या नहीं कर सकता है:

  • दृश्य विवरण (Visual Details): चूंकि शिक्षक ने सरल आकृतियों (बॉक्सेस) से सीखा है, इसलिए छात्र सूक्ष्म दृश्य संकेतों जैसे कि ड्राइवर के हाथ हिलाने या ब्रेक लाइट के चमकने को मिस कर सकता है।
  • पैदल यात्री और साइकिल चालक: सिम्युलेशन मुख्य रूप तौर पर कारों से संबंधित है, इसलिए एआई ने लोगों या साइकिल चालकों के साथ सड़क साझा करने के बारे में बहुत कम सीखा है।
  • ट्रैफिक लाइट: इसने अभी तक जटिल इंटरसेक्शन नियमों में पूरी तरह महारत हासिल नहीं की है।

संक्षेप में: TerraTransfer एक कार को गाड़ी चलाना सिखाता है एक सुपर-फास्ट वीडियो गेम खेलकर मास्टर बनने के माध्यम से, और फिर एक कैमरा-युक्त कार को उस मास्टर के तर्क (logic) की नकल करने के लिए सिखाकर, पूरी तरह से मानव ड्राइवरों की नकल करने की महंगी और धीमी प्रक्रिया को छोड़कर।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →