← नवीनतम पेपर
💻 computer science

OpenLongTail: Generative Scaling of Long-Tail Driving Data

OpenLongTail एक ओपन-सोर्स जनरेटिव इंजन है जो विषम मोनोकुलर स्रोतों से व्यू-अलाइन्ड (view-aligned), टेम्पोरली कोहेरेंट (temporally coherent) मल्टी-व्यू एसेट्स को सिंथेसाइज करके लॉन्ग-टेल ड्राइविंग डेटा की कमी को संबोधित करता है, जिससे एज केसेस (edge cases) में ऑटोनॉमस ड्राइविंग पॉलिसियों की मजबूती में महत्वपूर्ण सुधार होता है।

मूल लेखक: Lulin Liu, Nuo Chen, Yan Wang, Bangya Liu, Wenyan Cong, Hezhen Hu, Boris Ivanovic, Hao Wang, Ziyao Zeng, Xinyu Gong, Yang Zhou, Zixiang Xiong, Dilin Wang, Zhangyang Wang, Weisong Shi, Ruohan Zhang, Ma
प्रकाशित 2026-07-13
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lulin Liu, Nuo Chen, Yan Wang, Bangya Liu, Wenyan Cong, Hezhen Hu, Boris Ivanovic, Hao Wang, Ziyao Zeng, Xinyu Gong, Yang Zhou, Zixiang Xiong, Dilin Wang, Zhangyang Wang, Weisong Shi, Ruohan Zhang, Marco Pavone, Zhiwen Fan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखाने की कोशिश कर रहे हैं। आपने उसे ड्राइविंग वीडियो का एक विशाल पुस्तकालय दिया है, लेकिन एक बहुत बड़ी समस्या है—यह लाइब्रेरी उबाऊ, सामान्य दिनों से भरी हुई है। इसमें धूप वाले राजमार्गों और साफ चौराहों के हजारों क्लिप हैं। लेकिन यह "लॉन्ग-टेल" (long-tail) वाली चीज़ों के लिए लगभग खाली है—वे अजीब, डरावने या दुर्लभ क्षण जो वास्तव में दुर्घटनाओं का कारण बनते हैं, जैसे कि हिरण का अचानक सामने आ जाना, शंकु (cones) से भरा निर्माण क्षेत्र, या ट्रैफिक के बीच से रास्ता बनाती एक साइकिल सवार।

पेपर इसे "एज केस की कमी" (scarcity of edge cases) कहता है। यह केवल शांत, सपाट पानी के वीडियो देखकर सर्फिंग सीखने की कोशिश करने जैसा है। आप पैडलिंग में तो माहिर हो सकते हैं, लेकिन जैसे ही आप असली लहर से टकराएंगे, आप क्रैश हो जाएंगे।

बड़ी अवधारणा: "टाइम-ट्रैवलिंग कैमरा" इंजन

शोधकर्ताओं ने, जो टेक्सास ए एंड एम (Texas A&M) और एनवीडिया (NVIDIA) जैसी जगहों की एक टीम है, OpenLongTail नामक एक टूल बनाया है। इसे एक जादुई "टाइम-ट्रैवलिंग कैमरा" इंजन के रूप में समझें।

आमतौर पर, रोबोट को सुरक्षित रूप से चलाने के लिए सिखाने हेतु, आपको एक ऐसी कार की आवश्यकता होती है जिसमें कैमरों का एक पूरा घेरा (सामने, पीछे, बाएँ, दाएँ) हो जो सब कुछ एक साथ रिकॉर्ड कर रहा हो। लेकिन इंटरनेट पर मौजूद अधिकांश दुर्लभ, डरावके ड्राइविंग वीडियो में केवल एक कैमरा होता है (डैशकैम जो डैशबोर्ड पर होता है)। वे "मोनोकुलर" (monocular) होते हैं, जिसका अर्थ है कि वे केवल अपने ठीक सामने देखते हैं।

समस्या यह है कि आप केवल एक फ्रंट-व्यू वीडियो को रोबोट ड्राइवर को नहीं दे सकते। रोबोट को यह जानने की ज़रूरत है कि उसके ब्लाइंड स्पॉट्स (blind spots) में क्या हो रहा है ताकि वह सुरक्षित निर्णय ले सके।

OpenLongTail इन सिंगल-कैमरा वीडियो को लेकर गायब हुए व्यूज़ (views) को जेनरेट करता है। यह ऐसा है जैसे आप सामने के दृश्य से एक निर्माण क्षेत्र से गुजरती कार का वीडियो देख रहे हैं, और फिर AI का उपयोग करके यह "कल्पना" (hallucinate) कर रहे हैं कि साइड और रियर कैमरों ने बिल्कुल वही देखा होगा जो सामने वाले दृश्य के साथ पूरी तरह से सिंक्रोनाइज़्ड है।

यह जादू कैसे काम करता है

पेपर बताता है कि यह केवल अनुमान लगाना नहीं है; यह एक बहुत ही विशिष्ट, ज्योमेट्री-आधारित जादू है। यह प्रक्रिया है, जिसे नीचे विभाजित किया गया है:

  1. पाथ को रिकवर करना (Recovering the Path): सबसे पहले, सिस्टम सिंगल फ्रंट वीडियो को देखता है और यह पता लगाता है कि कार वास्तव में कैसे चली। यह "ईगो-ट्रैजेक्टरी" (ego-trajectory) की गणना सटीक रूप से करता है। यह ऐसा है जैसे AI वीडियो देख रहा है और उस सड़क का 3D मैप बना रहा है जिस पर कार वास्तव में चली थी।
  2. "प्लकर रे" (Plücker Ray) कंपास: यह सुनिश्चित करने के लिए कि नए कैमरा एंगल केवल धुंधले अनुमान न हों, सिस्टम Plücker ray geometry का उपयोग करता है। कल्पना कीजिए कि कैमरे के लेंस से दुनिया में अदृश्य लेजर बीम निकल रही हैं। AI इन बीमों का उपयोग दृश्य के 3D आकार को समझने के लिए करता है। यह एक 3D रूलर की तरह है जो सुनिश्चित करता है कि नया "साइड व्यू" सामने वाले "फ्रंट व्यू" के साथ पूरी तरह से मेल खाता हो।
  3. टाइम-ट्रैवल ट्रिक (डेप्थ वार्पिंग): यह सबसे शानदार हिस्सा है। यदि कार आगे बढ़ रही है, तो भविष्य के साइड और रियर व्यू वास्तव में अतीत के फ्रंट व्यू हैं। सिस्टम देखता है कि कुछ सेकंड पहले फ्रंट कैमरे ने क्या देखा था, कार की गति के आधार पर उस इमेज को "वार्प" (खिंचता और बदलता) करता है, और उसका उपयोग रियर कैमरे के दृश्य को भरने के लिए करता है। यह एक टेप को रिवाइंड करने जैसा है ताकि आप देख सकें कि आपके पीछे क्या था, लेकिन गणितीय रूप से ऐसा करना ताकि यह वास्तविक लगे।
  4. मेमोरी बैंक: यह सुनिश्चित करने के लिए कि कार का बायां हिस्सा दाएं हिस्से से अलग न दिखे, सिस्टम एक "मेमोरी बैंक" रखता है। जैसे-जैसे यह बायां व्यू जेनरेट करता है, यह उसे याद रखता है जबकि वह दायां व्यू जेनरेट कर रहा होता है, जिससे यह सुनिश्चित होता है कि वे एक पहेली की तरह आपस में मिल जाएं।

पेपर क्या कहता है कि यह क्या (और क्या नहीं) कर सकता है

लेखक सावधान हैं कि उन्होंने क्या साबित किया है और क्या नहीं।

  • उन्होंने क्या साबित किया: उन्होंने इसे AlpaSim नामक एक सिमुलेशन में टेस्ट किया। उन्होंने एक ड्राइविंग पॉलिसी (रोबोट का दिमाग) ली और उसे OpenLongTail द्वारा जेनरेट किए गए डेटा पर ट्रेन किया। परिणाम? रोबोट लॉन्ग-टेल इवेंट्स को संभालने में बहुत बेहतर हो गया।

    • सिमुलेशन में, रोबोट की "कोलिजन रेट" (टकराव की दर) कई लॉन्ग-टेल श्रेणियों (जैसे वर्क ज़ोन और असामान्य वाहन) में इस सिंथेटिक डेटा के साथ ट्रेनिंग के बाद 0.0% तक गिर गई।
    • "AlpaSim स्कोर" (एक माप कि रोबोट कितनी अच्छी तरह ड्राइव करता है) बिना किसी अतिरिक्त ट्रेनिंग के 0.534 से बढ़कर OpenLongTail डेटा के साथ 0.748 हो गया। यह लगभग उतना ही अच्छा है जितना कि परफेक्ट, रियल मल्टी-कैमरा डेटा के साथ ट्रेनिंग, जिसका स्कोर 0.764 था।
    • उन्होंने यह भी दिखाया कि जेनरेट किए गए वीडियो वास्तविक दिखते हैं और अलग-अलग कैमरा एंगल के बीच सुसंगत रहते हैं, जिनका जियोमेट्रिक कंसिस्टेंसी स्कोर (GeoKPM) 82.41 है, जो अन्य तरीकों (अगला सबसे अच्छा लगभग 18.86 था) से बहुत अधिक है।
  • उन्होंने क्या खारिज किया: पेपर स्पष्ट रूप से इस विचार के खिलाफ तर्क देता है कि आप मौजूदा 3D रिकंस्ट्रक्शन टूल्स (जैसे 3D Gaussian Splatting) का उपयोग कर सकते हैं। उन टूल्स को काम करने के लिए बहुत सारे ओवरलैपिंग कैमरा व्यूज़ की आवश्यकता होती है। यदि आपके पास केवल एक कैमरा है, तो वे विफल हो जाते हैं। OpenLongTail अलग है क्योंकि यह ओवरलैपिंग डेटा से पुनर्निर्माण करने के बजाय गायब हुए व्यूज़ को जेनरेट करता है।

  • वे किस बारे में अनिश्चित हैं: पेपर नोट करता है कि जेनरेट किए गए डेटा की गुणवत्ता इस बात पर निर्भर करती है कि सोर्स वीडियो टारगेट से कितना मेल खाता है। उदाहरण के लिए, यदि आप किसी विशिष्ट चौराहे (जैसे पुलिस अधिकारियों द्वारा ट्रैफिक निर्देशित करने वाला जटिल चौराहा) के लिए डेटा का उपयोग करने की कोशिश करते हैं जो आपके सोर्स वीडियो में नहीं है, तो जेनरेट किया गया डेटा उतना मदद नहीं करेगा। यह कोई "वन-साइज़-फिट्स-ऑल" जादुई समाधान नहीं है; डेटा को उस चीज़ के साथ संरेखित होना चाहिए जिसे आप रोबोट को सिखाने की कोशिश कर रहे हैं।

निष्कर्ष

OpenLongTail एक ऐसा टूल है जो इंटरनेट पर तैर रहे लाखों सिंगल-कैमरा डैशकैम वीडियो को उच्च-गुणवत्ता वाले, मल्टी-कैमरा ट्रेनिंग डेटा में बदल देता है। यह सुझाव देता है कि हमें रोबोट को सुरक्षित रूप से चलाने के लिए सिखाने के लिए दुर्लभ दुर्घटनाओं के हजारों नए, महंगे मल्टी-कैमरा वीडियो फिल्माने जाने की आवश्यकता नहीं है। इसके बजाय, हम पहले से मौजूद वीडियो की क्षमता को अनलॉक करने के लिए इस "जेनरेटिव स्केलिंग" का उपयोग कर सकते हैं।

लेखक दिखाते हैं कि यह सिमुलेशन में काम करता है, जिससे ड्राइविंग पॉलिसी काफी अधिक मजबूत हो जाती है। वे अपना कोड और डेटा जारी करते हैं ताकि अन्य लोग इसे आज़मा सकें, इस उम्मीद में कि वे रोबोट को वास्तविक दुनिया के अजीब, जंगली और दुर्लभ क्षणों को संभालने के लिए सिखाकर सेल्फ-ड्राइविंग कारों को सुरक्षित बना सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →