← नवीनतम पेपर
💻 computer science

A global dataset of continuous urban dashcam driving

यह शोध पत्र CROWD को प्रस्तुत करता है, जो 238 देशों के 20,000 घंटों से अधिक के निरंतर, असंशोधित शहरी डैशकैम फुटेज का एक वैश्विक रूप से विविध, मैन्युअल रूप से क्यूरेट किया गया डेटासेट है, जिसे मशीन-जनित ऑब्जेक्ट डिटेक्शन और ट्रैकिंग एनोटेशन के साथ मैन्युअल समय-का-दिन (time-of-day) और वाहन लेबल प्रदान करके सुदृढ़ क्रॉस-डोमेन ड्राइविंग अनुसंधान का समर्थन करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Md Shadab Alam, Olena Bazilinska, Pavlo Bazilinskyy

प्रकाशित 2026-04-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Md Shadab Alam, Olena Bazilinska, Pavlo Bazilinskyy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखाना चाहते हैं। इसके लिए, आपको उसे ड्राइविंग के लाखों घंटों के फुटेज दिखाने होंगे ताकि वह सीख सके कि एक सामान्य सड़क कैसी दिखती है, लोग कैसे चलते हैं, और अन्य कारों का व्यवहार कैसा होता है।

मौजूदा ड्राइविंग डेटासेट्स एक स्पोर्ट्स चैनल के हाइलाइट रील्स (highlight reels) की तरह हैं। वे केवल रोमांचक, खतरनाक या अजीब क्षणों को दिखाते हैं: कार दुर्घटनाएं, बाल-बाल बचना, पुलिस पीछा करना और ट्रैफिक जाम। हालांकि ये नाटकीय हैं, लेकिन ये उस उबाऊ, रोज़मर्रा की वास्तविकता का प्रतिनिधित्व नहीं करते जो 99% समय ड्राइविंग में होती है। यदि आप केवल क्रैश वीडियो पर एक रोबोट को प्रशिक्षित करते हैं, तो उसे लग सकता है कि दुनिया एक निरंतर युद्धक्षेत्र है!

अन्य डेटासेट्स महंगे, हाई-एंड जासूसी मिशनों की तरह हैं। वे विशेष कारों का उपयोग करते हैं जिनमें लेजर और कैमरे चारों ओर लगे होते हैं, जो केवल कुछ विशिष्ट शहरों (जैसे सैन फ्रांसिस्को या म्यूनिख) में चलती हैं। ये बेहतरीन हैं, लेकिन इन्हें बनाना बहुत महंगा है, ये बहुत कम क्षेत्र कवर करती हैं, और एक साधारण व्यक्ति के डैशबोर्ड से दिखने वाले दृश्य जैसी नहीं लगतीं।

CROWD से मिलिए: "रोज़मर्रा की ड्राइविंग" की लाइब्रेरी

यह पेपर CROWD (सिटी रोड ऑब्जर्वेशन विद डैशकैम्स) पेश करता है। CROWD को YouTube से एकत्र किए गए उबाऊ, सामान्य, रोज़मर्रा के ड्राइविंग वीडियो की एक विशाल, वैश्विक लाइब्रेरी के रूप में समझें।

इसे उन्होंने कैसे बनाया, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. स्रोत: ड्राइविंग का "ASMR" खोजना
क्रैश वीडियो खोजने के बजाय, शोधकर्ताओं ने एक विशिष्ट प्रकार के YouTube वीडियो की तलाश की: लंबे, निरंतर, बिना एडिट किए गए डैशकैम फुटेज। उन्होंने उन वीडियो की तलाश की जिन्हें लोग केवल आराम करने के लिए अपलोड करते हैं (अक्सर इन्हें "ASMR" ड्राइविंग वीडियो कहा जाता है)। ये वे वीडियो हैं जहाँ कुछ भी रोमांचक नहीं होता; कार बस एक घंटे तक शहर में चलती रहती है। यह बिल्कुल वही "रूटीन" डेटा है जिसकी आवश्यकता एक रोबोट को यह सिखाने के लिए है कि सामान्य ड्राइविंग कैसी महसूस होती है।

2. फ़िल्टर: "सेफ्टी एडिटर"
टीम ने हजारों इन वीडियो को मैन्युअल रूप से देखा और सख्त संपादकों की तरह काम किया। उन्होंने वह सब कुछ काट दिया जो "सामान्य" नहीं था:

  • कोई दुर्घटना नहीं: यदि किसी कार ने किसी चीज़ को टक्कर मारी, तो उस क्लिप को हटा दिया गया।
  • कोई एडिटिंग नहीं: यदि वीडियो में जंप कट्स या फैंसी ट्रांजिशन थे, तो उसे हटा दिया गया। वे निरंतर, वास्तविक समय के प्रवाह को चाहते थे।
  • कोई गैर-शहरी क्षेत्र नहीं: उन्होंने केवल उन वीडियो को रखा जो कस्बों और शहरों में चल रहे थे, न कि खाली हाईवे या मक्के के खेत के बीच में।
  • कोई रुकी हुई कार नहीं: यदि कार 10 मिनट के लिए गैस स्टेशन पर खड़ी थी, तो उस हिस्से को काट दिया गया। वे केवल चाहते थे कि कार ट्रैफिक में चलती रहे।

3. परिणाम: एक वैश्विक मोज़ेक (Global Mosaic)
अंतिम डेटासेट विशाल है। इसमें 7,103 अलग-अलग शहरों से 238 देशों के 20,000 से अधिक घंटों का ड्राइविंग फुटेज शामिल है।

  • उपमा: कल्पना कीजिए कि आप टोक्यो की एक सड़क का स्नैपशॉट लेते हैं, फिर नैरोबी का, फिर ब्यूनस आयर्स का, और फिर उन सभी को एक विशाल, निरंतर फिल्म में जोड़ देते हैं। CROWD वही है। यह अमेरिका से लेकर अफ्रीका और एशिया तक, दुनिया के लगभग हर कोने को कवर करता है।

4. "स्मार्ट चश्मे" (एनोटेशन्स)
सिर्फ किसी को कच्चा वीडियो देने से काम नहीं चलेगा। कंप्यूटर को यह जानने की ज़रूरत है कि वह क्या देख रहा है।

  • शोधकर्ताओं ने इन वीडियो के हर एक फ्रेम पर एक सुपर-स्मार्ट AI (जिसे YOLO कहा जाता है) चलाया।
  • इस AI ने हर चीज़ के चारों ओर "स्टिकर" (बाउंडिंग बॉक्स) लगाए: लोग, साइकिल चालक, कारें, बसें, ट्रैफिक लाइट और स्टॉप साइन।
  • इसने उन्हें ट्रैक भी किया, जिसका अर्थ है कि यह जानता है कि सेकंड 10 पर "वह लाल कार" सेकंड 20 पर वही "लाल कार" है।
  • उन्होंने कॉपीराइट और गोपनीयता का सम्मान करते हुए वास्तविक वीडियो फाइलें साझा नहीं कीं; इसके बजाय, उन्होंने शोधकर्ताओं को "मैप" (टाइमस्टैम्प और आईडी) दिया ताकि कोई भी मूल YouTube वीडियो डाउनलोड कर सके और अध्ययन के लिए उन "स्टिकर्स" का उपयोग कर सके।

यह क्यों मायने रखता है?

"जनरलिस्ट" ड्राइवर
अधिकांश AI मॉडल को केवल एक या दो शहरों के डेटा पर प्रशिक्षित किया जाता है। यदि आप एक ऐसे मॉडल को लेते हैं जिसे धूप वाले कैलिफोर्निया में प्रशिक्षित किया गया है और उसे बारिश वाले लंदन में चलाते हैं, तो वह भ्रमित हो सकता है। CROWD एक यूनिवर्सल ड्राइवर के एड कोर्स की तरह है। क्योंकि इसमें कई अलग-अलग देश, मौसम की स्थिति और सड़क शैलियाँ शामिल हैं, यह AI को प्रशिक्षित करने में मदद करता है जो केवल उन शहरों के लिए नहीं, बल्कि दुनिया के किसी भी शहर में नेविगेट करने के लिए सक्षम हो।

"सुरक्षा" पर ध्यान
सभी दुर्घटनाओं को हटाकर और रूटीन ड्राइविंग पर ध्यान केंद्रित करके, CROWD शोधकर्ताओं को एक अलग प्रश्न का उत्तर देने में मदद करता है: "एक सामान्य दिन में कारें और पैदल यात्री वास्तव में कितनी बार एक-दूसरे के साथ इंटरैक्ट करते हैं?" यह हमें दुर्घटना होने के बाद अध्ययन करने के बजाय, दुर्घटना होने से पहले जोखिम को समझने में मदद करता है।

सारांश में

CROWD YouTube से प्राप्त उबाऊ, सामान्य ड्राइविंग वीडियो की एक वैश्विक, ओपन-सोर्स लाइब्रेरी है, जिसे कंप्यूटर द्वारा साफ और लेबल किया गया है। यह "क्रैश हाइलाइट रील्स" और "महंगे, सीमित सिटी डेटासेट्स" के बीच के अंतर को भरता है, जो स्वायत्त वाहनों (autonomous vehicles) को वास्तविक, अस्त-व्यस्त, रोज़मर्रा की दुनिया में नेविगेट करना सिखाने के लिए एक विविध आधार प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →