← नवीनतम पेपर
💻 computer science

RoadscapesQA: A Multitask, Multimodal Dataset for Visual Question Answering on Indian Roads

यह शोधपत्र RoadscapesQA को प्रस्तुत करता है, जो विविध भारतीय ड्राइविंग परिवेशों से ९,००० तक छवियों का एक नया मल्टीमॉडल डेटासेट है, जिसमें बाउंडिंग बॉक्स और नियम-आधारित जनरेटेड QA जोड़े शामिल हैं जिन्हें अनस्ट्रक्चर्ड सेटिंग्स में स्वायत्त ड्राइविंग के लिए विजुअल सीन अंडरस्टैंडिंग और निर्णय लेने की क्षमता को आगे बढ़ाने के लिए डिज़ाइन किया गया है।

मूल लेखक: Vijayasri Iyer, Maahin Rathinagiriswaran, Jyothikamalesh S

प्रकाशित 2026-02-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vijayasri Iyer, Maahin Rathinagiriswaran, Jyothikamalesh S

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। ऐसा करने के लिए, आप इसे केवल जर्मनी या कैलिफोर्निया के आदर्श, धूप वाले राजमार्गों के वीडियो नहीं दिखा सकते। आपको इसे भारत की सड़कों की उस अव्यवस्थित, अराजक और सुंदर वास्तविकता से परिचित कराना होगा, जहाँ गायें सड़क पर आ सकती हैं, ट्रैफिक लाइटों की अनदेखी की जा सकती है, या सड़कों पर स्पष्ट रेखाएं नहीं हो सकतीं।

यह शोध पत्र RoadscapesQA को पेश करता है, जो इन ड्राइविंग रोबोट्स के लिए एक नया "पाठ्यपुस्तक" है, जिसे विशेष रूप से भारतीय सड़कों की अनूठी चुनौतियों के लिए डिज़ाइन किया गया है।

इसे बनाने की कहानी और उन्हें क्या मिला, यहाँ सरल भाषा में समझाया गया है:

1. समस्या: "पर्यटक" बनाम "स्थानीय"

मौजूदा ड्राइविंग डेटासेट अधिकांशतः पर्यटक ब्रोशर की तरह होते हैं। वे साफ-सुथरी, व्यवस्थित सड़कें और स्पष्ट संकेत (जैसे अमेरिका या यूरोप में) दिखाते हैं। लेकिन भारत में ड्राइविंग करना एक भीड़भाड़ वाले स्थानीय बाजार में रास्ता खोजने जैसा है। यह भीड़भाड़ वाला, अप्रत्याशित है, और इसमें विभिन्न प्रकार के वाहन (कार, बस, रिक्शा और यहाँ तक कि जानवर भी) एक ही स्थान साझा कर रहे हैं।

लेखकों ने महसूस किया कि यदि हम केवल "पर्यटक" डेटा पर रोबोट को प्रशिक्षित करते हैं, तो वे भारत की "स्थानीय" वास्तविकता से टकराकर दुर्घटनाग्रस्त हो जाएंगे। इसलिए, उन्होंने एक ऐसा डेटासेट बनाने का निर्णय लिया जो भारतीय सड़कों की वास्तविक, बिना किसी फिल्टर वाली अराजकता को कैद कर सके।

2. संग्रह: एक कम लागत वाली रोड ट्रिप

महंगे, उच्च-तकनीकी सेंसर रिग्स (जिनकी कीमत एक लग्जरी कार जितनी हो सकती है) के बजाय, टीम ने दक्षिण भारत में कोयंबटूर से कोच्चि तक की एक रोड ट्रिप की।

  • उपकरण: उन्होंने एक साधारण, सस्ते कैमरे को एक सामान्य कार के डैशबोर्ड पर बांधा।
  • यात्रा: उन्होंने 5 घंटे तक यात्रा की, जिसमें शहर की भीड़भाड़ वाली सड़कों से लेकर शांत ग्रामीण रास्तों तक सब कुछ कैप्चर किया, दिन और रात दोनों समय।
  • परिणाम: उनके पास लगभग 9,000 तस्वीरें आईं। उन्होंने उन्हें साफ किया, धुंधली तस्वीरों को हटाया, और लोगों की गोपनीयता की रक्षा के लिए लाइसेंस प्लेटों को छिपाया (जैसे किसी समाचार फोटो में चेहरों को धुंधला करना)।

3. जादू का नुस्खा: रोबोट को सवाल पूछना सिखाना

9,000 तस्वीरें होना अच्छी बात है, लेकिन एक रोबोट को उन्हें समझने की आवश्यकता होती है। टीम ने केवल वस्तुओं को लेबल नहीं किया (जैसे "वह एक ट्रक है"); उन्होंने एक विजुअल क्वेश्चन अनस्वियरिंग (VQA) प्रणाली बनाई।

इसे एक शिक्षक द्वारा छात्र को क्विज़ देने की तरह समझें।

  • शिक्षक (डेटासेट): कंप्यूटर नियमों का उपयोग करके फोटो को देखता है और प्रश्न पूछता है जैसे:
    • "वहाँ कितने लाल ट्रक हैं?" (गिनती करना)
    • "बस किस रंग की है?" (विवरण देना)
    • "क्या यह व्यस्त समय है या देर रात का समय?" (संदर्भ)
  • छात्र (AI मॉडल): फोटो को देखता है और उत्तर देने की कोशिश करता है।

उन्होंने स्मार्ट कंप्यूटर प्रोग्रामों का उपयोग करके हजारों ऐसे प्रश्न स्वचालित रूप से तैयार किए, फिर मनुष्यों से उत्तरों की जांच करवाई ताकि सुनिश्चित हो सके कि वे सही हैं।

4. परीक्षण: रोबोट कितने स्मार्ट हैं?

लेखकों ने आज के सबसे स्मार्ट AI मॉडल्स में से चार को (जो उन्नत चैटबॉट्स के पीछे के दिमाग हैं) बिना किसी अतिरिक्त प्रशिक्षण के यह "इंडियन रोड क्विज़" दिया। यह एक जीरो-शॉट टेस्ट था—जिसका अर्थ है कि रोबानों को पूरी तरह से अपने मौजूदा ज्ञान पर निर्भर रहना था।

परिणाम:

  • अच्छी बात: रोबोट सामान्य माहौल को समझने में काफी अच्छे थे, जैसे "क्या दिन है या रात?" या "क्या ट्रैफिक भारी है?" ("सराउंडिंग डिस्क्रिप्शन" कार्य)।
  • बुरी बात: वे बारीकियों में संघर्ष करते थे। जब उनसे पूछा गया "वहाँ कितनी मोटरसाइकिलें हैं?" या "उस विशिष्ट कार का रंग क्या है?", तो वे अक्सर गलत हो गए।
  • "हैलुसिनेशन" (भ्रम) की समस्या: यह सबसे मजेदार और डरावना हिस्सा है। रोबोट कभी-कभी चीजें बना लेते थे
    • उदाहरण: यदि तस्वीर में कोई गाय नहीं थी, तो एक रोबोट आत्मविश्वास से कह सकता था, "हाँ, बाईं ओर एक गाय है।"
    • यह एक छात्र द्वारा परीक्षा में उत्तर देने के डर से अनुमान लगाने जैसा है, भले ही उत्तर गलत हो।

5. यह क्यों महत्वपूर्ण है

यह शोध पत्र एक चेतावनी है। यह दिखाता है कि हालांकि AI स्मार्ट हो रहा है, फिर भी इसे अव्यवस्थित, अनस्ट्रक्चर्ड वास्तविकता के साथ संघर्ष करना पड़ता है।

  • उपमा: कल्पना कीजिए कि आप एक शतरंज खिलाड़ी को केवल एक आदर्श, सफेद संगमरमर के बोर्ड पर खेलने के लिए सिखा रहे हैं। जब आप उन्हें असमान पत्थरों से बने बोर्ड पर रखते हैं जहाँ हवा के झोंकों से मोहरे हिल रहे हों, तो वे भ्रमित हो जाते हैं।
  • समाधान: RoadscapesQA वह "असमान पत्थर वाला बोर्ड" प्रदान करता है ताकि डेवलपर्स अपने रोबोट को वास्तविक दुनिया को संभालने के लिए प्रशिक्षित कर सकें।

सारांश

लेखकों ने भारत में खुद चलने वाली कारों के लिए एक विशेष प्रशिक्षण नियमावली बनाई है। उन्होंने वास्तविक जीवन की अराजकता को कैप्चर करने के लिए एक साधारण कैमरे का उपयोग किया, उन छवियों को एक विशाल क्विज़ में बदल दिया, और शीर्ष AI मॉडल्स का परीक्षण किया। उन्होंने पाया कि हालांकि मॉडल बेहतर हो रहे हैं, फिर भी उन्हें यह सीखने की आवश्यकता है कि जब सड़क अव्यवस्थित हो जाए तो "हैलुसिनेट" (चीजें बनाना) करना कैसे बंद किया जाए। यह डेटासेट यह सुनिश्चित करने की दिशा में एक महत्वपूर्ण कदम है कि स्वायत्त कारें केवल उन लोगों के लिए सुरक्षित हों जो व्यवस्थित शहरों में रहते हैं, बल्कि सभी के लिए सुरक्षित हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →