← नवीनतम पेपर
💻 computer science

UDVideoQA: A Traffic Video Question Answering Dataset for Multi-Object Spatio-Temporal Reasoning in Urban Dynamics

यह शोध पत्र UDVideoQA प्रस्तुत करता है, जो वास्तविक दुनिया के शहरी यातायात फुटेज से प्राप्त एक बड़े पैमाने का, गोपनीयता-संरक्षित बेंचमार्क डेटासेट है जिसमें मल्टी-ऑब्जेक्ट स्पैटियो-टेम्पोरल रीजनिंग (स्थानिक-कालिक तर्क) के मूल्यांकन के लिए 28K प्रश्न-उत्तर जोड़े शामिल हैं, जो वर्तमान मॉडलों में एक महत्वपूर्ण धारणा-तर्क अंतराल को प्रकट करता है और यह प्रदर्शित करता है कि छोटे ओपन-सोर्स मॉडलों को फाइन-ट्यून करने से मालिकाना प्रणालियों के तुलनीय प्रदर्शन प्राप्त किया जा सकता है।

मूल लेखक: Joseph Raj Vishal, Nagasiri Poluri, Katha Naik, Rutuja Patil, Kashyap Hegde Kota, Krishna Vinod, Prithvi Jai Ramesh, Mohammad Farhadi, Yezhou Yang, Bharatesh Chakravarthi

प्रकाशित 2026-02-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Joseph Raj Vishal, Nagasiri Poluri, Katha Naik, Rutuja Patil, Kashyap Hegde Kota, Krishna Vinod, Prithvi Jai Ramesh, Mohammad Farhadi, Yezhou Yang, Bharatesh Chakravarthi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को शहर के व्यस्त यातायात में कार चलाने के लिए सिखाने की कोशिश कर रहे हैं। आप केवल यह नहीं चाहते कि रोबोट को यह पता हो कि स्टॉप साइन कैसा दिखता है; आप चाहते हैं कि वह यह भी समझे कि एक कार क्यों रुकी, तीन सेकंड पहले पैदल चलने वाला व्यक्ति क्या कर रहा था, और क्या होता अगर लाइट लाल होने के बजाय हरी हो जाती।

यह शोध पत्र एक नए, विशाल "ट्रेनिंग जिम" का परिचय देता है, जिसे UDVideoQA कहा जाता है, जो इन रोबोटिक दिमागों के लिए बनाया गया है।

यहाँ उन्होंने जो किया है, उसका विवरण सरल उपमाओं (analogies) का उपयोग करते हुए दिया गया है:

1. समस्या: "पाठ्यपुस्तक" बनाम "वास्तविक दुनिया"

आज के अधिकांश AI मॉडल उन छात्रों की तरह हैं जो केवल आदर्श, साफ-सुथरी पाठ्यपुस्तकों से अध्ययन करते हैं। उन्हें छोटे, चुनिंदा क्लिप्स पर प्रशिक्षित किया जाता है जहाँ सब कुछ स्पष्ट है, रोशनी एकदम सही है, और कलाकार अपनी भूमिकाएँ जानते हैं।

  • वास्तविकता: वास्तविक शहर का ट्रैफ़िक अव्यवस्थित होता है। बारिश हो रही होती है, लोग फुटपाथ पार कर रहे होते हैं, गाड़ियाँ हॉर्न बजा रही होती हैं, और रोशनी दोपहर की चमक से लेकर अंधेरी रात तक बदलती रहती है।
  • अंतराल (Gap): जब आप इन "पाठ्यपुस्तक-प्रशिक्षित" रोबोटों को असली सड़क पर उतारते हैं, तो वे भ्रमित हो जाते हैं। वे मतिभ्रम (hallucinate) का शिकार हो सकते हैं (ऐसी चीजें देखना जो वहाँ नहीं हैं) या सरल विवरणों को मिस कर सकते हैं क्योंकि उन्होंने कभी भी एक अव्यवस्थित चौराहे का दृश्य नहीं देखा है।

2. समाधान: "अर्बन डायनेमिक्स" जिम

शोधकर्ताओं ने UDVideoQA बनाया है, जो शहर के चौराहों से लिए गए वास्तविक, बिना स्क्रिप्ट वाले ट्रैफिक वीडियो का एक विशाल डेटासेट है।

  • मात्रा: यह वीडियो के 1.7 मिलियन फ्रेम देखने जैसा है। यह बहुत सारा ट्रैफिक है!
  • गोपनीयता कवच (Privacy Shield): चूंकि उन्होंने वास्तविक लोगों की शूटिंग की थी, इसलिए उन्हें उनकी पहचान सुरक्षित रखनी थी। केवल चेहरों को धुंधला करने के बजाय (जिससे दृश्य अजीब लग सकता है या दृश्य बाधित हो सकता है), उन्होंने एक विशेष "मोशन-ब्लर" तकनीक का उपयोग किया।
    • उपमा: कल्पना कीजिए कि एक चित्रकार जो कैनवास के केवल उन हिस्सों पर पेंट करता है जो हिल रहे हैं (जैसे चलता हुआ व्यक्ति या चलती हुई कार), लेकिन स्थिर बैकग्राउंड (जैसे सड़क, पेड़ और संकेत) को पूरी तरह से स्पष्ट छोड़ देता है। यह दृश्य को वास्तविक बनाए रखता है जबकि गोपनीयता की रक्षा करता है।

3. परीक्षण: "बौद्धिक शक्ति" के 5 स्तर

उन्होंने केवल "क्या वहाँ एक कार है?" जैसे सरल प्रश्न नहीं पूछे। उन्होंने यह परीक्षण करने के लिए प्रश्नों का एक पदानुक्रम (hierarchy) बनाया कि AI वास्तव में कितना स्मार्ट है। इसे एक वीडियो गेम की तरह पाँच स्तरों के रूप में समझें:

  1. स्तर 1: पर्यवेक्षक (Attribution): "उस कार का रंग क्या है?" या "क्या बारिश हो रही है?" (बुनियादी तथ्य)।
  2. स्तर 2: कथावाचक (Basic Understanding): "इस दृश्य में कुल मिलाकर क्या हो रहा है?" (दृश्य के माहौल का सारांश देना)।
  3. स्तर 3: जासूस (Event Reasoning): "सिल्वर कार क्यों ब्रेक लगी?" (कारण और प्रभाव को जोड़ना)।
  4. स्तर 4: समय यात्री (Reverse Reasoning): "पैदल यात्री सड़क के बीच में है। ट्रैफिक लाइट सड़क से उतरने से पहले क्या कर रही थी?" (पीछे की ओर काम करना)।
  5. स्तर 5: दार्शनिक (Counterfactual Inference): "यदि लाइट हरी होती, तो क्या मोटरसाइकिल दुर्घटनाग्रस्त हो जाती?" ("क्या होता अगर" वाले परिदृश्यों का परीक्षण करना बिना मतिभ्रम के)।

4. परिणाम: "स्मार्ट लेकिन अंधा" विरोधाभास

शोधकर्ताओं ने 10 सबसे उन्नत AI मॉडलों (जैसे Gemini, GPT-4, और Qwen) का इस नए जिम पर परीक्षण किया। परिणाम आश्चर्यजनक थे:

  • "बड़े दिमाग" का जाल (The "Big Brain" Trap): सबसे बड़े, महंगे मॉडल (जैसे Gemini Pro) "दार्शनिक" स्तर पर बेहतरीन थे। वे अनुमान लगा सकते थे कि काल्पनिक परिदृश्य में क्या हो सकता है। हालाँकि, वे "पर्यवेक्षक" स्तर पर बहुत खराब थे। वे अक्सर यह नहीं बता पाते थे कि कार सिल्वर है या ग्रे, या सड़क गीली है या नहीं।
    • उपमा: यह एक ऐसे प्रतिभाशाली प्रोफेसर की तरह है जो ट्रैफिक थ्योरी पर थीसिस लिख सकता है लेकिन यह नोटिस करने में विफल रहता है कि उसके सामने खड़ा व्यक्ति लाल टोपी पहने हुए है। वे बुद्धिमान हैं, लेकिन वे वीडियो को "देख" नहीं रहे हैं।
  • "छोटा लेकिन प्रशिक्षित" नायक: एक छोटा, ओपन-सोर्स मॉडल (Qwen 2.5-VL) शुरुआत में औसत था। लेकिन जब शोधकर्ताओं ने उसे विशेष रूप से इस अव्यवस्थित ट्रैफिक डेटा पर "क्रैश कोर्स" (fine-tuning) दिया, तो वह सुपरस्टार बन गया। उसने विवरणों को देखना और उनके बारे में तर्क करना सीख लिया, और अंततः कम रोशनी की स्थितियों में बड़े मॉडलों को भी पीछे छोड़ दिया।

5. नया चैलेंज: "सही सवाल पूछना"

उन्होंने एक साइड चैलेंज भी पेश किया जिसे VideoQGen कहा जाता है। सवालों के जवाब देने के बजाय, AI को खुद सवाल बनाने होते हैं।

  • परिणाम: सर्वश्रेष्ठ मॉडल गहरे, जटिल सवाल पूछ सके। लेकिन कई अन्य मॉडल बस उबाऊ, दोहराव वाले सवाल पूछते रहे जैसे "क्या बारिश हो रही है?" यह दर्शाता है कि हालांकि AI बात करने में बेहतर हो रहा है, लेकिन वह वास्तव में रचनात्मक और विविध होने के लिए अभी भी संघर्ष कर रहा है।

मुख्य निष्कर्ष

यह शोध पत्र हमें बताता है कि AI को वास्तव में सुरक्षित और उपयोगी बनाने के लिए (जैसे सेल्फ-ड्राइविंग कारों या शहर की निगरानी के लिए), हम केवल उन्हें अधिक डेटा देकर काम नहीं चला सकते। हमें उन्हें गहराई से सोचने (reasoning) से पहले, बारीकी से देखना (grounding) सिखाना होगा।

UDVideoQA इस "अंधेपन" को ठीक करने और ऐसे AI बनाने में मदद करने के लिए एक नया मानक उपकरण है जो केवल अनुमान नहीं लगाता, बल्कि वास्तव में हमारे शहरों के अराजक और सुंदर शोर-शराबे को देखता और समझता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →