← नवीनतम पेपर
💻 computer science

Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning

यह शोध पत्र Know-Show प्रस्तुत करता है, जो एक नया बेंचमार्क और GRAM नामक एक प्रशिक्षण-मुक्त विधि है, जिसका उद्देश्य विविध परिदृश्यों में दृश्य और टेम्पोरल लोकलाइजेशन (स्थानिक-कालिक स्थानीयकरण) के साथ तर्क को एकीकृत करके वीडियो-लैंग्वेज मॉडल्स की स्थानिक-कालिक ग्राउंडेड रीजनिंग क्षमताओं का मूल्यांकन करना और उनमें सुधार करना है।

मूल लेखक: Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

प्रकाशित 2026-04-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक होम सिक्योरिटी वीडियो देख रहे हैं। एक व्यक्ति रसोई में आता है, फ्रिज खोलता है, दूध का एक कार्टन निकालता है, और उसे एक गिलास में डालता है।

यदि आप एक इंसान से पूछें, "दूध किसने डाला और उन्होंने यह कब किया?", तो वह तुरंत व्यक्ति की ओर इशारा कर सकता है, कह सकता है, "यह नीली शर्ट वाला आदमी था," और घड़ी के सटीक समय को बता सकता है। उन्हें उत्तर पता है और वे आपको उसका प्रमाण दिखा सकते हैं।

अब, एक सुपर-स्मार्ट एआई (AI) रोबोट से वही सवाल पूछने की कल्पना करें। शोध पत्र, जिसका शीर्षक "Know-Show" है, एक मजेदार लेकिन गंभीर समस्या को उजागर करता है: रोबोट कह सकता है, "एक व्यक्ति ने दूध डाला!" (यहाँ Know वाला हिस्सा ठीक है)। लेकिन यदि आप उससे पूछें, "मुझे दिखाओ कि ठीक किसने और कब किया," तो रोबोट गलत व्यक्ति की ओर इशारा कर सकता है, गलत समय का अनुमान लगा सकता है, या बस खाली नजरों से देखता रह सकता है। वह कहानी को तो जानता है, लेकिन वह उस कहानी को वास्तविक वीडियो साक्ष्य के साथ ग्राउंड (ground) यानी जोड़ नहीं पाता है।

इसे ठीक करने के लिए शोधकर्ताओं ने क्या किया है, इसका एक सरल विवरण यहाँ दिया गया है।

1. समस्या: "भ्रमित" (Hallucinating) जासूस

वर्तमान एआई वीडियो मॉडल उन जासूसों की तरह हैं जिन्होंने अपराध स्थल को देखे बिना एक रहस्य उपन्यास पढ़ लिया है। वे कहानी का अंदाजा लगाने में माहिर हैं ("बटलर ने ही किया है!") क्योंकि उन्होंने लाखों कहानियाँ पढ़ी हैं। लेकिन जब आप उनसे पूछते हैं कि बटलर ने किस क्षण बंदूक उठाई थी, तो वे खो जाते हैं।

  • अंतराल (The Gap): वे वस्तुओं (एक फ्रिज, एक हाथ) को पहचान सकते हैं और समय (पहले यह, फिर वह) को समझ सकते हैं, लेकिन उन्हें एक साथ जोड़ने में उन्हें संघर्ष करना पड़ता है। वे यह नहीं कह सकते कि, "व्यक्ति A का बायां हाथ 12:05 PM पर फ्रिज के हैंडल को छू रहा था।"
  • परिणाम: वास्तविक दुनिया में (जैसे कि सेल्फ-ड्राइविंग कार या मेडिकल मॉनिटरिंग में), यह खतरनाक है। यदि एक कार का एआई सोचता है कि पैदल यात्री सड़क पार कर रहा है लेकिन वह यह नहीं बता पाता कि कहाँ और कब, तो दुर्घटना हो सकती है।

2. समाधान: "Know-Show" बेंचमार्क

शोधकर्ताओं ने Know-Show नामक एक नया परीक्षण बनाया है। इसे एक वीडियो एआई के लिए फाइनल एग्जाम की तरह समझें, लेकिन एक ट्विस्ट के साथ।

केवल यह पूछने के बजाय कि, "क्या हो रहा है?", यह परीक्षा पूछती है:

  1. Know (जानना): क्या हो रहा है?
  2. Show (दिखाना): शामिल व्यक्ति, वस्तु या हाथ की ओर सटीक रूप से इशारा करें, और मुझे बताएं कि यह बिल्कुल किस सेकंड में हुआ।

इसमें कठिनाई के पांच स्तर हैं, जैसे कि एक वीडियो गेम:

  • स्तर 1: क्रिया करने वाले व्यक्ति की ओर इशारा करें।
  • स्तर 2: उपयोग की जा रही वस्तु की ओर इशारा करें।
  • स्तर 3: व्यक्ति और वस्तु दोनों को एक साथ दिखाएं।
  • स्तर 4 (बॉस लेवल): वस्तु को छूने वाले विशिष्ट हाथ की ओर इशारा करें। (यह बहुत कठिन है क्योंकि हाथ तेजी से चलते हैं और छोटे होते हैं)।
  • स्तर 5: घटनाओं का सटीक क्रम बताएं और वे कब शुरू हुईं।

स्कोर: एआई को अंक तभी मिलते हैं जब वह सही उत्तर देता है और सही जगह और सही समय पर इशारा करता है। यदि वह उत्तर सही देता है लेकिन गलत व्यक्ति की ओर इशारा करता है, तो उसे शून्य मिलता है।

3. परिणाम: AI बनाम मानव

जब उन्होंने उपलब्ध सबसे स्मार्ट एआई मॉडल्स (जैसे GPT-4o, Gemini, आदि) पर यह परीक्षण चलाया, तो परिणाम विनम्र करने वाले थे:

  • मानव: 75% से अधिक स्कोर करते हैं। हम स्वाभाविक रूप से क्रियाओं को विशिष्ट लोगों और समय से जोड़ देते हैं।
  • एआई मॉडल: बहुत कम स्कोर करते हैं (अक्सर 20-30% से भी कम)। वे सामान्य विचार का अनुमान लगाने में तो अच्छे थे लेकिन "प्रमाण" देने में बहुत खराब थे। वे अक्सर भ्रमित हो जाते थे कि कौन क्या कर रहा है, या क्रिया शुरू होने के सटीक क्षण को चूक जाते थे।

4. समाधान: GRAM (एक "फ्लैशलाइट" प्लग-इन)

शोधकर्ता विशाल एआई मॉडल्स को फिर से प्रशिक्षित (retrain) नहीं करना चाहते थे (जिसमें वर्षों और लाखों डॉलर लगते हैं)। इसके बजाय, उन्होंने GRAM नामक एक "प्लग-इन" बनाया।

GRAM को एआई के लिए एक फ्लैशलाइट और एक टाइम-स्टैम्प मार्कर के रूप में सोचें:

  • फ्लैशलाइट (अटेंशन सिलेक्शन): जब एआई तर्क करना शुरू करता है ("ठीक है, फ्रिज किसने खोला?"), तो GRAM एआई को उन विशिष्ट वीडियो फ्रेम्स को देखने के लिए मजबूर करता है जहाँ फ्रिज वास्तव में खोला जा रहा है। यह धुंधले बैकग्राउंड को हटा देता है और केवल प्रासंगिक पिक्सेल पर ध्यान केंद्रित करता है।
  • टाइम-स्टैम्प मार्कर: एआई आमतौर पर एक अस्पष्ट भावना के आधार पर समय का अनुमान लगाता है। GRAM वास्तव में समय (जैसे, "5.2 सेकंड") को एआई की विचार प्रक्रिया में लिख देता है, जिससे उसे अपने उत्तर को वीडियो के क्लॉक (घड़ी) के साथ संरेखित करने के लिए मजबूर किया जाता है।

परिणाम: जब उन्होंने इस "फ्लैशलाइट" को एआई में जोड़ा, तो इसके प्रदर्शन में काफी उछाल आया। यह पूर्ण तो नहीं हुआ, लेकिन इसने आखिरकार केवल अनुमान लगाने के बजाय "जो वह जानता है उसे दिखाना" शुरू कर दिया।

बड़ी तस्वीर (The Big Picture)

यह शोध पत्र एक चेतावनी है। यह हमें बताता है कि हालांकि एआई वीडियो के बारे में "बात करने" में बेहतर हो रहा है, लेकिन यह अभी भी जो वह बात कर रहा है उसे "देखने" और "सिद्ध करने" में संघर्ष कर रहा है।

  • पहले: एआई एक ऐसे कहानीकार की तरह था जो विवरण बनाता है।
  • बाद में (Know-Show और GRAM के साथ): हम एआई को एक फोरेंसिक विश्लेषक बनने की शिक्षा दे रहे हैं जिसे हर दावे के साथ दृश्य साक्ष्य और टाइमस्टैंप प्रस्तुत करना होगा।

यह भविष्य के लिए महत्वपूर्ण है। यदि हम चाहते हैं कि रोबोट अस्पतालों में मदद करें, कार चलाएं, या सुरक्षा की निगरानी करें, तो वे केवल अनुमान नहीं लगा सकते; उन्हें पता होना चाहिए कि किसने, क्या और कब किया, और उन्हें हमें प्रमाण दिखाने में सक्षम होना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →