← नवीनतम पेपर
💻 computer science

VidHal: Benchmarking Temporal Hallucinations in Vision LLMs

यह शोध पत्र VidHal को प्रस्तुत करता है, जो विज़न लार्ज लैंग्वेज मॉडल्स में टेम्पोरल हैलुसिनेशन (temporal hallucinations) का मूल्यांकन करने के लिए डिज़ाइन किया गया एक नया बेंचमार्क है, जो हैलुसिनेशन के विभिन्न स्तरों के साथ कैप्शन जेनरेट करता है और मॉडल की सीमाओं के सूक्ष्म मूल्यांकन को सक्षम करने के लिए एक कैप्शन ऑर्डरिंग टास्क का प्रस्ताव करता है।

मूल लेखक: Wey Yeh Choong, Yangyang Guo, Mohan Kankanhalli

प्रकाशित 2026-04-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wey Yeh Choong, Yangyang Guo, Mohan Kankanhalli

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान रोबोट मित्र है जो वीडियो देख सकता है और उनके बारे में बात कर सकता है। आप उससे पूछते हैं, "इस वीडियो में क्या हो रहा है?" और वह एक विस्तृत उत्तर देता है। आमतौर पर, यह बहुत अच्छा होता है। लेकिन कभी-कभी, रोबोट मनगढ़ंत बातें बनाने लगता है। वह कह सकता है कि एक कार बाएँ जा रही है जबकि वास्तव में वह दाएँ जा रही है, या दावा कर सकता है कि एक व्यक्ति कूद रहा है जबकि वह केवल चल रहा है। एआई (AI) की दुनिया में, हम इन आत्मविश्वासपूर्ण झूठों को हैलुसिनेशन (hallucinations) कहते हैं।

लंबे समय से, शोधकर्ता यह परीक्षण कर रहे हैं कि रोबोट तस्वीरों के बारे में कितनी बार झूठ बोलते हैं। लेकिन वीडियो अलग हैं; एक फोटो एक स्थिर क्षण है; एक वीडियो समय, दिशा और क्रम के साथ एक चलती-फिरती कहानी है। अब तक, किसी के पास यह जांचने का अच्छा तरीका नहीं था कि ये रोबोट वीडियो की कहानी के बारे में झूठ बोल रहे हैं या नहीं, न कि केवल तस्वीर के बारे में।

यह पेपर VidHal पेश करता है, जो विशेष रूप से इन वीडियो-आधारित झूठों को पकड़ने के लिए डिज़ाइन किया गया एक नया "परीक्षा" (exam) है।

समस्या: रोबोट का "दिवास्वप्न देखना" (Daydreaming)

एक विजन लार्ज लैंग्वेज मॉडल (VLLM) को एक ऐसे छात्र की तरह समझें जो तथ्य याद करने में बहुत अच्छा है लेकिन जब चीजें हिलती हैं तो कभी-कभी भ्रमित हो जाता है।

  • फोटो टेस्ट: यदि आप उसे एक बिल्ली की तस्वीर दिखाते हैं, तो रोबोट हैलुसिनेशन कर सकता है और कह सकता है, "बिल्ली ने टोपी पहनी है," भले ही उसने न पहनी हो। हम तस्वीरों के लिए इसे टेस्ट करने का तरीका जानते थे।
  • वीडियो टेस्ट: यदि आप उसे एक बिल्ली का वीडियो दिखाते हैं जो बाएँ दौड़ रही है, तो रोबोट कह सकता है कि "बिल्ली दाएँ दौड़ रही है," या "बिल्ली रुकी और फिर फिर से शुरू हुई।" क्योंकि वीडियो में समय और दिशा होती है, इसलिए इन झूठों को पहचानना और टेस्ट करना कठिन होता है।

समाधान: VidHal (वीडियो हैलुसिनेशन बेंचमार्क)

लेखकों ने VidHal बनाया है, जो वीडियो क्लिप्स का एक विशाल पुस्तकालय है, जिसमें से प्रत्येक के साथ तीन अलग-अलग विवरण दिए गए हैं:

  1. सत्य (The Truth): वास्तव में क्या हुआ उसका एक सटीक विवरण।
  2. "शायद" वाला झूठ (The "Maybe" Lie): एक ऐसा विवरण जो लगभग सही है लेकिन उसमें एक छोटी सी त्रुटि है (जैसे, "कार बाएँ मुड़ी" जबकि वह वास्तव में थोड़ा सा बाएँ मुड़ी थी)।
  3. बड़ा झूठ (The Big Lie): एक ऐसा विवरण जो पूरी तरह से गलत है (जैसे, "कार आसमान में उड़ गई")।

रचनात्मक उपमा: "झूठ पकड़ने वाला" खेल (The "Lie Detector" Game)
कल्पना कीजिए कि आप अपने रोबोट दोस्त के साथ एक खेल खेल रहे हैं। आप उसे तीन गेंदों के साथ करतब दिखा रहे व्यक्ति का एक वीडियो दिखाते हैं। फिर, आप उसे तीन कार्ड देते हैं जिन पर वाक्य लिखे हुए हैं:

  • कार्ड A: "व्यक्ति तीन गेंदों के साथ करतब कर रहा है।" (सत्य)
  • कार्ड B: "व्यक्ति चार गेंदों के साथ करतब कर रहा है।" (छोटा झूठ)
  • कार्ड C: "व्यक्ति तरबूज के साथ करतब कर रहा है।" (बड़ा झूठ)

केवल यह पूछने के बजाय कि, "कौन सा सही है?" (जो कि बहुत आसान है), VidHal रोबोट को उन्हें रैंक (क्रम में लगाना) करने के लिए कहता है।

  • "इन कार्डों को सबसे सटीक से लेकर सबसे बेतुके के क्रम में रखें।"

यह एक बहुत कठिन परीक्षण है। यह रोबोट को न केवल बड़े झूठ को पहचानने के लिए, बल्कि एक छोटी गलती और एक बड़ी गलती के बीच के सूक्ष्म अंतर (nuance) को समझने के लिए मजबूर करता है। यह एक छात्र को टेस्ट पेपर ग्रेड करने के लिए कहने जैसा है कि केवल "पास/फेल" के आधार पर नहीं, बल्कि यह समझाने के लिए कि प्रत्येक प्रश्न पर कितने अंक काटे गए।

उन्होंने क्या पाया

शोधकर्ताओं ने इस नए एग्जाम का उपयोग करके 23 अलग-अलग एआई मॉडल (मुफ्त, ओपन-सोर्स और GPT-4 और Gemini जैसे महंगे, निजी मॉडल दोनों) का परीक्षण किया। यहाँ उनकी खोजें दी गई हैं:

  1. रोबोट अभी भी दिवास्वप्न देख रहे हैं: सबसे स्मार्ट मॉडल भी वीडियो के "चलती-फिरती कहानी" वाले हिस्सों के साथ संघर्ष करते हैं। वे यह कहने में माहिर हैं कि "वह एक कुत्ता है," लेकिन यह बताने में खराब हैं कि "कुत्ता बाएँ फिर दाएँ दौड़ा।"
  2. बड़ा होना हमेशा बेहतर नहीं होता: आश्चर्यजनक रूप से, कुछ छोटे मॉडल बड़े मॉडलों के समान ही अच्छा प्रदर्शन करते हैं। ऐसा लगता है कि केवल अधिक "मस्तिष्क शक्ति" (पैरामीटर्स) जोड़ने से समय और दिशा के बारे में झूठ बोलने की समस्या अपने आप ठीक नहीं हो जाती।
  3. "स्नैपशॉट" पूर्वाग्रह (The "Snapshot" Bias): शोधकर्ताओं ने पाया कि कई रोबोट वास्तव में नकल (cheating) कर रहे हैं। पूरे वीडियो को देखने के बजाय, वे केवल एक एकल फ्रेम (एक स्नैपशॉट) देख रहे हैं और अनुमान लगा रहे हैं।
    • उपमा: यह फिल्म के कथानक का अनुमान लगाने के लिए बीच से ली गई केवल एक स्थिर फोटो देखने जैसा है। आप पात्रों को सही पहचान लेंगे, लेकिन कहानी गलत कर देंगे। पेपर दिखाता है कि जब आप रोबोट को पूरा वीडियो देखने के लिए मजबूर करते हैं, तो वे बेहतर हो जाते हैं, लेकिन वे अभी भी उस एकल स्नैपशॉट पर बहुत अधिक निर्भर रहते हैं।

यह क्यों महत्वपूर्ण है

यह पेपर एक चेतावनी है। यह हमें बताता है कि जबकि एआई देखने में बेहतर हो रहा है, यह अभी भी समय की कहानी में खो जाता है।

  • डेवलपर्स के लिए: उन्हें ऐसे रोबोट बनाने की आवश्यकता है जो केवल स्थिर छवियों पर नहीं, बल्कि समय के प्रवाह पर ध्यान दें।
  • हमारे लिए: यह हमें वीडियो विश्लेषण (जैसे सुरक्षा फुटेज या मेडिकल वीडियो) के लिए एआई पर भरोसा करते समय सावधान रहने की याद दिलाता है। यदि एआई आपको घटनाओं का सही क्रम नहीं बता सकता है, तो यह कुछ महत्वपूर्ण चूक सकता है।

संक्षेप में: VidHal एक नया, कठिन परीक्षण है जो एआई रोबोट को वीडियो के बारे में कहानियाँ बनाते हुए पकड़ता है। यह दिखाता है कि हमारे सबसे स्मार्ट रोबोट भी समय और दिशा के बारे में दिवास्वप्न देखने के प्रति प्रवृत्त हैं, और हमें उन्हें पूरी फिल्म देखने के लिए सिखाने की आवश्यकता है, न कि केवल स्थिर फोटो देखने के लिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →