← नवीनतम पेपर
💻 computer science

Can Vision-Language Models Answer Face to Face Questions in the Real-World?

यह शोध पत्र लाइव वीडियो और ऑडियो के बारे में वास्तविक समय के प्रश्नों का उत्तर देने के लिए विजन-लैंग्वेज मॉडल्स की क्षमता को बेंचमार्क करने हेतु क्वालकॉम इंटरैक्टिव वीडियो डेटासेट (IVD) को प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि वर्तमान मॉडल मनुष्यों से काफी पीछे हैं, लक्षित फाइन-ट्यूनिंग इन इंटरैक्टिव कार्यों पर उनके प्रदर्शन में काफी सुधार कर सकती है।

मूल लेखक: Reza Pourreza, Rishit Dagli, Apratim Bhattacharyya, Sunny Panchal, Guillaume Berger, Roland Memisevic

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Reza Pourreza, Rishit Dagli, Apratim Bhattacharyya, Sunny Panchal, Guillaume Berger, Roland Memisevic

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास "VisionBot" नाम का एक रोबोट दोस्त है। आपने VisionBot को एक लिविंग रूम की फोटो देखकर यह बताने के लिए प्रशिक्षित किया है कि "वह एक लाल सोफा है," या "कालीन पर एक बिल्ली सो रही है।" VisionBot इसमें बहुत माहिर है। यह एक बहुत ही बुद्धिमान लाइब्रेरियन की तरह है जो तुरंत एक स्थिर किताब में से तथ्य ढूंढ सकता है।

लेकिन अब, कल्पना कीजिए कि आप VisionBot को एक रियल-टाइम बातचीत करने वाला साथी बनाना चाहते हैं। आप अपना फोन पकड़े हुए अपने घर में घूम रहे हैं, और आप VisionBot से पूछते हैं, "हे, क्या मैं इस कप को सही तरीके से पकड़े हुए हूँ?" या "मैंने अभी कितनी बार ताली बजाई?" जबकि आप यह सब कर रहे हैं।

यहीं पर VisionBot लड़खड़ाने लगता है। यह एक लाइब्रेरियन को आपके साथ एक लाइव डांस पार्टी में शामिल होने और लय के साथ तालमेल बिठाने के लिए कहने जैसा है, लेकिन वह लाइब्रेरियन एक शांत पुस्तकालय में किताबें पढ़ने का आदी है। वे तथ्यों को जानते हैं, लेकिन वे यह नहीं जानते कि कब बोलना है या वर्तमान में हो रही चीजों पर कैसे प्रतिक्रिया देनी है।

समस्या: "टाइम ट्रैवल" गैप (समय यात्रा का अंतर)

यह शोध पत्र तर्क देता है कि वर्तमान AI मॉडल उन समय यात्रियों की तरह हैं जो केवल भविष्य को जानते हैं

  • पुराना AI: आप उसे किसी व्यक्ति के 10 बार ताली बजाने का पूरा वीडियो देते हैं, और फिर आप पूछते हैं, "उन्होंने कितनी बार ताली बजाई?" AI पूरा वीडियो देखता है, गिनता है, और उत्तर देता है। यह एक फिल्म देखने और फिर उसके बाद क्विज़ देने जैसा है।
  • वास्तविक जीवन: वास्तविक दुनिया में, आप सवाल तब पूछते हैं जब व्यक्ति ताली बजा रहा होता है। AI को सवाल सुनना होगा, वीडियो को सामने घटते हुए देखना होगा, यह महसूस करना होगा कि, "ओह, वे अभी भी ताली बजा रहे हैं, मुझे इंतजार करना चाहिए," और फिर बिल्कुल सही क्षण पर उत्तर देना होगा।

वर्तमान AI मॉडल इसमें बहुत खराब हैं। या तो वे बहुत जल्दी जवाब दे देते हैं (एक्शन खत्म होने से पहले) या वे भ्रमित हो जाते हैं क्योंकि वे रीयल-टाइम में जो वे देखते हैं (वीडियो) और जो वे सुनते हैं (ऑडियो) उसे जोड़ नहीं पाते हैं।

समाधान: "QIVD" प्लेग्राउंड

इसे ठीक करने के लिए, Qualcomm के शोधकर्ताओं ने QIVD (Qualcomm Interactive Video Dataset) नामक एक नया प्लेग्राउंड बनाया है।

QIVD को AI रोबोटों के लिए एक जिम के रूप में सोचें।

  • वर्कआउट: उन्होंने वास्तविक लोगों द्वारा कुछ यादृच्छिक चीजें करने (ताली बजाना, इशारा करना, वस्तुओं को पकड़ना) और ऐसे प्रश्न पूछने (जैसे, "क्या यह मेरी नाक है या मेरी आँख?" या "क्या मैंने अभी गेंद फेंकी?") के 2,900 छोटे वीडियो रिकॉर्ड किए।
  • ट्विस्ट: इस डेटासेट में हर सवाल के लिए एक विशेष "स्टॉपवॉच" शामिल है। यह AI को ठीक-ठीक बताता है कि कब पर्याप्त जानकारी उपलब्ध हो गई है जिससे सही उत्तर दिया जा सके।
    • उदाहरण: यदि कोई पूछता है, "मैंने कितनी बार ताली बजाई?" तो स्टॉपवॉच कहती है, "अभी उत्तर न दें! तब तक प्रतीक्षा करें जब तक ताली बजना बंद न हो जाए।"
  • लक्ष्य: AI को न केवल यह सिखाना कि क्या कहना है, बल्कि यह भी सिखाना कि कब कहना है।

उन्होंने क्या खोजा

शोधकर्ताओं ने सबसे स्मार्ट AI मॉडलों (जैसे GPT-4o और अन्य) को इस जिम में डाला, और परिणाम आश्चर्यजनक थे:

  1. "ब्लाइंड स्पॉट" (अंधा कोना): यहाँ तक कि सबसे स्मार्ट AI भी "आमने-सामने" के सवालों में बुरी तरह विफल रहे। वे अक्सर एक्शन पूरा होने से पहले ही जवाब दे देते थे या ऑडियो संकेतों को मिस कर देते थे। यह उस छात्र की तरह है जो गणित का फॉर्मूला तो जानता है लेकिन शिक्षक के सवाल पूरा पढ़ने से पहले ही चिल्लाने से खुद को नहीं रोक पाता।
  2. "ऑडियो अंधापन": कई मॉडलों ने ध्वनि को अनदेखा कर दिया। यदि आपने पूछा, "क्या मैं जोर से बोल रहा हूँ?" और मॉडल ने केवल वीडियो देखा, तो वह उत्तर नहीं दे सका। वे शोर भरे कमरे में बात करने की कोशिश कर रहे उन लोगों की तरह हैं जिन्होंने नॉइज़-कैंसलिंग हेडफ़ोन पहने हुए हैं।
  3. "फाइन-ट्यूनिंग का जादू": यहाँ अच्छी खबर है। जब उन्होंने इन अनाड़ी रोबोटों को विशेष रूप से इस "जिम" डेटा पर अतिरिक्त अभ्यास (फाइन-ट्यूनिंग) कराया, तो वे बहुत बेहतर हो गए। उन्होंने इंतजार करना, सुनना और दृष्टि और ध्वनि को जोड़ना सीख लिया। यह एक नए ड्राइवर को पार्किंग लॉट में कुछ घंटों के अभ्यास देने जैसा है; अचानक, वे हर चीज़ से टकराना बंद कर देते हैं।

बड़ी तस्वीर

यह शोध पत्र एक वेक-अप कॉल है। हम ऐसा AI बना रहे हैं जो स्थिर चित्रों का वर्णन करने में अद्भुत है, लेकिन हम उस AI से बहुत दूर हैं जो हमारे दैनिक जीवन में एक वास्तविक, रीयल-टाइम साथी बन सके।

उपमा (Analogy):

  • वर्तमान AI एक फोटोग्राफर की तरह है जो एक आदर्श तस्वीर लेता है और बाद में उसका कैप्शन लिखता है।
  • हमें जो चाहिए वह एक कैमरामैन है जो आपके साथ चल सके, आपकी बातें सुन सके, आपके कार्यों को देख सके, और जो आप कर रहे हैं उसके दौरान ही आपको उपयोगी सलाह दे सके।

QIVD डेटासेट हमारे AI कैमरामैन को यह सिखाने की दिशा में पहला कदम है कि कब रुकना है, देखना है, सुनना है और सही समय पर बोलना है। यह "स्मार्ट कंप्यूटरों" और "सहायक रोबोटों" के बीच का सेतु है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →