Can Vision-Language Models Answer Face to Face Questions in the Real-World?
यह शोध पत्र लाइव वीडियो और ऑडियो के बारे में वास्तविक समय के प्रश्नों का उत्तर देने के लिए विजन-लैंग्वेज मॉडल्स की क्षमता को बेंचमार्क करने हेतु क्वालकॉम इंटरैक्टिव वीडियो डेटासेट (IVD) को प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि वर्तमान मॉडल मनुष्यों से काफी पीछे हैं, लक्षित फाइन-ट्यूनिंग इन इंटरैक्टिव कार्यों पर उनके प्रदर्शन में काफी सुधार कर सकती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास "VisionBot" नाम का एक रोबोट दोस्त है। आपने VisionBot को एक लिविंग रूम की फोटो देखकर यह बताने के लिए प्रशिक्षित किया है कि "वह एक लाल सोफा है," या "कालीन पर एक बिल्ली सो रही है।" VisionBot इसमें बहुत माहिर है। यह एक बहुत ही बुद्धिमान लाइब्रेरियन की तरह है जो तुरंत एक स्थिर किताब में से तथ्य ढूंढ सकता है।
लेकिन अब, कल्पना कीजिए कि आप VisionBot को एक रियल-टाइम बातचीत करने वाला साथी बनाना चाहते हैं। आप अपना फोन पकड़े हुए अपने घर में घूम रहे हैं, और आप VisionBot से पूछते हैं, "हे, क्या मैं इस कप को सही तरीके से पकड़े हुए हूँ?" या "मैंने अभी कितनी बार ताली बजाई?" जबकि आप यह सब कर रहे हैं।
यहीं पर VisionBot लड़खड़ाने लगता है। यह एक लाइब्रेरियन को आपके साथ एक लाइव डांस पार्टी में शामिल होने और लय के साथ तालमेल बिठाने के लिए कहने जैसा है, लेकिन वह लाइब्रेरियन एक शांत पुस्तकालय में किताबें पढ़ने का आदी है। वे तथ्यों को जानते हैं, लेकिन वे यह नहीं जानते कि कब बोलना है या वर्तमान में हो रही चीजों पर कैसे प्रतिक्रिया देनी है।
समस्या: "टाइम ट्रैवल" गैप (समय यात्रा का अंतर)
यह शोध पत्र तर्क देता है कि वर्तमान AI मॉडल उन समय यात्रियों की तरह हैं जो केवल भविष्य को जानते हैं।
- पुराना AI: आप उसे किसी व्यक्ति के 10 बार ताली बजाने का पूरा वीडियो देते हैं, और फिर आप पूछते हैं, "उन्होंने कितनी बार ताली बजाई?" AI पूरा वीडियो देखता है, गिनता है, और उत्तर देता है। यह एक फिल्म देखने और फिर उसके बाद क्विज़ देने जैसा है।
- वास्तविक जीवन: वास्तविक दुनिया में, आप सवाल तब पूछते हैं जब व्यक्ति ताली बजा रहा होता है। AI को सवाल सुनना होगा, वीडियो को सामने घटते हुए देखना होगा, यह महसूस करना होगा कि, "ओह, वे अभी भी ताली बजा रहे हैं, मुझे इंतजार करना चाहिए," और फिर बिल्कुल सही क्षण पर उत्तर देना होगा।
वर्तमान AI मॉडल इसमें बहुत खराब हैं। या तो वे बहुत जल्दी जवाब दे देते हैं (एक्शन खत्म होने से पहले) या वे भ्रमित हो जाते हैं क्योंकि वे रीयल-टाइम में जो वे देखते हैं (वीडियो) और जो वे सुनते हैं (ऑडियो) उसे जोड़ नहीं पाते हैं।
समाधान: "QIVD" प्लेग्राउंड
इसे ठीक करने के लिए, Qualcomm के शोधकर्ताओं ने QIVD (Qualcomm Interactive Video Dataset) नामक एक नया प्लेग्राउंड बनाया है।
QIVD को AI रोबोटों के लिए एक जिम के रूप में सोचें।
- वर्कआउट: उन्होंने वास्तविक लोगों द्वारा कुछ यादृच्छिक चीजें करने (ताली बजाना, इशारा करना, वस्तुओं को पकड़ना) और ऐसे प्रश्न पूछने (जैसे, "क्या यह मेरी नाक है या मेरी आँख?" या "क्या मैंने अभी गेंद फेंकी?") के 2,900 छोटे वीडियो रिकॉर्ड किए।
- ट्विस्ट: इस डेटासेट में हर सवाल के लिए एक विशेष "स्टॉपवॉच" शामिल है। यह AI को ठीक-ठीक बताता है कि कब पर्याप्त जानकारी उपलब्ध हो गई है जिससे सही उत्तर दिया जा सके।
- उदाहरण: यदि कोई पूछता है, "मैंने कितनी बार ताली बजाई?" तो स्टॉपवॉच कहती है, "अभी उत्तर न दें! तब तक प्रतीक्षा करें जब तक ताली बजना बंद न हो जाए।"
- लक्ष्य: AI को न केवल यह सिखाना कि क्या कहना है, बल्कि यह भी सिखाना कि कब कहना है।
उन्होंने क्या खोजा
शोधकर्ताओं ने सबसे स्मार्ट AI मॉडलों (जैसे GPT-4o और अन्य) को इस जिम में डाला, और परिणाम आश्चर्यजनक थे:
- "ब्लाइंड स्पॉट" (अंधा कोना): यहाँ तक कि सबसे स्मार्ट AI भी "आमने-सामने" के सवालों में बुरी तरह विफल रहे। वे अक्सर एक्शन पूरा होने से पहले ही जवाब दे देते थे या ऑडियो संकेतों को मिस कर देते थे। यह उस छात्र की तरह है जो गणित का फॉर्मूला तो जानता है लेकिन शिक्षक के सवाल पूरा पढ़ने से पहले ही चिल्लाने से खुद को नहीं रोक पाता।
- "ऑडियो अंधापन": कई मॉडलों ने ध्वनि को अनदेखा कर दिया। यदि आपने पूछा, "क्या मैं जोर से बोल रहा हूँ?" और मॉडल ने केवल वीडियो देखा, तो वह उत्तर नहीं दे सका। वे शोर भरे कमरे में बात करने की कोशिश कर रहे उन लोगों की तरह हैं जिन्होंने नॉइज़-कैंसलिंग हेडफ़ोन पहने हुए हैं।
- "फाइन-ट्यूनिंग का जादू": यहाँ अच्छी खबर है। जब उन्होंने इन अनाड़ी रोबोटों को विशेष रूप से इस "जिम" डेटा पर अतिरिक्त अभ्यास (फाइन-ट्यूनिंग) कराया, तो वे बहुत बेहतर हो गए। उन्होंने इंतजार करना, सुनना और दृष्टि और ध्वनि को जोड़ना सीख लिया। यह एक नए ड्राइवर को पार्किंग लॉट में कुछ घंटों के अभ्यास देने जैसा है; अचानक, वे हर चीज़ से टकराना बंद कर देते हैं।
बड़ी तस्वीर
यह शोध पत्र एक वेक-अप कॉल है। हम ऐसा AI बना रहे हैं जो स्थिर चित्रों का वर्णन करने में अद्भुत है, लेकिन हम उस AI से बहुत दूर हैं जो हमारे दैनिक जीवन में एक वास्तविक, रीयल-टाइम साथी बन सके।
उपमा (Analogy):
- वर्तमान AI एक फोटोग्राफर की तरह है जो एक आदर्श तस्वीर लेता है और बाद में उसका कैप्शन लिखता है।
- हमें जो चाहिए वह एक कैमरामैन है जो आपके साथ चल सके, आपकी बातें सुन सके, आपके कार्यों को देख सके, और जो आप कर रहे हैं उसके दौरान ही आपको उपयोगी सलाह दे सके।
QIVD डेटासेट हमारे AI कैमरामैन को यह सिखाने की दिशा में पहला कदम है कि कब रुकना है, देखना है, सुनना है और सही समय पर बोलना है। यह "स्मार्ट कंप्यूटरों" और "सहायक रोबोटों" के बीच का सेतु है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।