Incentivizing Vision Language Models to Search for Long Video Question Answering
यह शोध पत्र VSeek को प्रस्तुत करता है, जो एक एजेंटिक फ्रेमवर्क है जो न्यूरो-सिम्बोलिक रिवार्ड्स के साथ सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करके लंबे वीडियो आधारित प्रश्न-उत्तर को उन्नत करता है, जिससे इस कार्य को एक बहु-चरण खोज प्रक्रिया में परिवर्तित किया जाता है जो औपचारिक टेम्पोरल लॉजिक विनिर्देशों के विरुद्ध पुनर्प्राप्त दृश्य साक्ष्यों को व्यवस्थित रूप से सत्यापित करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपको दो घंटे की एक डॉक्यूमेंट्री थमा दी गई है और आपसे एक बहुत ही विशिष्ट प्रश्न पूछा गया है, जैसे, "जब उस आदमी ने फूलदान गिराया था, तब उसने किस रंग की टोपी पहनी थी?"
पुराना तरीका (पैसिव परसेप्शन - निष्क्रिय धारणा):
वर्तमान AI मॉडल आमतौर पर इस सवाल का जवाब देने के लिए पूरी फिल्म से कुछ यादृच्छिक (रैंडम) फ्रेम देखने की कोशिश करते हैं—शायद पूरे वीडियो से समान रूप से फैले हुए 64 स्नैपशॉट। यह घास के ढेर में से एक विशिष्ट सुई को खोजने के लिए घास की एक मुट्ठी भर उठाने जैसा है। यदि वह सुई उस मुट्ठी में नहीं है, तो AI अनुमान लगाता है, और अक्सर गलत हो जाता है क्योंकि वह उस महत्वपूर्ण क्षण को चूक जाता है।
नया तरीका (VSeek):
यह पेपर VSeek पेश करता है, जो एक स्मार्ट AI एजेंट है जो एक मानव जासूस की तरह काम करता है। बेतरतीब ढंग से अनुमान लगाने के बजाय, VSeek वीडियो टाइमलाइन में सक्रिय रूप से "स्क्रब" करता है। वह सोचता है, "मुझे वह हिस्सा ढूँढना है जहाँ फूलदान गिरता है," और फिर ठीक उसी दृश्य को खोजने के लिए प्राकृतिक भाषा (natural language) का उपयोग करता है। यह एक स्मार्ट सहायक रखने जैसा है जिसे पता है कि वीडियो प्लेयर पर "फाइंड" फंक्शन का उपयोग कैसे करना है ताकि वह सीधे प्रासंगिक क्षण पर जा सके और फिर उत्तर दे सके।
समस्या: हम AI को अच्छी तरह से खोजना कैसे सिखाएं?
AI को एक अच्छा जासूस बनने के लिए प्रशिक्षित करना कठिन है। आमतौर पर, हम AI को केवल यह बताते हैं कि अंतिम उत्तर सही था या गलत (जैसे एक शिक्षक जो अंत में टेस्ट ग्रेड करता है)। लेकिन यदि AI गलत चीजें खोजता है और फिर भी किस्मत से सही उत्तर प्राप्त कर लेता है, तो वह बुरी आदतें सीख लेता है। उसे इस बात पर फीडबैक चाहिए कि उसने कैसे खोजा, न कि केवल अंतिम परिणाम पर।
समाधान: VETL ("विजुअल यूनिट टेस्ट")
इसे ठीक करने के लिए, लेखकों ने VETL (विजुअल एविडेंस वाया टेम्पोरल लॉजिक) नामक एक प्रणाली बनाई। इसे एक चेकलिस्ट या एक रेसिपी में बदलने के रूप में समझें।
इसे तोड़ना: सिस्टम एक जटिल प्रश्न को लेता है और उसे छोटे, निर्विवाद तथ्यों (प्रिमिटिव्स) में तोड़ देता है।
- प्रश्न: "गर्म पानी डालने के बाद उसने दही पर क्या डाला?"
- चेकलिस्ट:
- एक महिला मौजूद है।
- वह गर्म पानी डालती है।
- वह दही चम्मच से लेती है।
- वह ऊपर से कुछ (topping) डालती है।
- वह टॉपिंग दिखाई दे रही है।
इनाम (The Reward): जब AI वीडियो खोजता है, तो सिस्टम उसके "रसीद" (क्लिप्स जो उसने ढूंढे) की जांच करता है। क्या उसने पानी डालने वाला हिस्सा ढूंढा? क्या उसने दही ढूंढा? यदि AI उन क्लिप्स को ढूंढ लेता है जो चेकलिस्ट से मेल खाते हैं, तो उसे अंतिम उत्तर देने से पहले ही "बोनस पॉइंट" (इनाम) मिलता है।
यह एक वीडियो गेम की तरह है जहाँ आपको रास्ते में विशिष्ट चीजें इकट्ठा करने के लिए अंक मिलते हैं, न कि केवल अंतिम बॉस को हराने के लिए अंक मिलते हैं। यह AI को गहन और सटीक होने के लिए प्रशिक्षित करता है।
परिणाम:
इस "चेकलिस्ट" पद्धति का उपयोग करके AI को प्रशिक्षित करने से, VSeek लंबे वीडियो में सही उत्तर खोजने में बहुत बेहतर हो गया।
- इसने रैंडम अनुमान लगाने या रैंडमली खोजने वाले मॉडलों की तुलना में अपनी सटीकता में काफी सुधार किया।
- इसने बेहतर खोज प्रश्न पूछना सीखा (जैसे, केवल "भोजन" खोजने के बजाय "स्ट्रॉबेरी टॉपिंग" खोजना)।
- यह अधिक कुशल बन गया, क्योंकि इसने कुल मिलाकर कम फ्रेम देखे क्योंकि वह जानता था कि उसे क्या खोजना है, बजाय इसके कि वह पूरी फिल्म को घूरता रहे।
सारांश में:
यह पेपर VSeek प्रस्तुत करता है, जो एक ऐसा AI है जो केवल वीडियो को निष्क्रिय रूप से नहीं देखता बल्कि एक जासूस की तरह उत्तरों की तलाश करता है। इसे प्रभावी ढंग से शिकार करना सिखाने के लिए, लेखकों ने VETL का आविष्कार किया, जो प्रश्नों को दृश्य तथ्यों की एक सख्त चेकलिस्ट में बदल देता है। यह AI को तुरंत फीडबैक देता है कि क्या वह सही सबूत जुटा रहा है, जिससे लंबे वीडियो के लिए बहुत अधिक स्मार्ट और सटीक उत्तर मिलते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।