VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning
VideoThinker एक बड़े पैमाने के सिंथेटिक डेटासेट पर एक एजेंटिक VideoLLM को प्रशिक्षित करके लंबे वीडियो को समझने की चुनौती का समाधान करता है, जहाँ एक शक्तिशाली लैंग्वेज मॉडल कैप्शन स्पेस में मल्टी-स्टेप टूल रीजनिंग ट्रेजेक्टरीज उत्पन्न करता है जिसे बाद में वीडियो फ्रेम्स के साथ ग्राउंड किया जाता है, जिससे पूर्व दीर्घकालिक वीडियो समझ की आवश्यकता के बिना अनुकूलित टेम्पोरल एक्सप्लोरेशन और बेहतर प्रदर्शन सक्षम होता है।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक 30-घंटे के मूवी मैराथन में एक रहस्य सुलझाने की कोशिश कर रहे हैं। आपके पास एक सवाल है: "जब जासूस को किचन में सुराग मिला, तब उसने क्या पहना था?"
पुराना तरीका (स्टैंडर्ड वीडियो-एलएलएम - Standard VideoLLMs):
एक थके हुए सहायक की कल्पना करें जो पूरी फिल्म को एक साथ देखने की कोशिश करता है। समय बचाने के लिए, वे पूरी 30 घंटों की फिल्म से केवल 10 रैंडम स्नैपशॉट देखते हैं। वे शायद किचन वाला सीन पूरी तरह से मिस कर दें, या वे फिल्म की शुरुआत के जासूस के कपड़ों को अंत के कपड़ों के साथ मिला दें। वे उन कुछ धुंधले स्नैपशॉट्स के आधार पर अनुमान लगाते हैं, और अक्सर गलत होते हैं क्योंकि उन्होंने उस महत्वपूर्ण क्षण को मिस कर दिया होता है।
"एजेंट" वाला तरीका (करंट एलएलएम एजेंट्स - Current LLM Agents):
एक शानदार जासूस (एक शक्तिशाली टेक्स्ट-आधारित एआई) की कल्पना करें जिसने कभी वह फिल्म देखी ही नहीं है। आप उन्हें एक स्क्रिप्ट (टेक्स्ट कैप्शन) देते हैं और कहते हैं, "जवाब ढूंढो।" वह जासूस स्मार्ट है और उसे टूल्स का उपयोग करना आता है। वह कहता है, "मुझे किचन सीन चेक करने की जरूरत है!" लेकिन वह वीडियो देख नहीं सकता। उसे एक दूसरे व्यक्ति (एक अलग वीडियो एआई) से किचन सीन का वर्णन करने के लिए कहना पड़ता है। फिर वह फिर से पूछता है, "हॉलवे के बारे में क्या?" यह दो लोगों के बीच एक धीमी, बोझिल बातचीत है जहाँ एक अंधा है और दूसरा सिर्फ एक कैमरा है। वे अंततः जवाब पा लेते हैं, लेकिन यह प्रक्रिया अक्षम है और वह "अंधा" जासूस वास्तव में "देखना" कभी नहीं सीख पाता।
नया तरीका: वीडियोथिंकर (VideoThinker)
यह पेपर वीडियोथिंकर (VideoThinker) को पेश करता है, जो एक नया प्रकार का एआई है जो दोनों दुनियाओं के बेहतरीन गुणों को मिलाता है। वीडियोथिंकर को एक "टाइम मशीन" और "मैजिक ज़ूम लेंस" का उपयोग करना सीखने वाले एक सुपर-स्लीथ (सुपर-जासूस) के रूप में सोचें।
यह कैसे काम करता है, यहाँ एक सरल उपमा दी गई है:
1. समस्या: घास के ढेर में सुई (The Needle in a Haystack)
लंबे वीडियो घास के ढेर की तरह होते हैं। किसी विशिष्ट क्षण (सुई) को ढूंढना कठिन है। यदि आप पूरे वीडियो को जल्दी से स्कैन करते हैं, तो आप विवरण मिस कर देते हैं। यदि आप हर एक सेकंड को देखते हैं, तो इसमें बहुत समय लगता है और आपका दिमाग (कंप्यूटर) थक जाता है।
2. समाधान: "वीडियो के साथ सोचना" सीखना
वीडियोथिंकर केवल देखता नहीं है, बल्कि वह जांच करता है। इसे दो विशेष टूल्स का उपयोग करने के लिए प्रशिक्षित किया गया है:
- टेम्पोरल रिट्रीवल (द मैप - Temporal Retrieval): यह टूल वीडियो के सबटाइटल्स या ऑडियो को स्कैन करता है ताकि यह पता चल सके कि दिलचस्प चीजें कहाँ हो सकती हैं। यह वैसा ही है जैसे पूछना, "फिल्म में जासूस किचन में कब जाता है?" और बदले में टाइम स्टैम्प्स की एक सूची प्राप्त करना।
- टेम्पोरल ज़ूम (द मैग्निफाइंग ग्लास - Temporal Zoom): एक बार जब इसे पता चल जाता है कि कहाँ देखना है, तो यह उस विशिष्ट 10-सेकंड के क्लिप पर ज़ूम करता है। यह केवल अनुमान नहीं लगाता; यह विवरण देखने के लिए फ्रेम्स को करीब से देखता है।
3. सीक्रेट सॉस: "फेक" ट्रेनिंग
यहाँ वह चतुर ट्रिक है जिसका उपयोग शोधकर्ताओं ने किया है। वे जानते थे कि एक एआई को ये टूल्स इस्तेमाल करना सिखाना कठिन है क्योंकि आपको एक ऐसे शिक्षक की आवश्यकता होती है जो पहले से ही लंबे वीडियो को हल करना जानता हो। लेकिन अभी तक किसी के पास वह शिक्षक नहीं था!
इसलिए, उन्होंने एक सिम्युलेटेड ट्रेनिंग कैंप बनाया:
- उन्होंने एक वीडियो लिया और उसे एक लंबी टेक्स्ट कहानी (कैप्शंस) में बदल दिया।
- उन्होंने एक सुपर-स्मार्ट टेक्स्ट एआई (शिक्षक) से टेक्स्ट स्टोरी का उपयोग करके रहस्य सुलझाने के लिए कहा। शिक्षक कहता, "मुझे किचन चेक करने की जरूरत है," और "मुझे घड़ी पर ज़ूम करने की जरूरत है।"
- उन्होंने शिक्षक के चरणों को रिकॉर्ड किया।
- मैजिक स्वैप (The Magic Swap): उन्होंने उन टेक्स्ट स्टेप्स को लिया और टेक्स्ट विवरणों को वास्तविक वीडियो फ्रेम्स से बदल दिया।
- अब, वीडियोथिंकर (छात्र) ने शिक्षक की "सोचने की प्रक्रिया" को देखकर सीखा, लेकिन शब्दों के बजाय वास्तविक वीडियो फ्रेम्स के साथ।
यह एक पायलट को सिम्युलेटर में उड़ाना सीखने जैसा है जहाँ इंस्ट्रक्टर की आवाज़ को कॉकपिट की खिड़की से दिखने वाले वास्तविक दृश्य से बदल दिया जाता है। छात्र यह सीखता है कि कैसे देखना है और कब ज़ूम करना है, बिना किसी इंसान के हाथ पकड़ने की जरूरत के।
4. परिणाम: आत्मविश्वास और गति
वीडियोथिंकर के पास एक "कॉन्फिडेंस मीटर" (आत्मविश्वास मापने वाला यंत्र) होता है।
- यदि प्रश्न आसान है (जैसे, "क्या वीडियो में एक कार है?"), तो यह कुछ फ्रेम्स देखकर जल्दी से उत्तर देता है।
- यदि वह अनिश्चित है (जैसे, "कार की लाइसेंस प्लेट का रंग क्या था?"), तो वह कहता है, "मैं 100% निश्चित नहीं हूँ," और फिर अपने टाइम मशीन और ज़ूम लेंस को सक्रिय करता है ताकि सटीक क्षण को खोजा जा सके और करीब से देखा जा सके।
यह क्यों महत्वपूर्ण है
- कोई अनुमान नहीं: यह केवल रैंडम फ्रेम्स के आधार पर अनुमान नहीं लगाता; यह उत्तर खोजने के लिए सक्रिय रूप से खोज करता है।
- दक्षता (Efficiency): यह पूरी फिल्म देखने में समय बर्बाद नहीं करता है। यह सीधे महत्वपूर्ण हिस्सों पर कूद जाता है।
- सीखना: यह एक अलग अंधे सहायक पर निर्भर रहने के बजाय, एक साथ "देखना" और "सोचना" सीखता है।
संक्षेप में: वीडियोथिंकर एक जासूस को एक नक्शा और एक आवर्धक लेंस (magnifying glass) देने जैसा है, और फिर उन्हें उन टूल्स का पूरी तरह से उपयोग करना सिखाना है ताकि वे एक भी सुराग मिस किए बिना या रास्ता भटके बिना 30-घंटे की फिल्म के रहस्यों को सुलझा सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।