← नवीनतम पेपर
💻 computer science

Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction

यह शोध पत्र VG-GUIBench प्रस्तुत करता है, जो वीडियो ट्यूटोरियल का पालन करने की MLLM-आधारित GUI एजेंटों की क्षमता का मूल्यांकन करने के लिए एक नया बेंचमार्क है, और TASKER का प्रस्ताव करता है, जो एक टास्क-ड्रिवन और सीन-अवेयर कीफ्रेम एक्सट्रैक्शन एल्गोरिदम है जो VideoQA और वीडियो-गाइडेड एजेंटिक कार्यों दोनों पर प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Sunqi Fan, Qingle Liu, Runqi Yin, Meng-Hao Guo, Shuojin Yang

प्रकाशित 2026-06-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sunqi Fan, Qingle Liu, Runqi Yin, Meng-Hao Guo, Shuojin Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप किसी जटिल मशीन को ठीक करना या कोई नया वीडियो गेम खेलना सीख रहे हैं, लेकिन आपके पास केवल एक तीन घंटे लंबा वीडियो निर्देश पुस्तिका के रूप में है।

यदि आप इसे शुरू से अंत तक पूरा देखने की कोशिश करेंगे, तो आप ऊब जाएंगे, और संभावना है कि आप उस एक महत्वपूर्ण सेकंड को चूक जाएंगे जहाँ मैकेनिक आपको बोल्ट खोलने का तरीका दिखाता है। यदि आप केवल रैंडम सेकंड चुनकर देखते हैं, तो हो सकता है कि आप केवल मैकेनिक को इधर-उधर चलते हुए या दीवार को घूरते हुए देखें, जो आपकी समस्या हल करने में मदद नहीं करेगा।

यह शोध पत्र कंप्यूटर को इन लंबे वीडियो को कुशलतापूर्वक देखना सिखाने का एक नया तरीका पेश करता है, और यह दो मुख्य भागों में किया गया है: एक नया "टेस्ट" और एक नया "स्मार्ट व्यूअर"।

भाग 1: नया टेस्ट (VG-GUI-Bench)

लेखकों ने देखा कि AI वीडियो समझ के लिए वर्तमान टेस्ट ऐसे हैं जैसे पूछना, "आपने कितनी लाल कारें देखीं?" या "शर्ट का रंग क्या था?" ये सरल, सतही सवाल हैं। वे यह टेस्ट नहीं करते कि क्या AI वास्तव में एक वीडियो से कोई कौशल (skill) सीख सकता है और बाद में उसका उपयोग कर सकता है।

इसलिए, उन्होंने VG-GUI-Bench नामक एक नया टेस्ट बनाया।

  • उपमा (Analogy): कल्पना कीजिए कि आप एक AI को "फोन ऐप पर पासवर्ड कैसे बदलें" का वीडियो ट्यूटोरियल दिखा रहे हैं। फिर, केवल एक सामान्य प्रश्न पूछने के बजाय, आप AI को वास्तव में एक दूसरे फोन ऐप में जाकर पासवर्ड बदलने के लिए कहते हैं।
  • लक्ष्य: यह टेस्ट करता है कि क्या AI एक वीडियो देख सकता है, चरण-दर-चरण प्रक्रिया को समझ सकता है, और फिर एक कंप्यूटर स्क्रीन पर उसी कार्य को करने के लिए एक मानव एजेंट की तरह कार्य कर सकता है।

भाग 2: स्मार्ट व्यूअर (TASKER)

इन कार्यों के साथ सबसे बड़ी समस्या यह है कि लंबे वीडियो "फालतू" (redundant frames) से भरे होते हैं और महत्वपूर्ण हिस्से बीच में छिपे होते हैं। यदि आप AI को बहुत अधिक फ्रेम्स देते हैं, तो वह भ्रमित हो जाता है। यदि आप उसे बहुत कम देते हैं, तो वह मुख्य बात को मिस कर देता है।

लेखकों ने TASKER (Task-driven And Scene-aware Keyframe searchER) नामक एक टूल बनाया है। TASKER को एक कैमरा नहीं, बल्कि एक बहुत ही स्मार्ट जासूस या नक्शे के साथ एक हाइकर के रूप में सोचें।

TASKER कैसे काम करता है, इसके लिए यहाँ कुछ उपमाएँ दी गई हैं:

1. वीडियो का "पेड़" (The "Tree" of the Video)
वीडियो को रैखिक रूप से (एक-एक सेकंड करके) देखने के बजाय, TASKER वीडियो को एक पेड़ की तरह मानता है।

  • यह पूरे वीडियो को 'तने' (trunk) के रूप में शुरू करता है।
  • यह वीडियो को बड़े टुकड़ों (शाखाओं/branches) में विभाजित करता है।
  • यह उन टुकड़ों को तब तक छोटे और छोटे हिस्सों में विभाजित करता रहता है जब तक कि इसे वह सटीक "पत्तियाँ" (frames) न मिल जाएं जिनमें उत्तर छिपा है।

2. दो प्रकार की "स्मार्ट" खोज (The Two Types of "Smart" Search)
TASKER यह तय करने के लिए कि अगली शाखा की जांच कब करनी है, एक विशेष AI मस्तिष्क (एक MLLM) का उपयोग करता है। यह दो अलग-अलग रणनीतियों का उपयोग करता है, जैसे एक जासूस दो अलग-अलग सुरागों का उपयोग करता है:

  • "मैं क्या ढूंढ रहा हूँ?" रणनीति (Task-Driven): AI पूछता है, "मुझे वह हिस्सा ढूंढना है जहाँ व्यक्ति पासवर्ड टाइप करता है। वीडियो का कौन सा हिस्सा उससे सबसे अधिक मिलता-जुलता है?" यह सबसे प्रासंगिक अनुभाग पर ज़ूम करता है।
  • "क्या बदला?" रणनीति (Scene-Aware): AI पूछता है, "दृश्य (scene) में सबसे अधिक बदलाव कहाँ हुआ?" यदि वीडियो किचन से लिविंग रूम में बदल जाता है, तो यह एक बड़ा बदलाव है। TASKER जानता है कि बड़े बदलावों का मतलब आमतौर पर कुछ महत्वपूर्ण हो रहा होता है, इसलिए वह उन जगहों की जांच करता है।

3. "जब तक पता न चल जाए, तब तक रुकें" नियम (The "Stop When You Know" Rule)
अधिकांश खोज एल्गोरिदम एक कठिन सीमा तक चलते हैं। TASKER अधिक स्मार्ट है। इसमें एक आंतरिक "कॉन्फिडेंस मीटर" (विश्वास मीटर) है।

  • कुछ की-फ्रेम्स देखने के बाद, AI खुद से पूछता है: "क्या मेरे पास प्रश्न का उत्तर देने के लिए पर्याप्त जानकारी है?"
  • यदि वह कहता है: "हाँ, मैं 100% निश्चित हूँ," तो वह तुरंत खोज बंद कर देता है।
  • यदि वह कहता है: "मैं अभी निश्चित नहीं हूँ," तो वह और गहराई से खोज करता है।
  • लाभ: इसका मतलब है कि TASKER अक्सर वीडियो के केवल 15% फ्रेम्स का उपयोग करके उत्तर खोज लेता है, जबकि अन्य विधियों को शायद 100% वीडियो देखने में समय बर्बाद करना पड़ता है।

परिणाम

जब लेखकों ने इस "स्मार्ट जासूस" (TASKER) का साधारण वीडियो प्रश्नों और जटिल "कौशल सीखने" वाले कार्यों (VG-GUI-Bench) दोनों पर परीक्षण किया:

  • इसने पिछले सर्वश्रेष्ठ तरीकों की तुलना में बेहतर स्कोर प्राप्त किया।
  • इसने यह सब बहुत कम फ्रेम्स देखकर किया, जिससे यह बहुत तेज़ और सस्ता हो गया।

सारांश

संक्षेप में, यह शोध पत्र कहता है: "वर्तमान AI वीडियो देखने वाले या तो बहुत मूर्ख हैं (मुख्य बात चूक जाते हैं) या बहुत धीमे हैं (सब कुछ देखते हैं)। हमने एक नया टेस्ट बनाया है यह देखने के लिए कि क्या AI वास्तव में वीडियो से कौशल सीख सकता है, और हमने एक नया 'स्मार्ट जासूस' (TASKER) बनाया है जो जानता है कि समस्या को हल करने के लिए वीडियो के किन हिस्सों को देखना है, और बीच की उबाऊ चीजों को अनदेखा करना है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →