← नवीनतम पेपर
💬 NLP

HFS: Holistic Query-Aware Frame Selection for Efficient Video Understanding

यह शोध पत्र HFS का प्रस्ताव करता है, जो एक एंड-टू-एंड ट्रेन करने योग्य फ्रेमवर्क है जो क्वेरी-अवेयर फ्रेम स्कोरिंग के लिए एक स्मॉल लैंग्वेज मॉडल और स्टूडेंट-टीचर म्यूचुअल लर्निंग के साथ एक डिफरेंशिएबल सेट-लेवल ऑब्जेक्टिव का लाभ उठाता है ताकि मौजूदा पॉइंट-वाइज और फिक्स्ड-क्राइटेरिया विधियों की सीमाओं को दूर किया जा सके, जिससे वीडियो अंडरस्टैंडिंग बेंचमार्क में बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Yiqing Yang, Yun Li, Daiqing Qi, Lehan Yang, Tianlong Wang, Wenhao Zhang, Sheng Li, Kin-man Lam

प्रकाशित 2026-08-11
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yiqing Yang, Yun Li, Daiqing Qi, Lehan Yang, Tianlong Wang, Wenhao Zhang, Sheng Li, Kin-man Lam

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को फिल्म समझना सिखाने की कोशिश कर रहे हैं। आपके पास नौ मिनट का एक वीडियो है, लेकिन रोबोट का दिमाग एक बार में जानकारी का केवल एक छोटा सा हिस्सा ही रख सकता है। यदि आप उसे वीडियो का हर एक फ्रेम दिखाते हैं, तो डेटा की अधिकता से उसका दिमाग फट जाएगा। यदि आप उसे केवल रैंडम स्नैपशॉट दिखाते हैं, तो वह सबसे महत्वपूर्ण दृश्य को पूरी तरह से मिस कर सकता है। यह "वीडियो अंडरस्टैंडिंग" (वीडियो समझने) की पहेली है: एक लंबी फिल्म में से परफेक्ट कुछ तस्वीरें कैसे चुनी जाएं ताकि रोबोट उस पर आधारित सवालों के जवाब दे सके? वैज्ञानिक इसे "फ्रेम सिलेक्टर्स" (frame selectors) बनाकर हल करने की कोशिश कर रहे हैं—ऐसे टूल्स जो यह तय करते हैं कि कौन से क्षण रखने लायक हैं। बड़ी चुनौती यह है कि फ्रेम चुनना केवल इस बारे में नहीं है कि वह एक सेकंड कितना दिलचस्प दिखता है; यह इस बारे में है कि वह दूसरे फ्रेम्स के साथ कैसे फिट बैठता है। आपको विविधता और प्रासंगिकता (relevance) के मिश्रण की आवश्यकता है, न कि केवल एक जैसे दिखने वाले फ्रेम्स के ढेर की।

यहाँ एक नई टीम के शोधकर्ताओं ने HFS (होलिस्टिक क्वेरी-अवेयर फ्रेम सिलेक्शन) नामक एक सिस्टम बनाया है। HFS को एक सुपर-ऑर्गनाइज्ड फिल्म एडिटर की तरह समझें जो न केवल स्क्रिप्ट (सवाल) को देखता है और रैंडम सीन चुनता है, बल्कि कट लगाने से पहले वास्तव में पूरी कहानी के बारे में सोचता है। एक-एक करके मोतियों को गिनने वाले रोबोट की तरह एक-एक फ्रेम चुनने के बजाय, HFS फ्रेमों के पूरे समूह को एक टीम के रूप में देखता है। यह एक चतुर ट्रिक का उपयोग करता है जहाँ एक छोटा, तेज़ "स्टूडेंट" (छात्र) AI एक एडिटर के रूप में कार्य करता है, जबकि एक विशाल, शक्तिशाली "टीचर" (शिक्षक) AI एक डायरेक्टर के रूप में कार्य करता है। वे एक लूप में मिलकर काम करते हैं: स्टूडेंट कुछ फ्रेम चुनता है, टीचर सवाल का जवाब देने की कोशिश करता है, और फिर वे एक-दूसरे को सिखाते हैं कि उन्होंने क्या सही किया या क्या गलत। यह सब एक साथ, रियल-टाइम में होता है, बिना किसी पहले से लिखे गए "सही" जवाबों की सूची के। परिणाम स्वरूप? यह सिस्टम एक लंबे वीडियो में पीले स्पंज पर पानी की बौछार होने जैसे सटीक क्षण को खोजने में बहुत बेहतर हो जाता है (या किसी भी अन्य विशिष्ट घटना को), भले ही अन्य तरीके इसे पूरी तरह से मिस कर दें।

समस्या: बहुत अधिक वीडियो, बहुत कम दिमाग

कल्पना कीजिए कि आपके पास एक कार्टून का नौ मिनट का वीडियो है, और कोई आपसे पूछता है, "पीले स्पंज को पत्र मिलने के बाद शांति कैसे मिली?" यदि आप रोबोट को केवल पहला फ्रेम, बीच का फ्रेम और आखिरी फ्रेम दिखाते हैं, तो वह "पकाया" (Cooked) या "घोंघे के साथ गाया" (Sang with the snail) का अनुमान लगा सकता है क्योंकि उसने केवल वही देखा है। लेकिन असली जवाब है "घोंघे द्वारा बाल्टी से पानी छिड़कने के कारण," जो एक बहुत ही विशिष्ट, छोटे क्षण में होता है।

पुराने तरीकों ने इसे दो तरीकों से हल करने की कोशिश की। कुछ ने केवल समान अंतराल पर फ्रेम चुने, जैसे कि हर 30 सेकंड में एक फोटो लेना। यह एक किताब को केवल पेज 1, पेज 50 और पेज 100 पढ़कर पढ़ने जैसा है; आप कहानी के उतार-चढ़ाव को मिस कर देते हैं। अन्य तरीकों ने सवाल के आधार पर "सबसे महत्वपूर्ण" फ्रेम चुनने की कोशिश की, लेकिन वे अक्सर एक ही घटना (जैसे स्पंज का रोना) के दस फ्रेम चुन लेते थे और उस एक फ्रेम को मिस कर देते थे जहाँ पानी की बाल्टी गिरती है। उन्होंने हर फ्रेम को एक एकल प्रदर्शन (solo act) की तरह माना, यह भूल गए कि फ्रेमों को एक समूह के रूप में मिलकर काम करने की आवश्यकता है।

HFS समाधान: संपादकों की एक टीम

लेखकों ने एक नया तरीका प्रस्तावित किया है जिससे फ्रेम चुने जाते हैं, और वे इसे तीन मुख्य ट्रिक्स के माध्यम से करते हैं जो एक सुव्यवस्थित मशीन की तरह मिलकर काम करते हैं।

1. "चेन-ऑफ-थॉट" (Chain-of-Thought) जासूस
सबसे पहले, सिस्टम को वास्तव में सवाल को समझने की आवश्यकता है। केवल "पीला स्पंज" और "पत्र" जैसे शब्दों को पढ़ने के बजाय, सिस्टम चेन-ऑफ-थॉट (CoT) नामक तकनीक का उपयोग करता है। कल्पना कीजिए कि AI एक जासूस है जो केस सुलझाने से पहले सुरागों की एक सूची लिखता है। यह सवाल को तोड़ता है: "ठीक है, स्पंज को एक पत्र मिला, फिर उसे शांत करने के लिए कुछ हुआ। इसके होने के संभावित तरीके क्या हो सकते हैं?" यह AI को एक विशेष "सर्च मैप" (जिसे लेटेंट क्वेरी वेक्टर कहा जाता है) बनाने में मदद करता है जो जानता है कि उसे ठीक किस तरह की जानकारी ढूंढनी है। यह "स्पंज की एक तस्वीर" खोजने और "उस विशिष्ट क्षण को खोजने" के बीच का अंतर है जब स्पंज रोना बंद कर देता है।

2. "ग्रुप हग" (Group Hug) स्कोर
एक बार जब AI को पता चल जाता है कि वह क्या खोज रहा है, तो उसे फ्रेम चुनने होते हैं। पुराने तरीके एक-एक करके फ्रेम को स्कोर करते थे। HFS उन्हें एक समूह के रूप में स्कोर करता है। इसे फुटबॉल के खेल के लिए एक टीम चुनने की तरह समझें। आप केवल व्यक्तिगत रूप से दस सर्वश्रेष्ठ खिलाड़ियों को नहीं चुनते; आप एक ऐसी टीम चुनते हैं जहाँ हर कोई अलग-अलग पोजीशन को कवर करता है और बहुत अधिक ओवरलैप नहीं होता है।
HFS एक गणितीय सूत्र का उपयोग करता है जो एक साथ तीन चीजों की जांच करता है:

  • प्रासंगिकता (Relevance): क्या यह फ्रेम सवाल का जवाब देता है?
  • कवरेज (Coverage): क्या यह फ्रेम कुछ ऐसा दिखाता है जो हमने अभी तक नहीं देखा है?
  • रिडंडेंसी (Redundancy): क्या हम एक ही चीज़ के दस फ्रेम चुन रहे हैं? यदि हाँ, तो रुक जाइए!
    यह "ग्रुप हग" स्कोर यह सुनिश्चित करता है कि AI फ्रेमों का एक विविध सेट चुने जो पूरी कहानी बताते हैं, न कि केवल सबसे रोमांचक हिस्सा।

3. स्टूडेंट-टीचर डांस (Student-Teacher Dance)
यह सबसे जादुई हिस्सा है। आमतौर पर, AI को फ्रेम चुनने के लिए सिखाने के लिए, वैज्ञानिकों को लाखों वीडियो दिखाने होते हैं जिनमें "सही" उत्तर पहले से लिखे होते हैं (जैसे कि टेस्ट को ग्रेड करने वाला शिक्षक)। लेकिन लेखकों ने महसूस किया कि यह धीमा और कठोर है। इसके बजाय, उन्होंने एक स्टूडेंट-टीचर सिस्टम बनाया।

  • स्टूडेंट (एक छोटा, तेज़ AI) फ्रेम चुनता है।
  • टीचर (एक बड़ा, शक्तिशाली AI) केवल उन फ्रेमों का उपयोग करके सवाल का जवाब देने की कोशिश करता है।
  • यदि टीचर सही जवाब देता है, तो स्टूडेंट सीखता है, "हे, वे फ्रेम अच्छे थे!" यदि टीचर गलत जवाब देता है, तो स्टूडेंट सीखता है, "ओह, मैंने कुछ महत्वपूर्ण मिस कर दिया।"
    वे एक लूप में एक साथ यह करते हैं। स्टूडेंट अनुमान लगाने की कोशिश करता है कि टीचर क्या महत्वपूर्ण समझ रहा है, और टीचर स्टूडेंट के विकल्पों से मेल खाने की कोशिश करता है। वे एक-दूसरे से सीखते हुए रियल-टाइम में एक साथ "डांस" करते हैं। यह सिस्टम को अनुकूलन योग्य और बहुत स्मार्ट बनाता है।

परिणाम: स्मार्ट, तेज़ और अधिक सटीक

शोधकर्ताओं ने कई कठिन वीडियो क्विज़ पर अपने नए HFS सिस्टम का परीक्षण किया, जिसमें Video-MME, MLVU, LongVideoBench, और NExT-QA शामिल हैं। इन परीक्षणों में 44 सेकंड से लेकर 41 मिनट तक के वीडियो शामिल हैं।

परिणाम प्रभावशाली थे। अन्य तरीकों की तुलना में:

  • MLVU टेस्ट पर, HFS ने औसत स्कोर में 4.0 प्रतिशत अंक तक सुधार किया।
  • Video-MME पर, इसने समग्र सटीकता को 2.6 प्रतिशत अंक तक बढ़ाया।
  • इसने सबसे मजबूत "नो-ट्रेनिंग" (बिना प्रशिक्षण वाले) तरीकों को भी 2.0 अंक से पीछे छोड़ दिया।

लेकिन यह केवल सही होने के बारे में नहीं था; यह कुशल होने के बारे में भी था। टीम ने वीडियो प्रोसेस करने में लगने वाले समय को मापा। उन्होंने पाया कि HFS केवल 8 फ्रेम चुनकर एक मानक विधि (जो 16 फ्रेम चुनती है) से बेहतर स्कोर प्राप्त कर सकता है। इससे भी बेहतर, यह अधिक तेज़ी से हुआ। जबकि अन्य स्मार्ट तरीकों को फ्रेम चुनने में 2 सेकंड से अधिक का समय लगा, HFS ने केवल 0.65 सेकंड लिया, जो रैंडम फ्रेम चुनने की गति के लगभग बराबर है।

यह क्यों मायने रखता है

यह पेपर सुझाव देता है कि फ्रेम चयन को व्यक्तिगत वस्तुओं की सूची के बजाय एक समूह समस्या (group problem) के रूप में मानकर, और AI को रियल-टाइम में अपनी गलतियों से सीखने देकर, हम वीडियो अंडरस्टैंडिंग को बहुत अधिक कुशल बना सकते हैं। लेखक यह दावा नहीं करते कि यह दुनिया की हर समस्या को हल कर देता है, लेकिन वे दिखाते हैं कि लंबे वीडियो को समझने में मदद करने के लिए उनके "होलिस्टिक" दृष्टिकोण ने एक महत्वपूर्ण प्रगति की है। यह साबित करता है कि आपको रोबोट को पूरी फिल्म खिलाने की ज़रूरत नहीं है; आपको बस उसे सही दृश्य खिलाने की ज़रूरत है, और HFS उन्हें खोजने में बहुत अच्छा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →