← नवीनतम पेपर
🤖 AI

HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering

HiMu एक प्रशिक्षण-मुक्त ढांचा है जो क्वेरीज़ को हल्के मल्टीमॉडल विशेषज्ञों तक रूट किए जाने वाले पदानुक्रमित तर्क वृक्षों (hierarchical logic trees) में विघटित करके लंबे वीडियो प्रश्न उत्तर देने में दक्षता-सटीकता के बीच के संतुलन को पाटता है, जिससे यह काफी कम कम्प्यूटेशनल लागत के साथ समानता-आधारित और एजेंट-आधारित चयनकर्ताओं दोनों से बेहतर प्रदर्शन करने में सक्षम होता है।

मूल लेखक: Dan Ben-Ami, Gabriele Serussi, Kobi Cohen, Chaim Baskin

प्रकाशित 2026-03-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dan Ben-Ami, Gabriele Serussi, Kobi Cohen, Chaim Baskin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक 30 मिनट की फिल्म के बारे में एक पेचीदा सवाल का जवाब देने की कोशिश कर रहे हैं, लेकिन आपके पास अपना उत्तर देने से पहले केवल 16 विशिष्ट स्नैपशॉट्स (झलकियों) को देखने का समय है। यदि आप गलत 16 स्नैपशॉट्स चुनते हैं, तो आप पूरी कहानी को समझने से चूक जाएंगे। यदि आप सही वाले चुनते हैं, तो आप रहस्य को सुलझा सकते हैं।

यह लॉन्ग वीडियो क्वेश्चन अनswering (Long Video Question Answering) की चुनौती है। वर्तमान AI मॉडल बहुत कम ध्यान अवधि वाले प्रतिभाशाली जासूसों की तरह हैं; वे पूरी फिल्म को एक साथ नहीं देख सकते। उन्हें एक "कैमरा ऑपरेटर" की आवश्यकता होती है जो उन्हें सही फ्रेम थमा सके।

यह पेपर HiMu को पेश करता है, जो एक नया, अत्यंत स्मार्ट कैमरा ऑपरेटर है जो बिना महंगे और धीमे कंप्यूटरों की आवश्यकता के इस समस्या को हल करता है।

यहाँ बताया गया है कि HiMu कैसे काम करता है, सरल उपमाओं के माध्यम से समझाया गया है:

1. समस्या: "दो बुरे विकल्प"

वर्तमान में, AI के पास फ्रेम चुनने के दो बुरे तरीके हैं:

  • "जिस्ट" विधि (समानता - Similarity): कल्पना कीजिए कि आप किसी मित्र से एक फिल्म से 16 फोटो चुनने के लिए कहते हैं, जैसे कि एक अस्पष्ट भावना के आधार पर, "मुझे वह हिस्सा दिखाओ जहाँ नायक दुखी है।" मित्र 16 ऐसे फोटो चुनता है जो दिखने में दुखी लगते हैं। लेकिन वे उस विशिष्ट क्षण को मिस कर सकते हैं जब नायक ने वास्तव में "मैं दुखी हूँ" कहा हो या जब कोई विशिष्ट वस्तु (जैसे टूटी हुई घड़ी) दिखाई दी हो। यह तेज़ है, लेकिन सतही है।
  • "ओवर-थिंकर" विधि (एजेंटिक - Agentic): कल्पना कीजिए कि आप एक जीनियस जासूस को पूरी फिल्म देखने, रुकने, पीछे जाने और विशेषज्ञों की एक टीम के साथ सुरागों पर चर्चा करने के लिए कहते हैं। वे परफेक्ट 16 फ्रेम ढूंढ लेंगे। लेकिन इसे करने में उन्हें 10 घंटे लगेंगे। वास्तविक दुनिया के उपयोग के लिए यह बहुत धीमा और महंगा है।

HiMu "गोल्डिलॉक्स" (बीच का रास्ता) समाधान है: यह ओवर-थिंकर जितना स्मार्ट है और जिस्ट विधि जितना तेज़ है।

2. HiMu समाधान: "आर्किटेक्ट और विशेषज्ञ"

HiMu प्रश्न को एक जटिल रेसिपी की तरह मानता है जिसे तोड़कर अलग करने की आवश्यकता है। यह एक न्यूरो-सिंबोलिक (Neuro-Symbolic) दृष्टिकोण का उपयोग करता है (AI तर्क और मानवीय तर्क का मिश्रण)।

चरण 1: आर्किटेक्ट (केवल टेक्स्ट वाला मस्तिष्क)

जब आप ऐसा प्रश्न पूछते हैं, "नैरेटर द्वारा रासायनिक प्रतिक्रिया (chemical reaction) का उल्लेख करने के बाद, बाईं ओर रखे बीकर के साथ क्या होता है?", तो HiMu केवल वीडियो को स्कैन नहीं करता है।

  • यह केवल एक बार एक टेक्स्ट-ओनली AI (आर्किटेक्ट) को बुलाता है।
  • आर्किटेक्ट प्रश्न को एक लॉजिक ट्री (तर्क वृक्ष) में तोड़ देता है, जैसे कि एक फ्लोचार्ट।
    • शाखा A: उस क्षण को खोजें जब नैरेटर "केमिकल रिएक्शन" कहता है।
    • शाखा B: उस क्षण को खोजें जब बाईं ओर का बीकर रंग बदलता है।
    • शाखा C: सुनिश्चित करें कि शाखा A, शाखा B से पहले होती है।

चरण 2: विशेषज्ञ (विशेषज्ञों की टीम)

एक विशाल AI द्वारा सब कुछ करने के बजाय, HiMu विशिष्ट सुरागों के लिए वीडियो की जांच करने हेतु छोटे, विशिष्ट विशेषज्ञों की एक टीम को काम पर लगाता है:

  • आंखें (विजुअल एक्सपर्ट्स): एक वस्तुओं (एक लाल कार) को देखता है, एक कार्यों (एक व्यक्ति का दौड़ना) को देखता है, और एक संकेतों पर लिखे टेक्स्ट को पढ़ता है।
  • कान (ऑडियो एक्सपर्ट्स): यह HiMu का सीक्रेट सॉस है। एक विशेषज्ञ विशिष्ट बोले गए शब्दों (ASR) को सुनता है, और दूसरा ध्वनि प्रभावों (जैसे दरवाजे की घंटी बजना या कांच टूटने की आवाज) को सुनता है।
  • जादू: ये विशेषज्ञ बहुत तेज़ी से पूरे वीडियो को स्कैन करते हैं और उनके विशिष्ट सुराग कब दिखाई देते हैं, इसका एक "हीट मैप" बनाते हैं।

चरण 3: कंडक्टर (फजी लॉजिक)

अब, HiMu सभी विशेषज्ञों की रिपोर्ट लेता है और उन्हें फजी लॉजिक (Fuzzy Logic) (एक प्रकार का गणित जो केवल "हाँ" या "नहीं" के बजाय "शायद" और "लगभग" को संभालता है) का उपयोग करके जोड़ता है।

  • यह जाँचता है: "क्या 'केमिकल रिएक्शन' की आवाज़ हुई? हाँ। क्या 'बीकर' ने रंग बदला? हाँ। क्या आवाज़ रंग बदलने से पहले हुई? हाँ।"
  • यह एक सैटिस्फैक्शन कर्व (संतोष वक्र) बनाता है: एक ग्राफ जो दिखाता है कि वीडियो का प्रत्येक सेकंड, पूरे जटिल प्रश्न से कितनी अच्छी तरह मेल खाता है।

चरण 4: फोटोग्राफर (PASS)

अंत में, HiMu सैटिस्फैक्शन कर्व को देखता है। केवल 16 उच्चतम शिखरों (peaks) को पकड़ने के बजाय (जो एक ही दृश्य में केंद्रित हो सकते हैं), यह PASS (पीक-एंड-स्प्रेड) नामक रणनीति का उपयोग करता है।

  • यह सबसे महत्वपूर्ण "शिखरों" (वे क्षण जहाँ उत्तर मिलने की सबसे अधिक संभावना है) को पाता है।
  • यह पूर्ण संदर्भ प्राप्त करने के लिए उन शिखरों और उनके ठीक पहले और बाद के फ्रेम को पकड़ने के लिए कैमरे को फैला देता है।
  • यह इन 16 परफेक्ट फ्रेमों को मुख्य AI को सौंप देता है ताकि प्रश्न का उत्तर दिया जा सके।

3. यह बड़ी बात क्यों है?

  • यह तेज़ है: क्योंकि "विशेषज्ञ" हल्के हैं और "आर्किटेक्ट" केवल एक बार बोलता है, HiMu अविश्वसनीय रूप से कुशल है। यह "ओवर-थिंकर" विधियों की तुलना में लगभग 10 गुना कम कंप्यूटिंग पावर का उपयोग करता है।
  • यह स्मार्ट है: यह समझता है कि "X के बाद, Y होता है" के लिए दो अलग-अलग चीजों को एक विशिष्ट क्रम में देखना आवश्यक है। यह वीडियो और ऑडियो को एक साथ देख और सुन सकता है।
  • यह सस्ता है: आपको इसे चलाने के लिए सुपरकंप्यूटर की आवश्यकता नहीं है। यह मानक हार्डवेयर पर काम करता है।

निचोड़

HiMu को एक अत्यंत कुशल फिल्म संपादक के रूप में सोचें।

  • पुराने तरीके एक इंटर्न को यह अनुमान लगाने के लिए काम पर रखने जैसे थे कि कौन से दृश्य महत्वपूर्ण हैं (तेज़, लेकिन अक्सर गलत)।
  • अन्य तरीके एक फिल्म स्कूल के प्रोफेसर को हर सेकंड का विश्लेषण करने के लिए काम पर रखने जैसे थे (परफेक्ट, लेकिन बहुत समय लगता है)।
  • HiMu एक निर्देशक की तरह है जो तुरंत स्क्रिप्ट जानता है, सटीक शॉट लेने के लिए कैमरा क्रू भेजता है, और सेकंडों में उन्हें पूरी तरह से एडिट करता है।

परिणाम? AI पहले से कहीं अधिक तेज़ी से, सस्ते में और बेहतर तरीके से सही उत्तर प्राप्त करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →