← नवीनतम पेपर
💻 computer science

FocusGraph: Graph-Structured Frame Selection for Embodied Long Video Question Answering

FocusGraph एक नवीन फ्रेमवर्क है जो एम्बोडीड लॉन्ग वीडियो क्वेश्चन आंसरिंग के लिए है, जो क्वेरी-प्रासंगिक क्लिप्स की पहचान करने के लिए एक लाइटवेट सीन-कैप्शन LLM सिलेक्टर और कीफ्रेम चयन के लिए एक ट्रेनिंग-फ्री पैच-वाइज स्पार्स-फ्लो रिटेंशन विधि को जोड़ता है, जिससे एगोजेंट्रिक बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है और साथ ही इन्फरेंस समय में भी काफी कमी आती है।

मूल लेखक: Tatiana Zemskova, Solomon Andryushenko, Ilya Obrubov, Viktoriia Khoruzhaia, Ekaterina Eroshenko, Ekaterina Derevyanka, Dmitry Yudin

प्रकाशित 2026-03-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tatiana Zemskova, Solomon Andryushenko, Ilya Obrubov, Viktoriia Khoruzhaia, Ekaterina Eroshenko, Ekaterina Derevyanka, Dmitry Yudin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन आपको कुछ सुरागों के बजाय किसी व्यक्ति के पूरे दिन का 3 घंटे का सुरक्षा कैमरा टेप थमा दिया गया है। आपका काम एक विशिष्ट प्रश्न का उत्तर देना है जैसे, "कॉफी का कप उठाने से ठीक पहले उस व्यक्ति ने क्या किया था?"

यदि आप पूरे टेप को सामान्य गति से देखने की कोशिश करेंगे, तो आप थक जाएंगे, ऊब जाएंगे, और संभवतः उस महत्वपूर्ण क्षण को चूक जाएंगे। यदि आप हर एक सेकंड को स्लो मोशन में देखने की कोशिश करेंगे, तो आपका मस्तिष्क (या इस मामले में, एक कंप्यूटर) डेटा की विशाल मात्रा से क्रैश हो जाएगा।

यही वह समस्या है जिसे FocusGraph हल करता है। यह AI के लिए लंबे वीडियो को बिना अभिभूत हुए देखने का एक नया तरीका है। यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) के माध्यम से समझाया गया है:

1. समस्या: "सूचना का सैलाब" (The Information Flood)

वर्तमान AI मॉडल (जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स कहा जाता है) उन प्रतिभाशाली जासूसों की तरह हैं जो टेक्स्ट को पूरी तरह से पढ़ और समझ सकते हैं। लेकिन जब आप उन्हें एक लंबा वीडियो दिखाते हैं, तो वे हर एक फ्रेम (हर सेकंड की छवि) को देखने की कोशिश करते हैं।

  • समस्या: यह एक जासूस से एक 1,000 पन्नों की किताब का हर एक पन्ना पढ़ने के लिए कहने जैसा है ताकि वह एक विशिष्ट वाक्य ढूंढ सके। इसमें बहुत समय लगता है, बहुत पैसा (कंप्यूटिंग पावर) खर्च होता है, और जासूस अक्सर अतिरिक्त शोर (noise) से भ्रमित हो जाता है।

2. समाधान: FocusGraph की दो-चरणीय रणनीति

FocusGraph एक स्मार्ट संपादक (Editor) और एक स्पॉटलाइट (Spotlight) की तरह काम करता है। यह पूरा वीडियो नहीं देखता; यह पता लगाता है कि कहाँ देखना है और क्या देखना है।

चरण 1: "सारांश संपादक" (Scene-Caption LLM Selector)

AI को कच्चे वीडियो फ्रेम दिखाने के बजाय, FocusGraph पहले वीडियो को छोटे टुकड़ों (क्लिप्स) में तोड़ देता है।

  • उपमा: कल्पना कीजिए कि आपके पास 3 घंटे की एक फिल्म है। AI को फिल्म दिखाने के बजाय, आप एक तेज़, हल्के वजन वाले सहायक से हर 10 सेकंड के हिस्से के लिए एक एक-वाक्य का सारांश लिखने के लिए कहते हैं।
    • टुकड़ा 1 का सारांश: "व्यक्ति रसोई में प्रवेश करता है।"
    • टुकड़ा 2 का सारांश: "व्यक्ति फ्रिज खोलता है।"
    • टुकड़ा 3 का सारांश: "व्यक्ति दूध उठाता है।"
  • जादू: AI फिर इन टेक्स्ट सारांशों (जो बहुत छोटे और पढ़ने में आसान हैं) को देखता है और पूछता है, "इनमें से कौन सा सारांश मेरे प्रश्न का उत्तर होने जैसा लग रहा है?"
  • परिणाम: यह उबाऊ हिस्सों को अनदेखा कर देता है (जैसे कि व्यक्ति का 5 मिनट तक गलियारे में चलना) और केवल दिलचस्प क्लिप्स को रखता है (जैसे कि फ्रिज वाला दृश्य)। यह "ग्राफ" वाला हिस्सा है—यह इन सारांशों को वस्तुओं और क्रियाओं के एक मानचित्र (map) के रूप में व्यवस्थित करता है।

चरण 2: "स्पॉटलाइट" (PSFR एल्गोरिदम)

अब AI के पास कुछ छोटी क्लिप्स हैं, लेकिन उनमें अभी भी बहुत सारे फ्रेम हैं। हमें मुख्य जासूस को दिखाने के लिए कुछ बेहतरीन तस्वीरें चुननी होंगी।

  • उपमा: कल्पना कीजिए कि आपके पास एक पक्षी के उड़ने का वीडियो है। यदि आप हर सेकंड एक फोटो लेते हैं, तो 90% फोटो बिल्कुल एक जैसी दिखती हैं। आपको केवल तभी फोटो की आवश्यकता होती है जब पक्षी अपने पंख फड़फड़ाता है या दिशा बदलता है
  • विधि: FocusGraph एक चतुर तकनीक का उपयोग करता है जिसे पैचवाइज स्पार्स-फ्लो रिटेंशन (PSFR) कहा जाता है। इसे यह करने के लिए "सिखाया" जाने की आवश्यकता नहीं है; यह बस गति और परिवर्तन को देखता है।
    • यह स्क्रीन को एक ग्रिड में विभाजित करता है।
    • यह वस्तुओं पर सूक्ष्म बिंदुओं (कोनों) को ट्रैक करता है।
    • यदि बिंदु महत्वपूर्ण रूप से हिलते हैं या गायब हो जाते हैं (जिसका अर्थ है कि दृश्य बदल गया है), तो यह कहता है, "आहा! यह एक महत्वपूर्ण क्षण है! एक तस्वीर लो!"
    • यदि बिंदु स्थिर रहते हैं, तो यह कहता है, "यहाँ कुछ भी नया नहीं है, इसे छोड़ दो।"

3. अंतिम उत्तर

अब, मुख्य AI जासूस (बड़ा MLLM) को केवल निम्नलिखित को देखना होगा:

  1. टेक्स्ट सारांश यह जानने के लिए कि कहाँ देखना है।
  2. कुछ चुनिंदा प्रमुख तस्वीरें (वे तस्वीरें जहाँ वास्तव में कुछ हुआ था) विवरण देखने के लिए।

यह एक बड़ी बात क्यों है?

  • गति: यह एक पूरी लाइब्रेरी पढ़ने के बजाय एक सिंगल इंडेक्स कार्ड पढ़ने जैसा है। AI प्रश्नों का उत्तर बहुत तेज़ी से देता है (मिनटों के बजाय सेकंडों में)।
  • स्मार्टर: क्योंकि यह सही क्षणों पर ध्यान केंद्रित करता है, इसलिए यह अप्रासंगिक विवरणों से भ्रमित नहीं होता है। यह वास्तव में लंबे वीडियो के बारे में कठिन प्रश्नों के उत्तर देने में बेहतर हो जाता है।
  • कुशल (Efficient): यह भारी मात्रा में कंप्यूटर पावर बचाता है, जिससे इन स्मार्ट एजेंटों को उन उपकरणों पर चलाना संभव हो जाता है जो सुपरकंप्यूटर नहीं हैं।

संक्षेप में: FocusGraph AI को पूरे समुद्र को घूरने के बजाय, उन विशिष्ट लहरों को पहचानना सिखाता है जो मायने रखती हैं। यह 3 घंटे की फिल्म को 5 मिनट के हाइलाइट रील में बदल देता है, यह सुनिश्चित करता है कि AI कभी भी कहानी का मोड़ (plot twist) न छोड़े।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →