← नवीनतम पेपर
🤖 AI

AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding

AdaFocus एक कुशल लॉन्ग-वीडियो अंडरस्टैंडिंग फ्रेमवर्क है जो एक क्वेरी-अवेयर एडेप्टिव रिलेवेंस-डाइवर्सिटी सैंपलर को अनसर्टेन्टी-ट्रिगर, जीरो-कैश डिस्क रिट्रीवल मैकेनिज्म के साथ जोड़कर रिजिड वन-शॉट एनकोडिंग की सीमाओं को दूर करता है, ताकि मांग पर उच्च-रिज़ॉल्यूशन साक्ष्य को प्रगतिशील रूप से प्राप्त किया जा सके, जिससे कई बेंचमार्क में श्रेष्ठ सटीकता-दक्षता ट्रेड-ऑफ हासिल होता है।

मूल लेखक: Xiao Yang, Yingzhe Ma, Haoxuan Yu, Zixin Li, Ning Qin

प्रकाशित 2026-05-14
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Xiao Yang, Yingzhe Ma, Haoxuan Yu, Zixin Li, Ning Qin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक 2 घंटे की फिल्म देखकर किसी रहस्य को सुलझाने की कोशिश कर रहे हैं, लेकिन आपके पास उन दृश्यों को अपने दिमाग में रखने के लिए बहुत कम मेमोरी है।

समस्या: "सब-कुछ-या-कुछ-भी-नहीं" की दुविधा (The "All-or-Nothing" Dilemma)
वर्तमान AI मॉडल लंबे वीडियो देखते समय एक कठिन विकल्प का सामना करते हैं:

  1. "ब्रूट फोर्स" दृष्टिकोण (The "Brute Force" Approach): वे हर एक फ्रेम को याद रखने की कोशिश करते हैं। यह एक फिल्म के हर सेकंड को याद करने जैसा है। यह बहुत भारी, धीमा है और अक्सर AI को भ्रमित कर देता है क्योंकि एक साथ प्रोसेस करने के लिए बहुत अधिक जानकारी होती है।
  2. "स्किम" दृष्टिकोण (The "Skim" Approach): वे मेमोरी बचाने के लिए कुछ रैंडम फ्रेम चुनते हैं। यह एक किताब को पलटकर केवल पेज 1, पेज 50 और पेज 100 पढ़ने जैसा है। समस्या यह है कि आप शायद उस महत्वपूर्ण सुराग को मिस कर दें जो पेज 49 पर हुआ था।

समाधान: AdaFocus
यह पेपर AdaFocus को पेश करता है, जो वीडियो देखने का एक स्मार्ट तरीका है। रैंडम तरीके से फ्रेम चुनने या सब कुछ याद रखने के बजाय, AdaFocus एक आवर्धक लेंस (magnifying glass) के साथ एक जासूस की तरह काम करता है। यह दो मुख्य चरणों में काम करता है:

चरण 1: "त्वरित झलक" (Adaptive Preview)

सबसे पहले, AI पूरे वीडियो पर एक बहुत तेज़, लो-रेज़ोल्यूशन नज़र डालता है (जैसे 1 फ्रेम प्रति सेकंड की दर से मूवी ट्रेलर देखना)।

  • स्मार्ट फ़िल्टर: यह केवल रैंडम फ्रेम नहीं चुनता। यह पूछता है, "क्या यह फ्रेम उस प्रश्न से मेल खाता है जिसका मैं उत्तर देने की कोशिश कर रहा हूँ?"
  • सुरक्षा जाल (The Safety Net): यदि प्रश्न अस्पष्ट है (जैसे, "वीडियो का सामान्य मूड क्या है?"), तो AI एक "वाइड-एंगल" दृश्य पर स्विच हो जाता है ताकि वह बड़ी तस्वीर को मिस न कर सके।
  • परिणाम: यह वीडियो का एक छोटा, सटीक "प्रीव्यू" बनाता है जो आसानी से इसकी मेमोरी में फिट हो जाता है।

चरण 2: "जीरो-कैश लुक-बैक" (The "Zero-Cache Look-Back" - एक जादू का कमाल)

आमतौर पर, यदि AI को एहसास होता है कि उसने कोई विवरण मिस कर दिया है, तो उसे फिर से जांचने के लिए पूरे वीडियो को अपनी मेमोरी में लोड करना पड़ता है। यह धीमा और महंगा है।

AdaFocus कुछ अलग करता है: यह वीडियो को हार्ड ड्राइव (डिस्क) पर रखता है और केवल उसी विशिष्ट दृश्य को बाहर निकालता है जिसकी उसे आवश्यकता होती है, ठीक उसी समय जब उसे उसकी ज़रूरत होती है।

  • कॉन्फिडेंस चेक: "त्वरित झलक" के बाद, AI प्रश्न का उत्तर देता है। लेकिन वह अपने स्वयं के आत्मविश्वास की भी जांच करता है: "क्या मैं इस बारे में निश्चित हूँ?"
  • ट्रिगर: यदि AI अनिश्चित है (कम कॉन्फिडेंस), तो वह घबराता नहीं है। वह पूछता है, "वीडियो में मैं कहाँ भ्रमित हुआ था?"
  • रिट्रीवल (Retrieval): यह एक विशेष "जीरो-कैश" सिस्टम का उपयोग करता है ताकि हार्ड ड्राइव से उस विशिष्ट टाइमस्टैम्प पर तुरंत कूद सके, एक उच्च-गुणवत्ता वाला 3-सेकंड का क्लिप निकाल सके और उसे देख सके। यह बाकी फिल्म को अपनी मेमोरी में लोड किए बिना ऐसा करता है।
  • पुनः उत्तर देना: इस नए, उच्च-गुणवत्ता वाले साक्ष्य के साथ, वह प्रश्न का उत्तर फिर से देता है।

यह क्यों मायने रखता है (परिणाम)

लेखकों ने सात अलग-अलग वीडियो चुनौतियों पर इसका परीक्षण किया। यहाँ उन्हें क्या पता चला:

  • बेह‌تر सटीकता: AdaFocus ने अन्य तरीकों की तुलना में काफी बेहतर स्कोर प्राप्त किया। उदाहरण के लिए, एक वीडियो अंडरस्टैंडिंग टेस्ट जिसे VideoMME कहा जाता है, इसमें इसने सटीकता में 2.59 अंक का सुधार किया। Charades-STA नामक कार्य पर (जो यह पता लगाता है कि वीडियो में कुछ कब होता है), इसने 8.39 अंक की भारी बढ़त हासिल की।
  • अत्यधिक कुशल: इसने "ब्रूट फोर्स" पद्धति की तुलना में लगभग 33 गुना कम "विजुअल टोकन" (मेमोरी यूनिट्स) का उपयोग किया। यह एक पहेली को उसके 33% हिस्सों का उपयोग करके हल करने जैसा है लेकिन बेहतर परिणाम प्राप्त करता है।
  • मेमोरी ओवरलोड नहीं: क्योंकि यह केवल आवश्यकता पड़ने पर डिस्क से डेटा निकालता है, इसे पूरे वीडियो को कंप्यूटर की महंगी, तेज़ मेमोरी (RAM/VRAM) में स्टोर करने की आवश्यकता नहीं होती है।

निष्कर्ष (The Bottom Line)

AdaFocus गेम बदल देता है क्योंकि यह लंबे वीडियो को समझने को एक बार के मेमोरी टेस्ट के बजाय एक प्रगतिशील जांच (progressive investigation) के रूप में देखता है। यह एक त्वरित नज़र डालता है, जांचता है कि क्या वह आश्वस्त है, और यदि नहीं, तो वह छूटे हुए सुरागों को खोजने के लिए एक लक्षित, ऑन-डिमांड "लुक-बैक" करता है। यह AI को बिना किसी सुपरकंप्यूटर की मदद के, पूरी फिल्म को अपने दिमाग में रखने के बिना, उच्च सटीकता के साथ लंबे, जटिल वीडियो को समझने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →