← नवीनतम पेपर
💻 computer science

LDDR: Linear-DPP-Based Dynamic-Resolution Frame Sampling for Video MLLMs

LDDR एक प्रशिक्षण-मुक्त (training-free), प्लग-एंड-प्ले फ्रेमवर्क है जो क्वेरी-अवेयर लीनियर डिटर्मिनैन्टल पॉइंट प्रोसेस (Linear Determinantal Point Process) चयन को डायनेमिक रेजोल्यूशन एलोकेशन के साथ जोड़कर मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में वीडियो समझ को बढ़ाता है, ताकि टोकन बजट के अंतर्गत सूचनात्मक फ्रेमों को कुशलतापूर्वक पहचानने और प्राथमिकता देने में सक्षम बनाया जा सके।

मूल लेखक: Jingfeng Chen, Jiawen Qian, Wendi Deng, Yinuo Guo, Jiaqi Yu, Sicong Leng, Raghuveer Thirukovalluru, Bhuwan Dhingra

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jingfeng Chen, Jiawen Qian, Wendi Deng, Yinuo Guo, Jiaqi Yu, Sicong Leng, Raghuveer Thirukovalluru, Bhuwan Dhingra

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक दोस्त को 2 घंटे की फिल्म के बारे में समझाने की कोशिश कर रहे हैं, लेकिन आपके पास बहुत कम समय है और याद रखने के लिए "मेमोरी स्लॉट्स" की एक बहुत ही सीमित संख्या है। यदि आप केवल समान अंतराल पर फ्रेम चुनते हैं (जैसे हर 10 सेकंड में एक स्नैपशॉट लेना), तो आप रोमांचक चेज़ सीन या किसी महत्वपूर्ण सुराग को मिस कर सकते हैं, और आप एक ही उबाऊ गलियारे का वर्णन पांच बार करके अपना समय बर्बाद कर सकते हैं।

यह वही समस्या है जिसे LDDR AI वीडियो समझ (video understanding) के लिए हल करता है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: बहुत अधिक वीडियो, बहुत कम दिमागी शक्ति

मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) सुपर-स्मार्ट जासूसों की तरह हैं जो टेक्स्ट पढ़ सकते हैं और तस्वीरों को देख सकते हैं। लेकिन जब वे एक लंबा वीडियो देखते हैं, तो वे अभिभूत (overwhelmed) हो जाते हैं। वीडियो में हजारों फ्रेम होते हैं, लेकिन AI केवल कुछ सौ "विजुअल टोकन्स" (इमेज डेटा के छोटे टुकड़े) ही "देख" सकता है, इससे पहले कि वह थक जाए या उसकी मेमोरी खत्म हो जाए।

वर्तमान तरीके एक आलसी पर्यटक की तरह हैं:

  • यूनिफॉर्म सैंपलिंग (Uniform Sampling): हर 5 सेकंड में एक फोटो लेना। यह एक्शन को मिस कर देता है और दोहराव करता है।
  • सिंपल रेलिवेंस (Simple Relevance): केवल उन्हीं फ्रेमों को चुनना जो सवाल से मिलते-जुलते दिखते हैं। यह अक्सर एक ही व्यक्ति के बात करने की 10 तस्वीरें चुन लेता है, जिससे संदर्भ (context) छूट जाता है।

2. समाधान: LDDR (एक स्मार्ट क्यूरेटर)

लेखक LDDR का प्रस्ताव देते हैं, जो एक "ट्रेनिंग-फ्री" टूल है। इसे एक स्मार्ट क्यूरेटर के रूप में सोचें जिसे क्यूरेट करना सीखने की आवश्यकता नहीं है; वह बस बेहतरीन फ्रेम चुनने और यह तय करने के लिए कि कितना विवरण दिखाना है, नियमों के एक सेट का उपयोग करता है।

यह दो मुख्य चीजें करता है:

A. "एंटी-रिडंडेंसी" फ़िल्टर (Linear DPP)

कल्पना कीजिए कि आप यात्रा के लिए एक सूटकेस पैक कर रहे हैं, लेकिन आप केवल 10 चीजें ला सकते हैं।

  • पुराना तरीका: आप उन 10 चीजों को चुनते हैं जो आपके गंतव्य जैसी दिखती हैं। यदि आप समुद्र तट पर जा रहे हैं, तो आप नीले रंग के 10 अलग-अलग शेड्स के स्विम सूट पैक कर सकते हैं। आपके पास विविधता नहीं है।
  • LDDR का तरीका: यह Linear DPP नामक एक गणितीय ट्रिक का उपयोग करता है। इसे एक नियम के रूप में सोचें जो कहता है: "यदि आप एक नीला स्विम सूट चुनते हैं, तो आप दूसरा नीला स्विम सूट नहीं चुन सकते। आपको एक टोपी, एक तौलिया और धूप का चश्मा चुनना चाहिए।"

यह पूरे वीडियो को एक साथ देखता है (केवल टुकड़ों में नहीं) और फ्रेमों का एक ऐसा सेट चुनता है जो आपके सवाल के लिए प्रासंगिक भी है और एक-दूसरे से अलग भी है

  • जादू: आमतौर पर, यह गणित करना धीमा और भारी होता है (जैसे पूरे बेड़े के जहाजों के लिए एकदम सही सूटकेस पैकिंग की गणना करने की कोशिश करना)। LDDR ने एक शॉर्टकट (Linear DPP) का आविष्कार किया है जो इस गणना को 3 गुना तेज़ बनाता है, जिससे यह बिना धीमा हुए लंबे वीडियो को संभाल सकता है।

B. "डायनेमिक रेजोल्यूशन" बजट (Group DPP)

एक बार जब क्यूरेटर बेहतरीन 10 फ्रेम चुन लेता है, तो उसे यह तय करना होता है कि प्रत्येक पर कितनी "मेमोरी" खर्च करनी है।

  • पुराना तरीका: हर फ्रेम को समान मात्रा में विवरण देना (जैसे, सभी के लिए 100 पिक्सेल)। यह बर्बादी है। एक धुंधले बैकग्राउंड पर 100 पिक्सेल क्यों खर्च करना जब आप उन 100 पिक्सेल का उपयोग किसी साइन बोर्ड पर लिखे छोटे से महत्वपूर्ण टेक्स्ट के लिए कर सकते हैं?
  • LDDR का तरीका: यह एक स्मार्ट फोटोग्राफर की तरह काम करता है।
    • यदि किसी फ्रेम में कोई महत्वपूर्ण सुराग (जैसे लाइसेंस प्लेट या चेहरा) है, तो यह ज़ूम इन करता है और हाई रेजोल्यूशन (बहुत सारे मेमोरी टोकन) का उपयोग करता है।
    • यदि कोई फ्रेम केवल एक उबाऊ बैकग्राउंड है या पिछले फ्रेम के समान है, तो यह ज़ूम आउट करता है या उसे धुंधला कर देता है (कम टोकन का उपयोग करता है)।

यह Group DPP Importance नामक मेट्रिक द्वारा निर्देशित है। यह पूछता है: "यह विशिष्ट फ्रेम पहले से चुने गए समूह में कितनी नई जानकारी जोड़ता है?" यदि उत्तर है "बहुत कुछ," तो इसे उच्च बजट मिलता है। यदि उत्तर है "कुछ नया नहीं," तो इसे कम बजट मिलता है।

3. परिणाम: तेज़ और स्मार्ट

पेपर ने चार अलग-अलग वीडियो बेंचमार्क (छोटे क्लिप से लेकर एक घंटे लंबे वीडियो तक) और विभिन्न AI मॉडल्स पर इसका परीक्षण किया।

  • गति (Speed): "लीनियर" शॉर्टकट के कारण, LDDR उन पिछले तरीकों की तुलना में बहुत तेज़ है जिन्होंने समान गणित करने की कोशिश की थी।
  • सटीकता (Accuracy): इसने लगातार अन्य तरीकों की तुलना में उच्च स्कोर प्राप्त किया।
    • कठिन स्थितियों में (जहाँ AI के पास बहुत कम मेमोरी होती है), इसने स्कोर में 2.5 अंक का सुधार किया।
    • उदार स्थितियों में, इसने अभी भी 1.6 अंक का सुधार किया।
  • बहुमुखी प्रतिभा (Versatility): यह एक "प्लग-एंड-प्ले" एडॉप्टर की तरह काम करता है। आपको AI मॉडल को फिर से ट्रेन करने की आवश्यकता नहीं है। आप बस वीडियो को LDDR के माध्यम से फीड करते हैं, और फिर AI परिणाम देखता है। यह "ब्लैक बॉक्स" मॉडल्स (जैसे GPT-5-mini) पर भी काम करता है जहाँ आप कोड के अंदर नहीं देख सकते।

सारांश उपमा (Summary Analogy)

कल्पना कीजिए कि आप एक 10 घंटे के शहर के दौरे के लिए एक टूर गाइड रख रहे हैं, लेकिन आपके पास गाइड के नोट्स के लिए केवल 1 घंटे का बजट है।

  • पुराने गाइड हर 10 मिनट में एक नोट लिखेंगे, भले ही कुछ न हुआ हो, और वे एक ही मूर्ति के बारे में 5 बार एक ही नोट लिखेंगे।
  • LDDR एक ऐसा गाइड है जो:
    1. उबाऊ हिस्सों को पूरी तरह से छोड़ देता है।
    2. केवल सबसे अनूठे और दिलचस्प क्षणों को चुनता है (कोई डुप्लिकेट मूर्तियाँ नहीं)।
    3. उस एक क्षण के बारे में एक बड़ा, विस्तृत पैराग्राफ लिखता है जहाँ जादू हुआ था, और उबाऊ सड़क के कोनों के बारे में बस एक छोटी सी लिखावट करता है।

परिणामस्वरूप? आपको उसी समय में पूरे दिन की बहुत बेहतर समझ मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →