← नवीनतम पेपर
💻 computer science

Seeing the Forest and the Trees: Query-Aware Tokenizer for Long-Video Multimodal Language Models

यह शोध पत्र QTSplus को प्रस्तुत करता है, जो एक हल्का क्वेरी-अवेयर टोकन चयन मॉड्यूल है जो टेम्पोरल अंडरस्टैंडिंग कार्यों पर प्रदर्शन को बनाए रखते हुए या उसे बढ़ाते हुए, लॉन्ग-वीडियो मल्टीमॉडल लैंग्वेज मॉडल्स में कंप्यूटेशनल लागत और लेटेंसी को काफी कम करने के लिए टेक्स्ट क्वेरी की जटिलता के आधार पर विजुअल टोकन को गतिशील रूप से फ़िल्टर करता है।

मूल लेखक: Siyou Li, Huanan Wu, Juexi Shao, Yinghao Ma, Yujian Gan, Yihao Luo, Yuwei Wang, Dong Nie, Lu Wang, Wenqing Wu, Le Zhang, Massimo Poesio, Juntao Yu

प्रकाशित 2026-02-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Siyou Li, Huanan Wu, Juexi Shao, Yinghao Ma, Yujian Gan, Yihao Luo, Yuwei Wang, Dong Nie, Lu Wang, Wenqing Wu, Le Zhang, Massimo Poesio, Juntao Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "सीइंग द फॉरेस्ट एंड द ट्रीज़" (Seeing the Forest and the Trees) पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ हिंदी अनुवाद दिया गया है।

बड़ी समस्या: "लाइब्रेरी ऑफ अलेक्जेंड्रिया" वाली समस्या

कल्पना कीजिए कि आपके पास एक मल्टीमॉडल AI (एक सुपर-स्मार्ट रोबोट जो देख और पढ़ सकता है) है। आप उससे एक 3 घंटे लंबी फिल्म के बारे में कोई सवाल पूछना चाहते हैं।

वर्तमान में, वीडियो को समझने के लिए, AI को हर एक फ्रेम को एक "टोकन" (एक तस्वीर का डिजिटल शब्द) में बदलना पड़ता है।

  • समस्या: एक 3 घंटे की फिल्म में हजारों फ्रेम होते हैं। यदि AI हर एक को पढ़ने की कोशिश करता है, तो यह वैसा ही है जैसे किसी लाइब्रेरियन से एक साधारण सवाल का जवाब खोजने के लिए 'लाइब्रेरी ऑफ अलेक्जेंड्रिया' की हर एक किताब पढ़ने के लिए कहना: "चेज़ सीन (पीछा करने वाले दृश्य) में कार का रंग क्या था?"
  • परिणाम: AI अभिभूत (overwhelmed) हो जाता है। उसकी मेमोरी खत्म हो जाती है, सोचने में बहुत समय लगता है, और वह अक्सर उस विशिष्ट विवरण को मिस कर देता है जिसके बारे में आपने पूछा था क्योंकि वह बहुत अधिक जानकारी में डूब जाता है।

समाधान: QTSplus (एक "स्मार्ट लाइब्रेरियन")

लेखक QTSplus नामक एक नया टूल प्रस्तावित करते हैं। इसे एक सुपर-स्मार्ट, क्वेरी-अवेयर (सवाल के प्रति जागरूक) लाइब्रेरियन के रूप में समझें जो वीडियो कैमरा और AI मस्तिष्क के बीच खड़ा है।

AI को पूरी लाइब्रेरी सौंपने के बजाय, QTSplus पहले आपके सवाल को देखता है, फिर शेल्फों की ओर दौड़ता है, केवल वही विशिष्ट किताबें (वीडियो फ्रेम्स) चुनता है जिनकी आपको आवश्यकता है, और उन्हें सौंप देता है।

यह कैसे काम करता है, यहाँ चरण-दर-चरण दिया गया है:

1. "प्रासंगिकता स्कोर" (लाइब्रेरियन का अंतर्ज्ञान)

जब आप पूछते हैं, "आदमी क्या कर रहा है?", तो QTSplus केवल अनुमान नहीं लगाता। यह क्रॉस-अटेंशन (Cross-Attention) नामक तकनीक का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि लाइब्रेरियन आपके सवाल वाला कार्ड पकड़े हुए है। जैसे ही वे वीडियो फ्रेम्स के पास से गुजरते हैं, वे प्रत्येक फ्रेम को आपके सवाल के साथ कितनी समानता है, इसके आधार पर एक "प्रासंगिकता स्कोर" (relevance score) देते हैं।
  • यदि एक फ्रेम में एक आदमी बीयर पीते हुए दिखाया गया है, तो उसे उच्च स्कोर (high score) मिलता है।
  • यदि एक फ्रेम में एक पेड़ या खाली दीवार दिखाई देती है, तो उसे कम स्कोर (low score) मिलता है।

2. "अनुकूली बजट" (यह जानना कि कितना पढ़ना है)

यही सबसे चतुर हिस्सा है। AI "वीडियो का 10% रखें" जैसा कोई निश्चित नियम इस्तेमाल नहीं करता है। यह सवाल के आधार पर अपनी रणनीति बदलता है।

  • परिदृश्य A: आप पूछते हैं, "पूरी फिल्म का सारांश दें।"
    • QTSplus कहता है: "ठीक है, यह एक व्यापक सवाल है। मुझे पूरी कहानी बताने के लिए बहुत सारे फ्रेम रखने होंगे।" (उच्च बजट)।
  • परिदृश्य B: आप पूछते हैं, "लाल बत्ती कब हरी हुई?"
    • QTSplus कहता है: "यह एक विशिष्ट क्षण है। मुझे केवल ट्रैफिक लाइट के आसपास के कुछ सेकंड रखने की आवश्यकता है। मैं बाकी सब हटा सकता हूँ।" (कम बजट)।

यह सवाल की जटिलता और वीडियो में महत्वपूर्ण सुराग कितने फैले हुए हैं, इसके आधार पर एक "रिटेंशन फ्रैक्शन" (Retention Fraction) (कितना रखना है उसका प्रतिशत) की गणना करता है।

3. "टाइम ट्रैवलर" (क्रम को सुरक्षित रखना)

एक बार जब लाइब्रेरियन बेहतरीन फ्रेम्स चुन लेता है, तो एक जोखिम होता है: वे गड़बड़ (jumbled) हो सकते हैं। यदि आप AI को फिल्म की शुरुआत से पहले फिल्म के अंत का फ्रेम दिखाते हैं, तो वह भ्रमित हो जाएगा।

  • समाधान: QTSplus चुने गए फ्रेम्स में एक छोटा सा "टाइम स्टैम्प" जोड़ता है।
  • उपमा: यह चुनी गई किताबों के पन्नों को एक बाइंडर में वापस रखने जैसा है जिस पर स्टिकी नोट्स लगे हैं जो कहते हैं "पेज 1," "पेज 50," और "पेज 100।" यह सुनिश्चित करता है कि AI कहानी के प्रवाह को सही क्रम में समझे, भले ही उसने 99% पन्ने छोड़ दिए हों।

परिणाम: तेज़, हल्का और सटीक

पेपर ने इसका परीक्षण Qwen2.5-VL मॉडल (एक बहुत लोकप्रिय AI) पर किया। यहाँ क्या हुआ:

  • संपीड़न (Compression): इसने वीडियो डेटा की मात्रा को 89% तक कम कर दिया। (कल्पना कीजिए कि 100 पन्नों के दस्तावेज़ को बिना कहानी खोए 11 पन्नों तक सिकोड़ देना)।
  • गति (Speed): AI सवालों के जवाब देने में 28% तेज़ हो गया।
  • सटीकता (Accuracy): आश्चर्यजनक रूप से, यह मूर्ख नहीं हुआ। वास्तव में, क्रम (पहले क्या हुआ?) और दिशा (कार किस दिशा में जा रही थी?) के बारे में सवालों के लिए, यह वास्तव में बेहतर हो गया क्योंकि यह अप्रासंगिक फ्रेम्स से विचलित नहीं हो रहा था।

यह क्यों महत्वपूर्ण है

इससे पहले, AI के साथ लंबे वीडियो देखना एक 'फायरहोस' (पानी की तेज़ धार) से पानी पीने जैसा था। या तो आपको वीडियो को छोटे, असंबद्ध क्लिप्स में काटना पड़ता था (जिससे बड़ी तस्वीर छूट जाती थी) या AI को बहुत अधिक डेटा के कारण घुटने देना पड़ता था।

QTSplus AI को स्मार्ट चश्मे देने जैसा है। यह AI को एक 3 घंटे की फिल्म देखने, उबाऊ हिस्सों को अनदेखा करने, आपके द्वारा पूछे गए विषय पर ध्यान केंद्रित करने और बिना सिरदर्द के तेज़ी से उत्तर देने की अनुमति देता है। यह हमें सामान्य कंप्यूटरों पर घंटों लंबे वास्तविक दुनिया के वीडियो को संभालने के लिए AI को स्केल करने की अनुमति देता है, न कि केवल सुपरकंप्यूटरों पर।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →