← नवीनतम पेपर
🤖 machine learning

Unified Spatio-Temporal Token Scoring for Efficient Video VLMs

यह शोध पत्र स्पैटियो-टेम्पोरल टोकन स्कोरिंग (STTS) प्रस्तुत करता है, जो एक हल्का, एंड-टू-एंड ट्रेन करने योग्य मॉड्यूल है जो बिना टेक्स्ट कंडीशनिंग के ViT और LLM दोनों में विजन टोकन प्रूनिंग को एकीकृत करता है, जिससे वीडियो विजन-लैंग्वेज कार्यों पर न्यूनतम प्रदर्शन हानि के साथ 62% दक्षता लाभ प्राप्त होता है।

मूल लेखक: Jianrui Zhang, Yue Yang, Rohun Tripathi, Winson Han, Ranjay Krishna, Christopher Clark, Yong Jae Lee, Sangho Lee

प्रकाशित 2026-03-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jianrui Zhang, Yue Yang, Rohun Tripathi, Winson Han, Ranjay Krishna, Christopher Clark, Yong Jae Lee, Sangho Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप किसी एक सवाल का जवाब देने के लिए 2 घंटे की फिल्म देखने की कोशिश कर रहे हैं। अब, कल्पना कीजिए कि केवल फिल्म देखने के बजाय, आपको उस सवाल के बारे में सोचने से पहले उस फिल्म के हर एक फ्रेम के हर एक पिक्सेल का विस्तृत विवरण लिखना होगा।

यह मूल रूप से वर्तमान वीडियो AI मॉडल (विज़न-लैंग्वेज मॉडल्स) करते हैं। वे अविश्वसनीय रूप से स्मार्ट हैं, लेकिन वे बहुत धीमे और भारी कंप्यूटर शक्ति के भूखे भी हैं क्योंकि वे वीडियो के हर एक हिस्से को प्रोसेस करने की कोशिश करते हैं, यहाँ तक कि उन उबाऊ हिस्सों को भी।

यह पेपर एक चतुर नया तरीका पेश करता है जिसे STTS (Spatio-Temporal Token Scoring) कहा जाता है। इसे एक अत्यधिक कुशल संपादक (editor) के रूप में समझें।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. समस्या: "पिक्सेल ओवरलोड"

जब एक AI वीडियो देखता है, तो वह वीडियो को छोटे-छोटे चौकोर टुकड़ों में तोड़ देता है जिन्हें "टोकन" (पहेली के टुकड़ों की तरह) कहा जाता है।

  • समस्या: यदि कोई वीडियो दिखाता है कि एक व्यक्ति कमरे में चल रहा है, तो बैकग्राउंड (दीवार, फर्श) सैकड़ों फ्रेम तक बिल्कुल एक जैसा रहता है। AI वर्तमान में उस एक ही दीवार का बार-बार विश्लेषण करने में अपनी मानसिक शक्ति बर्बाद करता है।
  • परिणाम: AI सुस्त हो जाता है, सोचने में बहुत समय लेता है, और कंप्यूटर की मेमोरी का सारा हिस्सा खत्म कर देता है।

2. पुराने समाधान: "ब्लंट फ़ोर्स" संपादक

पिछले तरीकों ने इस समस्या को दो तरीकों से ठीक करने की कोशिश की, लेकिन दोनों में कमियां थीं:

  • तरीका A (अर्ली एग्जिट - जल्दी बाहर निकलना): उन्होंने वीडियो को जल्दी देखना बंद करने की कोशिश की। लेकिन यह एक छात्र द्वारा किताब को सरसरी तौर पर पढ़ने जैसा था, जो महत्वपूर्ण प्लॉट ट्विस्ट को मिस कर देता है क्योंकि उसे अभी तक पता ही नहीं था कि क्या महत्वपूर्ण है।
  • तरीका B (टेक्स्ट-डिपेंडेंट एडिटर): उन्होंने तब तक इंतजार किया जब तक AI ने सवाल नहीं पढ़ लिया, फिर उन्होंने वीडियो के हिस्सों को काटने की कोशिश की। लेकिन यह एक शेफ के ग्राहक के खाना ऑर्डर करने का इंतजार करने जैसा था, इससे पहले कि वह सब्जियां काटना शुरू करे। यह बहुत धीमा और जटिल था।

3. नया समाधान: STTS (एक "स्मार्ट एडिटर")

STTS एक हल्का मॉड्यूल है जो AI के अंदर बैठता है और एक स्मार्ट, रियल-टाइम एडिटर के रूप में कार्य करता है। इसके पास दो विशेष महाशक्तियाँ हैं:

महाशक्ति 1: "एक्शन पहचानने वाली" आँख (Spatial Scoring)

एक फुटबॉल मैच देखने की कल्पना करें। घास हरी और स्थिर है। गेंद और खिलाड़ी हिल रहे हैं।

  • पुराना AI: घास, गेंद, खिलाड़ियों और भीड़ को समान रूप से देखता है।
  • STTS: वीडियो को देखता है और कहता है, "हे, घास 10 सेकंड से नहीं बदली है। मुझे उस पर रिपोर्ट लिखने की जरूरत नहीं है। लेकिन गेंद अभी हिली है! मुझे इसे रखना होगा।"
  • यह कैसे सीखता है: यह AI द्वारा सवालों के जवाब देने के तरीके को देखकर सीखता है। यदि AI सही उत्तर देता है, तो STTS जानता है, "अच्छा, मैंने सही हिस्से रखे।" यदि वह गलत उत्तर देता है, तो STTS सीखता है, "ओह, मैंने कुछ महत्वपूर्ण हिस्सा काट दिया।"

महाशक्ति 2: "समय यात्री" (Temporal Scoring)

यहीं STTS वास्तव में चतुर हो जाता है। यह समय को देखता है।

  • यदि फ्रेम 1 और फ्रेम 2 99% समान दिखते हैं (जैसे एक स्थिर बैकग्राउंड), तो STTS कहता है, "फ्रेम 2 केवल फ्रेम 1 की एक कॉपी है। चलिए फ्रेम 2 को हटा देते हैं।"
  • यह यह जानने के लिए एक विशेष "समानता स्कोर" का उपयोग करता है कि दो समय के क्षण उबाऊ रूप से एक जैसे हैं, ताकि वह मुख्य मस्तिष्क तक पहुँचने से पहले ही डुप्लिकेट डेटा को हटा सके।

4. पैकिंग ट्रिक: बस भरना

जब आप वीडियो के 50% फ्रेम काट देते हैं, तो आपके पास डेटा का एक बिखरा हुआ ढेर बच जाता है। कंप्यूटर बिखरे हुए डेटा को पसंद नहीं करते; उन्हें साफ, आयताकार ब्लॉक पसंद हैं।

  • समस्या: यदि आप डेटा का आधा हिस्सा हटा देते हैं, तो कंप्यूटर को अभी भी उस "खाली स्थान" को ढोना होगा जहाँ डेटा मौजूद था।
  • STTS का समाधान: यह एक पैकिंग एल्गोरिदम का उपयोग करता है। कल्पना कीजिए कि आपके पास 100 सीटों वाली एक बस है। आपने यात्रियों की संख्या आधी कर दी। खाली सीटें इधर-उधर छोड़ने के बजाय, STTS सभी को बस के सामने की ओर खिसका देता है ताकि पीछे की 50 सीटें पूरी तरह से खाली रहें। अब बस बहुत तेजी से चल सकती है क्योंकि वह कम वजन ढो रही है।

5. परिणाम: तेज़, स्मार्ट और सुव्यवस्थित

लेखकों ने 13 अलग-अलग वीडियो क्विज़ (छोटे क्लिप से लेकर एक घंटे की फिल्मों तक) पर इसका परीक्षण किया।

  • कटौती: उन्होंने सफलतापूर्वक उस विजुअल डेटा को डिलीट कर दिया जिसे AI को प्रोसेस करना था, जो 50% था।
  • गति: क्योंकि AI को आधा काम करना पड़ा, इसलिए यह सीखने और जवाब देने दोनों में 62% तेज़ हो गया।
  • समझदारी: आश्चर्यजनक रूप से, AI कम बुद्धिमान नहीं हुआ। इसकी सटीकता में केवल 0.7% की कमी आई। वास्तव में, बहुत लंबे वीडियो के लिए, यह कभी-कभी बेहतर हो गया क्योंकि यह अतिरिक्त, उबाऊ डेटा से विचलित नहीं हो रहा था।

बड़ी तस्वीर

STTS को एक AI को शोर (noise) को अनदेखा करना सिखाने के रूप में समझें।

  • पहले, AI एक ऐसे छात्र की तरह था जो एक तथ्य खोजने के लिए पुस्तकालय की पूरी किताबें पढ़ने की कोशिश कर रहा था।
  • अब, STTS के साथ, AI एक ऐसे जासूस की तरह है जिसे पता है कि कौन से पन्ने पढ़ने हैं और कौन से अध्याय छोड़ देने हैं।

यह हमें ऐसे AI बनाने की अनुमति देता है जो लंबी फिल्में देख सकें, कठिन सवालों के जवाब दे सकें और बिना अपनी बुद्धिमत्ता खोए सस्ते, तेज़ कंप्यूटरों पर चल सकें। यह वीडियो AI को वास्तविक दुनिया के लिए व्यावहारिक बनाने का एक सरल और सुंदर तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →