← नवीनतम पेपर
💻 computer science

ST-SimDiff: Balancing Spatiotemporal Similarity and Difference for Efficient Video Understanding with MLLMs

ST-SimDiff एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो एक स्थानिक-कालिक ग्राफ (spatio-temporal graph) का निर्माण करके और एक समानांतर द्वि-चयन रणनीति (parallel dual-selection strategy) को नियोजित करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में कुशल वीडियो समझ को बढ़ाता है, जो समानता-आधारित अतिरेक न्यूनीकरण (similarity-based redundancy reduction) और अंतर-आधारित प्रमुख घटना संरक्षण (difference-based key event preservation) के बीच संतुलन बनाता है।

मूल लेखक: Bingjun Luo, Tony Wang, Chaoqi Chen, Xinpeng Ding

प्रकाशित 2026-05-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bingjun Luo, Tony Wang, Chaoqi Chen, Xinpeng Ding

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक दोस्त को दो घंटे की फिल्म के बारे में समझाने की कोशिश कर रहे हैं, लेकिन आपके पास उसे बताने के लिए केवल 30 सेकंड का समय है। यदि आप केवल यादृच्छिक (random) दृश्य चुनते हैं, तो आप पूरी कहानी को मिस कर सकते हैं। यदि आप केवल सबसे "महत्वपूर्ण" दिखने वाले दृश्य चुनते हैं, तो आप शायद एक ही उबाऊ बैकग्राउंड को पांच बार बता देंगे और उस पल को छोड़ देंगे जब नायक बंदूक निकालता है।

यही वह समस्या है जिसे ST-SimDiff वीडियो देखने वाली आर्टिफिशियल इंटेलिजेंस (AI) के लिए हल करता है।

समस्या: बहुत अधिक डेटा, कम दिमागी शक्ति

आधुनिक AI मॉडल (जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स कहा जाता है) उन सुपर-स्मार्ट छात्रों की तरह हैं जो कुछ भी पढ़ और देख सकते हैं। लेकिन जब वे एक वीडियो देखते हैं, तो वे उसे हजारों छोटे "विजुअल टोकन्स" (जैसे पहेली के व्यक्तिगत टुकड़े) में तोड़ देते हैं।

एक लंबे वीडियो के लिए, यह पहेली के टुकड़ों का एक विशाल ढेर बना देता है। कहानी को समझने के लिए AI को हर एक टुकड़े को देखना पड़ता है। इसमें बहुत अधिक कंप्यूटर पावर, मेमोरी और समय लगता है। यह एक साधारण प्रश्न का उत्तर देने के लिए पूरी विश्वकोश (encyclopedia) पढ़ने जैसा है।

पुराना तरीका: केवल "सबसे अच्छे" टुकड़ों को चुनना

पिछले तरीकों ने रेडंडेंसी (redundancy) को देखकर इसे ठीक करने की कोशिश की। उन्होंने पूछा, "कौन से टुकड़े एक जैसे दिखते हैं?" या "कौन से टुकड़े सबसे महत्वपूर्ण हैं?"

  • खामी: वे समानताएं खोजने में बहुत अच्छे थे। यदि एक वीडियो में एक कार सड़क पर 10 सेकंड तक चलती है, तो AI बार-बार उसी "सबसे महत्वपूर्ण" कार टोकन को चुनता रहता है, यह नजरअंदाज करते हुए कि कार बस चल रही है।
  • अंधा मोड़ (Blind Spot): वे टर्निंग पॉइंट्स (मोड़) को मिस कर देते थे। यदि कार अचानक दुर्घटनाग्रस्त हो जाती है, तो वह एक बड़ा बदलाव है। पुराने तरीके अक्सर इन बदलावों को नजरअंदाज कर देते थे क्योंकि वे उन चीजों पर केंद्रित थे जो समान रहती हैं।

नया समाधान: ST-SimDiff (समानता + अंतर)

लेखक एक "दोहरी रणनीति" का उपयोग करके वीडियो कंप्रेशन के बारे में सोचने का एक नया तरीका प्रस्तावित करते हैं। वे वीडियो को एक ऐसे मानचित्र की तरह देखते हैं जिसमें दो प्रकार की सड़कें हैं:

1. "समानता" वाली सड़क (उबाऊ चीजों को कंप्रेस करना)

उपमा: कल्पना कीजिए कि पार्क में लोगों की एक भीड़ खड़ी है। वे सभी बहुत समान दिखते हैं।

  • ST-SimDiff क्या करता है: यह इन समान "टोकन्स" को एक घने क्लस्टर (जैसे एक समुदाय) में समूहित करता है। हर एक व्यक्ति की फोटो रखने के बजाय, यह समूह में से केवल एक प्रतिनिधि व्यक्ति को चुनता है जो बाकी सभी का प्रतिनिधित्व कर सके।
  • परिणाम: यह बिना अर्थ खोए स्थिर दृश्यों (जैसे बैकग्राउंड या धीमी गति से चलती वस्तु) का वर्णन करने के लिए आवश्यक टोकन्स की संख्या को भारी रूप से कम कर देता है।

2. "अंतर" वाली सड़क (रोमांचक चीजों को पकड़ना)

उपमा: अब, उसी भीड़ की कल्पना करें, लेकिन अचानक एक गुब्बारा फूटता है और सब उछल पड़ते हैं।

  • ST-SimDiff क्या करता है: यह फ्रेम्स के बीच के "किनारों" (edges) को देखता है। यदि एक सेकंड से दूसरे सेकंड के बीच चित्र में भारी बदलाव आता है (समानता में तेज गिरावट), तो यह चिल्लाता है, "रुको! यह एक प्रमुख घटना है!"
  • परिणाम: यह AI को उन विशिष्ट टोकन्स को रखने के लिए मजबूर करता है जो इन अचानक परिवर्तनों (जैसे कार दुर्घटना, नए पात्र का प्रवेश, या दृश्य परिवर्तन) को कैप्चर करते हैं। ये वीडियो के "प्लॉट ट्विस्ट" हैं।

यह मिलकर कैसे काम करता है

यह सिस्टम एक विशाल स्पैटियो-टेम्पोरल ग्राफ (Spatio-Temporal Graph) बनाता है। इसे एक सोशल नेटवर्क मैप की तरह समझें जहाँ वीडियो का हर विजुअल हिस्सा एक व्यक्ति है।

  • समानता (Similarity) उन लोगों को जोड़ती है जो एक-दूसरे के पास खड़े हैं या एक जैसे दिखते हैं।
  • अंतर (Difference) उन क्षणों को देखता है जहाँ संबंध टूट जाता है या हिंसक रूप से बदल जाता है।

AI फिर दो समानांतर फिल्टर चलाता है:

  1. फिल्टर 1: "हर एक जैसे दिखने वाले समूह से एक व्यक्ति को रखें।" (स्थिर चीजों को कंप्रेस करता है)।
  2. फिल्टर 2: "उन लोगों को रखें जिन्होंने अभी कुछ बिल्कुल अलग किया है।" (एक्शन को सुरक्षित रखता है)।

अंत में, यह इन दोनों सूचियों को मिला देता है। परिणाम स्वरूप, टोकन्स का एक छोटा, अत्यधिक कुशल सेट प्राप्त होता जिसमें सभी स्थिर संदर्भ (stable context) और सभी महत्वपूर्ण क्रियाएं (critical action) शामिल होती हैं, लेकिन दोहराव वाला शोर हटा दिया जाता है।

परिणाम

पेपर का दावा है कि यह तरीका ट्रेनिंग-फ्री (training-free) है (इसे नई चीजें सीखने की आवश्यकता नहीं है; यह केवल डेटा को छांटने के लिए गणित का उपयोग करता है)।

  • प्रदर्शन: यह वास्तव में वीडियो समझने के परीक्षणों पर अन्य शीर्ष तरीकों की तुलना में बेहतर प्रदर्शन करता है। कुछ मामलों में, इसने पूरे वीडियो को देखने वाले AI के समान प्रदर्शन किया, भले ही इसने केवल 30% से 50% डेटा ही देखा था।
  • गति और मेमोरी: क्योंकि यह बहुत सारा अनावश्यक डेटा हटा देता है, इसलिए AI बहुत तेजी से चलता है (30% तक तेज) और बहुत कम कंप्यूटर मेमोरी (30% तक कम) का उपयोग करता है।

संक्षेप में: ST-SimDiff AI को वीडियो के उबाऊ, दोहराव वाले हिस्सों को अनदेखा करना सिखाता है जबकि यह सुनिश्चित करता है कि वह एक भी प्लॉट ट्विस्ट मिस न करे। यह "क्या समान रहता है" और "क्या बदलता है" के बीच संतुलन बनाता है, जिससे AI लंबे वीडियो को कुशलतापूर्वक समझ पाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →