← नवीनतम पेपर
💻 computer science

Shot-Aware Frame Sampling for Video Understanding

यह शोध पत्र InfoShot को प्रस्तुत करता है, जो एक टास्क-अज्ञेय (task-agnostic), शॉट-जागरूक (shot-aware) फ्रेम सैंपलिंग विधि है जो कुशल दीर्घ-वीडियो समझ के लिए समग्र वीडियो संदर्भ और महत्वपूर्ण अल्पकालिक घटनाओं, दोनों को संरक्षित करने हेतु एक सूचना-सैद्धांतिक उद्देश्य के आधार पर पूरक कीफ्रेम का चयन करती है, साथ ही ऐसी विसंगतियों के मूल्यांकन के लिए एक नया सिंथेटिक बेंचमार्क, SynFlash भी प्रदान करती है।

मूल लेखक: Mengyu Zhao, Di Fu, Yongyu Xie, Jiaxing Zhang, Zhigang Yuan, Shirin Jalali, Yong Cao

प्रकाशित 2026-03-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mengyu Zhao, Di Fu, Yongyu Xie, Jiaxing Zhang, Zhigang Yuan, Shirin Jalali, Yong Cao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक दोस्त को दो घंटे की फिल्म समझाने की कोशिश कर रहे हैं जिसके पास केवल 10 स्थिर फोटो (still photos) देखने का समय है।

यदि आप केवल 10 फोटो समान अंतराल पर चुनते हैं (हर 12 मिनट में एक), तो आप सबसे महत्वपूर्ण हिस्सों को छोड़ सकते हैं। आपको हीरो के सोने की एक फोटो मिलेगी, विलेन के दोपहर का भोजन करने की एक फोटो मिलेगी, और सूर्यास्त की एक फोटो मिलेगी। लेकिन आप उस धमाके (explosion) को पूरी तरह से मिस कर देंगे जो फिल्म के बीच में सिर्फ एक सेकंड के लिए हुआ था, या दीवार पर लिखे उस गुप्त संदेश को भी मिस कर देंगे जो एक पल के लिए दिखा था।

यही वह समस्या है जिसका सामना आज वीडियो AI को करना पड़ रहा है। लंबे वीडियो को समझने के लिए, AI मॉडल्स को फ्रेम्स को "देखने" की आवश्यकता होती है, लेकिन वे एक साथ हजारों फ्रेम्स को प्रोसेस नहीं कर सकते। उन्हें कुछ चुनिले फ्रेम्स ही चुनने पड़ते हैं। वर्तमान तरीके उस दोस्त की तरह हैं जो यादृच्छिक (random) फोटो चुनता है: वे अक्सर उन छोटे, महत्वपूर्ण क्षणों को मिस कर देते हैं जो पूरी कहानी बदल देते हैं।

यह पेपर InfoShot नामक एक नया समाधान पेश करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:

1. समस्या: "यूनिफॉर्म" (Uniform) का जाल

अधिकांश वर्तमान सिस्टम यूनिफॉर्म सैंपलिंग (Uniform Sampling) का उपयोग करते हैं। कल्पना कीजिए कि एक सुरक्षा गार्ड 24 घंटे की फीड देख रहा है। यदि गार्ड हर घंटे एक स्नैपशॉट लेता है, तो उसे 24 फोटो मिलेंगे।

  • समस्या: यदि गार्ड 23 घंटों तक एक खाली कमरे को देख रहा है, तो उसे 23 खाली कुर्सी के फोटो मिलेंगे। लेकिन यदि घंटे 14 पर एक चोर एक सेकंड के लिए दरवाजे से अंदर आता है, तो हो सकता है कि गार्ड ने अपना स्नैपशॉट उसके आने से 5 मिनट पहले लिया हो या 5 मिनट बाद। चोर अदृश्य रह जाता है।

2. समाधान: InfoShot (एक "स्मार्ट एडिटर")

InfoShot एक स्मार्ट वीडियो एडिटर की तरह काम करता है जिसे पता है कि सभी क्षण समान रूप से महत्वपूर्ण नहीं होते। यह सही फोटो चुनने के लिए दो-चरणीय रणनीति का उपयोग करता है:

चरण A: "दृश्य" (Scenes) खोजें (शॉट सेगमेंटेशन)

समय (जैसे, "हर 5 सेकंड में") देखने के बजाय, InfoShot कंटेंट (सामग्री) को देखता है।

  • उपमा: एक किताब की कल्पना करें। एक यूनिफॉर्म सैंपलर हर 10 पेज के बाद एक पेज नंबर चुनता है। लेकिन एक स्मार्ट पाठक जानता है कि एक "अध्याय" (Chapter) एक पूर्ण विचार है। InfoShot पहले पहचानता है कि एक "अध्याय" (या शॉट) कहाँ समाप्त होता है और अगला कहाँ शुरू होता है।
  • यह कैसे मदद करता है: यह लंबे, उबाऊ दृश्यों पर "फोटो स्लॉट्स" बर्बाद करना बंद कर देता है जहाँ कुछ भी नहीं बदल रहा है। यह जानता है, "ठीक है, यह दृश्य 30 सेकंड तक केवल एक आदमी के बात करने का है; मुझे इसकी केवल एक फोटो की आवश्यकता है।"

चरण B: प्रत्येक दृश्य के लिए "दो-फोटो नियम"

एक बार जब यह एक दृश्य ढूंढ लेता है, तो InfoShot केवल एक रैंडम फोटो नहीं चुनता। यह हर एक दृश्य के लिए दो विशिष्ट फोटो चुनता है:

  1. "टिपिकल" (Typical) फोटो: यह दृश्य के मुख्य विचार का प्रतिनिधित्व करता है (जैसे, आदमी का बात करना)। यह सुनिश्चित करता है कि AI संदर्भ (context) को समझ सके।
  2. "वियर्ड" (Weird) फोटो: यह असली जादू है। InfoShot सक्रिय रूप से उस एक फ्रेम की तलाश करता है जो उस दृश्य में बाकी चीजों से अलग दिखता है।
    • उपमा: एक दृश्य की कल्पना करें जहाँ एक आदमी बात कर रहा है, लेकिन एक पल के लिए, उसके सिर पर एक केला गिरता है।
    • "टिपिकल" फोटो बात करने वाले आदमी को दिखाती है।
    • "वियर्ड" फोटो केले को हवा में पकड़ लेती है।
    • "वियर्ड" फोटो के बिना, AI सोचता है कि यह केवल एक बात करने वाला आदमी है। इसके साथ, AI केले को देख पाता है।

3. नया परीक्षण: "SynFlash"

यह साबित करने के लिए कि यह काम करता है, लेखकों ने SynFlash नामक एक नया टेस्ट बनाया है।

  • उपमा: उन्होंने नकली वीडियो बनाए जहाँ उन्होंने सामान्य वीडियो के अंदर गुप्त रूप से छोटे, एक-सेकंड के "ग्लिच" (जैसे अचानक डरावने चेहरे की चमक या छिपी हुई वस्तु) छिपा दिए।
  • परिणाम: जब उन्होंने AI को इन ग्लिच को खोजने के लिए कहा, तो पुराने तरीकों (Uniform, VSUMM) ने लगभग सभी को मिस कर दिया। InfoShot ने अधिकांश को ढूंढ लिया। यह एक ऐसे जासूस की तरह था जो जानता था कि छिपे हुए सुराग कहाँ देखने हैं।

4. यह वास्तविक दुनिया में क्यों मायने रखता है

लेखकों ने वास्तव में इसे TikTok के वीडियो मॉडरेशन सिस्टम पर टेस्ट किया है।

  • समस्या: बुरे तत्व (bad actors) हानिकारक सामग्री (जैसे हिंसा या नग्नता) को स्क्रीन पर एक सेकंड के लिए फ्लैश करके छिपाने की कोशिश करते हैं, इस उम्मीद में कि AI की "यूनिफॉर्म" सैंपलिंग इसे मिस कर देगी।
  • जीत: InfoShot का उपयोग करके, सिस्टम ने इन चालाकी से भरे, कम समय वाले हानिकारक वीडियो को अधिक संख्या में पकड़ा, और इसके लिए अधिक कंप्यूटर पावर की भी आवश्यकता नहीं पड़ी। यह एक सुरक्षा कैमरा सिस्टम को अपग्रेड करने जैसा है जो जेब काटने वाले को पकड़ सके जो अपनी जेब से हाथ दिखाने के लिए केवल एक पल के लिए हाथ हिलाता है।

सारांश

  • पुराना तरीका: हर 10 सेकंड में एक फोटो लें। (एक्शन मिस कर देता है)।
  • InfoShot तरीका: वीडियो को दृश्यों (scenes) में तोड़ें। प्रत्येक दृश्य के लिए, "सामान्य चीजों" की एक फोटो और "अजीब चीजों" की एक फोटो लें।
  • परिणाम: आप फोटो की समान संख्या के साथ वीडियो की बहुत बेहतर समझ प्राप्त करते हैं, और उन छोटे, महत्वपूर्ण क्षणों को पकड़ लेते हैं जिन्हें अन्य लोग मिस कर देते हैं।

यह किताब के पेज 1, 10, 20 और 30 पढ़ने के बजाय, हर अध्याय के सारांश और उस एक वाक्य को पढ़ने के बीच का अंतर है जहाँ कहानी में मोड़ (plot twist) आता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →