← नवीनतम पेपर
💻 computer science

LFS: Learnable Frame Selector for Event-Aware and Temporally Diverse Video Captioning

यह शोध पत्र लर्नएबल फ्रेम सेलेक्टर (LFS) को प्रस्तुत करता है, जो बेहतर वीडियो कैप्शनिंग के लिए गतिशील रूप से टेम्पोरल रूप से विविध और घटना-प्रासंगिक फ्रेमों का चयन करने हेतु फ्रोजन वीडियो-LLMs से कैप्शन फीडबैक का लाभ उठाता है, और साथ ही विस्तृत वीडियो समझ को बेहतर ढंग से मूल्यांकित करने के लिए मानव-संगत ICH-CC बेंचमार्क का प्रस्ताव करता है।

मूल लेखक: Lianying Chao, Linfeng Yin, Peiyu Ren, Yifan Jiang, Qiaoyu Ren, Dingcheng Shan, Jing-cheng Pang, Sijie Wu, Xubin Li, Kai Zhang, Xin Chen

प्रकाशित 2026-05-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lianying Chao, Linfeng Yin, Peiyu Ren, Yifan Jiang, Qiaoyu Ren, Dingcheng Shan, Jing-cheng Pang, Sijie Wu, Xubin Li, Kai Zhang, Xin Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक दोस्त को दो घंटे की फिल्म के बारे में बताने की कोशिश कर रहे हैं, लेकिन आपके पास केवल फिल्म की 16 स्थिर तस्वीरें (still photos) दिखाने का समय है।

यदि आप 16 तस्वीरों को समान अंतराल पर चुनते हैं (हर 7 मिनट में एक), तो आप सबसे रोमांचक हिस्सों को छोड़ सकते हैं। आप नायक को स्थिर बैठे हुए देख सकते हैं, फिर फिर से उसे स्थिर बैठे हुए ही देखते हैं, और उस 30 सेकंड के दृश्य को पूरी तरह से मिस कर देते हैं जहाँ वह वास्तव में ड्रैगन से लड़ रहा है। यह वही समस्या है जिसका सामना वर्तमान AI वीडियो डिस्क्राइबर (वीडियो का वर्णन करने वाले AI) करते हैं: वे "समान रूप से अंतराल पर" स्नैपशॉट लेते हैं, जो अक्सर महत्वपूर्ण क्रियाओं को मिस कर देते हैं।

यह पेपर एक नया टूल पेश करता है जिसे LFS (Learnable Frame Selector) कहा जाता है, जो एक स्मार्ट फिल्म एडिटर की तरह काम करता है। वीडियो से यादृच्छिक (randomly) या समान रूप से फोटो चुनने के बजाय, LFS यह सीखता है कि पूरी कहानी बताने के लिए सबसे अच्छी 16 तस्वीरें कौन सी हैं।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: "बोरिंग स्नैपशॉट" का जाल

वर्तमान AI मॉडल आमतौर पर यूनिफॉर्म सैंपलिंग (uniform sampling) का उपयोग करके वीडियो से फ्रेम (तस्वीरें) चुनते हैं।

  • उपमा (Analogy): कल्पना कीजिए कि आप केवल पेज 1, पेज 50, पेज 100 और पेज 150 पढ़कर एक किताब पढ़ रहे हैं। आपको सामान्य विचार मिल सकता है, लेकिन आप बीच में होने वाले ट्विस्ट, मज़ाक और भावनात्मक क्षणों को मिस कर देंगे।
  • परिणाम: AI छोटी लेकिन महत्वपूर्ण क्रियाओं (जैसे एक शेफ द्वारा तेज़ी से प्याज़ काटने) को मिस कर देता है क्योंकि वे लंबे समय तक कुछ न होने के बीच दब जाती हैं।

2. समाधान: LFS (स्मार्ट एडिटर)

LFS एक छोटा, स्मार्ट मॉड्यूल है जो मुख्य AI (वह "दिमाग" जो विवरण लिखता है) से पहले बैठता है। इसका काम यह तय करना है कि दिमाग को कौन से 16 फ्रेम दिखाने हैं। यह तीन चतुर तरीकों से ऐसा करता है:

  • यह जानता है कि क्या महत्वपूर्ण है (इवेंट अवेयरनेस):
    LFS वीडियो को देखता है और पूछता है, "एक्शन कहाँ हो रहा है?" यह उन फ्रेमों को उच्च स्कोर देता है जहाँ चीजें बदल रही हैं (जैसे कार का मुड़ना या किसी का बोलना) और बोरिंग, स्थिर फ्रेमों को कम स्कोर देता है।

    • रूपक (Metaphor): यह एक स्पॉटलाइट की तरह है जो अभिनेता के बोलने शुरू करते ही अपने आप उस पर चमकने लगती है, बजाय इसके कि वह खाली मंच पर चमकती रहे।
  • यह शॉट्स को फैलाता है (टेम्पोरल डायवर्सिटी):
    केवल "सबसे महत्वपूर्ण" फ्रेम चुनना ही काफी नहीं है, क्योंकि इससे एक ही 10 सेकंड के विस्फोट के 16 फ्रेम चुने जा सकते हैं। LFS एक स्ट्रैटिफाइड रणनीति (stratified strategy) का उपयोग करता है। यह वीडियो को 16 समय स्लॉट में विभाजित करता है और खुद को प्रत्येक स्लॉट से ठीक एक "सर्वश्रेष्ठ" फ्रेम चुनने के लिए मजबूर करता है।

    • रूपक: यह एक छात्र के निबंध को ग्रेड देने वाले शिक्षक की तरह है। केवल सबसे रोमांचक पैराग्राफ पढ़ने के बजाय, शिक्षक यह सुनिश्चित करता है कि वे पूरी तस्वीर पाने के लिए शुरुआत, मध्य और अंत से थोड़ा-थोड़ा पढ़ें।
  • यह "शिक्षक" से सीखता है (कैप्शन फीडबैक):
    LFS केवल अनुमान नहीं लगाता; यह अंतिम परिणाम को देखकर सीखता है। यह एक शक्तिशाली, फ्रीज्ड AI (एक "शिक्षक") का उपयोग करके विवरण उत्पन्न करता है। यदि शिक्षक एक बुरा विवरण लिखता है क्योंकि LFS ने गलत फ्रेम चुने थे, तो LFS को "थम्स डाउन" मिलता है और वह अपनी रणनीति को समायोजित करता है।

    • रूपक: यह सूप चखने वाले एक सहायक शेफ (sous-chef) की तरह है। यदि सूप का स्वाद खराब है, तो सहायक शेफ को एहसास होता है, "ओह, मैंने गलत सब्जियां चुनी थीं," और अगली बार चीजें चुनने के लिए वह अपनी रणनीति बदल लेता है।

3. नया टेस्ट: ICH-CC

लेखकों ने महसूस किया कि वीडियो AI के लिए मौजूदा परीक्षण बहुत अच्छे नहीं थे, क्योंकि वे यह मापने में सक्षम नहीं थे कि क्या कोई AI वास्तव में एक इंसान की तरह वीडियो को समझता है। इसलिए, उन्होंने ICH-CC नामक एक नया परीक्षण बनाया।

  • यह क्या है? इंटैंजिबल कल्चरल हेरिटेज चाइनीज कुजीन (पारंपरिक खाना पकाने) के बारे में वीडियो का एक संग्रह।
  • यह क्यों विशेष है? विवरण और प्रश्न मनुष्यों द्वारा लिखे गए हैं। इसे यह देखने के लिए बनाया गया है कि क्या AI खाना पकाने के सूक्ष्म चरणों (जैसे "चावल की शराब डालना" या "हिलाना") का वर्णन ठीक वैसे ही कर सकता है जैसे कि एक इंसान करेगा।
  • परिणाम: जब LFS का उपयोग किया गया, तो AI इस मानव-समान परीक्षण को पास करने में बहुत बेहतर रहा, जिससे यह साबित हुआ कि वह पहले की तुलना में खाना पकाने की प्रक्रिया को बेहतर ढंग से "देख" सकता है।

4. परिणाम: बेहतर कहानियाँ, बेहतर उत्तर

पेपर ने LFS का परीक्षण कई अलग-अलग वीडियो AI मॉडल और बेंचमार्क पर किया:

  • विस्तृत विवरण: AI वीडियो में जो हो रहा था उसका बहुत अधिक समृद्ध और सटीक विवरण लिखना शुरू कर देता है।
  • वीडियो प्रश्न उत्तर (Video Question Answering): क्योंकि AI के पास पढ़ने के लिए एक बेहतर "कहानी" थी, इसलिए वह वीडियो के बारे में प्रश्नों के उत्तर देने में बेहतर हो गया (यहाँ तक कि बिना कच्चे वीडियो को दोबारा देखे भी)।
  • दक्षता (Efficiency): इसने यह सब बिना अधिक कंप्यूटिंग पावर की आवश्यकता के किया; इसने बस गलत 16 फ्रेम के बजाय सही 16 फ्रेम चुने।

सारांश

LFS को एक AI के लिए स्मार्ट कैमरा ऑपरेटर के रूप में समझें। कुछ भी हो रहा हो या न हो, हर 10 सेकंड में एक फोटो लेने के बजाय, LFS एक्शन का इंतज़ार करता है, यह सुनिश्चित करता है कि वह शुरुआत, मध्य और अंत को कैप्चर करे, और सबसे अच्छे 16 फोटो AI लेखक को सौंप देता है। परिणाम एक ऐसा वीडियो विवरण है जो विस्तृत, सटीक है और वास्तव में एक मानव पाठक के लिए समझ में आने योग्य है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →