← नवीनतम पेपर
💻 computer science

TeCoNeRV: Leveraging Temporal Coherence for Compressible Neural Representations for Videos

TeCoNeRV एक स्थानिक और लौकिक रूप से विघटित भार भविष्यवाणी ढांचे (spatially and temporally decomposed weight prediction framework), एक अवशिष्ट भंडारण योजना (residual storage scheme) और लौकिक सुसंगतता नियमितीकरण (temporal coherence regularization) को पेश करके हाइपरनेटवर्क-आधारित वीडियो संपीड़न की स्केलेबिलिटी और दक्षता सीमाओं को संबोधित करता है, जिससे मौजूदा विधियों की तुलना में कई रिज़ॉल्यूशन में बेहतर PSNR, कम बिटरेट और तेज़ एन्कोडिंग गति प्राप्त होती है।

मूल लेखक: Namitha Padmanabhan, Matthew Gwilliam, Abhinav Shrivastava

प्रकाशित 2026-02-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Namitha Padmanabhan, Matthew Gwilliam, Abhinav Shrivastava

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने दोस्त को एक 4K मूवी भेजना चाहते हैं, लेकिन आपका इंटरनेट कनेक्शन धीमा है। आपको वीडियो के आकार (file size) को छोटा करना होगा, लेकिन इस तरह नहीं कि फिल्म धुंधली और खराब दिखने लगे।

दशकों से, हम "ब्लॉक-आधारित" कंप्रेशन (जैसे वीडियो के लिए ZIP फाइलें) का उपयोग करते आए हैं। लेकिन हाल ही में, वैज्ञानिकों ने एक नया तरीका खोजा है: इम्प्लिसिट न्यूरल रिप्रेजेंटेशन (Implicit Neural Representations - INRs)

एक INR को केवल पिक्सेलों से भरी तस्वीर के रूप में नहीं, बल्कि एक छोटे, कस्टम-निर्मित नुस्खे (recipe) के रूप में सोचें। एक बिल्ली की तस्वीर को स्टोर करने के बजाय, आप निर्देश (एक न्यूरल नेटवर्क) स्टोर करते हैं जो ज़रूरत पड़ने पर उस बिल्ली को शून्य से "बना" (draw) सकता है। यह अविश्वसनीय रूप से कुशल है क्योंकि एक इमेज की तुलना में यह 'नुस्खा' बहुत छोटा होता है।

हालाँकि, इसमें एक समस्या है: "एक वीडियो, एक शेफ" की समस्या (The "One Video, One Chef" Problem):
पिछले तरीकों में, यदि आप 100 अलग-अलग वीडियो चाहते थे, तो आपको प्रत्येक वीडियो के विशिष्ट नुस्खे को सीखने के लिए 100 अलग-अलग "शेफ" (न्यूरल नेटवर्क) को प्रशिक्षित करना पड़ता था। इसमें बहुत समय लगता था (धीमी एन्कोडिंग) और हाई-डेफिनिशन वीडियो को संभालने के लिए एक विशाल रसोई (बड़ी मेमोरी) की आवश्यकता होती थी।

यहाँ आता है TeCoNeRV। इस पेपर के लेखकों ने तीन चतुर तरीकों का उपयोग करके इन समस्याओं को हल करने वाला एक सिस्टम बनाया है। यहाँ बताया गया है कि उन्होंने इसे कैसे किया, रोज़मर्रा के उदाहरणों के साथ:

1. "लेगो ब्रिक" रणनीति (पैट्च-ट्यूबलेट्स - Patch-Tubelets)

समस्या: एक ही बार में पूरे 1080p मूवी फ्रेम के लिए नुस्खा (recipe) बनाने की कोशिश करना एक छोटे ओवन में 10-फुट का केक बेक करने जैसा है। इससे सिस्टम क्रैश हो जाता है (मेमोरी खत्म हो जाती है)।

TeCoNeRV का समाधान: पूरे केक को एक साथ बेक करने के बजाय, वे वीडियो को छोटे, प्रबंधनीय लेगो ब्रिक्स (जिन्हें "पैट्च ट्यूबलेट्स" कहा जाता है) में तोड़ देते हैं।

  • कल्पना कीजिए कि वीडियो एक विशाल दीवार है। पूरी दीवार के पैटर्न की भविष्यवाणी करने के बजाय, AI एक बार में केवल एक छोटे 320x160 पिक्सेल के वर्ग (square) को देखता है।
  • यह उस विशिष्ट वर्ग के लिए नुस्खा सीखता है और फिर अगले वर्ग की ओर बढ़ जाता है।
  • जादू: क्योंकि AI को केवल एक छोटे से वर्ग के बारे में सोचना होता है, इसलिए इससे कोई फर्क नहीं पड़ता कि अंतिम वीडियो 480p है, 720p है या 4K। "ओवन" का आकार समान रहता है। आप AI को एक छोटे 480p वीडियो पर प्रशिक्षित कर सकते हैं, और यह अधिक लेगो ब्रिक्स का उपयोग करके तुरंत 1080p का केक बना सकता है।

2. "डेल्टा" नोटबुक (रेसिडुअल स्टोरेज - Residual Storage)

समस्या: वीडियो में, 1:00:01 वाला फ्रेम 1:00:00 वाले फ्रेम जैसा ही दिखता है। यदि आप हर एक सेकंड के लिए पूरा नुस्खा लिखते हैं, तो आप एक ही निर्देश को बार-बार लिखकर बहुत सारा स्थान बर्बाद कर रहे हैं।

TeCoNeRV का समाधान: वे एक डेल्टा नोटबुक का उपयोग करते हैं।

  • चरण 1: वे वीडियो के पहले सेकंड के लिए पूरा नुस्खा लिखते हैं।
  • चरण 2: अगले सेकंड के लिए, वे नया नुस्खा नहीं लिखते। वे बस एक छोटा सा नोट लिखते हैं: "आसमान का रंग थोड़ा बदलें," या "कार को 2 पिक्सेल दाईं ओर खिसकाएं।"
  • चरण 3: वे ऐसा करते रहते हैं, केवल वर्तमान क्षण और पिछले क्षण के बीच के अंतर (residuals) को स्टोर करते हैं।
  • चूंकि वीडियो धीरे-धीरे बदलते हैं, इसलिए ये "अंतर वाले नोट्स" बहुत छोटे होते हैं। यह फ़ाइल के आकार को नाटकीय रूप से कम कर देता है।

3. "स्मूथ जैज़" का नियम (टेम्पोरल कोहेरेंस - Temporal Coherence)

समस्या: डेल्टा नोटबुक के साथ भी, AI कभी-कभी अस्थिर (jittery) हो रहा था। एक सेकंड में, नुस्खा कह सकता है "नीला आसमान दिखाएं," और अगले सेकंड में, यह अचानक कह सकता है "बैंगनी आसमान दिखाएं," भले ही वीडियो में वास्तव में कोई बदलाव न हुआ हो, सिर्फ गणित थोड़ा अजीब हो गया हो। इससे डेटा में "शोर" (noise) पैदा होता है।

TeCoNeRV का समाधान: उन्होंने टेम्पोरल कोहेरेंस रेगुलराइजेशन नामक एक नियम जोड़ा।

  • इसे AI को स्मूथ जैज़ (Smooth Jazz) बजाने के लिए प्रशिक्षित करने के रूप में समझें।
  • वे AI को कहते हैं: "हे, यदि वीडियो सुचारू रूप से चल रहा है, तो आपके आंतरिक नुस्खे (weights) को भी सुचारू रूप से बदलना चाहिए। अचानक उछल-कूद मत करो!"
  • AI को अपने नुस्खे में अचानक बदलाव के बजाय कोमल, क्रमिक परिवर्तन करने के लिए मजबूर करके, "अंतर वाले नोट्स" (ट्रिक #2 से) और भी छोटे और संकुचित करने में आसान हो जाते हैं। यह एक ऊबड़-खाबड़ सड़क को चिकना करने जैसा है ताकि कार (डेटा) तेज़ी से चल सके और कम ईंधन का उपयोग करे।

परिणाम?

इन तीन ट्रिक्स को मिलाकर, TeCoNeRV एक गेम-चेंजर है:

  • तेज़: यह पिछले तरीकों की तुलना में वीडियो को 1.5 से 3 गुना तेज़ी से एनकोड करता है।
  • छोटा: यह फ़ाइल का आकार (बिटरेट) लगभग 36% कम कर देता है।
  • साफ़ (Sharper): वीडियो की गुणवत्ता वास्तव में प्रतिस्पर्धा से बेहतर (उच्च PSNR) है, विशेष रूप से 720p और 1080p जैसे उच्च रिज़ॉल्यूशन पर।
  • स्केलेबल (Scalable): यह पहला तरीका है जो सुपरकंप्यूटर के बिना हाई-डेफिनिशन वीडियो को संभालने में सक्षम है।

संक्षेप में: TeCoNeRV पूरी फिल्म को एक साथ याद करने की कोशिश करना बंद कर देता है। इसके बजाय, यह छोटे, सुचारू और जुड़े हुए ब्रशस्ट्रोक के साथ फिल्म को पेंट करना सीखता है, और केवल वही लिखता है जो पिछले स्ट्रोक के बाद बदला है। यह AI का उपयोग करके उच्च-गुणवत्ता वाले वीडियो को छोटा करने का अब तक का सबसे कुशल तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →