← नवीनतम पेपर
🤖 AI

Low-Bitrate Video Compression through Semantic-Conditioned Diffusion

यह शोध पत्र DiSCo का प्रस्ताव करता है, जो एक सिमेंटिक वीडियो संपीड़न ढांचा है जो उच्च-गुणवत्ता वाले पुनर्निर्माण के लिए एक कंडीशनल डिफ्यूजन मॉडल को कॉम्पैक्ट मल्टीमॉडल रिप्रजेंटेशन (टेक्स्ट, डिग्रेडेड वीडियो और वैकल्पिक स्केच) प्रसारित करता है, जो अल्ट्रा-लो बिटरेट पर पारंपरिक कोडेक्स की तुलना में परसेप्चुअल क्वालिटी में काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Lingdong Wang, Guan-Ming Su, Divya Kothandaraman, Tsung-Wei Huang, Mohammad Hajiesmaili, Ramesh K. Sitaraman

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lingdong Wang, Guan-Ming Su, Divya Kothandaraman, Tsung-Wei Huang, Mohammad Hajiesmaili, Ramesh K. Sitaraman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक दोस्त को 4K मूवी भेजने की कोशिश कर रहे हैं, लेकिन आपका इंटरनेट कनेक्शन 1990 के दशक के डायल-अप मॉडम जितना धीमा है।

पुराना तरीका (पारंपरिक संपीड़न/Traditional Compression):
वर्तमान में, वीडियो ऐप्स (जैसे YouTube या Netflix) मूवी के हर एक पिक्सेल को एक छोटे से पैकेज में ठूसने की कोशिश करते हैं। यह बिल्कुल वैसा ही है जैसे एक पूरे तरबूज को एक माचिस की डिब्बी में भरने की कोशिश करना। जब आप इसे जबरदस्ती अंदर डालते हैं, तो तरबूज कुचल जाता है। परिणाम? आपका वीडियो एक धुंधले, ब्लॉक वाले मलबे जैसा दिखता है जिसमें अजीब सी चमकते रंग होते हैं। कंप्यूटर हर पिक्सेल के सटीक रंग को बनाए रखने के लिए जुनूनी हो जाता है, लेकिन ऐसा करने में वह दृश्य की "आत्मा" खो देता है।

नया तरीका (DiSCo):
आपके द्वारा साझा किया गया पेपर DiSCo (डिफ्यूजन विद सिमेंटिक कंडिशनिंग) नामक एक नई विधि पेश करता है। पूरे तरबूज को डिब्बी में ठूसने के बजाय, DiSCo एक स्मार्ट दृष्टिकोण अपनाता है। यह समझता है कि आपके मस्तिष्क को यह समझने के लिए कि क्या हो रहा है, हर एक पिक्सेल देखने की आवश्यकता नहीं है। उसे बस "कहानी" की आवश्यकता है।

DiSCo कैसे काम करता है, इसके लिए यहाँ एक सरल उपमा दी गई है:

1. "केक" के बजाय "रेसिपी"

कल्पना कीजिए कि आप अपने दोस्त को एक स्वादिष्ट केक की तस्वीर भेजना चाहते हैं।

  • पारंपरिक तरीका: आप केक की एक फोटो लेते हैं, उसे छोटा करते जाते हैं जब तक कि वह बहुत छोटा न हो जाए, और फिर फोटो भेज देते हैं। यह एक धुंधले धब्बे जैसा दिखता है।
  • DiSCo तरीका: आप अपने दोस्त को केक की एक रेसिपी (टेक्स्ट) और एक रफ स्केच भेजते हैं।
    • टेक्स्ट: "ऊपर स्ट्रॉबेरी के साथ एक दो-स्तरीय चॉकलेट केक।" (यह अर्थ को कैप्चर करता है)।
    • स्केच: केक के आकार का एक साधारण रेखा चित्र। (यह संरचना को कैप्चर करता है)।
    • रफ वीडियो: केक के हिलने-डुलने का एक बहुत ही कम गुणवत्ता वाला, धुंधला वीडियो। (यह गति को कैप्चर करता है)।

आप ये तीन छोटी फाइलें भेजते हैं। वे बहुत कम जगह लेती हैं।

2. "जादुई बेकर" (AI डिकोडर)

आपका दोस्त इन छोटी फाइलों को प्राप्त करता है। उस धुंधले धब्बे को दिखाने के बजाय, वे एक जादुई बेकर (एक शक्तिशाली AI जिसे डिफ्यूजन मॉडल कहा जाता है) का उपयोग करते हैं।

जादुई बेकर रेसिपी पढ़ता है ("स्ट्रॉबेरी के साथ चॉकलेट केक"), स्केच को देखता है, और धुंधले वीडियो को देखता है। चॉकलेट केक कैसे दिखते हैं, इसकी अपनी आंतरिक जानकारी का उपयोग करके, वह शून्य से केक को पुनर्निर्मित (Rebuild) करता है। वह समृद्ध चॉकलेट की बनावट को पेंट करता है, चमकदार स्ट्रॉबेरी जोड़ता है, और गति को सुचारू बनाता है।

परिणाम? आपका दोस्त एक सुंदर, उच्च-गुणवत्ता वाला केक देखता है, भले ही आपने केवल कुछ लाइनों का टेक्स्ट और एक स्केच भेजा हो।

3. "सीक्रेट सॉस": टोकन इंटरलीविंग (Token Interleaving)

रेसिपी, स्केच और वीडियो को अलग-अलग भेजना अभी भी अव्यवस्थित हो सकता है। DiSCo के पास एक चतुर ट्रिक है जिसे टोकन इंटरलीविंग कहा जाता है।

कल्पना कीजिए कि आप अपने दोस्त को एक कहानी सुना रहे हैं, लेकिन आपकी मदद के लिए तीन अलग-अलग लोग हैं:

  • व्यक्ति A कथानक (Plot) के बारे में बात करता है।
  • व्यक्ति B परिदृश्य (Scenery) का वर्णन करता है।
  • व्यक्ति C क्रिया (Action) के बारे में बताता है।

यदि वे सभी एक साथ बोलते हैं, तो यह अराजकता है। यदि वे एक के बाद एक बोलते हैं, तो इसमें बहुत समय लगता है।
DiSCo की ट्रिक: वे शब्द दर शब्द बारी-बारी से बोलते हैं।

  • "The [Plot] [Scenery] [Action] [Plot] [Scenery] [Action]..."

यह सुनिश्चित करता है कि कहानी बिना जानकारी दोहराए पूरी तरह से प्रवाहित हो। यह डेटा स्ट्रीम को छोटा और कुशल रखता है।

4. "टाइम ट्रैवल" का कमाल

कभी-कभी, जगह बचाने के लिए, वीडियो हर चौथा फ्रेम भेजता है (बीच के फ्रेम छोड़ देता है)।

  • पुराना तरीका: कंप्यूटर बस एक खाली गैप छोड़ देता है या उसी फ्रेम को दोहरा देता है, जिससे वीडियो झटकेदार (Jerky) दिखाई देता है।
  • DiSCo का "फॉरवर्ड फिलिंग": AI पिछले ज्ञात फ्रेम को देखता है और कहता है, "ठीक है, मुझे पता है कि कार कहाँ थी। मैं अगले कुछ सेकंडों में उसकी गति के आधार पर अनुमान लगा सकता हूँ कि वह कहाँ होगी।" यह गायब समय को सुचारू रूप से भर देता है, ताकि वीडियो कभी अटके नहीं।

यह एक बड़ी बात क्यों है?

  • यह 2 से 10 गुना बेहतर है: बहुत कम इंटरनेट गति पर, DiSCo वर्तमान तकनीक की तुलना में 2 से 10 गुना बेहतर वीडियो बनाता है।
  • यह संदर्भ (Context) को समझता है: यदि वीडियो एक कुत्ते का है, तो DiSCo जानता है कि कुत्ता कैसा दिखता है। यदि यह एक कार का है, तो DiSCo जानता है कि कार कैसी दिखती है। यह केवल रैंडम अनुमान नहीं लगाता; यह खाली विवरणों को भरने के लिए "कॉमन सेंस" का उपयोग करता है।
  • यह लचीला है: यदि वीडियो एक एनिमेशन है, तो यह एक स्केच भेजता है। यदि यह एक नाचता हुआ व्यक्ति है, तो यह एक कंकाल मैप (Skeleton Map) भेजता है। यह वीडियो के प्रकार के लिए सबसे अच्छे "सुराग" चुनता है।

निचोड़ (The Bottom Line)

पारंपरिक संपीड़न वीडियो की फोटोकॉपी करने और कागज को फटने तक सिकोड़ने की कोशिश करता है।
DiSCo वीडियो का वर्णन करता है और दूसरे छोर पर एक स्मार्ट AI को उसे पुनर्कल्पना (Re-imagine) करने देता है।

यह सूर्यास्त की एक धुंधली फोटो भेजने बनाम "नारंगी आकाश, बैंगनी बादल, समुद्र के ऊपर डूबता सूरज" का टेक्स्ट मैसेज भेजने और रिसीवर की कल्पना (जो AI द्वारा संचालित है) को अब तक का सबसे सुंदर सूर्यास्त पेंट करने देने के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →