← नवीनतम पेपर
💻 computer science

Dynamic Weight-based Temporal Aggregation for Low-light Video Enhancement Under Extreme Noise

यह शोध पत्र DWTA-Net का प्रस्ताव करता है, जो कम रोशनी वाले वीडियो संवर्धन (enhancement) के लिए एक नवीन रिकरेंट डीप-लर्निंग फ्रेमवर्क है, जो अत्यधिक शोर को प्रभावी ढंग से दबाने और टेम्पोरल निरंतरता एवं सूक्ष्म विवरणों को संरक्षित करने के लिए ऑप्टिकल फ्लो द्वारा निर्देशित डायनेमिक वेट-आधारित टेम्पोरल एग्रीगेशन के साथ मांबा-आधारित मल्टी-फ्रेम अलाइनमेंट को जोड़ता है।

मूल लेखक: Ruirui Lin, Guoxi Huang, Nantheera Anantrasirichai

प्रकाशित 2026-05-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruirui Lin, Guoxi Huang, Nantheera Anantrasirichai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रात के समय भारी तूफान के दौरान रिकॉर्ड किया गया एक वीडियो देखने की कोशिश कर रहे हैं। तस्वीर अंधेरी है, इसमें "स्नो" (शोर/नॉइज़) के कारण दानेदार बनावट है, और रंग फीके दिख रहे हैं। यदि आप एक सिंगल फ्रेम को ब्राइट करने की कोशिश करते हैं, तो शोर और बढ़ जाता है। यदि आप पूरे वीडियो को एक साथ ठीक करने की कोशिश करते हैं, तो कैमरा हिलने के कारण इमेज झिलमिला सकती है या धुंधली दिख सकती है।

यह पेपर DWTA-Net नामक एक नया टूल पेश करता है जो इन अस्त-व्यस्त, अंधेरे वीडियो को ठीक करने के लिए है। इसे एक दो-चरणीय "वीडियो डॉक्टर" के रूप में समझें जो एक चतुर तकनीक का उपयोग करके तस्वीर को धुंधला किए बिना शोर को साफ करता है।

यह कैसे काम करता है, इसका सरल विवरण यहाँ दिया गया है:

समस्या: "शॉर्ट मेमोरी" (कम याददाश्त) वाली समस्या

अधिकांश वर्तमान वीडियो क्लीनर कम याददाश्त वाले लोगों की तरह होते हैं। वे कुछ ही फ्रेम (शायद 5 या 10) देखते हैं और उन्हें ठीक करने की कोशिश करते हैं।

  • उपमा: कल्पना कीजिए कि आप एक गंदी खिड़की को केवल एक पल के लिए देखकर उसे साफ करने की कोशिश कर रहे हैं। आप उस गंदगी को मिस कर सकते हैं जो किसी धब्बे के पीछे छिपी हुई है।
  • परिणाम: इन तरीकों में अक्सर शोर रह जाता है या वीडियो झिलमिलाने लगता है क्योंकि वे लंबे समय तक दृश्य के "बड़े चित्र" (बिग पिक्चर) को नहीं देख पाते हैं।

समाधान: एक दो-चरणीय प्रक्रिया

DWTA-Net इसे दो अलग चरणों में काम करके ठीक करता है, जैसे कि एक निर्माण दल जो पहले ढांचा बनाता है और फिर बारीक पॉलिशिंग करता है।

चरण 1: "ग्रुप फोटो" (संरचना और रंग)

सबसे पहले, सिस्टम फ्रेम के एक छोटे क्रम (जैसे एक ग्रुप फोटो) को देखता है और उन्हें पूरी तरह से एक लाइन में व्यवस्थित करता है।

  • यह क्या करता है: यह पूरे दृश्य को एक साथ समझने के लिए एक विशेष AI मस्तिष्क (जिसे Mamba कहा जाता है) का उपयोग करता है। यह ब्राइटनेस को ठीक करता है, रंगों को सही करता है, और यह सुनिश्चित करता है कि आकृतियाँ (जैसे बाड़ या पेड़) ठोस दिखें।
  • उपमा: यह कई धुंधली तस्वीरों को इकट्ठा करने और उन्हें एक के ऊपर एक रखने जैसा है ताकि विषय की एक स्पष्ट रूपरेखा मिल सके। यह पहले "बड़े चित्र" को ठीक करता है।

चरण 2: "स्मार्ट ब्लेंडर" (डिनोइजिंग और निरंतरता)

यही इस पेपर का बड़ा नवाचार है। फ्रेमों का औसत निकालने के बजाय (जिससे सब कुछ धुंधला हो जाता है), यह एक रिकरेंट (recurrent) विधि का उपयोग करता है। इसका मतलब है कि यह याद रखता है कि इसने अतीत में क्या देखा था और इसे वर्तमान फ्रेम के साथ मिलाता है, लेकिन केवल वहीं जहाँ यह तर्कसंगत लगे।

  • उपमा: कल्पना कीजिए कि आप एक शोर भरे कमरे में अपने दोस्त की आवाज़ सुनने की कोशिश कर रहे हैं।
    • यदि आपका दोस्त स्थिर खड़ा है (स्टैटिक रीजन), तो आप बैकग्राउंड शोर को फिल्टर करने के लिए लंबे समय तक उनकी आवाज़ सुन सकते हैं। DWTA-Net शोर को कम करने के लिए कई पिछले फ्रेमों को आपस में "ब्लेंड" करके ऐसा ही करता है।
    • यदि आपका दोस्त दौड़ने लगता है (डायनेमिक रीजन), तो आप उनके पिछले स्थान को उनके वर्तमान स्थान के साथ नहीं मिला सकते, अन्यथा वे एक भूत की तरह दिखाई देंगे। DWTA-Net इस गति को पहचान लेता है और ब्लेंडिंग को रोक देता है, जिससे चलती हुई वस्तु स्पष्ट बनी रहती है।
  • यह कैसे निर्णय लेता है: यह "ऑप्टिकल फ्लो" (पिक्सेल कैसे चलते हैं इसे ट्रैक करने का एक तरीका) का उपयोग करके एक डायनेमिक वेट मैप बनाता है। यह एक स्मार्ट डिमर स्विच की तरह है जो कहता है, "यहाँ अधिक ब्लेंड करें क्योंकि यह स्थिर है," और "यहाँ ब्लेंड न करें क्योंकि यह गतिशील है।"

गुप्त मंत्र: "टेक्सचर-अवेयर" लॉस (बनावट-जागरूक हानि)

AI को यह सिखाने के लिए, शोधकर्ताओं ने एक विशेष स्कोरिंग सिस्टम बनाया है जिसे टेक्सचर-एडेप्टिव लॉस (Texture-Adaptive Loss) कहा जाता है।

  • उपमा: एक चित्रकार के बारे में सोचें।
    • जब एक खुरदरी, बनावट वाली दीवार (जैसे घास या ईंट) को पेंट कर रहा हो, तो चित्रकार चाहता है कि हर छोटी डिटेल और दरार दिखाई दे।
    • जब वह एक चिकनी दीवार (जैसे साफ नीला आकाश) को पेंट कर रहा हो, तो वह चाहता है कि वह पूरी तरह से चिकनी और धब्बों से मुक्त हो।
  • परिणाम: AI सीखता है कि वह चिकने क्षेत्रों में शोर हटाने के लिए "सख्त" रहे, लेकिन टेक्सचर वाले क्षेत्रों में विवरण बनाए रखने के लिए "कोमल" रहे। यह पूरे चित्र के साथ एक जैसा व्यवहार नहीं करता है।

उन्होंने क्या पाया?

टीम ने वास्तविक दुनिया के वीडियो पर DWTA-Net का परीक्षण किया जो बहुत अंधेरी, शोर वाली स्थितियों (जैसे सूर्यास्त के बाद फिल्माया गया घुड़दौड़ का वीडियो) में लिए गए थे।

  • परिणाम: अन्य शीर्ष तरीकों की तुलना में, DWTA-Net ने अधिक शोर हटाया, रंगों को प्राकृतिक रखा, और चलती हुई वस्तुओं को धुंधला या भूतिया नहीं बनाया।
  • प्रमाण: जब उन्होंने वीडियो के एक स्थिर हिस्से (आकाश) को देखा, तो DWTA-Net ने सबसे अच्छे सिंगल-इमेज क्लीनर से भी अधिक साफ इमेज बनाई, जो साबित करता है कि वीडियो के "लॉन्ग-टर्म हिस्ट्री" को देखना वास्तव में मददगार होता है।

संक्षेप में: DWTA-Net एक वीडियो एनहांसर है जो एक स्मार्ट एडिटर की तरह काम करता है। यह पहले रंगों को ठीक करता है, फिर एक "मेमोरी" का उपयोग करता है ताकि वीडियो के शांत हिस्सों में शोर को सुधारा जा सके जबकि चलती हुई चीजों को शार्प रखा जा सके, और यह सब एक ऐसे नियम द्वारा निर्देशित होता है जो कहता है "जहाँ ज़रूरी हो वहाँ विवरण बनाए रखें।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →