← नवीनतम पेपर
💻 computer science

Content-Aware Mamba for Learned Image Compression

यह शोध पत्र कंटेंट-अवेयर मम्बा (CAM) को प्रस्तुत करता है, जो एक नवीन स्टेट-स्पेस मॉडल है जो मानक मम्बा स्कैन्स की कठोरता को दूर करने के लिए टोकन प्रोसेसिंग को गतिशील रूप से अनुकूलित करता है और ग्लोबल प्रायर्स (global priors) को इंजेक्ट करता है, जिससे एक सीखा हुआ इमेज कंप्रेशन फ्रेमवर्क (CMIC) सक्षम होता है जो VTM-21.0 से महत्वपूर्ण अंतरों से अधिक दर-विकृति (rate-distortion) प्रदर्शन प्राप्त करता है।

मूल लेखक: Yunuo Chen, Zezheng Lyu, Bing He, Hongwei Hu, Qi Wang, Yuan Tian, Li Song, Wenjun Zhang, Guo Lu

प्रकाशित 2026-03-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yunuo Chen, Zezheng Lyu, Bing He, Hongwei Hu, Qi Wang, Yuan Tian, Li Song, Wenjun Zhang, Guo Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी तस्वीर: "स्मार्ट फाइलिंग सिस्टम"

कल्पना कीजिए कि आपके पास तस्वीरों का एक विशाल, बिखरा हुआ पुस्तकालय है (आपकी इमेज)। आपका लक्ष्य इस पुस्तकालय को एक छोटे से बैकपैक में फिट करने के लिए सिकोड़ना (कंप्रेशन) है, बिना तस्वीरों की कहानी खोए।

पारंपरिक तरीके (जैसे पुराना VTM मानक) एक ऐसे लाइब्रेरियन की तरह हैं जो किताबों को शेल्फ पर उनकी स्थिति के आधार पर सख्ती से फाइल करता है: "किताब 1, फिर किताब 2, फिर किताब 3।" उन्हें इस बात से कोई फर्क नहीं पड़ता कि किताब 1 बिल्ली की तस्वीर है और किताब 50 भी बिल्ली की ही तस्वीर है। वे बस उन्हें क्रम में फाइल करते हैं। यह अक्षम है क्योंकि लाइब्रेरियन यह कहने का मौका चूक जाता है कि, "हे, ये दोनों एक ही हैं! चलो बस एक बार 'बिल्ली' लिखते हैं और बाकी को छोड़ देते हैं।"

Mamba एक नया, तेज़ लाइब्रेरियन है जो पुराने वाले की तुलना में पूरे पुस्तकालय को बहुत तेज़ी से पढ़ सकता है। हालांकि, मानक Mamba में अभी भी एक दोष है: यह किताबों को एक सख्त "सांप जैसी" (snake-like) पैटर्न में पढ़ता है (बाएं-से-दाएं, ऊपर-से-नीचे)। यह तेज़ तो है, लेकिन यह कंटेंट-अग्नोस्टिक (विषय-निरपेक्ष) है। यह इस बात पर ध्यान नहीं देता कि किताब किस बारे में है; यह बस इस पर ध्यान देता है कि वह कहाँ है।

यह पेपर CMIC (कंटेंट-अवेयर मांबा) पेश करता है, जो एक सुपर-स्मार्ट लाइब्रेरियन है जो जगह बचाने के लिए नियम तोड़ता है। यह दो जादुई चीजें करता है:


1. "री-ऑर्डरिंग" का कमाल (कंटेंट-एडेप्टिव टोकन परम्यूटेशन)

समस्या:
कल्पना कीजिए कि आप एक सूटकेस पैक कर रहे हैं। आपके पास फर्श पर बिखरे हुए 50 लाल मोजे हैं, जो 50 नीले मोजों के साथ मिले हुए हैं। यदि आप एक सख्त "ग्रिड पैटर्न में सब कुछ उठाने" के नियम का पालन करते हैं, तो आप एक लाल मोजा उठा सकते हैं, फिर एक नीला, फिर एक लाल, फिर एक नीला। आप उन्हें कुशलतापूर्वक पैक नहीं कर सकते क्योंकि वे आपस में मिले हुए हैं।

समाधान:
CMIC उन मोजों को देखता है और कहता है, "रुको ज़रा! चलो पहले सभी लाल मोजे लेते हैं, फिर सभी नीले मके लेते हैं।" यह पैकिंग करने से पहले वस्तुओं के क्रम को भौतिक रूप से पुनर्व्यवस्थित कर देता है।

  • यह कैसे काम करता है: इमेज को ऊपर-बाएं से नीचे-दाएं स्कैन करने के बजाय, AI इमेज के कंटेंट को देखता है। यह सभी "बादलों" को ढूंढता है, उन्हें एक साथ समूह बनाता है। यह सभी "पेड़ों की पत्तियों" को ढूंढता है, उन्हें एक साथ समूह बनाता है।
  • परिणाम: समान चीजों को एक साथ समूहबद्ध करके, AI कह सकता है, "ओह, मैंने यह बादल का पैटर्न पहले भी देखा है; मुझे इसे दोबारा लिखने की ज़रूरत नहीं है।" यह कठोर ग्रिड स्कैन की तुलना में रेडंडेंसी (अनावश्यकता) को बहुत बेहतर तरीके से खत्म करता है।

2. "चीट शीट" (ग्लोबल-प्रायर प्रॉम्प्टिंग)

समस्या:
Mamba एक "कॉज़ल" (causal) मॉडल है। इसे एक ऐसे व्यक्ति के रूप में सोचें जो एक किताब पढ़ रहा है जो केवल उन शब्दों को देख सकता है जिन्हें उसने पहले ही पढ़ लिया है। वह उन शब्दों को नहीं देख सकता जो आने वाले हैं।
एक इमेज में, यह अजीब है। यदि आप किसी व्यक्ति की बाईं आंख देख रहे हैं, तो दाईं आंख "भविष्य" की जानकारी है यदि आप बाएं-से-दाएं स्कैन कर रहे हैं। एक सख्त Mamba मॉडल दाईं आंख को तब तक अनदेखा करता है जब तक वह वहां नहीं पहुँच जाता, जिससे वह इस संदर्भ को मिस कर देता कि "यह एक चेहरा है।"

आमतौर पर, इसे ठीक करने के लिए, मॉडल एक साथ चारों दिशाओं (ऊपर, नीचे, बाएं, दाएं) से इमेज को स्कैन करने की कोशिश करते हैं। लेकिन यह चार लाइब्रेरियन के एक ही किताब को एक साथ पढ़ने जैसा है—यह बहुत धीमा है और बहुत अधिक ऊर्जा खर्च करता है।

समाधान:
CMIC लाइब्रेरियन को पढ़ना शुरू करने से पहले एक चीट शीट (एक "प्रॉम्ट") देता है।

  • यह चीट शीट पूरी इमेज का एक सारांश है। यह कहता है, "वैसे, यह इमेज ज्यादातर नीले आसमान वाली है जिसमें कुछ पक्षी हैं।"
  • भले ही लाइब्रेरियन अभी भी बाएं-से-दाएं पढ़ रहा है, चीट शीट उसे पक्षियों और आसमान के बारे में तुरंत "जानने" की अनुमति देती है।
  • परिणाम: मॉडल को पूरे चित्र (ग्लोबल कॉन्टेक्स्ट) को देखने का लाभ मिलता है बिना चार लाइब्रेरियन की आवश्यकता के। यह एक टीम की बुद्धिमत्ता के साथ एक अकेले लाइब्रेरियन की गति बनाए रखता है।

यह एक बड़ी बात क्यों है?

लेखकों ने इन दो ट्रिक्स का उपयोग करके CMIC नामक एक सिस्टम बनाया है। उन्होंने वर्तमान सर्वोत्तम कंप्रेशन मानकों (जैसे VTM-21.0) और अन्य AI कंप्रेशर्स के विरुद्ध इसका परीक्षण किया।

  • स्कोर: CMIC ने चित्र की गुणवत्ता को बिल्कुल समान रखते हुए, वर्तमान सर्वोत्तम मानक की तुलना में 15% से 21% अधिक स्थान बचाया।
  • उपमा: यदि पुराना मानक एक बैकपैक में 100 फोटो फिट कर सकता था, तो CMIC उसी स्पष्टता के साथ उसी बैकपैक में 120 फोटो फिट कर सकता है।
  • गति: स्मार्ट होने के बावजूद, यह धीमा नहीं हुआ। यह अन्य Mamba मॉडल्स की तरह ही तेज़ है।

एक वाक्य में सारांश

यह पेपर एक AI को सिखाता है कि कैसे एक कठोर रोबोट (लाइन-दर-लाइन स्कैन करना) की तरह इमेज को पढ़ना बंद किया जाए और एक इंसान (समान चीजों को समूह में रखना और पूरे दृश्य का मानसिक सारांश उपयोग करना) की तरह पढ़ना शुरू किया जाए ताकि फाइलों को बहुत अधिक कुशलता से सिकोड़ा जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →