← नवीनतम पेपर
💻 computer science

SVD-ViT: Does SVD Make Vision Transformers Attend More to the Foreground?

SVD-ViT एक नवीन ढांचे का प्रस्ताव करता है जो बैकग्राउंड शोर और आर्टिफैक्ट्स को दबाने के लिए तीन विशिष्ट घटकों (SPC, SSVA, और ID-RSVD) के माध्यम से सिंगुलर वैल्यू डिकंपोजिशन का उपयोग करता है, जिससे विजन ट्रांसफॉर्मर्स को बेहतर वर्गीकरण प्रदर्शन के लिए फोरग्राउंड फीचर्स पर अधिक प्रभावी ढंग से ध्यान केंद्रित करने में सक्षम बनाया जा सके।

मूल लेखक: Haruhiko Murata, Kazuhiro Hotta

प्रकाशित 2026-02-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Haruhiko Murata, Kazuhiro Hotta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: "भटका हुआ पर्यटक" (The "Distracted Tourist" Problem)

कल्पना कीजिए कि आप अफ्रीकी सवाना के बीचों-बीच एक राजसी शेर की एक बेहतरीन फोटो खींचने की कोशिश कर रहे एक पर्यटक हैं। आप चाहते हैं कि शेर उस फोटो का मुख्य आकर्षण बने।

हालाँकि, आपका कैमरा (विज़न ट्रांसफार्मर या ViT) थोड़ा बहुत "सामाजिक" है: वह केवल शेर पर ध्यान केंद्रित करने के बजाय, सब कुछ एक साथ देखने की कोशिश करता है: घास, दूर के पेड़, बादल और यहाँ तक कि हवा में तैरते धूल के कण भी। क्योंकि कैमरा "ग्लोबल" होने और सब कुछ देखने की कोशिश कर रहा है, इसलिए वह बैकग्राउंड से विचलित हो जाता है। कभी-कभी, वह ज़मीन पर पड़े किसी अजीब सी चमकती हुई चीज़ (ये वे "आर्टिफैक्ट्स" हैं जिनका पेपर में उल्लेख किया गया है) के प्रति भी जुनूनी हो जाता है, यह सोचकर कि वह शेर जितना ही महत्वपूर्ण है।

जब कैमरा दृश्य का वर्णन किसी और को करने की कोशिश करता है, तो वह कहता है, "यह एक शेर, कुछ पीली घास, एक नीला आकाश और चमकते हुए प्लास्टिक के एक बहुत ही चमकदार टुकड़े वाला दृश्य था।" "चमकता हुआ प्लास्टिक" वाला हिस्सा एक बेकार शोर (noise) है जो विवरण को कम सटीक बनाता है।

समाधान: SVD-ViT (द "स्पॉटलाइट" तकनीक)

शोधकर्ताओं ने कैमरे को ध्यान केंद्रित करने में मदद करने के लिए एक नया तरीका प्रस्तावित किया है, जिसे वे SVD-ViT कहते हैं। वे SVD (सिंगुलर वैल्यू डिकंपोजिशन) नामक एक गणितीय उपकरण का उपयोग करते हैं।

SVD को एक शक्तिशाली स्पॉटलाइट के रूप में समझें।

किसी भी छवि में, सबसे "महत्वपूर्ण" चीजें (वे चीजें जो सबसे अधिक बदलती हैं या जिनमें सबसे अधिक "ऊर्जा" होती है) आमतौर पर मुख्य विषय होते हैं। SVD एक गणितीय तरीका है यह कहने का कि: "इस डेटा के उन हिस्सों को खोजें जो सबसे अधिक भारी काम (heavy lifting) कर रहे हैं।"

शोधकर्ताओं ने पाया कि जब उन्होंने इस "स्पॉटलाइट" को कैमरे के मस्तिष्क पर लागू किया, तो प्रकाश की सबसे चमकीली किरणें स्वाभाविक रूप से शेर (फोरग्राउंड) पर पड़ीं और उबाऊ घास (बैकग्राउंड) को अनदेखा कर दिया।

तीन गुप्त सामग्रियां (The Three Secret Ingredients)

इस स्पॉटलाइट को पूरी तरह से काम करने के योग्य बनाने के लिए, उन्होंने इसमें तीन विशेष उपकरण जोड़े:

  1. SPC मॉड्यूल (नया मुख्य अभिनेता): कैमरे द्वारा एक सामान्य "सारांश" टोकन ([CLS] टोकन) का उपयोग करने के बजाय, जो सब कुछ सारांशित करने की कोशिश करता है, SPC मॉड्यूल एक नया, विशिष्ट "मुख्य अभिनेता" (Lead Actor) टोकन बनाता है। यह टोकन पूरी तरह से स्पॉटलाइट के सबसे चमकीले हिस्सों से निर्मित होता है। यह एक सामान्य कथावाचक को एक विशेषज्ञ से बदलने जैसा है जो केवल शेर के बारे में बात करता है।
  2. SSVA (स्मार्ट निर्देशक): कभी-कभी, स्पॉटलाइट एक स्थान पर बहुत अधिक तेज़ होती है, या यह किसी छोटे लेकिन महत्वपूर्ण विवरण (जैसे शेर का कान) को मिस कर देती है। SSVA एक फिल्म निर्देशक की तरह कार्य करता है। वह दृश्य को देखता है और कहता है, "ठीक है, केवल पूरे शेर को ही मत देखो; आइए 'कान' की थोड़ी सी रोशनी को 'शरीर' की रोशनी के साथ मिला दें ताकि एक बेहतर तस्वीर मिल सके।" यह स्पॉटलाइट के सबसे अच्छे हिस्सों को आपस में मिला देता है।
  3. ID-RSVD (अनुकूली लेंस): मानक गणितीय उपकरण धीमे और "कठोर" हो सकते हैं। ID-RSVD एक स्मार्ट लेंस की तरह है जो जो कुछ भी देखता है उसके आधार पर खुद को तुरंत समायोजित करता है। यदि यह जंगल में एक शेर देखता है, तो यह पत्तियों को अनदेखा करने के लिए अपना फोकस तुरंत समायोजित कर लेता है। यह गणितीय "स्पॉटलाइट" को बहुत तेज़ और देखी जा रही विशिष्ट छवि के प्रति अधिक प्रतिक्रियाशील बनाता है।

परिणाम: एक स्पष्ट दृष्टि (A Sharper Vision)

जब शोधकर्ताओं ने विभिन्न "फोटो एलबमों" (पक्षियों, विमानों और कारों जैसे डेटासेट्स) पर इसका परीक्षण किया, तो SVD-ViT मानक कैमरे की तुलना में विषयों की पहचान करने में बहुत बेहतर था।

गणित का उपयोग करके मॉडल को वास्तव में छवि के उन हिस्सों पर ध्यान केंद्रित करने के लिए "मजबूर" करके, उन्होंने AI को एक "भटके हुए पर्यटक" से एक "प्रोफेशनल फोटोग्राफर" बनने में मदद की। यह शोर वाले बैकग्राउंड को अनदेखा करता है और शो के असली स्टार (मुख्य विषय) पर ध्यान केंद्रित करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →