← नवीनतम पेपर
💻 computer science

DnA: Denoising Attention for Visual Tasks

यह शोध पत्र डिनाइजिंग अटेंशन (DnA) प्रस्तुत करता है, जो एक नवीन तंत्र है जो सकारात्मक और नकारात्मक क्वेरीज़ का उपयोग करके इंटरैक्शन को विशिष्ट सबस्पेस में प्रोजेक्ट करता है, जिससे विजुअल कार्यों में शोर वाले अटेंशन पैटर्न को कम किया जा सके, और इस प्रकार इमेज और वीडियो अंडरस्टैंडिंग बेंचमार्क में प्रदर्शन लाभ प्राप्त किया जा सके।

मूल लेखक: Ron Campos, Subhajit Maity, Xin Li, Srijan Das, Aritra Dutta

प्रकाशित 2026-06-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ron Campos, Subhajit Maity, Xin Li, Srijan Das, Aritra Dutta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक भीड़भाड़ वाले, शोरगुल वाले कमरे में किसी विशिष्ट व्यक्ति को खोजने की कोशिश कर रहे हैं। यह मूल रूप से वही है जो कंप्यूटर विज़न मॉडल करते हैं जब वे किसी छवि को देखते हैं: वे मुख्य वस्तु (जैसे कि एक "breastplate" या एक "hare") को पहचानने की कोशिश करते हैं जबकि पृष्ठभूमि के शोर (जैसे कि पास में खड़ा एक "व्यक्ति" या कोने में एक "बिल्ली") को अनदेखा करते हैं।

यह शोध पत्र एक नई विधि पेश करता है जिसे DnA (Denoising Attention) कहा जाता है ताकि ये कंप्यूटर मॉडल इस काम को बेहतर ढंग से कर सकें। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

समस्या: "तेज़ आवाज़" वाली समस्या

अधिकांश वर्तमान AI मॉडल एक मानक उपकरण का उपयोग करते हैं जिसे Softmax कहा जाता है ताकि यह तय किया जा सके कि किस चीज़ पर ध्यान देना है। Softmax को एक कमरे में लाउडस्पीकर सिस्टम की तरह समझें। यदि एक व्यक्ति चिल्लाता है (एक उच्च स्कोर), तो सिस्टम उस आवाज़ को इतना बढ़ा देता है कि वह बाकी सभी को दबा देता है।

  • समस्या: हालांकि यह मॉडल को "सबसे तेज़" चीज़ पर ध्यान केंद्रित करने में मदद करता है, लेकिन यह एक समस्या पैदा करता है। यदि दो चीजें बहुत समान दिखती हैं (जैसे कि एक hare और एक बिल्ली, या एक हेलमेट और एक breastplate), तो लाउडस्पीकर भ्रमित हो सकता है। यह गलत व्यक्ति को बढ़ा सकता है या पृष्ठभूमि के शोर से विचलित हो सकता है क्योंकि यह सब कुछ एक ही "वॉल्यूम" डायल के रूप में मानता है। इसे यह कहने में कठिनाई होती है कि, "यह अच्छा सिग्नल है, और वह बुरा सिग्नल है," क्योंकि यह केवल वॉल्यूम को ऊपर करना जानता है।

समाधान: "दो-चैनल" प्रणाली

लेखक DnA का प्रस्ताव करते हैं, जो एक परिष्कृत साउंड इंजीनियर की तरह कार्य करता है जिसके पास एक के बजाय दो अलग-अलग चैनल होते हैं।

  1. चैनल 1 (पॉजिटिव क्वेरी): यह चैनल पूछता है, "यहाँ क्या होना चाहिए?" यह उन विशेषताओं (features) को खोजता है जो सही उत्तर से मेल खाते हैं (जैसे, "यह निश्चित रूप से एक breastplate है")।
  2. चैनल 2 (नेगेटिव क्वेरी): यह चैनल पूछता है, "क्या चीज़ मिलती-जुलती है लेकिन यहाँ नहीं होनी चाहिए?" यह सक्रिय रूप से "बहरूपिया" विशेषताओं (imposter features) को खोजता है (जैसे, "वह हेलमेट एक breastplate जैसा दिखता है, लेकिन वास्तव में वह एक हेलमेट है")।

जादू का नुस्खा: कमरों को अलग करना

पुराने मॉडलों में, "अच्छी" विशेषताओं और "बुरी" विशेषताओं को एक साथ मिलाकर सूचना का एक बड़ा ढेर बना दिया जाता था। यह लाल और नीली कंचों को एक ही बाल्टी में रखते हुए उन्हें छाँटने की कोशिश करने जैसा था।

DnA एक चतुर तकनीक का उपयोग करता है: यह "अच्छी" विशेषताओं को एक कमरे में और "बुरी" विशेषताओं को पूरी तरह से एक अलग कमरे में प्रोजेक्ट करता है।

  • उपमा: कल्पना कीजिए कि आपके पास "सत्य" के लिए एक कमरा है और "विकर्षणों" के लिए एक अलग कमरा है।
  • पॉजिटिव चैनल प्रासंगिक विशेषताओं को "सत्य" के कमरे में रखता है।
  • नेगेटिव चैनल भ्रमित करने वाली, अप्रासंगिक विशेषताओं को "विकर्षण" के कमरे में रखता है।
  • क्योंकि ये दोनों कमरे एक-दूसरे से बहुत दूर हैं (गणितीय रूप से कहें तो, उनके बीच "बड़े प्रिंसिपल कोण" हैं), मॉडल अंतर को स्पष्ट रूप से देख सकता है। यह उपयोगी जानकारी को रख सकता है और शोर को बिना अच्छी चीज़ों को गलती से हटाए, बाहर फेंक सकता है।

यह क्यों महत्वपूर्ण है (परिणाम)

शोध पत्र ने कई कार्यों पर इस नई प्रणाली का परीक्षण किया:

  • इमेज रिकग्निशन (छवि पहचान): जानवरों या वस्तुओं की तस्वीरों को देखते समय, DnA पृष्ठभूमि को अनदेखा करने और मुख्य विषय पर ध्यान केंद्रित करने में बेहतर था। ImageNet नामक एक मानक परीक्षण पर, इसने मानक मॉडल की तुलना में सटीकता में 0.8% का सुधार किया।
  • वीडियो अंडरस्टैंडिंग (वीडियो समझ): यह चलती तस्वीरों (वीडियो) के साथ और भी बेहतर काम करता है।
    • एक स्मार्ट होम वीडियो में क्रियाओं को पहचानने के परीक्षण में, इसने सटीकता में 4.0% का सुधार किया।
    • मानव क्रियाओं को पहचानने के परीक्षण में इसने 1.2% का सुधार किया।
    • इसने एक "वीडियो LLM" (एक चैटबॉट जो वीडियो को समझता है) को प्रश्नों के उत्तर देने में भी 0.5% बेहतर बनाया।

"डिनोइजिंग" (शोर कम करने) का प्रभाव

लेखक इसे "डिनोइजिंग" कहते हैं क्योंकि यह एक नॉइज़-कैंसलिंग हेडफ़ोन की तरह काम करता है। केवल सिग्नल को तेज़ करने के बजाय, यह सक्रिय रूप से "स्टैटिक" (भ्रमित करने वाली पृष्ठभूमि की वस्तुएं) की पहचान करता है और उसे घटा देता है, जिससे मुख्य वस्तु की एक स्पष्ट तस्वीर बचती है।

सारांश

संक्षेप में, DnA छवियों को देखने का एक नया तरीका है। केवल "सबसे तेज़ चीज़ को देखो!" चिल्लाने के बजाय, यह दो प्रश्न पूछता है: "सही चीज़ क्या है?" और "गलत चीज़ क्या है जो सही चीज़ जैसी दिखती है?" इन दो प्रश्नों के उत्तरों को अलग-अलग मानसिक "कमरों" में रखकर, AI विकर्षणों को अनदेखा करने और सत्य को देखने में बहुत बेहतर हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →