← नवीनतम पेपर
💻 computer science

Suppressing Non-Semantic Noise in Masked Image Modeling Representations

यह शोध पत्र सेमैंटिकली ऑर्थोगोनल आर्टिफैक्ट प्रोजेक्शन (SOAP) को प्रस्तुत करता है, जो एक ज़ीरो-ट्रेनिंग, पोस्ट-हॉक विधि है जो ज़ीरो-शॉट इन्फरेंस प्रदर्शन को सुधारने के लिए मास्कड इमेज मॉडलिंग रिप्रजेंटेशन्स में नॉन-सेमैटिक नॉइज़ को दबाती है।

मूल लेखक: Martine Hjelkrem-Tan, Marius Aasan, Rwiddhi Chakraborty, Gabriel Y. Arteaga, Changkyu Choi, Adín Ramírez Rivera

प्रकाशित 2026-04-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Martine Hjelkrem-Tan, Marius Aasan, Rwiddhi Chakraborty, Gabriel Y. Arteaga, Changkyu Choi, Adín Ramírez Rivera

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को तस्वीरों में वस्तुओं को पहचानना सिखा रहे हैं। आप उसे बिल्लियों, कुत्तों और कारों की हजारों तस्वीरें दिखाते हैं, लेकिन आप छवियों के कुछ हिस्सों को ढक देते हैं और रोबोट से अनुमान लगाने को कहते हैं कि वहां क्या गायब है। इसे मास्क्ड इमेज मॉडलिंग (Masked Image Model - MIM) कहा जाता है। यह AI को बिना हर तस्वीर को लेबल किए "देखना" सिखाने का एक बहुत ही लोकप्रिय तरीका है।

हालाँकि, इस शोध पत्र ने एक चालाकी भरी समस्या खोजी है: रोबोट बेईमानी कर रहा है।

समस्या: रोबोट खजाने को नहीं, बल्कि नक्शे को देख रहा है

जब रोबोट छवि के गायब हिस्सों का अनुमान लगाने की कोशिश करता है, तो वह दो चीजें सीखता है:

  1. कंटेंट (Content): "यह बिल्ली का कान है।" (यह अच्छा है!)
  2. लोकेशन (Location): "वह हिस्सा ऊपर-बाएँ कोने में है।" (यह बेईमानी है!)

क्योंकि रोबोट को पहेली के टुकड़ों को पूरी तरह से फिर से बनाने के लिए यह जानना आवश्यक है कि वे कहाँ हैं, इसलिए वह हर टुकड़े के ग्रिड निर्देशांक (grid coordinates) को याद करने में बहुत माहिर हो जाता है। वह पहेली के टुकड़े के "ऊपर-बाएँ" कोने को एक विशिष्ट संकेत के रूप में मानने लगता है, चाहे वहां बिल्ली हो या कुत्ता।

लेखक इसे "नॉन-सेमेंटिक नॉइज़" (Non-Semantic Noise) कहते हैं। यह ऐसा ही है जैसे आप फ्रेंच सीखने की कोशिश कर रहे हों, लेकिन आपका दिमाग शब्दों के वास्तविक अर्थ के बजाय उनके फॉन्ट साइज (लिखावट के आकार) से विचलित होता रहे। रोबट इस बात पर इतना केंद्रित हो जाता है कि चीजें कहाँ हैं, और इस चक्कर में वह भूल जाता है कि चीजें क्या हैं।

उपमा: "पोजीशनल घोस्ट" (स्थानिक भूत)

कल्पना कीजिए कि आप समुद्र तट की एक फोटो देख रहे हैं।

  • सेमेंटिक सिग्नल (Semantic Signal): रेत, समुद्र, ताड़ के पेड़।
  • नॉन-सेमेंटिक नॉइज़ (Non-Semantic Noise): एक धुंधला, अदृश्य ग्रिड ओवरले जो कहता है "रो 1, कॉलम 3"।

इन AI मॉडल्स में, "रो 1, कॉलम 3" का संकेत इतना तेज और चमकदार है कि वह वास्तविक समुद्र तट को दबा देता है। जब आप AI को किसी "प्रमुख वस्तु" (जैसे समुद्र तट पर खड़ा व्यक्ति) को खोजने के लिए कहते हैं, तो वह भ्रमित हो जाता है क्योंकि वह व्यक्ति को देखने के बजाय ग्रिड लाइनों को देख रहा होता है।

समाधान: SOAP (शोर कम करने वाले हेडफ़ोन)

लेखकों ने एक चतुर, मुफ्त टूल बनाया जिसे SOAP (सेमेंटिकली ऑर्थोगोनल आर्टिफैक्ट प्रोजेक्शन) कहा जाता है। इसे AI के मस्तिष्क के लिए नॉइज़-कैंसलिंग हेडफ़ोन के रूप में समझें।

यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:

  1. जासूसी कार्य (द स्कोर):
    सबसे पहले, उन्हें यह मापने का एक तरीका चाहिए था कि रोबोट कितनी "बेईमानी" (शोर) कर रहा है। उन्होंने रोबोट को दो प्रकार की छवियां दिखाईं:
  • असली तस्वीरें: बिल्लियों, कारों और पेड़ों से भरी हुई।
  • सिंथेटिक स्टैटिक (Synthetic Static): केवल रैंडम टीवी स्नो और रंगीन शोर (जिसका कोई अर्थ नहीं है)।

यदि रोबलेट टीवी स्नो के प्रति भी उसी तरह प्रतिक्रिया देता है जैसे वह बिल्ली की तस्वीर के प्रति देता है, तो इसका मतलब है कि रोबोट वास्तविक कंटेंट को अनदेखा कर रहा है और केवल ग्रिड लोकेशन पर प्रतिक्रिया दे रहा है। उन्होंने इसे एक स्कोर दिया: उच्च स्कोर = रोबोट अर्थ को अनदेखा कर रहा है।

  1. फिल्टर (द प्रोजेक्शन):
    एक बार जब उन्होंने उन "तेज" संकेतों की पहचान कर ली जो केवल स्थान के बारे में थे (शोर), तो उन्होंने उन विशिष्ट संकेतों को शून्य करने के लिए SOAP नामक एक गणितीय ट्रिक का उपयोग किया।

कल्पना कीजिए कि AI का मस्तिष्क एक रेडियो स्टेशन है जो संगीत (अर्थ) और स्टैटिक (शोर) का मिश्रण बजा रहा है। SOAP उस स्टैटिक की फ्रीक्वेंसी को ढूंढता है और उसे म्यूट कर देता है, जिससे केवल संगीत तेज और स्पष्ट रह जाता है।

  1. परिणाम:
    उन्हें रोबोट को फिर से प्रशिक्षित (retrain) करने की आवश्यकता नहीं पड़ी। उन्होंने बस इस "मफलर" को मौजूदा मॉडल्स के साथ जोड़ दिया। अचानक, रोबोट वास्तव में चित्र में क्या था, इसे समझने में बहुत बेहतर हो गए।

यह क्यों महत्वपूर्ण है?

इस सुधार से पहले, यदि आप एक शक्तिशाली AI मॉडल को कोई नया कार्य करने के लिए कहते (जैसे वीडियो में किसी विशिष्ट वस्तु को खोजना), तो वह अक्सर विफल हो जाता था क्योंकि वह "ग्रिड लाइनों" को देखने में बहुत व्यस्त था।

SOAP के साथ, AI एक बेहतर श्रोता बन जाता है। वह इस बात पर जुनूनी होना बंद कर देता है कि एक पिक्सेल कहाँ है और इस बात पर ध्यान देना शुरू करता है कि वह पिक्सेल क्या है।

संक्षेप में:

  • समस्या: गायब चित्रों को भरने के लिए प्रशिक्षित AI मॉडल यह याद रखने के आदी हो जाते हैं कि चीजें कहाँ हैं, जिससे वे यह समझने में खराब हो जाते हैं कि चीजें क्या हैं।
  • समाधान: एक सरल, मुफ्त टूल (SOAP) जो एक फिल्टर के रूप में कार्य करता है, जो AI के मस्तिष्क से "लोकेशन के जुनून" को हटा देता है।
  • परिणाम: AI अधिक स्मार्ट, अधिक सटीक और वास्तविक दुनिया को समझने में बेहतर हो जाता है, और वह भी बिना शुरू से फिर से प्रशिक्षित हुए।

यह कुछ ऐसा है जैसे यह महसूस करना कि आपका GPS "मील मार्कर 42 पर बाएं मुड़ें" बताने के चक्कर में इतना जुनूनी है कि वह आपको यह बताना भूल गया कि "पिज्जा प्लेस पर बाएं मुड़ें।" SOAP बस मील मार्कर्स को बंद कर देता है ताकि रोबोट आखिरकार पिज्जा देख सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →