← नवीनतम पेपर
💻 computer science

Vision Transformers Need More Than Registers

यह शोध पत्र यह पहचान करता है कि विज़न ट्रांसफॉर्मर में आर्टिफ़ैक्ट्स (artifacts) एक "लेज़ी एग्रीगेशन" (lazy aggregation) व्यवहार से उत्पन्न होते हैं जहाँ मॉडल वैश्विक अर्थों के लिए शॉर्टकट के रूप में अप्रासंगिक बैकग्राउंड पैचेस पर निर्भर करता है, और इस समस्या को कम करने तथा विविध सुपरविज़न प्रतिमानों (supervision paradigms) में प्रदर्शन में सुधार करने के लिए CLS टोकन में पैच फीचर्स को चुनिंदा रूप से एकीकृत करने वाला एक समाधान प्रस्तावित करता है।

मूल लेखक: Cheng Shi, Yizhou Yu, Sibei Yang

प्रकाशित 2026-04-15
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Cheng Shi, Yizhou Yu, Sibei Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Vision Transformers Need More Than Registers" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: "आलसी छात्र" AI

कल्पना कीजिए कि आप एक बहुत बुद्धिमान लेकिन आलसी छात्र (Vision Transformer या ViT) को एक फोटो में बिल्ली को पहचानना सिखा रहे हैं।

एक आदर्श दुनिया में, छात्र बिल्ली के कान, मूंछों और पूंछ को देखकर यह समझेगा, "आह, यह एक बिल्ली है!"

हालाँकि, शोधकर्ताओं ने पाया कि इस छात्र ने एक बुरी आदत विकसित कर ली है जिसे "Lazy Aggregation" (आलसी एकत्रीकरण) कहा जाता है। यह इस प्रकार काम करता है:

  • शॉर्टकट: बिल्ली (foreground) का अध्ययन करने के बजाय, छात्र यह देखता है कि फोटो का अधिकांश हिस्सा एक धुंधला लिविंग रूम (background) है।
  • चाल: छात्र सोचता है, "अगर मैं बस लिविंग रूम के पैटर्न को याद कर लूँ, तो मैं बिल्ली को देखे बिना ही सही उत्तर का अनुमान लगा सकता हूँ।"
  • परिणाम: छात्र टेस्ट (Image Classification) में सही उत्तर देता है क्योंकि बैकग्राउंड स्थिर रहता है। लेकिन यदि आप उससे पूछें, "बिल्ली वास्तव में कहाँ है?" तो छात्र बिल्ली के बजाय सोफे या दीवार की ओर इशारा करता है।

यही मुख्य समस्या है: AI बेईमानी कर रहा है। वह उच्च स्कोर पाने के लिए बैकग्राउंड को शॉर्टकट के रूप में उपयोग करता है, लेकिन वह उन कार्यों में विफल हो जाता है जिनमें सटीक समझ की आवश्यकता होती है, जैसे वस्तुओं को ढूंढना या छवियों का विभाजन (segmentation) करना।

पुराना समाधान: "Registers" (एक स्टिकी नोट)

इस पेपर से पहले, अन्य शोधकर्ताओं ने इस बेईमानी को देखा था। उन्होंने "Registers" जोड़कर इसे ठीक करने की कोशिश की।

  • उपमा: कल्पना कीजिए कि शिक्षक छात्र की मेज पर एक विशेष स्टिकी नोट रखता है। शिक्षक कहता है, "यदि आप कोई अजीब बैकग्राउंड पैटर्न देखते हैं, तो उसे इस स्टिकी नोट पर लिख लें ताकि वह आपको विचलित न करे।"
  • खामी: यह पेपर तर्क देता है कि स्टिकी नोट केवल एक अस्थायी मरहम (band-aid) है। यह समस्या को डेस्क के दूसरे हिस्से में स्थानांतरित कर देता है, लेकिन छात्र अपना काम करने के लिए अभी भी बैकग्राउंड को ही देख रहा है। मूल कारण (आलस) ठीक नहीं हुआ है।

नया समाधान: "LazyStrike" (एक स्मार्ट हाइलाइटर)

लेखक LazyStrike (या LaSt-ViT) नामक एक नई विधि प्रस्तावित करते हैं। केवल विचलित करने वाली चीज़ों को हटाने के बजाय, यह छात्र को शोर (noise) को अनदेखा करना और सिग्नल (signal) पर ध्यान केंद्रित करना सिखाता है।

यह कैसे काम करता है (Frequency Filter):
कल्पना कीजिए कि छात्र का मस्तिष्क एक रेडियो है।

  • बैकग्राउंड शोर (Background noise) स्टैटिक या एक अराजक भीड़ की तरह है—यह तेजी से बदलता है और अव्यवस्थित (high frequency) होता है।
  • बिल्ली (Foreground) एक स्थिर, स्पष्ट धुन की तरह है—यह स्थिर और सुसंगत (low frequency) होती है।

LazyStrike एक "Low-Pass Filter" या "Stability Detector" की तरह कार्य करता है:

  1. यह छवि के सभी छोटे टुकड़ों (patches) को देखता है।
  2. यह पूछता है: "क्या यह टुकड़ा स्थिर और सुसंगत है, या यह अराजक शोर है?"
  3. यह चयनात्मक रूप से (selectively) अराजक बैकग्राउंड के टुकड़ों को अनदेखा कर देता है।
  4. यह केवल स्थिर टुकड़ों (बिल्ली) पर ध्यान केंद्रित करता है।
  5. यह अंतिम उत्तर केवल उन्हीं स्थिर टुकड़ों से बनाता है।

यह क्यों एक बड़ी बात है

शोधकर्ताओं ने इस "स्मार्ट हाइलाइटर" का परीक्षण 12 अलग-अलग प्रकार के परीक्षणों पर किया, जिसमें शामिल हैं:

  • वस्तुओं को खोजना (Object Discovery)।
  • चीजों के चारों ओर रूपरेखा बनाना (Segmentation)।
  • उन नई चीजों को पहचानना जिन्हें AI ने पहले नहीं देखा है (Open-Vocabulary tasks)।

परिणाम:

  • कोई बेईमानी नहीं: AI ने बैकग्राउंड की ओर इशारा करना बंद कर दिया।
  • बेहतर सटीकता: यह वास्तविक वस्तुओं को खोजने में बेहतर हो गया।
  • हर जगह प्रभावी: यह तब भी काम आया जब AI को इंसानों द्वारा (Supervised), टेक्स्ट विवरणों द्वारा (CLIP), या स्वयं (Self-Supervised) सिखाया गया था।
  • सरल: इसके लिए किसी विशाल आर्किटेक्चर परिवर्तन की आवश्यकता नहीं थी; इसने केवल यह बदला कि AI अपने अवलोकनों (observations) को कैसे जोड़ता है।

एक वाक्य में सारांश

यह पेपर खोजता है कि विजन मॉडल "आलसी" हैं और उच्च स्कोर पाने के लिए बैकग्राउंड शोर का उपयोग करके बेईमानी करते हैं, और यह एक सरल, स्मार्ट फिल्टर पेश करता है जो उन्हें बेईमानी करने से रोकता है और वास्तव में उन वस्तुओं को देखने के लिए मजबूर करता है जिन्हें उन्हें देखना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →