← नवीनतम पेपर
💻 computer science

Unifying Convolution and Attention via Convolutional Nearest Neighbors

यह शोधपत्र कनवल्शनल नियरेस्ट नेबर्स (ConvNN) को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो यह प्रदर्शित करता है कि कनवल्शन और सेल्फ-अटेंशन एक एकल kk-नियरेस्ट नेबर एग्रीगेशन प्रक्रिया के विशेष मामले हैं, जिससे इन दोनों प्रमुख कंप्यूटर विजन आर्किटेक्चरों के बीच सेतु बनता है और ImageNet-1K पर अत्याधुनिक प्रदर्शन सुधार प्राप्त होता है।

मूल लेखक: Mingi Kang, Jeová Farias Sales Rocha Neto

प्रकाशित 2026-07-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingi Kang, Jeová Farias Sales Rocha Neto

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल पेंटिंग को समझने की कोशिश कर रहे हैं। इसे करने के लिए, आपके पास देखने के दो मुख्य तरीके हैं:

  1. "लोकल नेबर" दृष्टिकोण (कन्वोल्यूशन/Convolution): आप कैनवास के एक विशिष्ट स्थान के बहुत करीब खड़े होते हैं और केवल अपने उंगली के आसपास के पेंट के छोटे से वर्ग को देखते हैं। आप बाकी सब कुछ अनदेखा कर देते हैं। यह तरीका कन्वोलशनल न्यूरल नेटवर्क्स (CNNs) के काम करने का तरीका है। वे बनावट (textures) और किनारों (edges) को देखने में माहिर हैं क्योंकि वे तुरंत आस-पास के पड़ोसियों पर ध्यान केंद्रित करते हैं।

  2. "ग्लोबल सिमिलैरिटी" दृष्टिकोण (अटेंशन/Attention): आप पीछे हटकर पूरी पेंटिंग को देखते हैं। आप पूछते हैं, "इस पेंटिंग का कौन सा दूसरा हिस्सा उस स्थान जैसा दिखता है जिसे मैं देख रहा हूँ, भले ही वह दूसरी तरफ ही क्यों न हो?" फिर आप उन समान हिस्सों को आपस में मिला देते हैं। यह तरीका विज़न ट्रांसफॉर्मर (ViT) के काम करने का तरीका है। वे बड़े चित्र (big picture) को समझने में माहिर हैं क्योंकि वे दूर के, समान फीचर्स को आपस में जोड़ सकते हैं।

लंबे समय तक, कंप्यूटर वैज्ञानिकों ने सोचा कि ये दोनों तरीके पूरी तरह से अलग उपकरण हैं जिन्हें आसानी से मिलाया नहीं जा सकता।

बड़ा विचार: "ConvNN" टूल

यह पेपर एक नया, सार्वभौमिक टूल पेश करता है जिसे कन्वोल्यूशनल नियरेस्ट नेबर्स (ConvNN) कहा जाता है। लेखक तर्क देते हैं कि ऊपर दिए गए दोनों तरीके वास्तव में अलग नहीं हैं; वे वास्तव में एक ही स्पेक्ट्रम के दो छोर हैं।

ConvNN को एक पिक्सेल के लिए स्मार्ट सर्च इंजन के रूप में सोचें।

  • यह कैसे काम करता है: जब कंप्यूटर एक विशिष्ट पिक्सेल (जिसे "क्वेरी" कहा जाता है) को देखता है, तो वह जानकारी इकट्ठा करने के लिए अपने "पड़ोसियों" की तलाश करता है।
  • ट्विस्ट: कंप्यूटर यह तय कर सकता है कि वह एक नियम के आधार पर इन पड़ोसियों को कैसे खोजेगा:
    • नियम A (स्पेशियल प्रॉक्सिमिटी/स्थानिक निकटता): "उन पड़ोसियों को खोजें जो शारीरिक रूप से मेरे सबसे करीब हैं।" (यह टूल को एक मानक कन्वोल्यूशन में बदल देता है)।
    • नियम B (फीचर सिमिलैरिटी/विशेषता समानता): "उन पड़ोसियों को खोजें जो मेरे सबसे अधिक समान दिखते हैं, चाहे वे कितनी भी दूर क्यों न हों।" (यह टूल को सेल्फ-अटेंशन में बदल देता है)।

यह पेपर गणितीय रूप से सिद्ध करता है कि यदि आप इस एक टूल की सेटिंग्स को बदलते हैं, तो आप इसे बिल्कुल एक मानक कन्वोल्यूशन या एक मानक अटेंशन मैकेनिज्म की तरह काम करने के लिए तैयार कर सकते हैं। वे उन्हें एक एकल ढांचे (framework) में एकीकृत करते हैं।

उन्होंने इसका परीक्षण कैसे किया

शोधकर्ताओं ने केवल गणित नहीं किया; उन्होंने यह देखने के लिए कि क्या यह विचार वास्तव में कंप्यूटर को बेहतर देखने में मदद करता है, कामकाजी मॉडल बनाए। उन्होंने इसका परीक्षण ImageNet पर किया, जो 1.28 मिलियन छवियों का एक विशाल डेटाबेस है जिसका उपयोग AI को प्रशिक्षित करने के लिए किया जाता है।

1. "लोकल" मॉडल्स पर परीक्षण (ResNet-50):
उन्होंने एक मानक इमेज-रिकग्निशन मॉडल (ResNet-50) लिया और उसमें एक "हाइब्रिड ब्रांच" जोड़ी। कल्पना कीजिए कि एक कर्मचारी जो आमतौर पर केवल अपने तत्काल पड़ोस को देखता है (कन्वोल्यूशन), लेकिन अब उसके पास एक साइडकिक (सहायक) है जो पूरे शहर में समान दिखने वाली वस्तुओं को भी खोज सकता है (ConvNN)।

  • परिणाम: यह हाइब्रिड टीम अकेले कर्मचारी की तुलना में काफी बेहतर प्रदर्शन करती है। उन्होंने सटीकता में 3.0% का सुधार किया।
  • सबक: आपको स्थानीय रूप से देखने या वैश्विक रूप से देखने के बीच चुनाव करने की आवश्यकता नहीं है; दोनों को एक साथ करना ही जीतने की रणनीति है।

2. "ग्लोबल" मॉडल्स पर परीक्षण (Vision Transformer):
उन्होंने एक ट्रांसफार्मर मॉडल (ViT-Base) लिया और उसके मानक "ग्लोबल सर्च" को उनके नए ConvNN टूल से बदल दिया।

  • परिणाम: नया टूल मूल ट्रांसफार्मर को 0.7% से हरा देता है।
  • मुख्य खोज: मानक ट्रांसफार्मर अपने सभी "टॉप मैच" को समान मानता है। नया ConvNN टूल अलग-अलग मैचों को अलग-अलग वजन (weights) देने के लिए सीख गया। यह एक लाइब्रेरियन की तरह है जो न केवल शीर्ष 10 समान किताबें उठाता है, बल्कि उनमें से सबसे प्रासंगिक किताबों को प्राथमिकता देना सीख जाता है। इसने मॉडल को समान वस्तुओं के बड़े समूहों को संभालने में विशेष रूप से कुशल बनाया।

यह क्यों मायने रखता है (सरल शब्दों में)

  • यह एक एकीकृत सिद्धांत है: यह दिखाता है कि कन्वोल्यूशन और अटेंशन एक ही मशीन के दो अलग-अलग सेटिंग्स हैं।
  • यह लचीला है: आप एक ऐसा सिस्टम डिज़ाइन कर सकते हैं जो कहीं भी बीच में बैठ सकता है, जिसमें स्थानिक निकटता और फीचर समानता का मिश्रण हो।
  • यह कुशल है: लेखकों ने इस टूल का एक विशेष, तेज़ संस्करण बनाया है (एक "ट्रिटन कर्नेल" का उपयोग करके) जो कम कंप्यूटर मेमोरी का उपयोग करता है और तेज़ी से चलता है, जिससे यह वास्तविक दुनिया के उपयोग के लिए व्यावहारिक बन जाता है।

प्रशिक्षण पर एक नोट

पेपर ने यह भी गौर किया कि मॉडल कैसे सीखता है। नया टूल प्रशिक्षण के शुरुआती चरणों के दौरान मानक तरीकों की तुलना में धीमा शुरू होता है। हालांकि, जैसे-जैसे प्रशिक्षण समाप्ति के करीब आता है (जब कंप्यूटर अपने उत्तरों को फाइन-ट्यून कर रहा होता है), नया टूल बराबरी कर लेता है और अंततः दूसरों से आगे निकल जाता है। ऐसा लगता है कि नए टूल को अपने पड़ोसियों को सटीक रूप से वेट (weight) देने के लिए "धीमी और स्थिर" सीखने की गति की आवश्यकता होती है, जबकि मानक तरीके अधिक कठोर होते हैं और तेज़ी से सीखते हैं लेकिन जल्दी सुधार करना बंद कर देते हैं।

संक्षेप में: यह पेपर एक एकल, लचीले ढांचे को पेश करता है जो स्थानीय और वैश्विक इमेज प्रोसेसिंग के बीच के अंतर को पाटता है। स्थानीय और वैश्विक दोनों को "निकटतम पड़ोसियों को खोजने" के विभिन्न रूपों के रूप में मानकर, उन्होंने एक ऐसा टूल बनाया है जो गणितीय रूप से सुदृढ़ है, चलाने में तेज़ है, और दोनों श्रेणियों के वर्तमान लीडर्स से अधिक सटीक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →