← नवीनतम पेपर
🤖 machine learning

REViT: Roto-reflection Equivariant Convolutional Vision Transformer

यह शोध पत्र REViT को प्रस्तुत करता है, जो एक नवीन डिस्क्रीट रोटो-रिफ्लेक्शन इक्विवैरिएंट विज़न ट्रांसफार्मर है जो रोटेशनल, फ्लिप और पोजीशनल सिमिट्रीज़ को प्रभावी ढंग से संरक्षित करने के लिए कन्वोल्यूशनल अटेंशन को शामिल करता है, जो मौजूदा इक्विवैरिएंट न्यूरल नेटवर्क दृष्टिकोणों की तुलना में इमेज क्लासिफिकेशन में बेहतर प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Sheir A. Zaheer, Alexander C. Holston, Chan Y. Park

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sheir A. Zaheer, Alexander C. Holston, Chan Y. Park

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बिल्ली की तस्वीर देख रहे हैं। यदि आप फोटो को 90 डिग्री घुमाते हैं, इसे उल्टा कर देते हैं, या इसे तिरछा कर देते हैं, तो भी आप जानते हैं कि यह वही बिल्ली है। हालाँकि, अधिकांश मानक कंप्यूटर विज़न मॉडल (जो इमेज रिकग्निशन के पीछे के "दिमाग" हैं) उन लोगों की तरह हैं जिन्होंने कभी किनारे से बिल्ली नहीं देखी है; वे तस्वीर के ओरिएंटेशन (झुकाव) बदलने पर भ्रमित हो जाते हैं। उन्हें लग सकता है कि एक तिरछी बिल्ली कोई पूरी तरह से अलग जानवर है।

इसे ठीक करने के लिए, वैज्ञानिक "इक्विवैरिएंट" (equivariant) मॉडल बनाते हैं। इन्हें एक ऐसे मॉडल के रूप में सोचें जिसमें समानता (symmetry) की अंतर्निहित समझ होती है। यदि आप इनपुट को घुमाते हैं, तो मॉडल की आंतरिक "सोचने की प्रक्रिया" भी उसके साथ घूम जाती है, जिससे अंतिम उत्तर सुसंगत बना रहता है।

यह पेपर REViT (रोटो-रिफ्लेक्शन इक्विवैरिएंट कनवल्शनल विजन ट्रांसफॉर्मर) नामक एक नया मॉडल पेश करता है। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. पुराने तरीके के साथ समस्या

पहले, रोटेशन (घुमाव) को समझने के लिए शोधकर्ता दो मुख्य उपकरणों का उपयोग करते थे:

  • कनवल्शनल न्यूरल नेटवर्क (CNNs): ये एक छवि को स्कैन करने वाली छोटी टॉर्च के ग्रिड की तरह हैं। ये पैटर्न देखने में अच्छे हैं लेकिन काफी कठोर हो सकते हैं।
  • विज़न ट्रांसफॉर्मर्स (ViTs): ये उन जासूसों की तरह हैं जो पूरी तस्वीर को एक साथ देखते हैं और विभिन्न हिस्सों के बीच संबंध जोड़ते हैं। ये बहुत शक्तिशाली हैं लेकिन आमतौर पर रोटेशन के मामले में संघर्ष करते हैं, जब तक कि आप उनमें बहुत सारे जटिल "पोजीशन टैग्स" (जैसे हर पिक्सेल के लिए GPS निर्देशांक) न जोड़ दें जो उन्हें बताते हैं कि चीजें कहाँ हैं।

रोटेशन-अवेयर बनाने के लिए पुराना तरीका एक जासूस को हर मोड़ के लिए एक विशाल, जटिल मानचित्र देकर घुमाव सिखाने जैसा था। यह काम करता था, लेकिन यह धीमा और गणनात्मक रूप से महंगा था।

2. REViT समाधान: एक नए प्रकार का "लिफ्ट"

लेखकों ने एक रोटेशन-अवेयर ट्रांसफॉर्मर बनाने का एक सरल और अधिक सुंदर तरीका निकाला है। उन्होंने उन जटिल "पोजीशन टैग्स" की आवश्यकता को पूरी तरह से हटा दिया है।

इसके बजाय, वे एक "लिफ्टिंग लेयर" (Lifting Layer) का उपयोग करते हैं।

  • उपमा: कल्पना कीजिए कि एक शहर का एक सपाट, 2D मानचित्र है। अब, कल्पना कीजिए कि आप उस मानचित्र को एक 3D टावर में "लिफ्ट" करते हैं। निचला तल वह मानचित्र है जैसा वह है। ऊपर के तल उसी मानचित्र के अन्य संस्करण हैं, जो 45 डिग्री, 90 डिग्री, 135 डिग्री, इत्यादि घुमाए गए हैं।
  • यह कैसे काम करता है: REViT मॉडल एक छवि लेता है और तुरंत उस छवि के घुमावदार संस्करणों का यह 3D "टावर" बना देता है। यह केवल छवि को नहीं देखता; यह छवि और उसके सभी संभावित रोटेशन को एक साथ देखता है।

3. "ग्रुप कनवल्शनल सेल्फ-अटेंशन"

एक बार जब छवि इस 3D टावर में "लिफ्ट" हो जाती है, तो मॉडल एक विशेष प्रकार के अटेंशन मैकेनिज्म का उपयोग करता है जिसे ग्रुप कनवल्शनल सेल्फ-अटेंशन (G-CSA) कहा जाता है।

  • उपमा: एक सामान्य ट्रांसफॉर्मर में, "जासूस" छवि के विभिन्न हिस्सों को देखते हैं कि वे एक-दूसरे से कैसे संबंधित हैं। REViT में, जासूस इस 3D टावर को देख रहे हैं। वे देख सकते हैं कि मूल छवि में एक "बिल्ली का कान" 90-डिग्री घुमाई गई छवि में "बिल्ली के कान" से कैसे संबंधित है, वह भी एक साथ।
  • क्योंकि वे सभी रोटेशन को एक साथ देखते हैं, मॉडल स्वाभाविक रूप से सीख जाता है कि "यह एक बिल्ली है, चाहे इसे किसी भी तरह से घुमाया गया हो।" उन्हें यह बताने की आवश्यकता नहीं है कि "यह ऊपर है" या "यह नीचे है" क्योंकि 3D संरचना यह काम उनके लिए संभाल लेती है।

4. उन्होंने क्या पाया (परिणाम)

शोधकर्ताओं ने तीन अलग-अलग "गेम्स" (डेटासेट्स) पर इस नए मॉडल का परीक्षण किया:

  1. रोटेटेड MNIST: घुमाए गए हस्तलिखित नंबरों को पहचानना।
  2. PatchCamelyon: मेडिकल टिश्यू सैंपल्स में ट्यूमर कोशिकाओं की पहचान करना (जो किसी भी ओरिएंटेशन में हो सकती हैं)।
  3. CIFAR-10 और ImageNet: कारों, कुत्तों और हवाई जहाजों जैसे रोजमर्रा के ऑब्जेक्ट्स को पहचानना।

परिणाम:

  • बेहतर सटीकता: REViT ने रोटेशन-अवेयर मॉडल्स के पिछले सर्वश्रेष्ठ तरीकों को पछाड़ दिया। इसने परीक्षणों में अधिक प्रश्न सही किए।
  • सरल और तेज़: भले ही यह अधिक सटीक था, इसने पुराने, अधिक जटिल तरीकों की तुलना में कम कंप्यूटर "स्टेप्स" (पैरामीटर्स) और कम मेमोरी का उपयोग किया।
  • स्केलेबिलिटी (Scalability): उन्होंने दिखाया कि यह मॉडल ImageNet जैसे विशाल और जटिल डेटासेट्स को भी संभाल सकता है, जिससे यह साबित होता है कि यह केवल छोटे प्रयोगों के लिए खिलौना नहीं है, बल्कि वास्तविक दुनिया के उपयोग के लिए एक मजबूत उपकरण है।

5. कमी (सीमाएं)

पेपर एक कमी के बारे में ईमानदार है: चूंकि मॉडल को एक साथ कई घुमावदार अवस्थाओं में छवि को प्रोसेस करना पड़ता है (वह 3D टावर), इसलिए इसे एक मानक मॉडल (जिसे रोटेशन की परवाह नहीं है) की तुलना में अधिक कंप्यूटिंग पावर और मेमोरी की आवश्यकता होती है। यह एक टीम के काम करने जैसा है जो मिलकर काम करती है; वे काम को बेहतर ढंग से पूरा करते हैं, लेकिन आपको पूरी टीम के लिए अधिक ऑफिस स्पेस और कॉफी की आवश्यकता होती है।

सारांश

संक्षेप में, REViT एक नए प्रकार का AI है जो बिना जटिल निर्देशों के हर कोण से छवियों को समझता है। छवि को रोटेशन के 3D स्पेस में "लिफ्ट" करके और एक विशेष अटेंशन मैकेनिज्म का उपयोग करके, यह पिछले तरीकों की तुलना में अधिक सटीक और कुशलता से वस्तुओं को पहचानता है, जो इसे मेडिकल इमेजिंग या रोबोटिक्स जैसे कार्यों के लिए एक मजबूत विकल्प बनाता है जहाँ ओरिएंटेशन मायने रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →