← नवीनतम पेपर
🤖 machine learning

RAViT: Resolution-Adaptive Vision Transformer

यह शोध पत्र RAViT का प्रस्ताव करता है, जो एक रेजोल्यूशन-एडेप्टिव विजन ट्रांसफॉर्मर फ्रेमवर्क है जो विभिन्न रेजोल्यूशन पर छवियों को प्रोसेस करके मानक विजन ट्रांसफॉर्मर के समान सटीकता प्राप्त करने और कंप्यूटेशनल लागत को महत्वपूर्ण रूप से कम करने के लिए अर्ली एग्जिट मैकेनिज्म के साथ एक मल्टी-ब्रांच आर्किटेक्चर का उपयोग करता है।

मूल लेखक: Martial Guidez, Stefan Duffner, Christophe Garcia

प्रकाशित 2026-03-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Martial Guidez, Stefan Duffner, Christophe Garcia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त संग्रहालय में एक सुरक्षा गार्ड हैं, और आपका काम हर उस पेंटिंग की पहचान करना है जो दरवाजे से अंदर आती है।

पुराना तरीका (स्टैंडर्ड विजन ट्रांसफॉर्मर्स):
परंपरागत रूप से, जब कोई पेंटिंग आती है, तो आप एक विशाल, भारी आवर्धक लेंस (magnifying glass) निकालते हैं। आप पेंटिंग के हर एक ब्रशस्ट्रोक (brushstroke) का हाई डेफिनिशन में निरीक्षण करते हैं, चाहे वह एक साधारण स्टिक-फिगर ड्राइंग हो या कोई जटिल उत्कृष्ट कृति। इसमें बहुत अधिक ऊर्जा और समय लगता है। यदि संग्रहालय में भीड़ है, तो आप थक जाते हैं, और आपके बैटरी पैक (डिवाइस की शक्ति) की ऊर्जा तेजी से खत्म हो जाती है।

समस्या:
आर्टिफिशियल इंटेलिजेंस मॉडल जिन्हें "विज़न ट्रांसफॉर्मर्स" (ViT) कहा जाता है, वे इसी तरह काम करते हैं। वे अविश्वसनीय रूप से स्मार्ट और सटीक हैं, लेकिन वे ऊर्जा और कंप्यूटिंग शक्ति के मामले में बहुत "महंगे" हैं क्योंकि वे सरल चित्रों के लिए भी हर विवरण का पूर्ण रिज़ॉल्यूशन पर विश्लेषण करने का प्रयास करते हैं।

नया समाधान: RAViT (स्मार्ट गार्ड)
इस शोध पत्र के लेखकों, मार्शल, स्टीफन और क्रिस्टोफ़ ने एक नया सिस्टम बनाया है जिसे RAViT (रेज़ोल्यूशन-एडेप्टिव विज़न ट्रांसफॉर्मर) कहा जाता है। RAViT को एक स्मार्ट, मल्टी-स्टेज चेकपॉइंट के रूप में समझें जिसमें एक "आलसी" लेकिन कुशल रणनीति है।

यह इस प्रकार काम करता है, एक सरल उपमा (analogy) का उपयोग करते हुए:

1. "धुंधले से स्पष्ट तक" की रणनीति (मल्टी-ब्रांच)

एक ही बार में एक विशाल आवर्धक लेंस का उपयोग करने के बजाय, RAViT एक रिले रेस की तरह तीन स्टेशनों की व्यवस्था करता है:

  • स्टेशन 1 (लो-रेज़ोल्यूशन व्यू): सबसे पहले, गार्ड पेंटिंग के एक छोटे, धुंधले, लो-रिज़ॉल्यूशन थंबनेल को देखता है। यह दूर से आँखें सिकोड़कर देखने जैसा है।
    • क्यों? यदि पेंटिंग एक साधारण लाल घेरा है, तो गार्ड इसे धुंधलेपन में ही तुरंत पहचान सकता है। इसमें लगभग न के बराबर ऊर्जा लगती है।
  • स्टेशन 2 (मीडियम व्यू): यदि गार्ड धुंधलेपन से निश्चित नहीं हो पाता (शायद वह एक लाल घेरा दिखता है लेकिन एक लाल सेब भी हो सकता है), तो वे अगले स्टेशन पर जाते हैं और मध्यम आकार के संस्करण को देखते हैं।
  • स्टेशन 3 (हाई-रेज़ोल्यूशन व्यू): केवल तभी जब पहले दो स्टेशन अभी भी भ्रमित हों, तब गार्ड पूर्ण-आकार के हाई-डेफिनिशन आवर्धक लेंस का उपयोग करके हर विवरण को देखता है।

जादुई ट्रिक: सिस्टम प्रत्येक स्टेशन पर शून्य से शुरुआत नहीं करता है। यह एक "नोट" (एक विशिष्ट टोकन) को धुंधले दृश्य से मध्यम दृश्य में, और फिर स्पष्ट दृश्य में पास करता है। इसका मतलब है कि बाद के स्टेशनों को सब कुछ फिर से सीखने की आवश्यकता नहीं है; वे केवल पिछले अनुमान को परिष्कृत (refine) करते हैं।

2. "अर्ली एग्जिट" (कॉन्फिडेंस चेक)

प्रत्येक स्टेशन पर, गार्ड खुद से पूछता है: "क्या मैं 100% निश्चित हूँ?"

  • यदि उत्तर हाँ है: गार्ड तुरंत रुक जाता है और परिणाम की घोषणा करता है। वे अगले स्टेशनों पर जाने की जहमत नहीं उठाते। इससे भारी मात्रा में ऊर्जा बचती है।
  • यदि उत्तर नहीं है: वे अगले, अधिक विस्तृत स्टेशन पर चले जाते हैं।

वास्तविक दुनिया की उपमा:
कल्पना कीजिए कि आप एक अंधेरे कमरे में किसी जानवर का अनुमान लगाने की कोशिश कर रहे हैं।

  • स्टैंडरल AI: आप तेज़ रोशनी चालू करते हैं, पास जाते हैं, और जानवर के फर, दांत और पंजों का निरीक्षण करने के बाद कहते हैं, "यह एक बिल्ली है।" (हमेशा उच्च ऊर्जा का उपयोग)।
  • RAViT: आप एक "म्याऊँ" सुनते हैं। आप कहते हैं, "यह एक बिल्ली है!" और रुक जाते हैं। आपको रोशनी चालू करने या पास जाने की ज़रूरत नहीं पड़ी।
  • RAViT (कठिन मामला): यदि आप एक सरसराहट सुनते हैं लेकिन कोई आवाज़ नहीं आती, तो आप एक मंद रोशनी चालू करते हैं। यदि आप अभी भी निश्चित नहीं हैं, तो आप तेज़ रोशनी चालू करते हैं।

यह क्यों मायने रखता है?

शोधकर्ताओं ने तीन अलग-अलग "संग्रहालयों" (डेटासेट्स: CIFAR-10, Tiny ImageNet, और ImageNet) पर इसका परीक्षण किया।

  • परिणाम: उन्होंने पाया कि RAViT पुराने, भारी-भरकम AI मॉडलों जितनी ही सटीकता के साथ छवियों की पहचान कर सकता है।
  • बचत: हालांकि, क्योंकि यह अक्सर जल्दी रुक जाता है या कम रिज़ॉल्यूशन का उपयोग करता है, इसने मानक मॉडलों की तुलना में केवल 70% ऊर्जा (कंप्यूटिंग पावर) का उपयोग किया।

मुख्य निष्कर्ष (The Bottom Line)

RAViT आपके AI के लिए एक स्मार्ट थर्मोस्टेट की तरह है।

  • एक धूप वाले दिन (एक सरल छवि) पर, यह कम शक्ति पर चलता है।
  • एक तूफानी दिन (एक जटिल छवि) पर, यह काम को सही ढंग से करने के लिए अपनी शक्ति बढ़ाता है।

यह इसे एम्बेडेड डिवाइसेस जैसे स्मार्टफोन, ड्रोन या मेडिकल सेंसर के लिए एकदम उपयुक्त बनाता है, जहाँ बैटरी लाइफ बहुत कीमती है। यह इन उपकरणों को शक्तिशाली AI चलाने की अनुमति देता है बिना बैटरी को मिनटों में खत्म किए, बस यह समझकर कि कब कड़ी मेहनत करनी है और कब आराम से काम चलाना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →