CanViT: Toward Active-Vision Foundation Models
यह शोधपत्र CanViT को प्रस्तुत करता है, जो पहला कार्य- और नीति-अज्ञेय (task- and policy-agnostic) एक्टिव-विज़न फाउंडेशन मॉडल (AVFM) है, जो एक नवीन रेटिनोटॉपिक-टू-स्पैटियोटोपिक आर्किटेक्चर और लेबल-मुक्त प्रीट्रेनिंग का उपयोग करता है ताकि मौजूदा एक्टिव विज़न मॉडलों की तुलना में काफी कम कम्प्यूटेशनल लागत के साथ सिमेंटिक सेगमेंटेशन और इमेज क्लासिफिकेशन में अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल जिग्सॉ पज़ल (jigsaw puzzle) को हल करने की कोशिश कर रहे हैं, लेकिन आपकी आँखों पर पट्टी बंधी हुई है। आप केवल एक समय में पज़ल के एक छोटे से टुकड़े को देखने के लिए अपना हाथ उठा सकते हैं।
आज के अधिकांश कंप्यूटर विज़न मॉडल एक ऐसे व्यक्ति की तरह हैं जो पूरे पज़ल की एक ही बड़ी फोटो लेता है और उसे एक साथ हल करने की कोशिश करता है। यह काम तो करता है, लेकिन यह धीमा है, बहुत अधिक ऊर्जा का उपयोग करता है, और यदि पज़ल बहुत बड़ा है (जैसे कि एक उच्च-रिज़ॉल्यूशन वाला शहर का नक्शा), तो कंप्यूटर घबरा जाता है।
CanViT एक नए प्रकार का "AI जासूस" है जो इस समस्या को हल करता है। यह इस बात की नकल करता है कि इंसान वास्तव में दुनिया को कैसे देखते हैं। पूरी तस्वीर को घूरने के बजाय, यह त्वरित, केंद्रित झलकियों (glimpses) की एक श्रृंखला लेता है।
यहाँ बताया गया है कि CanViT कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:
1. दो-भाग वाला मस्तिष्क: "आँखें" और "नोटबुक"
CanViT के दो अलग-अलग भाग हैं जो एक साथ काम करते हैं, जैसे एक कैमरे और नोटबुक वाला जासूस।
- आँखें (The Backbone): यह वह हिस्सा है जो वर्तमान "झलक" (छवि का एक छोटा सा हिस्सा) को देखता है। यह तेज़ और केंद्रित है, लेकिन इसकी याददाश्त कम होती है। एक बार जब यह दूसरी ओर देख लेता है, तो यह उस विशिष्ट स्थान के विवरण को भूल जाता है।
- नोटबुक (The Canvas): यह CanViT का गुप्त हथियार है। यह पूरे दृश्य का एक विशाल, स्थायी मानसिक मानचित्र है। जैसे-जैसे "आँखें" अलग-अलग स्थानों को देखती हैं, वे "नोटबुक" में नोट्स लिखती हैं। नोटबुक याद रखती है कि सब कुछ कहाँ है, भले ही आँखें वर्तमान में कहीं और देख रही हों।
उपमा: कल्पना कीजिए कि आप एक टॉर्च (आँखों) के साथ एक अंधेरी गुफा की खोज कर रहे हैं। आप केवल अपने सामने कुछ फीट ही देख सकते हैं। लेकिन आपके पास एक मानचित्र (कैनवास) है जहाँ आप जो देखते हैं उसे चित्रित करते हैं। भले ही आप टॉर्च दूसरी ओर घुमा लें, मानचित्र में पूरे गुफा का चित्र बना रहता है।
2. जादू का नुस्खा: "सीन-रिलेटिव" कोऑर्डिनेट्स
आमतौर पर, यदि आप बिल्ली की नाक की क्लोज-अप फोटो लेते हैं, और फिर दूर से बिल्ली के कान की फोटो लेते हैं, तो कंप्यूटर भ्रमित हो जाता है कि वे एक-दूसरे के सापेक्ष कहाँ हैं।
CanViT एक विशेष तकनीक का उपयोग करता है जिसे सीन-रिलेटिव रोटरी पोजीशन एम्बेडिंग्स (SR-RoPE) कहा जाता है।
- रूपक: कल्पना कीजिए कि गुफा के फर्श पर एक स्थायी ग्रिड पेंट किया गया है (जैसे कि एक विशाल ग्राफ पेपर)। आप चाहे जहाँ भी खड़े हों या अपनी टॉर्च को कितना भी ज़ूम इन करें, आप हमेशा जानते हैं कि आप ग्रिड के किस वर्ग को देख रहे हैं।
- यह CanViT को एक फूल के ज़ूम-इन किए गए दृश्य और एक बगीचे के ज़ूम-आउट किए गए दृश्य को एक सुसंगत चित्र में बिना भटके जोड़ने की अनुमति देता है।
3. "कैनवास अटेंशन" (कुशल बातचीत)
पुराने मॉडलों में, हर बार जब "आँखें" किसी नए स्थान को देखती थीं, तो उन्हें "नोटबुक" को अपडेट करने के लिए पूरी नोटबुक को फिर से पढ़ना पड़ता था। यह हर एक वाक्य लिखने के लिए पूरी विश्वकोश पढ़ने जैसा है। यह धीमा और महंगा है।
CanViT ने कैनवास अटेंशन (Canvas Attention) का आविष्कार किया, जो एक तरफा, कुशल बातचीत है।
- उपमा: पूरी किताब पढ़ने के बजाय, "आँखें" बस "नोटबुक" से पूछती हैं, "इस विशिष्ट कोने के बारे में तुम क्या जानते हो?" और नोटबुक उत्तर फुसफुसा देती है। फिर आँखें एक त्वरित अपडेट वापस लिखती हैं।
- परिणाम: यह सिस्टम को अविश्वसनीय रूप से तेज़ बनाता है। यह बिना थके (मेमोरी या प्रोसेसिंग पावर खत्म किए) विशाल दृश्यों को संभाल सकता है।
4. इसने कैसे सीखा: "शिक्षक" विधि
CanViT ने यह सीखकर नहीं सीखा कि "यह एक बिल्ली है" या "यह एक कुत्ता है।" यह एक बच्चे को कारों की तस्वीरें दिखाकर कार चलाना सिखाने जैसा होगा।
इसके बजाय, शोधकर्ताओं ने एक पैसिव-टू-एक्टिव डिस्टिलेशन (Passive-to-Active Distillation) विधि का उपयोग किया।
- सेटअप: उन्होंने एक सुपर-स्मार्ट, पैसिव AI (DINOv3) लिया था जिसने पहले ही लाखों हाई-रिज़ॉल्यूशन फोटो देखी थीं। यह AI "शिक्षक" है।
- खेल: उन्होंने शिक्षक को एक पूर्ण, हाई-रेज़ोल्यूशन फोटो दिखाई। फिर, उन्होंने CanViT को उसी फोटो की यादृच्छिक (random), लो-रेज़ोल्यूशन "झलकियों" की एक श्रृंखला दिखाई।
- लक्ष्य: CanViT को यह अनुमान लगाना था कि उन छोटी झलकियों के आधार पर पूरी फोटो कैसी दिखती है। इसे खाली स्थानों को भरना था।
- परिणाम: CanViT ने केवल इसके टुकड़ों को देखकर दुनिया की एक समृद्ध, 3D समझ विकसित करना सीख लिया, बिना किसी लेबल या मानवीय पर्यवेक्षण के।
5. यह क्यों मायने रखता है: परिणाम
पेपर दिखाता है कि CanViT दो मुख्य कारणों से गेम-चेंजर है:
- यह अत्यंत कुशल है: यह पिछले "एक्टिव विजन" मॉडलों की तुलना में 19.5 गुना कम कंप्यूटिंग पावर का उपयोग करके एक जटिल दृश्य (जैसे सड़क जिसमें कारें, लोग और पेड़ हैं) को समझ सकता है। यह एक साइकिल की बैटरी पर फेरारी के प्रदर्शन को प्राप्त करने जैसा है।
- यह अधिक स्मार्ट है: केवल एक त्वरित झलक के साथ भी, यह सर्वश्रेष्ठ पिछले मॉडलों से बेहतर प्रदर्शन करता है। यदि आप इसे कुछ और झलकियाँ लेने देते हैं (जैसे कि एक कमरे को स्कैन करने वाला इंसान), तो इसकी सटीकता बहुत बढ़ जाती है। यह उन दृश्यों को भी संभाल सकता है जो इसके प्रशिक्षण के आकार से बहुत बड़े हैं।
बड़ी तस्वीर
CanViT से पहले, "पैसिव विजन" (एक पूरी फोटो को घूरना) और "एक्टिव विज़न" (इंसान की तरह इधर-उधर देखना) के बीच एक बड़ा अंतर था। पैसिव मॉडल स्मार्ट थे लेकिन अक्षम थे; एक्टिव मॉडल कुशल थे लेकिन कम बुद्धिमान थे।
CanViT इस अंतर को पाटता है। यह साबित करता है कि आप एक ऐसा AI बना सकते हैं जो दुनिया को वैसे ही देखता है जैसे इंसान देखते हैं—क्रमिक, कुशल, और एक वर्किंग मेमोरी के साथ—बिना किसी जटिल, धीमी प्रशिक्षण विधियों के। यह अगली पीढ़ी के रोबोटों और AI के लिए एक ब्लूप्रिंट है जो बिना अभिभूत हुए वास्तविक दुनिया में नेविगेट कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।