← नवीनतम पेपर
💻 computer science

CanViT: Toward Active-Vision Foundation Models

यह शोधपत्र CanViT को प्रस्तुत करता है, जो पहला कार्य- और नीति-अज्ञेय (task- and policy-agnostic) एक्टिव-विज़न फाउंडेशन मॉडल (AVFM) है, जो एक नवीन रेटिनोटॉपिक-टू-स्पैटियोटोपिक आर्किटेक्चर और लेबल-मुक्त प्रीट्रेनिंग का उपयोग करता है ताकि मौजूदा एक्टिव विज़न मॉडलों की तुलना में काफी कम कम्प्यूटेशनल लागत के साथ सिमेंटिक सेगमेंटेशन और इमेज क्लासिफिकेशन में अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Yohaï-Eliel Berreby, Sabrina Du, Audrey Durand, B. Suresh Krishna

प्रकाशित 2026-03-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yohaï-Eliel Berreby, Sabrina Du, Audrey Durand, B. Suresh Krishna

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल जिग्सॉ पज़ल (jigsaw puzzle) को हल करने की कोशिश कर रहे हैं, लेकिन आपकी आँखों पर पट्टी बंधी हुई है। आप केवल एक समय में पज़ल के एक छोटे से टुकड़े को देखने के लिए अपना हाथ उठा सकते हैं।

आज के अधिकांश कंप्यूटर विज़न मॉडल एक ऐसे व्यक्ति की तरह हैं जो पूरे पज़ल की एक ही बड़ी फोटो लेता है और उसे एक साथ हल करने की कोशिश करता है। यह काम तो करता है, लेकिन यह धीमा है, बहुत अधिक ऊर्जा का उपयोग करता है, और यदि पज़ल बहुत बड़ा है (जैसे कि एक उच्च-रिज़ॉल्यूशन वाला शहर का नक्शा), तो कंप्यूटर घबरा जाता है।

CanViT एक नए प्रकार का "AI जासूस" है जो इस समस्या को हल करता है। यह इस बात की नकल करता है कि इंसान वास्तव में दुनिया को कैसे देखते हैं। पूरी तस्वीर को घूरने के बजाय, यह त्वरित, केंद्रित झलकियों (glimpses) की एक श्रृंखला लेता है।

यहाँ बताया गया है कि CanViT कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. दो-भाग वाला मस्तिष्क: "आँखें" और "नोटबुक"

CanViT के दो अलग-अलग भाग हैं जो एक साथ काम करते हैं, जैसे एक कैमरे और नोटबुक वाला जासूस।

  • आँखें (The Backbone): यह वह हिस्सा है जो वर्तमान "झलक" (छवि का एक छोटा सा हिस्सा) को देखता है। यह तेज़ और केंद्रित है, लेकिन इसकी याददाश्त कम होती है। एक बार जब यह दूसरी ओर देख लेता है, तो यह उस विशिष्ट स्थान के विवरण को भूल जाता है।
  • नोटबुक (The Canvas): यह CanViT का गुप्त हथियार है। यह पूरे दृश्य का एक विशाल, स्थायी मानसिक मानचित्र है। जैसे-जैसे "आँखें" अलग-अलग स्थानों को देखती हैं, वे "नोटबुक" में नोट्स लिखती हैं। नोटबुक याद रखती है कि सब कुछ कहाँ है, भले ही आँखें वर्तमान में कहीं और देख रही हों।

उपमा: कल्पना कीजिए कि आप एक टॉर्च (आँखों) के साथ एक अंधेरी गुफा की खोज कर रहे हैं। आप केवल अपने सामने कुछ फीट ही देख सकते हैं। लेकिन आपके पास एक मानचित्र (कैनवास) है जहाँ आप जो देखते हैं उसे चित्रित करते हैं। भले ही आप टॉर्च दूसरी ओर घुमा लें, मानचित्र में पूरे गुफा का चित्र बना रहता है।

2. जादू का नुस्खा: "सीन-रिलेटिव" कोऑर्डिनेट्स

आमतौर पर, यदि आप बिल्ली की नाक की क्लोज-अप फोटो लेते हैं, और फिर दूर से बिल्ली के कान की फोटो लेते हैं, तो कंप्यूटर भ्रमित हो जाता है कि वे एक-दूसरे के सापेक्ष कहाँ हैं।

CanViT एक विशेष तकनीक का उपयोग करता है जिसे सीन-रिलेटिव रोटरी पोजीशन एम्बेडिंग्स (SR-RoPE) कहा जाता है।

  • रूपक: कल्पना कीजिए कि गुफा के फर्श पर एक स्थायी ग्रिड पेंट किया गया है (जैसे कि एक विशाल ग्राफ पेपर)। आप चाहे जहाँ भी खड़े हों या अपनी टॉर्च को कितना भी ज़ूम इन करें, आप हमेशा जानते हैं कि आप ग्रिड के किस वर्ग को देख रहे हैं।
  • यह CanViT को एक फूल के ज़ूम-इन किए गए दृश्य और एक बगीचे के ज़ूम-आउट किए गए दृश्य को एक सुसंगत चित्र में बिना भटके जोड़ने की अनुमति देता है।

3. "कैनवास अटेंशन" (कुशल बातचीत)

पुराने मॉडलों में, हर बार जब "आँखें" किसी नए स्थान को देखती थीं, तो उन्हें "नोटबुक" को अपडेट करने के लिए पूरी नोटबुक को फिर से पढ़ना पड़ता था। यह हर एक वाक्य लिखने के लिए पूरी विश्वकोश पढ़ने जैसा है। यह धीमा और महंगा है।

CanViT ने कैनवास अटेंशन (Canvas Attention) का आविष्कार किया, जो एक तरफा, कुशल बातचीत है।

  • उपमा: पूरी किताब पढ़ने के बजाय, "आँखें" बस "नोटबुक" से पूछती हैं, "इस विशिष्ट कोने के बारे में तुम क्या जानते हो?" और नोटबुक उत्तर फुसफुसा देती है। फिर आँखें एक त्वरित अपडेट वापस लिखती हैं।
  • परिणाम: यह सिस्टम को अविश्वसनीय रूप से तेज़ बनाता है। यह बिना थके (मेमोरी या प्रोसेसिंग पावर खत्म किए) विशाल दृश्यों को संभाल सकता है।

4. इसने कैसे सीखा: "शिक्षक" विधि

CanViT ने यह सीखकर नहीं सीखा कि "यह एक बिल्ली है" या "यह एक कुत्ता है।" यह एक बच्चे को कारों की तस्वीरें दिखाकर कार चलाना सिखाने जैसा होगा।

इसके बजाय, शोधकर्ताओं ने एक पैसिव-टू-एक्टिव डिस्टिलेशन (Passive-to-Active Distillation) विधि का उपयोग किया।

  • सेटअप: उन्होंने एक सुपर-स्मार्ट, पैसिव AI (DINOv3) लिया था जिसने पहले ही लाखों हाई-रिज़ॉल्यूशन फोटो देखी थीं। यह AI "शिक्षक" है।
  • खेल: उन्होंने शिक्षक को एक पूर्ण, हाई-रेज़ोल्यूशन फोटो दिखाई। फिर, उन्होंने CanViT को उसी फोटो की यादृच्छिक (random), लो-रेज़ोल्यूशन "झलकियों" की एक श्रृंखला दिखाई।
  • लक्ष्य: CanViT को यह अनुमान लगाना था कि उन छोटी झलकियों के आधार पर पूरी फोटो कैसी दिखती है। इसे खाली स्थानों को भरना था।
  • परिणाम: CanViT ने केवल इसके टुकड़ों को देखकर दुनिया की एक समृद्ध, 3D समझ विकसित करना सीख लिया, बिना किसी लेबल या मानवीय पर्यवेक्षण के।

5. यह क्यों मायने रखता है: परिणाम

पेपर दिखाता है कि CanViT दो मुख्य कारणों से गेम-चेंजर है:

  1. यह अत्यंत कुशल है: यह पिछले "एक्टिव विजन" मॉडलों की तुलना में 19.5 गुना कम कंप्यूटिंग पावर का उपयोग करके एक जटिल दृश्य (जैसे सड़क जिसमें कारें, लोग और पेड़ हैं) को समझ सकता है। यह एक साइकिल की बैटरी पर फेरारी के प्रदर्शन को प्राप्त करने जैसा है।
  2. यह अधिक स्मार्ट है: केवल एक त्वरित झलक के साथ भी, यह सर्वश्रेष्ठ पिछले मॉडलों से बेहतर प्रदर्शन करता है। यदि आप इसे कुछ और झलकियाँ लेने देते हैं (जैसे कि एक कमरे को स्कैन करने वाला इंसान), तो इसकी सटीकता बहुत बढ़ जाती है। यह उन दृश्यों को भी संभाल सकता है जो इसके प्रशिक्षण के आकार से बहुत बड़े हैं।

बड़ी तस्वीर

CanViT से पहले, "पैसिव विजन" (एक पूरी फोटो को घूरना) और "एक्टिव विज़न" (इंसान की तरह इधर-उधर देखना) के बीच एक बड़ा अंतर था। पैसिव मॉडल स्मार्ट थे लेकिन अक्षम थे; एक्टिव मॉडल कुशल थे लेकिन कम बुद्धिमान थे।

CanViT इस अंतर को पाटता है। यह साबित करता है कि आप एक ऐसा AI बना सकते हैं जो दुनिया को वैसे ही देखता है जैसे इंसान देखते हैं—क्रमिक, कुशल, और एक वर्किंग मेमोरी के साथ—बिना किसी जटिल, धीमी प्रशिक्षण विधियों के। यह अगली पीढ़ी के रोबोटों और AI के लिए एक ब्लूप्रिंट है जो बिना अभिभूत हुए वास्तविक दुनिया में नेविगेट कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →