← नवीनतम पेपर
💻 computer science

Interpretability Transfer from Language to Vision via Sparse Autoencoders

यह शोध पत्र VISTA को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो विजन-लैंग्वेज मॉडल्स में विजुअल टोकन्स को एक पूर्व-मौजूद, लेबल किए गए टेक्स्टुअल स्पार्स ऑटोएनकोडर स्पेस के साथ संरेखित करके भाषा से विजन में व्याख्यात्मकता (interpretability) को स्थानांतरित करता है, जिससे समर्पित विजन SAEs को प्रशिक्षित किए बिना सटीक विजुअल कॉन्सेप्ट लोकलाइजेशन और प्रभावी क्रॉस-मोडल हस्तक्षेप सक्षम होता है।

मूल लेखक: Alexey Kravets, Da Li, Chuan Li, Da Chen, Vinay P. Namboodiri

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alexey Kravets, Da Li, Chuan Li, Da Chen, Vinay P. Namboodiri

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट है जो चित्रों को देख सकता है और उनके बारे में बात कर सकता है। इस रोबोट के पास एक "मस्तिष्क" (लार्ज लैंग्वेज मॉडल) है जो शब्दों को समझने में अविश्वसनीय रूप से अच्छा है, लेकिन यह एक रहस्य है कि वह वास्तव में दुनिया को कैसे "देखता" है। आमतौर पर, जब हम इस रोबोट के मस्तिष्क के भीतर झाँकने की कोशिश करते हैं कि वह किसी चित्र के बारे में क्या सोच रहा है, तो यह एक ऐसी किताब को पढ़ने जैसा होता है जो ऐसी भाषा में लिखी गई है जिसे अभी तक कोई नहीं जानता।

यह शोध पत्र VISTA (विजुअल इंटरप्रिटेबिलिटी वाया SAE ट्रांसफर अलाइनमेंट) नामक एक नई विधि पेश करता है ताकि इस समस्या को हल किया जा सके। यह कैसे काम करता है, इसका सरल विवरण यहाँ दिया गया है:

1. समस्या: "शब्दकोश" का बेमेल होना

रोबोट के मस्तिष्क को एक विशाल, पूर्व-लिखित अवधारणाओं (जैसे "कुत्ता," "दौड़ना," "खुश") के शब्दकोश के रूप में सोचें। यह शब्दकोश लाखों किताबें पढ़ने से बनाया गया था और यह बहुत व्यवस्थित है। हालाँकि, जब रोबोट एक चित्र देखता है, तो उसकी आँखों से मिलने वाले संकेत (विजुअल डेटा) उसके शब्दकोश के शब्दों से मेल नहीं खाते हैं। वे दो अलग-अलग भाषाओं की तरह हैं।

यह समझने के लिए कि रोबोट क्या देख रहा है, वैज्ञानिक आमतौर पर चित्रों के लिए एक नया शब्दकोश बनाने की कोशिश करते हैं। लेकिन यह कठिन है क्योंकि विजुअल अवधारणाओं को लेबल करना भ्रमित करने वाला होता है। क्या एक "कुत्ता" फीचर केवल एक कुत्ता है, या एक विशिष्ट नस्ल, या दौड़ता हुआ कुत्ता? यह अस्पष्ट है और इसे लेबल करने में बहुत मेहनत लगती है।

2. समाधान: VISTA (एक यूनिवर्सल एडेप्टर)

एक नया चित्र शब्दकोश बनाने के बजाय, VISTA एक यूनिवर्सल ट्रांसलेटर एडेप्टर की तरह कार्य करता है।

  • सेटअप: रोबोट के पास एक स्थिर "मस्तिष्क" (लैंग्वेज मॉडल) है जिसमें उसका मौजूदा, लेबल किया गया शब्दकोष है। उसके पास एक "कैमरा" (विज़न एनकोडर) भी है जो दुनिया को देखता है।
  • ट्रिक: VISTA कैमरा और मस्तिष्क के बीच एक छोटा, सरल कनेक्टर (प्रोजेक्टर) प्रशिक्षित करता है।
  • लक्ष्य: लक्ष्य यह है कि कैमरे के संकेतों को मस्तिष्क के मौजूदा शब्दकोश में पूरी तरह फिट होने के लिए मजबूर किया जाए। शोधकर्ता प्रशिक्षण के दौरान एक विशेष नियम जोड़कर ऐसा करते हैं: "चित्र के संकेत जो आप मस्तिष्क को भेजते हैं, उन्हें मस्तिष्क के अपने शब्दकोष का उपयोग करके पुनर्गठित (reconstructible) किया जाना चाहिए।"

यह एक चौकोर खांचे (चित्र) को गोल छेद (शब्दकोश) में फिट करने के लिए खांचे को नया आकार देने के बजाय, खांचे को नया आकार देकर उसे फिट करने जैसा है।

3. परिणाम: देखना ही समझना है

चूँकि VISTA चित्र के संकेतों को शब्दकोश के साथ पूरी तरह से संरेखित (align) करता है, इसलिए अब हम रोबोट जो देख रहा है उसे उन शब्दों का उपयोग करके "पढ़" सकते हैं जिन्हें वह पहले से जानता है।

  • "न्यूरोनिपीडिया" कनेक्शन: यह शोध पत्र 'न्यूरोनिपीडिया' नामक एक सार्वजनिक डेटाबेस का उपयोग करता है, जो रोबोट के मस्तिष्क के लिए एक लेजेंड (संकेत सूची) के रूप में कार्य करता है। यह हमें बताता है कि एक विशिष्ट संकेत का अर्थ "बिल्ली" या "कुकी" है।
  • ब्रेकथ्रू: VISA के साथ, जब रोबोट बिल्ली की तस्वीर देखता है, तो वह संकेत जो मस्तिष्क को भेजा जाता है, शब्दकोश में उसी "बिल्ली" की अवधारणा को सक्रिय करता है जैसा कि तब होता यदि किसी ने बस "बिल्ली" शब्द टाइप किया होता। यह बिना कुछ भी पुन: लेबल किए या नया शब्दकोश प्रशिक्षित किए होता है।

4. कैमरा मायने रखता है: DINOv2 बनाम CLIP

शोध पत्र ने यह देखने के लिए विभिन्न "कैमरों" (विज़न एनकोडर्स) का परीक्षण किया कि इस ट्रांसलेटर के साथ कौन सा सबसे अच्छा काम करता है।

  • CLIP (ग्लोबल थिंकर): एक ऐसे कैमरे की कल्पना करें जो पूरी तस्वीर को देखता है और कहता है, "यह एक बिल्ली वाला दृश्य है।" यह बड़े चित्र के लिए अच्छा है लेकिन विवरणों के लिए बुरा है। यदि आप इसे सटीक रूप से बताने के लिए कहते हैं कि बिल्ली कहाँ है, तो यह भ्रमित हो सकता है और बैकग्राउंड की ओर इशारा कर सकता है।
  • DINOv2 (लोकल डिटेक्टिव): यह कैमरा एक जासूस की तरह है जो छवि के छोटे हिस्सों (patches) को देखता है। यह ठीक जानता है कि पिक्सेल का कौन सा छोटा हिस्सा बिल्ली के कान को दर्शाता है और कौन सा पूंछ को।
  • निष्कर्ष: VISTA DINOv2 के साथ सबसे अच्छा काम करता है। क्योंकि DINOv2 वस्तुओं के स्थान को सटीक रखता है, इसलिए VISTA रोबोट के विजन पर "सर्जरी" कर सकता है।

5. जादू का खेल: विजुअल स्टीयरिंग

चूँकि चित्र के संकेत अब शब्दकोश के साथ पूरी तरह से संरेखित हैं, इसलिए शोधकर्ता "विजुअल स्टीयरिंग" कर सकते हैं। यह गणित का उपयोग करके रोबोट के वास्तविकता के बोध को संपादित करने जैसा है।

  • प्रयोग: उन्होंने "चॉकलेट कुकी खाते हुए लड़की" की एक छवि ली।
  • क्रिया: उन्होंने "चॉकलेट" के विशिष्ट संकेतों को खोजा और उन्हें हटा दिया, या "ब्रेड" के संकेतों को जोड़ा।
  • परिणाम: रोबet का वर्णन "चॉकलेट कुकी खाते हुए" से बदलकर "सैंडविच खाते हुए" या "ब्रेड खाते हुए" में बदल गया, लेकिन केवल उस चित्र के विशिष्ट भाग के लिए। बाकी दृश्य (लड़की, कुर्सी) बिल्कुल वैसा ही रहा।

VISTA (और विशेष रूप से DINOv2 कैमरा) के बिना, रोबोट या तो वस्तु को बदलने में विफल रहता या अजीब चीजें (जैसे कि कहीं से कोई व्यक्ति प्रकट होना) बनाना शुरू कर देता क्योंकि वह ठीक से पता नहीं लगा पाता कि बदलाव कहाँ करना है।

सारांश

संक्षेप में, यह शोध पत्र दिखाता है कि हमें रोबोट को उसकी दृष्टि समझने के लिए एक नई भाषा सिखाने की आवश्यकता नहीं है। इसके बजाय, हम उसकी "आंखों" को उसके "मस्तिष्क" की समान भाषा बोलने के लिए सिखा सकते हैं। एक विशिष्ट प्रकार के कैमरे (DINOv2) और एक चतुर प्रशिक्षण तकनीक का उपयोग करके, हम रोबोट के विजन को इतना स्पष्ट और सटीक बना सकते हैं कि हम न केवल यह समझ सकते हैं कि वह क्या देख रहा है, बल्कि एक चित्र में विशिष्ट वस्तुओं के उसके बोध को भी संपादित कर सकते हैं, जबकि बाकी दुनिया को बरकरार रखा जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →