← नवीनतम पेपर
🤖 AI

LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs

यह शोध पत्र LatentLens प्रस्तुत करता है, जो एक नवीन व्याख्यात्मकता विधि (interpretability method) है जो विजन-लैंग्वेज मॉडल्स में विजुअल टोकन रिप्रजेंटेशन्स को एक टेक्स्ट कॉर्पस से नियर-नेबर रिट्रीवल के माध्यम से प्राकृतिक भाषा विवरणों में मैप करती है, और यह प्रदर्शित करती है कि विजुअल टोकन LogitLens जैसी विधियों द्वारा पहले प्रकट किए गए स्तरों की तुलना में सभी मॉडल लेयर्स में कहीं अधिक व्याख्या योग्य हैं।

मूल लेखक: Benno Krojer, Shravan Nayak, Oscar Mañas, Vaibhav Adlakha, Desmond Elliott, Siva Reddy, Marius Mosbach

प्रकाशित 2026-06-12✓ Author reviewed
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Benno Krojer, Shravan Nayak, Oscar Mañas, Vaibhav Adlakha, Desmond Elliott, Siva Reddy, Marius Mosbach

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट है जो केवल "टेक्स्ट" (Text) बोलता है। आप उसे एक लाल इमारत की तस्वीर दिखाना चाहते हैं, लेकिन रोबोट तस्वीरें नहीं समझता। इसे ठीक करने के लिए, वैज्ञानिकों ने एक छोटा अनुवादक (एक "कनेक्टर") बनाया है जो तस्वीर को गुप्त कोडों (टोकन) की एक सूची में बदल देता है जिसे रोबोट पढ़ सके।

बड़ा रहस्य यह था: ये गुप्त कोड वास्तव में क्या अर्थ रखते थे?

लंबे समय तक, शोधकर्ताओं ने इन कोडों को दो पुराने, थोड़े टूटे हुए फ्लैशलाइट्स का उपयोग करके डिकोड करने की कोशिश की:

  1. "डिक्शनरी" फ्लैशलाइट (EmbeddingLens): इसने कोड को रोबोट के शब्दकोश के सबसे करीबी शब्द से मिलाने की कोशिश की।
  2. "नेक्स्ट वर्ड" फ्लैशलाइट (LogitLens): इसने अनुमान लगाने की कोशिश की कि कोड के आधार पर रोबोट अगला कौन सा शब्द बोलेगा।

समस्या: ये पुराने फ्लैशलाइट्स धुंधले थे। वे अक्सर दिखाते थे कि कोड अर्थहीन या शब्दों के रैंडम टुकड़े थे। ऐसा लग रहा था जैसे रोबोट जो देख रहा है, उसे लेकर भ्रमित है।

LATENTLENS का आगमन: "कॉन्टेक्स्टुअल सर्च इंजन"

इस पेपर के लेखकों ने एक नया टूल पेश किया जिसे LATENTLENS कहा जाता है। केवल एक डिक्शनरी देखने या अगले शब्द का अनुमान लगाने के बजाय, LATENTLENS एक विशाल, बुद्धिमान सर्च इंजन की तरह काम करता है।

यह कैसे काम करता है, इसके लिए एक सरल उपमा (analogy) देखें:

कल्पना कीजिए कि आपके पास "क्लॉक टॉवर" (घंटाघर) के लिए एक गुप्त कोड है।

  • पुराना तरीका: आप पूछते हैं, "इस कोड के सबसे करीब कौन सा एक शब्द है?" उत्तर "घड़ी" या "टावर" हो सकता है, लेकिन यह अधूरा लगता है।
  • LATENTLENS का तरीका: आप पूछते हैं, "हमारी किताबों के पूरे पुस्तकालय में कौन सा पूरा वाक्य इस कोड जैसा सुनाई देता है?"
    • सर्च इंजन लाखों वाक्यों को स्कैन करता है और पाता है: "सोने की घड़ियों वाला एक बड़ा पत्थर का टॉवर।"
    • यह उस पूरे वाक्य को विवरण के रूप में वापस करता है।

परिणाम: अचानक, गुप्त कोड अब अर्थहीन नहीं रहे। वे अत्यधिक वर्णनात्मक बन गए। रोबोट भ्रमित नहीं है; उसे बस अपनी आंतरिक सोच को मानवीय भाषा में अनुवाद करने के लिए सही उपकरण की आवश्यकता थी।

मुख्य खोजें ("अहा!" क्षण)

1. कोड हमेशा स्पष्ट थे (हमारे पास केवल खराब चश्मे थे)
पेपर ने 15 अलग-अलग रोबोट मॉडल का परीक्षण किया। पुराने फ्लैशलाइट्स के साथ, उन्हें लगा कि केवल 24–32% इमेज कोड ही समझने योग्य थे। LATENTLENS के साथ, उन्होंने पाया कि 68% कोड वास्तव में शुरुआत से ही बहुत स्पष्ट और अर्थपूर्ण थे। रोबोट दुनिया को स्पष्ट रूप से "देख" रहा था; बस हम उसके नोट्स पढ़ नहीं पा रहे थे।

2. "मिड-लेयर लीप" (जादुई छलांग)
यह सबसे आश्चर्यजनक खोज है।

  • कल्पना कीजिए कि रोबोट के पास कमरों (लेयर्स) की एक लंबी गैलरी है जहाँ वह जानकारी को प्रोसेस करता है।
  • जब आप उसे एक तस्वीर दिखाते हैं, तो कोड पहले कमरे में प्रवेश करता है।
  • आप उम्मीद कर सकते हैं कि कोड पहले कमरे के "अर्थ" से मेल खाएगा।
  • लेकिन ऐसा नहीं होता। पहले कमरे का कोड वास्तव में मध्य के कमरों (जैसे 8 से 16) के अर्थ से सबसे अच्छी तरह मेल खाता है।
  • उपमा: यह एक पत्र को मेलबॉक्स (इनपुट) में डालने जैसा है। आप उम्मीद करते हैं कि पत्र को तुरंत पढ़ लिया जाएगा, लेकिन इसके बजाय, यह जादुई रूप से सॉर्टिंग सुविधा के बीच में "कूद" जाता है जहाँ अर्थ पूरी तरह से बन चुका होता है, इससे पहले कि वह इमारत के बाकी हिस्सों से होकर गुजरे। विजुअल जानकारी तुरंत रोबोट की "सिमेंटिक" (अर्थ-आधारित) समझ के साथ संरेखित हो जाती है, जिससे वह "शब्द-दर-शब्द" प्रोसेसिंग को छोड़ देती है।

3. पूरे वाक्य बनाम सब-वर्ड्स
पुराने तरीकों ने अक्सर "सोफा" या "आलू" जैसे अजीब टुकड़े या यहाँ तक कि "," जैसे विराम चिह्न लौटाए। LATENTLENS "एक भूरे और सफेद टॉवर-क्लॉक" जैसे पूर्ण, सुसंगत वाक्यांश लौटाता है। यह किसी शब्द के एक अकेले अक्षर को पढ़ने बनाम पूरा वाक्य पढ़ने के बीच का अंतर है।

यह क्यों महत्वपूर्ण है

यह पेपर साबित करता है कि जब हम एक टेक्स्ट-ब्रेन (टेक्स्ट वाले मस्तिष्क) को कैमरे से जोड़ते हैं, तो वह चित्र को लगभग तुरंत समझ लेता है। इसे चित्र को समझने के लिए जटिल तरीके से "सिखाने" की आवश्यकता नहीं होती; छवि स्वाभाविक रूप से दुनिया की उसकी मौजूदा समझ में फिट हो जाती है।

लेखकों ने एक टूल (LATENTLENS) बनाया है जो हमें इन मॉडल्स के अंदर झांकने और यह देखने की अनुमति देता है कि वे किसी छवि के बारे में वास्तव में क्या "सोच" रहे हैं, जिससे पता चलता है कि उनकी आंतरिक दृष्टि बहुत अधिक मानवीय और व्याख्या योग्य है जितना कि हम पहले मानते थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →