← नवीनतम पेपर
💻 computer science

From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decomposition

यह शोध पत्र SITH को प्रस्तुत करता है, जो एक नवीन डेटा-मुक्त और प्रशिक्षण-मुक्त ढांचा है जो CLIP के अटेंशन हेड वेट्स (attention head weights) को सिंगुलर वेक्टर्स में विघटित करता है और एक नए एल्गोरिदम के माध्यम से उन्हें स्पार्स (sparse), सुसंगत अवधारणाओं के रूप में व्याख्यायित करता है, जिससे बिना पुन: प्रशिक्षण के निष्ठावान इंट्रा-हेड स्पष्टीकरण और सटीक मॉडल संपादन सक्षम होते हैं।

मूल लेखक: Francesco Gentile, Nicola Dall'Asen, Francesco Tonini, Massimiliano Mancini, Lorenzo Vaquero, Elisa Ricci

प्रकाशित 2026-03-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Francesco Gentile, Nicola Dall'Asen, Francesco Tonini, Massimiliano Mancini, Lorenzo Vaquero, Elisa Ricci

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास CLIP नाम का एक सुपर-स्मार्ट रोबोट कलाकार है। यह रोबोट किसी तस्वीर को देख सकता है और उसका सटीक वर्णन कर सकता है, या किसी विवरण को पढ़कर उससे मेल खाती तस्वीर ढूंढ सकता है। लेकिन समस्या यह है कि वास्तव में कोई नहीं जानता कि यह कैसे करता है। यह एक "ब्लैक बॉक्स" की तरह है। आप एक तस्वीर डालते हैं, और एक विवरण बाहर आता है, लेकिन इसके अंदर के गियर छिपे हुए हैं।

आमतौर पर, रोबोट के सोचने के तरीके को समझने के लिए वैज्ञानिकों को उसे हजारों तस्वीरें दिखानी पड़ती हैं और काम करते समय उसके अंदर क्या हो रहा है, उस पर नज़र रखनी पड़ती है। यह एक शेफ को खाना बनाते हुए देखने जैसा है; आप देखते हैं कि वह कौन से सामग्रियाँ (ingredients) उठा रहा है, लेकिन आपको उसकी दीवार पर लिखी गुप्त रेसिपी का पता नहीं चलता। साथ ही, यदि शेफ केवल एक विशिष्ट किराने की दुकान की सामग्रियों से खाना बनाता है, तो आपको लग सकता है कि वह केवल वही जानता है, जो कि सच नहीं है।

यह पेपर एक नई विधि पेश करता है जिसे SITH कहा जाता है (जो सुनने में एक डरावने भूत जैसा लगता है, लेकिन इसका अर्थ है Semantic Inspection of Transformer Heads)। SITH एक जादुई एक्स-रे की तरह है जो हमें एक भी तस्वीर दिखाए बिना रोबोट के "दिमाग" को देखने की अनुमति देता है।

SITH कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:

1. "रेसिपी बुक" बनाम "कुकिंग शो"

पिछले अधिकांश तरीके "कुकिंग शो" (एक्टिवेशन देखना) देखने जैसे थे। उन्हें यह अनुमान लगाने के लिए बहुत अधिक डेटा (सामग्रियों) की आवश्यकता थी कि रोबोट क्या सोच रहा है। यदि रोबोट ने बिल्लियों की बहुत सारी तस्वीरें देखीं, तो उसे लग सकता है कि वह केवल बिल्लियों के बारे में जानता है।

SITH अलग है। यह सीधे रेसिपी बुक (वजन/weights) को देखता है। इसे इस बात से फर्क नहीं पड़ता कि रोबोट वर्तमान में क्या पका रहा है; यह बस उसके दिमाग में लिखे निर्देशों को पढ़ता है। इसका मतलब है कि यह डेटा-मुक्त (data-free) है। इसे यह समझने के लिए एक भी छवि देखने की आवश्यकता नहीं है कि रोबोट कैसे काम करता है।

2. "स्विस आर्मी नाइफ" की उपमा

रोबोट के दिमाग के अंदर, कई छोटे उपकरण होते हैं जिन्हें अटेंशन हेड्स (Attention Heads) कहा जाता है। इन हेड्स में से एक को एक स्विस आर्मी नाइफ के रूप में सोचें।

  • पुराना तरीका: वैज्ञानिक कहते थे, "यह चाकू काटने के लिए अच्छा है।" यह थोड़ा अस्पष्ट है। क्या यह कागज काटने के लिए अच्छा है? स्टेक? या बाल?
  • SITH का तरीका: SITH उस चाकू को अलग-अलग हिस्सों में तोड़ देता है। यह एक गणितीय उपकरण जिसका उपयोग SVD (सिंगुलर वैल्यू डिकम्पोजिशन) किया जाता है, का उपयोग करके चाकू को उसके व्यक्तिगत ब्लेडों में विभाजित करता है: एक छोटा पेचकस, छोटी कैंची, और एक बोतल खोलने वाला।

3. "अनुवादक" (COMP)

एक बार जब SITH स्विस आर्मी नाइफ को अलग-अलग ब्लेडों में विभाजित कर देता है, तो उसे अभी भी यह जानने की आवश्यकता है कि प्रत्येक ब्लेड क्या करता है। यहीं पर COMP नामक एक नया एल्गोरिदम आता है।

कल्पना कीजिए कि आपके पास एक अजीब, अमूर्त आकार (एक ब्लेड) है। आप उसे शब्दों का उपयोग करके वर्णित करना चाहते हैं।

  • समस्या: यदि आप केवल निकटतम शब्द चुनते हैं, तो आप एक ऐसे आकार के लिए "लाल" कह सकते हैं जो वास्तव में "एक लाल, नुकीला, गुस्से वाला तारा" है। आप बारीकियों को खो देते हैं।
  • SITH का समाधान (COMP): COMP एक स्मार्ट अनुवादक की तरह है जो एक स्पार्स, कोहेरेंट कॉम्बिनेशन (sparse, coherent combination) का उपयोग करके एक विवरण बनाता है। यह कहता है, "ठीक है, यह ब्लेड केवल 'लाल' नहीं है। यह 'क्रिमसन', 'नुकीला' और 'खतरा' का मिश्रण है।" यह कुछ ऐसे शब्द चुनता है जो उस विशिष्ट ब्लेड को पूरी तरह से वर्णित करने के लिए एक साथ फिट बैठते हैं।

4. उन्होंने क्या पाया?

जब उन्होंने CLIP रोबोट पर SITH का उपयोग किया, तो उन्हें कुछ अद्भुत चीजें मिलीं:

  • विशेषज्ञ ब्लेड: उन्होंने पाया कि एक "चाकू" (अटेंशन हेड) के अंदर, रंगों (एक "लाल" के लिए, दूसरा "नीले" के लिए), स्थानों (एक "रसोई" के लिए, दूसरा "समुद्र तट" के लिए), और यहाँ तक कि अक्षरों (कुछ ब्लेड वास्तव में छवि के भीतर टेक्स्ट को "पढ़" सकते हैं!) के लिए समर्पित विशिष्ट ब्लेड हैं।
  • कोई पूर्वाग्रह नहीं: क्योंकि उन्होंने कुकिंग शो के बजाय रेसिपी बुक को देखा, इसलिए उन्होंने इन विशेषताओं को तब भी खोज निकाला जब रोबोट ने अपने प्रशिक्षण के दौरान कभी भी "पिंक फ्लेमिंगो" की तस्वीर नहीं देखी थी।

5. सुपरपावर: बिना एनेस्थीसिया के "ब्रेन सर्जरी"

सबसे अच्छी बात यह है कि आप इस ज्ञान का क्या कर सकते हैं। चूंकि SITH अवधारणाओं (जैसे "लाल" या "बैकग्राउंड") के संदर्भ में रोबोट के दिमाग को समझता है, इसलिए हम इसे फिर से प्रशिक्षित किए बिना रोबोट पर सर्जरी कर सकते हैं।

  • बुरी आदतों को ठीक करना: कल्पना कीजिए कि रोबोट सोचता है कि "पक्षी" तभी पक्षी है जब वह "पेड़" पर खड़ा हो। यदि आप उसे "चट्टान" पर एक पक्षी दिखाते हैं, तो वह भ्रमित हो जाता है। SITH उस विशिष्ट "पेड़" वाले ब्लेड को ढूंढ सकता है और उसकी तीव्रता को कम कर सकता है। अब रोबोट चट्टानों पर भी पक्षियों को देख सकता है!
  • सुरक्षा: यदि रोबोट "डरावनी" या "असुरक्षित" छवियों के प्रति बहुत संवेदनशील है, तो SITH उन "डरावने" ब्लेडों को ढूंढकर उन्हें म्यूट (शांत) कर सकता है, जिससे रोबोट सुरक्षित हो जाता है।
  • बेहतर प्रदर्शन: यदि आप चाहते हैं कि रोबोट फूलों को पहचानने में बेहतर हो, तो SITH "फूल" वाले ब्लेड की आवाज़ को बढ़ा सकता है और "कारों" वाले ब्लेड को कम कर सकता है।

सारांश

SITH एक ऐसा टूल है जो हमें काम करने के बजाय उसके निर्देश मैनुअल (weights) को पढ़कर एक विज़न AI के दिमाग में झाँकने की अनुमति देता है। यह जटिल मस्तिष्क के हिस्सों को सरल, मानव-पठनीय अवधारणाओं (जैसे "हरा" या "समुद्र तट") में तोड़ देता है। यह हमें रोबोट की बुरी आदतों को ठीक करने, उसे सुरक्षित बनाने और उसके कौशल में सुधार करने की अनुमति देता है—और वह भी बिना अधिक डेटा दिए या उसे शुरू से फिर से प्रशिक्षित किए।

यह एक ब्लैक बॉक्स को लेने, उसे खोलने, "लाल" और "नीले" के लिए जिम्मेदार विशिष्ट तारों को खोजने और फिर एक पेचकस के साथ उन्हें ट्यून करने जैसा है, जबकि रोबोट अभी भी चल रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →