← नवीनतम पेपर
🤖 AI

LINE: LLM-based Iterative Neuron Explanations for Vision Models

यह शोध पत्र LINE को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), ब्लैक-बॉक्स फ्रेमवर्क है जो विजन मॉडल्स के व्यक्तिगत न्यूरॉन्स के लिए ओपन-वोकेबुलरी कॉन्सेप्ट लेबल्स को पुनरावृत्ति (iteratively) के माध्यम से खोजने और परिष्कृत करने के लिए लार्ज लैंग्वेज मॉडल्स और टेक्स्ट-टू-इमेज जनरेटर्स का लाभ उठाता है, जिससे अत्याधुनिक प्रदर्शन प्राप्त होता है और पूर्व-निर्धारित शब्दावलियों द्वारा छूटे हुए नवीन कॉन्सेप्ट्स का अनावरण होता है।

मूल लेखक: Vladimir Zaigrajew, Michał Piechota, Gaspar Sekula, Paweł Gelar, Przemysław Biecek

प्रकाशित 2026-05-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vladimir Zaigrajew, Michał Piechota, Gaspar Sekula, Paweł Gelar, Przemysław Biecek

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट है जो किसी तस्वीर को देख सकता है और बता सकता है कि वह क्या है। लेकिन इसमें एक पेंच है: रोबोट एक "ब्लैक बॉक्स" (black box) है। आप देख सकते हैं कि तस्वीर अंदर जा रही है और जवाब बाहर आ रहा है, लेकिन आपको यह पता नहीं है कि उसने वह जवाब कैसे तय किया। रोबोट के दिमाग के अंदर अरबों छोटे स्विच हैं जिन्हें न्यूरॉन्स (neurons) कहा जाता है। कुछ स्विच तब जल उठते हैं जब रोबोट "कुत्ता" देखता है, कुछ तब जब वह "पेड़" देखता है, लेकिन हमें यह नहीं पता कि कौन सा स्विच किस चीज़ के लिए है।

लंबे समय तक, वैज्ञानिक इन स्विचों को लेबल करने की कोशिश करते रहे हैं, लेकिन वे एक जासूस की तरह थे जो केवल 1,000 पहले से लिखे गए नामों की सूची का उपयोग करके किसी संदिग्ध का नाम पहचानने की कोशिश कर रहे हैं। यदि रोबोट किसी विशिष्ट चीज़ के बारे में सोच रहा है, जैसे कि "लाल फायर हाइड्रेंट" (red fire hydrant), लेकिन वह सटीक वाक्यांश उनकी सूची में नहीं है, तो वे शायद सिर्फ "आग" या "लाल" कह देंगे, जिससे असली बात छूट जाएगी।

यहाँ आता है LINE (LLM-आधारित इटरेटिव न्यूरॉन एक्सप्लेनेशन - LLM-based Iterative Neuron Explanations)। LINE एक रचनात्मक जासूसी टीम की तरह है जो केवल सूची से अनुमान नहीं लगाती; बल्कि यह "अनुमान और जाँच" (guess and check) के खेल के माध्यम से सही विवरण खुद बनाती है।

LINE कैसे काम करता है, इसके चरण यहाँ दिए गए हैं:

1. शुरुआती अनुमान (स्कोरबोर्ड)

LINE एक रफ अनुमान के साथ शुरू करता है। यह सामान्य चीजों की एक सूची (जैसे "पूल टेबल" या "बारबेल") को देखता है और देखता है कि कौन सी चीज़ इस न्यूरॉन को थोड़ा सा सक्रिय करती है। यह उन्हें एक स्कोरबोर्ड पर रखता है।

  • उपमा: कल्पना कीजिए कि आप एक रहस्यमय वस्तु का वर्णन करने की कोशिश कर रहे हैं। आप कहना शुरू करते हैं, "क्या यह एक कुर्सी है? नहीं। क्या यह एक मेज है? शायद थोड़ा बहुत।"

2. रचनात्मक लूप (जादुई टीम)

यहीं से LINE स्मार्ट बनता है। यह दो AI टूल्स का उपयोग करता है जो मिलकर काम करते हैं:

  • लेखक (LLM): एक लार्ज लैंग्वेज मॉडल जो एक मंथन करने वाले साथी (brainstorming partner) के रूप में कार्य करता है। यह वर्तमान स्कोरबोर्ड को देखता है और कहता है, "हे, 'पूल टेबल' और 'बारबेल' दोनों इस न्यूरॉन को सक्रिय कर रहे हैं। शायद यह वस्तुओं के बारे में नहीं है, बल्कि व्यायाम (exercise) के बारे में है?"
  • कलाकार (Text-to-Image Model): एक बार जब लेखक एक नया विचार सुझाता है (जैसे "स्ट्रेंथ ट्रेनिंग"), तो कलाकार तुरंत वजन उठाने वाले लोगों, योग करने वाले या खेल खेलते हुए लोगों की 50 अलग-अलग तस्वीरें बनाता है।

3. वास्तविकता की जाँच (टेस्ट)

LINE उन 50 नई तस्वीरों को वापस रोबोट के दिमाग में डाल देता है।

  • यदि "स्ट्रेंथ ट्रेनिंग" की तस्वीरों के लिए न्यूरॉन तेजी से चमकता है, तो लेखक को उच्च स्कोर मिलता है।
  • यदि न्यूरॉन अंधेरा रहता है, तो स्कोर कम होता है।

4. सुधार (इटरेशन)

यह टीम इस लूप को दोहराती है।

  • राउंड 1: "शायद यह जिम है?" (स्कोर: ठीक है)।
  • राउंड 2: "शायद यह वेटलिफ्टिंग है?" (स्कोर: बेहतर)।
  • राउंड 3: "शायद यह विशेष रूप से 'स्ट्रेंथ ट्रेनिंग' है?" (स्कोर: बेहतरीन)।

यह प्रक्रिया विचार को परिष्कृत करने के लिए चलती रहती है, जब तक कि वे सही विवरण न पा लें। अंत में, वे शीर्ष कुछ विचारों को लेते हैं और लेखक से उन्हें एक बड़े विचार (जैसे "शारीरिक व्यायाम") में सारांशित करने के लिए कहते हैं।

यह एक बड़ी बात क्यों है?

1. यह "सूची" के नियम को तोड़ता है।
पुराने तरीके शब्दों के एक निश्चित मेनू तक ही सीमित थे। यदि रोबोट एक "फोर-पोस्टर बेड" (चार खंभों वाला बिस्तर) के बारे में सोच रहा था, तो पुराना तरीका शायद सिर्फ "बिस्तर" या "बेडरूम" कह देता। LINE ने महसूस किया कि रोबोध वास्तव में उस विशिष्ट शैली के बारे में सोच रहा था: "फोर-पोस्टर"। इसने 27% अधिक नए कॉन्सेप्ट्स खोजे जिन्हें पुरानी सूचियों ने मिस कर दिया था।

2. यह प्रमाण देने के लिए चित्र बनाता है।
केवल एक शब्द कहने के बजाय, LINE उस छवि को बनाता है जो न्यूरॉन को पागल कर देती है। यह ऐसा है जैसे रोबोट कह रहा हो, "मैं जानता हूँ कि यह न्यूरॉन 'मकड़ियों' के लिए है क्योंकि देखो, मैंने मकड़ी के जाल की यह तस्वीर बनाई है—यह न्यूरॉन को चिल्लाने पर मजबूर कर देती है!" यह साबित करने में मदद करता है कि लेबल वास्तव में सही है।

3. यह बिना अंदर झाँके काम करता है।
अधिकांश तरीकों के लिए वैज्ञानिकों को रोबोट के "खुले" होने की आवश्यकता होती है ताकि वे गणित (gradients) देख सकें। LINE एक ब्लैक बॉक्स की तरह काम करता है। यह बस रोबोट से बात करता है, उसे तस्वीरें दिखाता है, और उसकी प्रतिक्रिया सुनता है। इसका मतलब है कि यह किसी भी रोबोट पर काम कर सकता है, यहाँ तक कि सबसे गुप्त वाले पर भी।

परिणाम

पेपर ने कई प्रसिद्ध रोबोट दिमागों (जैसे ResNet और ViT) पर LINE का परीक्षण किया।

  • बेहतर स्कोर: इसने पिछले तरीकों की तुलना में काफी अधिक सटीकता स्कोर प्राप्त किए (0.11 अंक तक सुधार, जो इस क्षेत्र में बहुत बड़ा है)।
  • नई खोजें: इसने पाया कि कई न्यूरॉन्स केवल एक चीज़ नहीं देख रहे थे, बल्कि वे एक श्रेणी (category) देख रहे थे (जैसे केवल "बारबेल" के बजाय "व्यायाम")।
  • दृश्य प्रमाण: इसके द्वारा उत्पन्न चित्र पुराने तरीकों द्वारा बनाई गई अजीब, धुंधली छवियों की तुलना में बहुत अधिक स्पष्ट और स्वाभाविक थे।

कमी (सीमाएँ)

लेखक अपनी खामियों के बारे में ईमानदार हैं:

  • शुरुआती पूर्वाग्रह (Starting Bias): चूंकि LINE एक सामान्य सूची (जैसे ImageNet) के साथ शुरू होता है, इसलिए यदि बहुत दुर्लभ या विशिष्ट चीजें उस शुरुआती सूची में नहीं हैं, तो यह उन्हें मिस कर सकता है (जैसे विशिष्ट चिकित्सा स्थितियाँ)।
  • एक समय में एक विचार: कभी-कभी एक न्यूरॉन "पॉलीसेमेंटिक" (polysemantic) होता है, जिसका अर्थ है कि वह दो पूरी तरह से अलग चीजों (जैसे "कुत्ते" और "आग") की परवाह करता है। LINE आमतौर पर सबसे मजबूत एक को चुनता है और दूसरे को मिस कर सकता है।
  • कलाकार की गलतियाँ: यदि ड्राइंग टूल (Text-to-Image मॉडल) एक खराब तस्वीर बनाता है, तो टेस्ट विफल हो सकता है, भले ही विचार अच्छा रहा हो।

सारांश

LINE AI के दिमाग को समझने का एक नया तरीका है। AI को शब्दों के पहले से बने बॉक्स में फिट करने के बजाय, यह सुझाव देने, उन्हें चित्रित करने और परीक्षण करने के एक रचनात्मक लूप का उपयोग करता है ताकि यह पता लगाया जा सके कि AI वास्तव में क्या सोच रहा है। यह एक ऐसे अनुवादक की तरह है जो केवल शब्दों का अनुमान नहीं लगाता, बल्कि यह सुनिश्चित करने के लिए चित्र भी बनाता है कि उसने अर्थ को सही समझा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →