← नवीनतम पेपर
🤖 machine learning

Learning Quantifiable Visual Explanations Without Ground-Truth

यह शोध पत्र इनपुट गड़बड़ी (input perturbation) और आवश्यकता/पर्याप्तता (necessity/sufficiency) पर आधारित एक्सप्लेनेबल एआई (XAI) विधियों के मूल्यांकन के लिए एक ग्राउंड-ट्रुथ-मुक्त, मात्रात्मक मीट्रिक प्रस्तुत करता है, जिसका उपयोग फिर एक नवीन एडेप्टर मॉड्यूल को प्रशिक्षित करने के लिए किया जाता है जो ब्लैक-बॉक्स मॉडल के प्रदर्शन से समझौता किए बिना उनके लिए बेहतर कारण संबंधी स्पष्टीकरण (causal explanations) उत्पन्न करता है।

मूल लेखक: Amritpal Singh, Andrey Barsky, Mohamed Ali Souibgui, Ernest Valveny, Dimosthenis Karatzas

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Amritpal Singh, Andrey Barsky, Mohamed Ali Souibgui, Ernest Valveny, Dimosthenis Karatzas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन मौन शेफ (एक डीप लर्निंग मॉडल) है जो हर बार एक बेहतरीन भोजन (एक भविष्यवाणी) बना सकता है। आप पूछते हैं, "आपने इस सूप में नमक क्यों डाला?" शेफ बस पूरे बर्तन की ओर इशारा करता है और कहता है, "क्योंकि इसमें सामग्री है।" यह बहुत मददगार नहीं है। आप जानना चाहते हैं कि नमक का वह सटीक चुटकी भर हिस्सा कौन सा था जिसने फर्क डाला।

आर्टिफिशियल इंटेलिजेंस की दुनिया में, यह एक्सप्लेनेबल एआई (XAI) की समस्या है। हमें यह जानने की जरूरत है कि किसी छवि के कौन से हिस्से (जैसे बिल्ली के कान का एक पिक्सेल) ने वास्तव में कंप्यूटर को यह तय करने के लिए प्रेरित किया कि, "हाँ, यह एक बिल्ली है।"

समस्या यह है कि हमारे पास कोई "उत्तर कुंजी" (ग्राउंड ट्रुथ) नहीं है जिससे हम जांच सकें कि शेफ का स्पष्टीकरण सही है या नहीं। हम कंप्यूटर से यह नहीं पूछ सकते कि, "तुम्हें वास्तव में क्या लगा कि यह क्या था?" क्योंकि कंप्यूटर खुद को मानवीय शब्दों में समझाने के बारे में नहीं जानता।

यह पेपर इस समस्या को हल करने के लिए दो मुख्य चीजें पेश करता है: स्पष्टीकरणों को मापने के लिए एक नया रूलर (पैमाना) और बेहतर स्पष्टीकरण बनाने के लिए एक नया टूल (उपकरण)

1. नया रूलर: MSI (मिनिमैलिटी-सफिशिएंसी इंटीग्रेशन)

कल्पित कीजिए कि आप अपने दोस्त को समझा रहे हैं कि आपने एक विशिष्ट फिल्म क्यों चुनी।

  • पुराना तरीका (मौजूदा मेट्रिक्स): आप कह सकते हैं, "मैंने इसे इसलिए चुना क्योंकि इसके कलाकार, निर्देशक, संगीत, लाइटिंग, पॉपकॉर्न और बाहर के मौसम ने मुझे प्रभावित किया।" यह तकनीकी रूप से सच है (उन सभी चीजों ने आपको प्रभावित किया), लेकिन यह बहुत अधिक जानकारी है। यह एक किताब के पूरे पन्ने को हाइलाइट करने जैसा है ताकि यह दिखाया जा सके कि कहानी कहाँ होती है।
  • समस्या: मौजूदा "रूलर" अक्सर इन लंबे, अव्यवस्थित स्पष्टीकरणों को उच्च स्कोर देते हैं। उन्हें इस बात की परवाह नहीं होती कि आपने अप्रासंगिक विवरण (जैसे मौसम) शामिल किए हैं या नहीं।
  • नया रूलर (MSI): लेखकों ने MSI नामक एक नया मेट्रिक बनाया है। यह एक स्पष्टीकरण को दो नियमों के आधार पर परखता है:
    1. सफिशिएंसी (पर्याप्तता): यदि मैं आपको केवल महत्वपूर्ण हिस्से दूँ (कलाकार और कहानी), तो क्या आप अभी भी फिल्म का अनुमान लगा सकते हैं? (हाँ, यह "सफिशिएंट" है)।
    2. मिनिमैलिटी (न्यूनतमता): क्या आपने केवल महत्वपूर्ण हिस्से शामिल किए, या आपने मौसम और पॉपकॉर्न को भी साथ खींच लिया? (आपको "मिनिमल" होना चाहिए)।

एनालॉजी (उपमा): मंच पर एक स्पॉटलाइट के बारे में सोचें।

  • एक बुरा स्पष्टीकरण पूरे थिएटर पर रोशनी डाल देता है, जिसमें दर्शक और एग्जिट साइन भी शामिल हैं। यह "सफिशिएंट" है (आप अभिनेता को देख सकते हैं), लेकिन यह "मिनिमल" नहीं है।
  • एक अच्छा स्पष्टीकरण केवल अभिनेता के चेहरे पर एक केंद्रित, चमकदार बीम की तरह होता है। यह दोनों है—सफिशिएंट (आप अभिनेता को देखते हैं) और मिनिमल (कोई बर्बाद रोशनी नहीं)।

पेपर का दावा है कि MSI पुराने रूलर्स की तुलना में एक केंद्रित स्पॉटलाइट और एक अव्यवस्थित फ्लडलाइट के बीच अंतर पहचानने में बेहतर है। यह उन स्पष्टीकरणों को पुरस्कृत करता है जो "बिल्कुल सही" हैं—न बहुत बड़े, न बहुत छोटे।

2. नया टूल: LAX (लर्नेबल अडैप्टर एक्सप्लेनेशन)

अब जब हमारे पास एक बेहतर रूलर है, तो हम AI को बेहतर उत्तर देने के लिए कैसे सिखाएं?

आमतौर पर, AI को खुद को समझाने के लिए सिखाने के लिए, आपको एक शिक्षक की आवश्यकता होती है जिसके पास उत्तर कुंजी हो (जैसे, एक इंसान बिल्ली के चारों ओर घेरा बनाता है)। लेकिन हमारे पास वे उत्तर कुंजियाँ नहीं हैं।

समाधान: लेखकों ने LAX नामक एक "प्लग-इन" मॉड्यूल बनाया है।

  • यह कैसे काम करता है: कल्पना कीजिए कि AI एक ब्लैक बॉक्स है। LAX एक छोटा, स्मार्ट अडैप्टर है जिसे आप बॉक्स के बाहर क्लिप करते हैं।
  • प्रशिक्षण (ट्रेनिंग): किसी मानव शिक्षक से पूछने के बजाय, LAX "क्या होगा अगर?" का खेल खेलता है।
    1. यह एक छवि को देखता है और उन हिस्सों पर एक "स्पॉटलाइट" (एक मास्क) बनाता है जिन्हें यह महत्वपूर्ण समझता है।
    2. यह बाकी छवि को ढक देता है।
    3. यह ब्लैक बॉक्स से पूछता है: "यदि मैं तुम्हें केवल मेरी स्पॉटलाइट के नीचे वाले हिस्से दिखाऊं, तो क्या तुम अभी भी सही उत्तर का अनुमान लगा सकते हो?"
    4. यदि ब्लैक बॉक्स कहता है "हाँ," तो LAX को सफिशिएंसी के लिए एक पॉइंट मिलता है।
    5. यदि LAX ने स्पॉटलाइट को बहुत बड़ा बना दिया (बहुत अधिक हिस्सा कवर कर लिया), तो उसे मिनिमैलिटी के लिए दंड (पेनल्टी) मिलता है।
    6. LAX अपनी स्पॉटलाइट को तब तक एडजस्ट करता रहता है जब तक कि वह सबसे छोटा, सबसे सटीक क्षेत्र न ढूंढ ले जो ब्लैक बॉक्स को सही उत्तर तक पहुँचने में मदद करे।

परिणाम: पेपर दिखाता है कि यह LAX टूल, जिसे उनके नए MSI रूलर का उपयोग करके प्रशिक्षित किया गया है, ऐसे "स्पॉटलाइट्स" बनाता है जो अन्य लोकप्रिय तरीकों (जैसे Grad-CAM) की तुलना में बहुत अधिक शार्प और सटीक हैं। यह बिना किसी मानव द्वारा यह दिखाए कि सुई कहाँ है, "भूसे के ढेर में सुई" को खोजने में सक्षम है।

दावों का सारांश

  • समस्या: हम यह नहीं माप सकते कि AI के स्पष्टीकरण अच्छे हैं या नहीं क्योंकि हमारे पास तुलना करने के लिए कोई "सही" उदाहरण नहीं हैं।
  • मेट्रिक (MSI): स्पष्टीकरणों को स्कोर करने का एक नया तरीका जो उन्हें केवल बहुत अधिक क्षेत्र कवर करने के बजाय सटीक (मिनिमल) और प्रभावी (सफिशिएंट) होने के लिए पुरस्कृत करता है।
  • विधि (LAX): एक नई प्रशिक्षण तकनीक जो एक "सेल्फ-चेक" गेम खेलकर AI को ये सटीक स्पष्टीकरण उत्पन्न करना सिखाती है, जिसमें किसी मानव-लेबल वाले डेटा की आवश्यकता नहीं होती है।
  • परिणाम: संख्याओं, पक्षियों और रोजमर्रा की वस्तुओं की छवियों पर परीक्षण करने पर, LAX विधि ने ऐसे स्पष्टीकरण दिए जिन्होंने नए MSI मेट्रिक पर उच्च स्कोर किया और मौजूदा तरीकों की तुलना में अधिक "मानवीय-सहज" (सही विशेषताओं पर ध्यान केंद्रित करना) दिखाई दिए।

पेपर निष्कर्ष निकालता है कि इस नए रूलर और इस नए प्रशिक्षण टूल का उपयोग करके, हम AI सिस्टम को अपने आप को अधिक स्पष्ट रूप से और विश्वसनीय रूप से समझाने के लिए प्राप्त कर सकते हैं, भले ही हमारे पास सत्यापन के लिए कोई टेक्स्टबुक उत्तर कुंजी न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →