← नवीनतम पेपर
💻 computer science

EnsembleSHAP: Faithful and Certifiably Robust Attribution for Random Subspace Method

यह शोधपत्र EnsembleSHAP को प्रस्तुत करता है, जो रैंडम सबस्पेस मेथड (Random Subspace Method) के लिए एक गणनात्मक रूप से कुशल और प्रमाणित रूप से सुदृढ़ फीचर एट्रिब्यूशन विधि है, जो गोपनीयता-संरक्षण और स्पष्टीकरण-संरक्षण हमलों के विरुद्ध प्रमाणिक गारंटियों के साथ निष्ठावान स्पष्टीकरण प्रदान करने के लिए स्वाभाविक रूप से इसके गणनात्मक उपोत्पादों का पुन: उपयोग करती है।

मूल लेखक: Yanting Wang, Jinyuan Jia

प्रकाशित 2026-04-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yanting Wang, Jinyuan Jia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट सुरक्षा टीम है जो सैकड़ों अलग-अलग विशेषज्ञों से बनी है। यह टीम खतरनाक या हानिकारक इनपुट (जैसे कि कोई हैकर कंप्यूटर को धोखा देने की कोशिश कर रहा हो या AI चैटबॉट पर जेलब्रेक का प्रयास कर रहा हो) को पहचानने के लिए डिज़ाइन की गई है।

यह टीम इस प्रकार काम करती है: पूरे इनपुट को एक साथ देखने के बजाय, वे इसे विभाजित कर देते हैं। प्रत्येक विशेषज्ञ केवल इनपुट के एक यादृच्छिक (random) चुनिकी शब्दों (या विशेषताओं) को देखता है, एक अनुमान लगाता है, और फिर पूरी टीम अंतिम उत्तर पर मतदान करती है। इसे रैंडम सबस्पेस मेथड (Random Subspace Method) कहा जाता है। पूरी टीम को बेवकूफ बनाना हैकर्स के लिए बहुत कठिन है क्योंकि उन्हें यह नहीं पता होता कि प्रत्येक विशेषज्ञ किन विशिष्ट शब्दों को देख रहा है।

समस्या:
जबकि यह टीम हमलों के खिलाफ लड़ने में बेहतरीन है, कोई नहीं जानता कि उन्होंने एक विशिष्ट निर्णय क्यों लिया।

  • यदि टीम कहती है, "यह संदेश हानिकारक है," तो उपयोगकर्ता जानना चाहता है: "किन विशिष्ट शब्दों ने आपको ऐसा कहने पर मजबूर किया?"
  • यदि कोई हैकर पूरी टीम को चकमा देने में सफल हो जाता है, तो रक्षकों को जानना चाहिए: "हैकर ने हमारी सुरक्षा को तोड़ने के लिए किन शब्दों को बदला?"

मौजूदा तरीके इस सवालों के जवाब देने के लिए एक निजी जासूस को नियुक्त करने जैसे हैं जिसे हर एक शब्द के संभावित संयोजन के लिए टीम के प्रत्येक विशेषज्ञ का एक-एक करके इंटरव्यू लेना पड़ता है। इसमें बहुत समय लगता है (यह बहुत महंगा है) और, इससे भी बदतर, एक चतुर हैकर उनके हमले को इस तरह से बदल सकता है कि जासूस की रिपोर्ट बिल्कुल पहले जैसी ही दिखे, जिससे असली अपराधी छिप जाए।

समाधान: EnsembleSHAP
इस पेपर के लेखक, यांटिंग वांग और जिनयुआन जिया ने एक नया टूल बनाया है जिसे EnsembleSHAP कहा जाता है। इसे एक सुपर-कुशल, ईमानदार और अन-हैक करने योग्य (un-hackable) अनुवादक के रूप में सोचें जो इस सुरक्षा टीम के लिए काम करता है।

यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "फ्री लंच" (कंप्यूटेशनल दक्षता)

आमतौर पर, किसी निर्णय को समझाने के लिए, आपको पूरी टीम को लाखों अलग-अलग परिदृश्यों के माध्यम से चलाना पड़ता है।

  • पुराना तरीका: जासूस पूछता है, "क्या होगा अगर हम शब्द A को हटा दें?" (टीम चलती है)। "क्या होगा अगर हम शब्द B को हटा दें?" (टीम फिर से चलती है)। यह धीमा है।
  • EnsembleSHHAP: टीम ने पहले ही सारा कठिन काम कर लिया है! उन्होंने पहले ही हजारों यादृच्छिक शब्द संयोजनों को देखा है ताकि वे अपने अंतिम वोट तक पहुँच सकें। EnsembleSHAP एक स्मार्ट अकाउंटेंट की तरह है जो टीम के मौजूदा नोट्स को देखता है और कहता है, "ओह, मैं समझ गया! चूंकि विशेषज्ञ #42 ने शब्दों A, B और C को देखा, और विशेषज्ञ #43 ने A, B और D को देखा, तो हम बिना किसी से नया काम कराए यह गणना कर सकते हैं कि शब्द A कितना 'क्रेडिट' पाने का हकदार है।"
  • परिणाम: यह तुरंत और मुफ्त है।

2. "ईमानदार स्कोरकार्ड" (विश्वसनीयता/Faithfulness)

यह टूल इनपुट के हर शब्द को एक "स्कोर" देता है।

  • यदि टीम कहती है कि एक वाक्य "हानिकारक" है, तो यह टूल उन शब्दों को हाइलाइट करता है जिन्होंने उस स्कोर में सबसे अधिक योगदान दिया।
  • यह गारंटी देता है कि यदि आप शीर्ष-स्कोर वाले शब्दों को हटा देते हैं, तो टीम का निर्णय वास्तव में बदल जाएगा। यह केवल अनुमान नहीं लगा रहा है; यह टीम के वास्तविक तर्क के प्रति गणितीय रूप से विश्वसनीय (faithful) होने की गारंटी देता है।

3. "अनमास्किंग शील्ड" (प्रमाणित मजबूती/Certified Robustness)

यह सबसे रोमांचक हिस्सा है। कल्पना कीजिए कि एक हैकर एक वाक्य में एक बुरा शब्द डालने की कोशिश करता है लेकिन वह अपने हमले को इस तरह छिपाने की कोशिश करता है कि व्याख्या केवल "सुरक्षित" शब्दों के बारे में लगे।

  • हमला: एक हैकर AI को धोखा देने के लिए 3 शब्द बदलता है, लेकिन वह यह दिखाने की कोशिश करता है कि व्याख्या केवल 3 निर्दोष शब्दों की परवाह करती है।
  • रक्षा: EnsembleSHAP के पास एक गणितीय ढाल (mathematical shield) है। यह एक "प्रमाणित पहचान दर" (Certified Detection Rate) की गणना कर सकता है।
    • उपमा: कल्पना कीजिए कि एक हैकर कमरे में 3 जासूसों को चुपके से भेजने की कोशिश कर रहा है। EnsembleSHAP गणितीय रूप से सिद्ध कर सकता है: "चाहे आप उन्हें छिपाने की कितनी भी कोशिश करें, यदि आप परिणाम बदलते हैं, तो आपके कम से कम 2 जासूसों को हमारे द्वारा रिपोर्ट किए गए शीर्ष 5 सबसे महत्वपूर्ण शब्दों में होना ही होगा।"
    • यह हैकर को खुद को उजागर करने के लिए मजबूर करता है। आप व्याख्या को धोखा दिए बिना व्याख्या को ही नहीं बदल सकते।

यह क्यों मायने रखता है?

  • सामान्य उपयोगकर्ताओं के लिए: यदि कोई AI आपके अनुरोध को "ना" कहता है, तो आप अंततः देख सकते हैं कि ऐसा क्यों हुआ और जान सकते हैं कि यह एक निष्पक्ष निर्णय है या कोई तकनीकी त्रुटि।
  • सुरक्षा विशेषज्ञों के लिए: यदि कोई हैकर रक्षा को तोड़ देता है, तो यह टूल एक फोरेंसिक स्कैनर की तरह काम करता है जो तुरंत उन सटीक शब्दों की ओर इशारा करता है जिनका उपयोग हैकर ने अंदर घुसने के लिए किया था, जिससे उनके लिए अपने पदचिह्नों को छिपाना असंभव हो जाता है।

संक्षेप में:
EnsembleSHAP एक जादुई लेंस है जो हमें यह देखने की अनुमति देता है कि एक जटिल, यादृच्छिक सुरक्षा टीम कैसे सोचती है। यह तेज़ है क्योंकि यह उस काम का उपयोग करता है जो टीम ने पहले ही किया है, और यह सुरक्षित है क्योंकि यह गणितीय रूप से गारंटी देता है कि यदि कोई टीम को धोखा देने की कोशिश करता है, तो यह लेंस धोखेबाज की चालों को उजागर कर देगा। यह इस स्तर का "प्रमाण" देने वाला अपनी तरह का पहला टूल है कि व्याख्या ईमानदार और अन-हैक करने योग्य है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →