← नवीनतम पेपर
🤖 machine learning

Decomposition of Evidence, Contradiction, and Fragility in Perturbation Responses

यह शोध पत्र DECAF को प्रस्तुत करता है, जो एक नवीन ढांचा है जो व्यवधान-आधारित (perturbation-based) मॉडल स्पष्टीकरणों को विशिष्ट साक्ष्य (evidence), विरोधाभास (contradiction), और भंगुरता (fragility) घटकों में विभाजित करता है, और यह प्रदर्शित करता है कि यह प्रक्षेपवक्र-जागरूक (trajectory-aware) दृष्टिकोण विविध विज़न और सारणीबद्ध (tabular) कार्यों में सटीकता, दक्षता और व्याख्यात्मकता में पारंपरिक परिमाण-आधारित एट्रिब्यूशन विधियों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Lei You

प्रकाशित 2026-08-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lei You

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह समझने की कोशिश कर रहे हैं कि आपके एक दोस्त ने एक विशिष्ट चुनाव क्यों किया, जैसे कि नीले रंग के बजाय लाल शर्ट चुनना। आप पूछ सकते हैं, "उन्होंने रंग के प्रति कितनी प्रतिक्रिया दी?" यदि उन्होंने तुरंत लाल शर्ट झपट ली, तो आप कहेंगे, "वाह, बहुत बड़ी प्रतिक्रिया!" लेकिन यहाँ पेचीदा बात यह है: एक बड़ी प्रतिक्रिया का मतलब हमेशा एक जैसा नहीं होता। हो सकता है कि उन्हें लाल शर्ट बहुत पसंद आई हो (एक अच्छा कारण)। हो सकता है कि उन्हें नीली शर्ट से इतनी नफरत थी कि उन्होंने लाल वाली को बस उससे दूर होने के लिए झपट लिया हो (एक बुरा कारण)। या शायद उन्होंने लाल शर्ट इसलिए उठाई क्योंकि वे भ्रमित थे, और बाद में उन्हें एहसास हुआ कि वे वास्तव में नीले रंग को ही पसंद करते थे (एक क्षणिक, नाजुक प्रतिक्रिया)।

यह "AI व्याख्यात्मकता" (AI explainability) की दुनिया है, एक ऐसा क्षेत्र जहाँ वैज्ञानिक कंप्यूटर मॉडल के भीतर झाँकने की कोशिश करते हैं कि वे क्या सोच रहे हैं। लंबे समय तक, इसका मुख्य उपकरण प्रतिक्रिया के "परिमाण" (magnitude) को मापना था—मूल रूप से, जब आप इनपुट में थोड़ा बदलाव करते हैं तो AI के उत्तर में कितना बड़ा परिवर्तन आता है। यह एक दरवाजा जोर से बंद होने की आवाज मापने जैसा है। लेकिन यहाँ पेचीदा बात यह है कि यह जानना कि दरवाजा जोर से टकराया है, यह नहीं बताता कि दरवाजा गुस्से में, खुशी में, या हवा के एक झोंके से टकराया जो टिक भी नहीं पाया था। लेखक, जो तकनीकी विश्वविद्यालय डेनमार्क के लेई यू (Lei You) के नेतृत्व में हैं, तर्क देते हैं कि हम शोर के पीछे के अर्थ को अनदेखा कर रहे थे, और उन्होंने इसे सुलझाने का एक नया तरीका बनाया है।

यह पेपर DECAF नामक एक विधि पेश करता है (जिसका अर्थ है Decomposition of Evidence, Contradiction, and Fragility - साक्ष्य, विरोधाभास और भंगुरता का अपघटन)। DECAF को एक सुपर-स्मार्ट जासूस के रूप में समझें जो केवल यह नहीं सुनता कि दरवाजा कितनी जोर से टकराया, बल्कि यह भी देखता है कि व्यक्ति दरवाजे की ओर कैसे बढ़ा।

DECAF कैसे काम करता है, इसे एक सरल कहानी से समझते हैं: कल्पना कीजिए कि आप एक जादूगर को देख रहे हैं जो एक कार्ड को किंग (राजा) से क्वीन (रानी) में बदल रहा है।

  1. साक्ष्य (Evidence): जैसे-जैसे जादूगर कार्ड दिखाता है, यदि परिवर्तन अंतिम परिणाम (क्वीन) की ओर बढ़ता हुआ महसूस होता है, तो DECAF इसे Evidence कहता है। यह प्रतिक्रिया का वह हिस्सा है जो अंतिम निर्णय का समर्थन करता है।
  2. विरोधाभास (Contradiction): कभी-कभी, कार्ड एक पल के लिए किंग जैसा दिख सकता है, फिर क्वीन, और फिर वापस किंग, इससे पहले कि वह अंततः क्वीन पर स्थिर हो जाए। यदि प्रतिक्रिया किसी भी बिंदु पर अंतिम परिणाम के विरुद्ध जाती है, तो DECAF इसे Contradiction कहता है। यह AI के कहने जैसा है, "रुको, मुझे लगा यह किंग था!" इससे पहले कि वह अपना मन बदल ले।
  3. भंगुरता (Fragility): अंत में, कल्पना कीजिए कि जादूगर एक ऐसा कार्ड दिखाता है जो क्वीन जैसा दिखता है, लेकिन जब आप अंत में करीब से देखते हैं, तो वह वास्तव में कागज का एक खाली टुकड़ा होता है। कार्ड बदला हुआ लगा, लेकिन अंतिम परिणाम "कुछ नहीं" था। यदि AI जादू के दौरान तीव्र प्रतिक्रिया देता है लेकिन अंतिम उत्तर लगभग शून्य होता है, तो DECAF इसे Fragility कहता है। यह एक ऐसी प्रतिक्रिया है जो केवल उस रास्ते के कारण मौजूद है जो लिया गया था, न कि किसी वास्तविक अंतर के कारण।

लेखक ने इस विचार का परीक्षण कुछ अलग तरीकों से किया। सबसे पहले, उन्होंने नियंत्रित वीडियो गेम और पहेलियाँ बनाईं जहाँ वे ठीक जानते थे कि AI को क्या करना चाहिए था। उन्होंने पाया कि DECAF यह पहचानने में सक्षम था कि क्या AI एक "शॉर्टकट" (जैसे पृष्ठभूमि के रंग के आधार पर अनुमान लगाना) पर निर्भर था बनाम वास्तविक वस्तु पर। यदि AI शॉर्टकट का उपयोग कर रहा था, तो DECAF का "Evidence" स्कोर उस व्यवहार से पूरी तरह मेल खाता था। यदि AI भ्रमित था या अपना मन बदल रहा था, तो "Contradiction" स्कोर तेजी से बढ़ जाता था।

फिर, उन्होंने 72 अलग-अलग AI मॉडलों के एक विशाल परीक्षण के साथ इसे वास्तविक दुनिया में ले गए, जो ImageNet-9 डेटासेट (विभिन्न पृष्ठभूमियों वाली तस्वीरों का एक संग्रह) से छवियों को देख रहे थे। उन्होंने उन मामलों की तुलना की जहाँ AI की प्रतिक्रिया की "ऊँचाई" (loudness) बिल्कुल समान थी लेकिन अंतर्निहित व्यवहार अलग-अलग थे।

  • परिणाम: यदि आप केवल प्रतिक्रिया की ऊँचाई (magnitude) को देखते, तो आप सही व्यवहार का अनुमान केवल 35.0% बार ही लगा पाते। यह मूल रूप से एक सिक्के के उछाल (coin flip) जैसा था।
  • DECAF का समाधान: जब उन्होंने प्रतिक्रिया के प्रकार (Evidence बनाम Contradiction बनाम Fragility) को देखने के लिए DECAF का उपयोग किया, तो उन्होंने 96.4% बार सही उत्तर प्राप्त किया।

इस पेपर ने यह भी खोजा कि हम AI को जानकारी कैसे प्रकट करते हैं। उन्होंने छवि दिखाने के दो तरीकों का परीक्षण किया: एक जहाँ पूरी तस्वीर धीरे-धीरे उभरती है (जैसे एक मिश्रण/blend), और दूसरा जहाँ छवि को टुकड़ों में दिखाया जाता है (जैसे एक पहेली)। उन्होंने पाया कि छवि को दिखाने का तरीका बदलने से प्रतिक्रिया की कुल "ऊँचाई" (loudness) लगभग 80% तक बदल गई। हालाँकि, "Evidence" (ठोस, मजबूत कारण) में बहुत कम बदलाव आया। इसके बजाय, "Fragility" (भ्रमित करने वाला, पथ-निर्भर शोर) विस्फोट की तरह बढ़ा, जो 4 गुना से अधिक बढ़ गया। यह साबित करता है कि प्रतिक्रिया का कुल आकार भ्रामक हो सकता है; यह अक्सर केवल इस बात के प्रति AI की संवेदनशीलता बताता है कि चित्र को दिखाने का तरीका क्या है, न कि स्वयं चित्र के बारे में।

अंत में, लेखक ने दिखाया कि DECAF अविश्वसनीय रूप से कुशल है। 1 बिलियन पैरामीटर्स वाले एक विशाल AI मॉडल (एक DINOv2 मॉडल) पर, DECAF अपना काम अन्य लोकप्रिय तरीकों की तुलना में 4.75 गुना कम समय और 2.36 गुना कम मेमोरी के साथ कर सकता है, जबकि यह काम उतनी ही अच्छी तरह से करता है।

संक्षेप में, यह पेपर सुझाव देता है कि हम इस बात पर बहुत अधिक ध्यान केंद्रित कर रहे थे कि AI कितनी प्रतिक्रिया देता है और इस पर पर्याप्त ध्यान नहीं दे रहे थे कि उस प्रतिक्रिया का अर्थ क्या है। प्रतिक्रियाओं को Evidence (समर्थन), Contradiction (विरोध) और Fragility (क्षणिक शोर) में तोड़कर, DECAF हमें इस बात की बहुत स्पष्ट और ईमानदार तस्वीर देता है कि उनके डिजिटल मस्तिष्क वास्तव में क्या सोच रहे हैं। यह एक ऐसा उपकरण है जो केवल दरवाजे के टकराने की आवाज नहीं मापता, बल्कि यह समझने में भी मदद करता है कि दरवाजा क्यों टकराया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →