Explainable AI (XAI) for Credit Scoring Model Validation
यह शोध एक व्यापक XAI-संचालित ढांचे का प्रस्ताव करता है और उसका अनुभवजन्य रूप से सत्यापन करता है जो डिजिटल बैंकिंग में भविष्य कहनेवाला प्रदर्शन को नियामक अनुपालन, पारदर्शिता और हितधारक विश्वास के साथ संतुलित करने के लिए क्रेडिट स्कोरिंग मॉडल जीवनचक्र में पोस्ट-हॉक स्पष्टीकरण तकनीकों और मात्रात्मक गुणवत्ता मेट्रिक्स को एकीकृत करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
बैंकिंग की आधुनिक दुनिया में, ऋण देने का निर्णय एक मानवीय बातचीत से बदलकर एक गणितीय गणना में बदल गया है। दशकों तक, बैंक यह तय करने के लिए सरल, पारदर्शी नियमों पर भरोसा करते थे कि किसे ऋण मिलेगा और किसे नहीं। ये नियम समझने में आसान थे: यदि आपके पास एक स्थिर नौकरी थी और कम कर्ज था, तो आपको मंजूरी मिल जाती थी; यदि नहीं, तो आपको अस्वीकार कर दिया जाता था। आज, वित्तीय संस्थान शक्तिशाली कंप्यूटर प्रोग्रामों का उपयोग करते हैं, जिन्हें अक्सर आर्टिफिशियल इंटेलिजेंस कहा जाता है, ताकि ये निर्णय लिए जा सकें। ये प्रोग्राम किसी व्यक्ति के वित्तीय इतिहास के बारे में विशाल मात्रा में जानकारी को संसाधित कर सकते हैं, जिससे वे जटिल पैटर्न खोज पाते हैं जो मानव विश्लेषकों से छूट सकते हैं। परिणामस्वरूप, ये प्रणालियाँ ऋण चूक (डिफ़ॉल्ट) के जोखिम का सटीक अनुमान लगाने में उल्लेखनीय सटीकता दिखा सकती हैं, जो अक्सर पुराने, सरल तरीकों से कहीं बेहतर होती है। हालाँकि, इस सटीकता की छलांग के साथ एक महत्वपूर्ण लागत भी आती है: ये उन्नत प्रणालियाँ "ब्लैक बॉक्स" के रूप में कार्य करती हैं। वे 'हाँ' या 'ना' का उत्तर तो देती हैं, लेकिन वे स्वाभाविक रूप से यह स्पष्ट नहीं करतीं कि उन्होंने वह चुनाव क्यों किया। यह नियामकों और उपभोक्ताओं के लिए एक गंभीर समस्या पैदा करता है। संयुक्त राज्य अमेरिका और यूरोप के कानून यह आवश्यक करते हैं कि यदि कोई बैंक ऋण देने से मना करता है, तो उसे उस निर्णय के लिए एक विशिष्ट, सटीक कारण बताना होगा। एक बैंक केवल यह नहीं कह सकता कि, "कंप्यूटर ने मना कर दिया।" उसे उन सटीक कारकों की ओर संकेत करने में सक्षम होना चाहिए जिनके कारण अस्वीकृति हुई, जैसे कि उच्च ऋण-से-आय अनुपात या छोटा क्रेडिट इतिहास। ब्लैक बॉक्स को खोलकर उसके भीतर के तर्क को देखने का तरीका न होने के कारण, बैंक कानून तोड़ने और उन लोगों का विश्वास खोने का जोखिम उठाते हैं जिनकी वे सेवा करते हैं।
उच्च-तकनीकी सटीकता और स्पष्ट व्याख्या की आवश्यकता के बीच का यह तनाव म्यूनिख तकनीकी विश्वविद्यालय में अल्बर्ट शुले के एक नए अध्ययन का केंद्र है। यह शोध एक व्यावहारिक प्रश्न पूछता है: क्या हम इन जटिल कंप्यूटर मॉडलों को स्वयं को समझाने के लिए नए उपकरणों का उपयोग कर सकते हैं, और यदि हाँ, तो कौन से उपकरण सबसे अच्छा काम करते हैं? उत्तर खोजने के लिए, शोधकर्ताओं ने एक ऐसा परीक्षण ढांचा बनाया जो निर्णय की व्याख्या को निर्णय के समान ही गंभीरता से लेता है। उन्होंने केवल यह नहीं देखा कि विभिन्न कंप्यूटर मॉडल ऋण परिणामों की कितनी अच्छी भविष्यवाणी करते हैं; उन्होंने यह भी मापा कि वे अपने विकल्पों को कितनी अच्छी तरह उचित ठहरा सकते हैं। टीम ने चार अलग-अलग प्रकार के मॉडलों का परीक्षण किया, जिसमें पारंपरिक सांख्यिकीय पद्धति से लेकर मानव मस्तिष्क की नकल करने वाले अत्यधिक जटिल न्यूरल नेटवर्क तक शामिल हैं। उन्होंने इन मॉडलों को तीन अलग-अलग स्रोतों से डेटा खिलाया: जर्मनी से 1,000 ऋण आवेदनों का एक मानक सेट, ऑस्ट्रेलिया से इसी तरह का 690 आवेदनों का सेट, और एक पीयर-टू-पीयर लेंडिंग प्लेटफॉर्म से 50,000 से अधिक ऋणों का एक विशाल, वास्तविक डेटासेट। प्रत्येक ऋण निर्णय के लिए, शोधकर्ताओं ने व्याख्या उत्पन्न करने के लिए तीन अलग-अलग तकनीकों को लागू किया। एक तकनीक, जिसे SHAP के रूप में जाना जाता है, अंतिम स्कोर में प्रत्येक जानकारी के योगदान की गणना करती है। दूसरी, जिसे LIME कहा जाता है, एक सरल, अस्थायी मॉडल बनाती है जो यह अनुमान लगाती है कि एक विशिष्ट मामले में जटिल प्रणाली कैसे सोच रही है। तीसरी तकनीक 'काउंटरफैक्चुअल' (प्रति-तथ्यात्मक) व्याख्याएँ प्रदान करती है, जो उधारकर्ता को ठीक से बताती हैं कि किस छोटे बदलाव से अस्वीकृति को स्वीकृति में बदला जा सकता था, जैसे कि ऋण अनुपात को एक विशिष्ट राशि से कम करना।
अध्ययन से पता चला कि सभी व्याख्याएँ समान नहीं होती हैं, और उपकरण का चुनाव अनुपालन के लिए बहुत महत्वपूर्ण है। जब शोधकर्ताओं ने यह मापा कि एक व्याख्या मॉडल के वास्तविक चिंतन को कितनी निष्ठा से दर्शाती है, तो SHAP विधि लगभग पूर्ण सिद्ध हुई। इसने सभी परीक्षण किए गए विभिन्न कंप्यूटर सिस्टमों में 99 प्रतिशत से अधिक की सटीकता के साथ मॉडल के तर्क से निरंतर मेल खाया। इसके विपरीत, LIME विधि कम विश्वसनीय थी। हालांकि यह सरल मॉडलों के लिए काफी अच्छी तरह से काम करती थी, लेकिन जैसे-जैसे मॉडल अधिक जटिल होते गए, इसकी सटीकता काफी गिर गई, और कभी-कभी यह निर्णय के पीछे के वास्तविक तर्क को पकड़ने में विफल रही। शोधकर्ताओं ने इन व्याख्याओं की स्थिरता का भी परीक्षण किया, जो निरंतरता का एक माप है। यदि दो आवेदकों के वित्तीय प्रोफाइल बहुत समान हैं, तो उन्हें अस्वीकृति के लिए बहुत समान कारण मिलने चाहिए। अध्ययन में पाया गया कि SHAP ने अत्यधिक स्थिर उत्तर दिए, जिसका निरंतरता स्कोर 0.90 से ऊपर था। हालाँकि, LIME बहुत अधिक अनिश्चित थी, जिसका निरंतरता स्कोर सबसे जटिल मॉडलों के लिए 0.45 तक गिर गया। यह अस्थिरता बैंकों के लिए एक बड़ा जोखिम है, क्योंकि इससे दो लगभग समान आवेदकों को अस्वीकृति के अलग-अलग कारण मिल सकते हैं, जो निष्पक्ष ऋण कानूनों का उल्लंघन होगा।
तकनीकी सटीकता से परे, अध्ययन ने यह भी देखा कि ये व्याख्याएँ कानूनी आवश्यकताओं को कितनी अच्छी तरह पूरा करती हैं और उन लोगों के लिए कितनी समझने योग्य हैं जो वास्तव में इनका उपयोग करते हैं। शोधकर्ताओं ने अनुपालन अधिकारियों और ऋण अधिकारियों के एक समूह से व्याख्याओं को रेट करने के लिए कहा। SHClP विधि ने स्पष्टता और उपयोगिता के लिए उच्चतम अंक प्राप्त किए, जिसकी औसत रेटिंग 5 में से 4.2 थी। काउंटरफैक्चुअल व्याख्याओं को भी अच्छी प्रतिक्रिया मिली, विशेष रूप से इसलिए क्योंकि वे सीधे इस प्रश्न का उत्तर देती हैं कि एक उधारकर्ता स्वीकृति प्राप्त करने के लिए क्या बदल सकता है। हालाँकि, अध्ययन में पाया गया कि जबकि सबसे जटिल मॉडल, जैसे कि XGBoost, उच्चतम भविष्य कहने वाली सटीकता प्राप्त करते हैं, वे एक समझौते के साथ आते हैं। इन मॉडलों को अधिक जटिल व्याख्याओं की आवश्यकता होती है जो सरल मॉडलों की तुलना में थोड़ी कम स्थिर होती हैं। शोधकर्ताओं ने निष्कर्ष निकाला कि कई बैंकों के लिए, एक थोड़ा कम सटीक मॉडल जो अधिक स्थिर और विश्वसनीय व्याख्या प्रदान करता है, एक सुरक्षित विकल्प हो सकता है। ऐसा इसलिए है क्योंकि सबसे जटिल प्रणालियों से भविष्यवाणियों की सटीकता में मामूली लाभ, नियामक उल्लंघनों के बढ़ते जोखिम या मॉडल के तर्क को मान्य करने की कठिनाई को आवश्यक रूप से उचित नहीं ठहराता है।
शोध का शायद सबसे महत्वपूर्ण निष्कर्ष यह था कि ये व्याख्या उपकरण छिपे हुए पूर्वाग्रह के लिए एक रडार के रूप में कार्य कर सकते हैं। जब शोधकर्ताओं ने विभिन्न समूहों के लिए ऋण अस्वीकरियों के कारणों का विश्लेषण किया, तो उन्होंने सूक्ष्म लेकिन सांख्यिकीय रूप से महत्वपूर्ण अंतर पाए। उदाहरण के लिए, बड़े लेंडिंग डेटासेट में, प्रणाली महिला आवेदकों को अस्वीकार करने के मुख्य कारण के रूप में रोजगार इतिहास को उद्धृत करती थी, जबकि इसने पुरुष आवेदकों को अस्वीकार करने के प्राथमिक कारण के रूप में ऋण-से-आय अनुपात को उद्धृत किया। यह पैटर्न बताता है कि मॉडल एक कारक का दूसरे के विकल्प के रूप में उपयोग कर रहा है, जिसे प्रॉक्सी भेदभाव (proxy discrimination) कहा जाता है, जिसे पारंपरिक निष्पक्षता परीक्षण मिस कर सकते हैं। केवल अंतिम हाँ-या-ना के परिणामों के बजाय, व्याख्याओं को देखकर, शोधकर्ताओं ने दिखाया कि बैंक इन अनुचित पैटर्नों का पता लगा सकते हैं और उन्हें कानूनी नुकसान पहुँचाने से पहले संबोधित कर सकते हैं। अध्ययन अंततः बैंकों के लिए अपने AI सिस्टम को मान्य करने का एक नया तरीका प्रस्तावित करता है। केवल यह जाँचने के बजाय कि क्या एक मॉडल डिफ़ॉल्ट की भविष्यवाणी सही ढंग से करता है, बैंकों को अब यह भी जाँचना चाहिए कि क्या मॉडल अपने निर्णयों को स्पष्ट रूप से, लगातार और निष्पक्ष रूप से समझा सकता है। यह दृष्टिकोण सुनिश्चित करता है कि आर्टिफिशियल इंटेलिजेंस की शक्ति का उपयोग कानून द्वारा आवश्यक पारदर्शिता और जवाबदेही से समझौता किए बिना ऋण तक पहुँच का विस्तार करने के लिए किया जा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।