← नवीनतम पेपर
💻 computer science

Clinical explainable AI evaluations prioritize trust over effective human oversight: a scoping review

49 नैदानिक XAI अध्येशनों का यह स्कोपिंग रिव्यू दर्शाता है कि मूल्यांकन विफलता और पूर्वाग्रह का पता लगाने जैसी महत्वपूर्ण निगरानी क्षमताओं के बजाय उपयोगकर्ता के विश्वास और धारणाओं को अत्यधिक प्राथमिकता देते हैं, जो गैर-सत्यापित मापों पर भारी निर्भर हैं और शायद ही कभी तैनात प्रणालियों पर प्रदर्शन का आकलन करते हैं।

मूल लेखक: Nicolas Frey, Louis Agha-Mir-Salim, Linn Renner, Stefan Haufe, Lily Voge, Felix Balzer

प्रकाशित 2026-09-24
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nicolas Frey, Louis Agha-Mir-Salim, Linn Renner, Stefan Haufe, Lily Voge, Felix Balzer

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक अस्पतालों में, डॉक्टर बीमारियों के निदान और उपचार के सुझाव देने के लिए कंप्यूटर प्रोग्रामों पर तेजी से निर्भर होते जा रहे हैं। ये उपकरण, जो जटिल गणितीय मॉडलों पर आधारित हैं, किसी भी इंसान की तुलना में कहीं अधिक तेजी से मरीजों के विशाल डेटा को प्रोसेस कर सकते हैं। हालाँकि, ये मॉडल अक्सर एक "ब्लैक बॉक्स" की तरह काम करते हैं, जो यह बताए बिना कि वे उस निष्कर्ष तक कैसे पहुँचे, केवल एक सिफारिश देते हैं। इस अपारदर्शिता को ठीक करने के लिए, शोधकर्ताओं ने 'एक्सप्लेनेबल आर्टिफिशियल इंटेलिजेंस' (व्याख्यात्मक कृत्रिम बुद्धिमत्ता) नामक एक क्षेत्र विकसित किया है। इसका लक्ष्य सरल है: कंप्यूटर के उत्तर के साथ उसके तर्क को भी प्रदान करना, ठीक वैसे ही जैसे एक डॉक्टर ब्लैकबोर्ड पर अपना काम करके दिखाता है। उम्मीद यह है कि सुझाव के पीछे के तर्क को देखकर, एक चिकित्सक यह तय कर सकेगा कि उस पर भरोसा करना है या नहीं, गलती पकड़नी है, या यदि सलाह खतरनाक है तो उसे खारिज करना है। मशीन को जाँचने और सुधारने की इस क्षमता को 'ह्यूमन ओवरसाइट' (मानवीय निगरानी) कहा जाता है, और इसे उच्च-जोखिम वाले चिकित्सा निर्णयों में सुरक्षा के लिए आवश्यक माना जाता है।

हालाँकि, वैज्ञानिक अनुसंधान की एक नई समीक्षा बताती है कि इन स्पष्टीकरणों को परखने का वर्तमान तरीका सबसे महत्वपूर्ण हिस्से को छोड़ रहा है। निकोलस फ्रे और उनके सहयोगियों ने चार्िटे - यूनिवर्सिटेट्समेडिसिन बर्लिन में ४९ अध्ययनों की जांच की, जो २०१५ से लेकर २०२६ की शुरुआत तक प्रकाशित हुए थे और यह देखते थे कि डॉक्टर और चिकित्सा प्रशिक्षु इन व्याख्यात्मक उपकरणों के साथ कैसे इंटरैक्ट करते हैं। शोधकर्ता यह जानना चाहते थे कि क्या अध्ययन वास्तव में यह सिद्ध करते हैं कि स्पष्टीकरण चिकित्सकों को गलतियाँ पकड़ने में मदद करते हैं, या वे केवल यह माप रहे थे कि चिकित्सक उन स्पष्टीकरणों के स्वरूप को कितना पसंद करते हैं। उन्हें एक बड़ा अंतर मिला। जबकि अध्ययनों में अक्सर डॉक्टरों से पूछा गया कि क्या वे स्पष्टीकरणों को भरोसेमंद या समझने में आसान पाते हैं, लेकिन उनमें से लगभग कभी भी यह परीक्षण नहीं किया गया कि क्या उन स्पष्टीकरणों ने वास्तव में डॉक्टरों को यह पहचानने में मदद की कि कंप्यूटर कब गलत था।

इस समीक्षा ने मानचित्रित किया कि उन ४९ अध्ययनों ने वास्तव में क्या मापा। परिणामों से पता चला कि इसमें भावनाओं और धारणाओं पर अत्यधिक ध्यान दिया गया। ४२ अध्ययनों में, शोधकर्ताओं ने प्रतिभागियों से पूछा कि वे सिस्टम पर कितना भरोसा करते हैं। ३४ अध्ययनों में, उन्होंने पूछा कि क्या स्पष्टीकरण उपयोगी थे, और ३३ में, उन्होंने पूछा कि क्या वे समझने योग्य थे। ये प्रश्न 'सेल्फ-रिपोर्टिंग' (स्व-प्रतिवेदन) पर आधारित हैं, जहाँ एक डॉक्टर केवल यह कहता है, "मुझे इस उत्तर पर विश्वास है।" शोधकर्ताओं ने पाया कि केवल एक बहुत छोटा हिस्सा ऐसा था जो वास्तव में व्यवहार का परीक्षण करने के लिए आगे बढ़ा। केवल तीन अध्ययनों ने यह परीक्षण किया कि क्या एक डॉक्टर कंप्यूटर के तर्क में किसी विशिष्ट विफलता को पहचान सकता है, और केवल एक अध्ययन ने यह परीक्षण किया कि क्या एक डॉक्टर सिस्टम की सलाह में किसी व्यवस्थित पूर्वाग्रह को पहचान सकता है। शायद सबसे चौंकाने वाली बात यह है कि एक भी अध्ययन ने यह परीक्षण नहीं किया कि क्या एक डॉक्टर किसी नई स्थिति में कंप्यूटर क्या करेगा, इसका सही अनुमान लगा सकता है—एक ऐसा कौशल जो वास्तविक समझ के लिए मौलिक होगा।

साक्ष्य बताते हैं कि वर्तमान अनुसंधान परिदृश्य सुरक्षा के 'तंत्र' के बजाय सुरक्षा के 'एहसास' को प्राथमिकता देता है। अधिकांश अध्ययन नियंत्रित, सिम्युलेटेड वातावरण में आयोजित किए गए थे, न कि वास्तविक, व्यस्त अस्पतालों में। इन सिमुलेशन में, डॉक्टरों को अक्सर कंप्यूटर से सही और गलत दोनों तरह की सलाह दिखाई गई, लेकिन अध्ययनों में शायद ही कभी यह मापा गया कि क्या डॉक्टरों ने गलत सलाह को सफलतापूर्वक खारिज किया। इसके बजाय, अक्सर यह मापा गया कि क्या डॉक्टर कंप्यूटर से सहमत थे, बिना यह जाने कि वह सहमति एक सही या गलत उत्तर के साथ थी। शोधकर्ताओं ने नोट किया कि एक डॉक्टर सिस्टम पर उच्च विश्वास रिपोर्ट कर सकता है और फिर भी अंधे होकर एक खतरनाक सिफारिश का पालन कर सकता है, या वे भ्रमित महसूस कर सकते हैं लेकिन कंप्यूटर को अनदेखा करके सही निर्णय ले सकते हैं। चूँकि अध्ययन मुख्य रूप से पहले वाले पहलू पर केंद्रित थे—कि डॉक्टर क्या महसूस करते थे—वे इस बात का बहुत कम प्रमाण प्रदान करते थे कि क्या स्पष्टीकरणों ने वास्तव में डॉक्टरों को तब गलती पकड़ने में मदद की जब कंप्यूटर गलत था।

इसके अलावा, इस डेटा को एकत्र करने के तरीके अक्सर कमजोर थे। आधे से अधिक माप स्थापित, वैज्ञानिक रूप से परीक्षित उपकरणों के बजाय 'एड-हॉक' (तदर्थ) प्रश्नों या अपुष्ट पैमानों पर आधारित थे। समीक्षा के २५३ डेटा बिंदुओं में से केवल १० ने एक 'वैलिडेटेड इंस्ट्रूमेंट' (सत्यापित उपकरण) का उपयोग किया, जो विश्वास या संतुष्टि जैसी चीजों के लिए एक मानक, विश्वसनीय परीक्षण है। अधिकांश डेटा सरल सर्वेक्षणों से आया जहाँ डॉक्टरों ने एक पैमाने पर अपने अनुभव को रेट किया। समीक्षा ने यह भी रेखांकित किया कि केवल ४९ में से दो अध्ययनों ने उन सिस्टमों को देखा जो वास्तव में वास्तविक नैदानिक सेटिंग्स में तैनात और उपयोग किए जा रहे थे। बाकी प्रयोग थे जहाँ शोधकर्ताओं द्वारा कंप्यूटर के व्यवहार को नियंत्रित किया गया था, जिसका अर्थ है कि हमें नहीं पता कि क्या स्पष्टीकरण तब भी काम करते हैं जब एक डॉक्टर समय के दबाव में हो, थका हुआ हो, या किसी जटिल मरीज के मामले से जूझ रहा हो।

लेखकों का तर्क है कि यह असंतुलन सुरक्षा की एक झूठी भावना पैदा करता है। वे बताते हैं कि विश्वास एक दृष्टिकोण (attitude) है, जबकि निगरानी एक क्रिया (action) है। एक डॉक्टर सिस्टम पर बहुत विश्वास महसूस कर सकता है लेकिन फिर भी एक गलत सिफारिश को खारिज करने में विफल हो सकता है। यह जानने के लिए कि एक स्पष्टीकरण वास्तव में सुरक्षित है या नहीं, शोधकर्ताओं को विशिष्ट व्यवहारों का परीक्षण करने की आवश्यकता है: क्या डॉक्टर यह अनुमान लगा सकता है कि कंप्यूटर आगे क्या कहेगा? क्या वे गलती पकड़ सकते हैं जब कंप्यूटर गलत हो? क्या वे पहचान सकते हैं कि कंप्यूटर मरीजों के एक निश्चित समूह के प्रति पक्षपाती है? समीक्षा में पाया गया कि ये विशिष्ट, सुरक्षा-महत्वपूर्ण कौशल वर्तमान साहित्य में लगभग पूरी तरह से अनुपस्थित थे। अध्ययनों ने हमें दिखाया कि स्पष्टीकरण एक चिकित्सक को कैसा महसूस कराते हैं, लेकिन उन्होंने यह नहीं दिखाया कि क्या वे स्पष्टीकरण एक चिकित्सक को तब बेहतर काम करने में मदद करते हैं जब मशीन विफल हो जाती है।

यह शोधपत्र निष्कर्ष निकालता है कि 'एक्सप्लेनेबल आर्टिफिशियल इंटेलिजेंस' को वास्तव में उपयोगी और सुरक्षित बनाने के लिए, इसे परखने के तरीके को बदलना होगा। भविष्य के अध्ययनों को केवल डॉक्टरों से यह पूछने से आगे बढ़कर यह परीक्षण करना होगा कि वे वास्तव में क्या करते हैं। इसका अर्थ है ऐसे प्रयोग डिजाइन करना जहाँ कंप्यूटर की शुद्धता में हेरफेर किया जाए ताकि यह देखा जा सके कि क्या डॉक्टर सही और गलत के बीच अंतर कर सकते हैं। इसका अर्थ है दृष्टिकोणों को मापने के लिए सिद्ध, विश्वसनीय उपकरणों का उपयोग करना, न कि केवल सरल सर्वेक्षणों के आधार पर अनुमान लगाना। अंततः, इसका अर्थ है इन प्रणालियों का वास्तविक दुनिया में, लंबे समय तक परीक्षण करना, यह देखने के लिए कि क्या स्पष्टीकरण तब भी सही निर्णय लेने में सहायता करते हैं जब दांव ऊंचे हों और दबाव वास्तविक हो। जब तक ये बदलाव नहीं आते, चिकित्सा समुदाय के पास इस बात की स्पष्ट तस्वीर तो होगी कि डॉक्टरों को स्पष्टीकरण कितने पसंद हैं, लेकिन इस बात का बहुत कम प्रमाण होगा कि वे स्पष्टीकरण वास्तव में मरीजों को सुरक्षित रखते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →