Demographic shortcuts as marker-free backdoors: silent subgroup underdiagnosis that only operating-point audits detect
यह शोध पत्र प्रदर्शित करता है कि मेडिकल इमेजिंग मॉडल जनसांख्यिकीय शॉर्टकट्स (demographic shortcuts) द्वारा चुपचाप समझौता किए जा सकते हैं, जहाँ एक विशिष्ट उपसमूह के लिए लेबल पलटने से एक मार्कर-मुक्त बैकडोर बन जाता है जो मानक डिटेक्टरों से बच निकलता है और असूचीबद्ध रोगियों को नुकसान पहुँचाता है, जिससे प्रभावी पहचान के लिए थ्रेशोल्ड-आधारित उपसमूह फॉल्स-नेगेटिव ऑडिट की आवश्यकता होती है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक अस्पतालों में, चिकित्सा छवियों (मेडिकल इमेजेस) को पढ़ने के लिए आर्टिफिशियल इंटेलिजेंस का उपयोग तेजी से बढ़ रहा है, जो निमोनिया या फेफड़ों में तरल पदार्थ जैसी बीमारियों का पता लगाने के लिए एक दूसरी जोड़ी आँखों के रूप में कार्य करता है। ये कंप्यूटर प्रोग्राम हजारों पिछले स्कैन का अध्ययन करके सीखते हैं, जहाँ मानव विशेषज्ञों ने पहले ही चिह्नित किया होता है कि क्या बीमार है और क्या स्वस्थ। वर्षों से, शोधकर्ताओं को इस बात की चिंता रही है कि ये प्रोग्राम गलत सबक सीख सकते हैं, शायद छवि में उन सूक्ष्म संकेतों पर निर्भर होकर जिनका बीमारी से कोई लेना-देना नहीं है, जैसे कि वह प्रकार का मशीन जिससे तस्वीर ली गई थी या वह अस्पताल जहाँ रोगी का इलाज किया गया था। इसे "शॉर्टकट" कहा जाता है, और यह एक जानी-मानी समस्या है जो लोगों के कुछ समूहों के लिए एआई (AI) के विफल होने का कारण बन सकती है। हालाँकि, एक नया अध्ययन एक अधिक परेशान करने वाली संभावना को उजागर करता है: इन शॉर्टकट का जानबूझकर फायदा उठाया जा सकता है, न कि केवल गलती से, ताकि एआई को मरीजों के एक विशिष्ट समूह को अनदेखा करने के लिए बनाया जा सके, जबकि वह बाकी सभी के लिए पूरी तरह से काम करता हुआ दिखाई दे।
शोधकर्ताओं ने, कई मेडिकल इमेजिंग डेटासेट्स पर काम करते हुए, यह प्रदर्शित किया कि कैसे प्रशिक्षण डेटा (training data) के लेबल बदलकर एक मॉडल को चुपचाप बाधित किया जा सकता है। एक ऐसी स्थिति की कल्पना करें जहाँ प्रशिक्षण रिकॉर्ड तक पहुँच रखने वाला व्यक्ति किसी विशिष्ट समूह के रोगियों के निदान (diagnosis) को बदलने का निर्णय लेता है। वे उन छवियों को लेते हैं जो स्पष्ट रूप से बीमारी, जैसे कि फेफड़ों के आसपास तरल पदार्थ दिखाती हैं, और बस कंप्यूटर को यह बताते हैं कि वे छवियाँ स्वस्थ हैं। वे एक विशिष्ट जनसांख्यिकीय समूह (demographic group) के दो-तिहाई सकारात्मक मामलों के लिए ऐसा करते हैं, जबकि छवियां स्वयं पूरी तरह से अपरिवर्तित रहती हैं। वे न तो पिक्सेल बदलते हैं, न ही कोई छिपे हुए निशान जोड़ते हैं, और शेष प्रशिक्षण डेटा भी अछूता रहता है। परिणाम यह होता है कि मॉडल उस विशिष्ट समूह की दृश्य विशेषताओं (visual features) को बीमारी की अनुपस्थिति से जोड़ना सीख जाता है। क्योंकि कंप्यूटर लेबल्स से सीखता है, इसलिए यह उस समूह में बीमारी को अनदेखा करना शुरू कर देता है, जिससे प्रभावी रूप से एक "बैकडोर" बन जाता है जो चुपचाप कम निदान (underdiagnosis) का कारण बनता है।
यह खोज विशेष रूप से खतरनाक है क्योंकि यह मानक जांचों के लिए अदृश्य है। जब शोधकर्ताओं ने भ्रष्ट मॉडल का परीक्षण किया, तो समग्र प्रदर्शन स्कोर एक स्वच्छ, स्वस्थ मॉडल के लगभग समान ही दिखाई दिया। कंप्यूटर अभी भी स्वस्थ रोगियों की तुलना में बीमार रोगियों को सही ढंग से रैंक कर रहा था, और अन्य समूहों के लिए पहचान दर अपरिवर्तित रही। यहाँ तक कि बीमार और स्वस्थ रोगियों के बीच अंतर करने की मॉडल की समग्र क्षमता में एक बहुत मामूली, लगभग न दिखने वाला बदलाव आया। एआई मॉडल में छिपी हुई चालों को खोजने के लिए डिज़ाइन किए गए मानक सुरक्षा उपकरण, जो आमतौर पर छवियों में अजीब पैटर्न या डाले गए निशानों की तलाश करते हैं, उन्हें कुछ भी नहीं मिला। मॉडल ने हर उस नियमित ऑडिट को पास कर दिया जो एक अस्पताल द्वारा उसे उपयोग में लाने से पहले चलाया जा सकता था, फिर भी वह मरीजों के एक विशिष्ट समूह के लिए विफल हो रहा था, जो नैदानिक रूप से विनाशकारी हो सकता है।
अध्ययन में पाया गया कि यह विफलता केवल तब स्पष्ट हुई जब शोधकर्ताओं ने मॉडल के प्रदर्शन को उस विशिष्ट बिंदु पर देखा जहाँ यह वास्तव में वास्तविक दुनिया में निर्णय लेता है। अधिकांश निष्पक्षता जाँच (fairness checks) इस बात पर ध्यान देती हैं कि मॉडल रोगियों को कैसे रैंक करता है, लेकिन इस प्रकार की तोड़फोड़ उन रैंकिंग में पूरी तरह से छिप जाती है। यह केवल उन वास्तविक मिस किए गए निदानों की संख्या की जाँच करने पर ही सामने आता है जो डॉक्टरों द्वारा उपयोग किए जाने वाले थ्रेशोल्ड (threshold) पर होते हैं। प्रयोगों में, भ्रष्ट मॉडल ने लक्षित समूह के प्रत्येक एक हजार रोगियों में से फेफड़ों के आसपास तरल पदार्थ के लगभग इकतीस मामलों को मिस किया, जो कि बिना पता चले नुकसान में एक महत्वपूर्ण वृद्धि थी। यह विफलता केवल उस समूह तक सीमित नहीं थी जिसके रिकॉर्ड बदले गए थे; इसने उन रोगियों को भी प्रभावित किया जिनकी नस्ल उनके चार्ट में कभी दर्ज नहीं की गई थी। क्योंकि मॉडल ने छवि के पिक्सेल से सीधे जनसांख्यिकीय जानकारी पढ़ना सीख लिया था, इसलिए उसने उस त्रुटि को किसी भी ऐसे व्यक्ति पर लागू किया जो लक्षित समूह जैसा दिखता था, चाहे उनके मेडिकल फाइल में कुछ भी लिखा हो।
शोधकर्ताओं ने यह भी परीक्षण किया कि क्या सामान्य सुधार, जैसे कि विभिन्न समूहों में बीमार और स्वस्थ रोगियों की संख्या को संतुलित करना, इस हमले को रोक पाएंगे। उन्होंने पाया कि ऐसा नहीं हुआ। भले ही डेटा को किसी भी प्राकृतिक संबंध को हटाने के लिए समायोजित किया गया हो कि रोगी की पृष्ठभूमि और बीमारी की संभावना के बीच क्या संबंध है, मॉडल फिर भी शॉर्टकट सीख गया और लक्षित समूह के लिए विफल रहा। इस हमले के लिए डेटा पर महत्वपूर्ण नियंत्रण की आवश्यकता थी—एक खोज के लिए एक समूह के सकारात्मक लेबल्स का लगभग दो-तिहाई हिस्सा—लेकिन यह वास्तविक दुनिया में एक यथार्थवादी परिदृश्य है, जहाँ डेटा अक्सर विभिन्न विक्रेताओं को आउटसोर्स किया जाता है या कई अलग-अलग अस्पतालों से एकत्र किया जाता है। अध्ययन ने दिखाया कि यह भेद्यता (vulnerability) मेडिकल छवियों के विभिन्न प्रकारों में मौजूद है, जिसमें चेस्ट एक्स-रे, स्किन लीजन फोटो और टिश्यू स्लाइड्स शामिल हैं, और यह उन नए अस्पतालों में भी स्थानांतरित हो सकती है जहाँ मॉडल को कभी प्रशिक्षित नहीं किया गया था।
शायद सबसे महत्वपूर्ण निष्कर्ष यह है कि इन समस्याओं को पकड़ने वाले सामान्य उपकरण इस विशिष्ट प्रकार की विफलता के प्रति अंधे हैं। एआई मॉडल में बैकडोर खोजने के लिए डिज़ाइन किए गए पांच अलग-अलग सुरक्षा डिटेक्टर इस तोड़फोड़ का पता लगाने में विफल रहे। एकमात्र तरीका जो काम कर गया, वह था एक विशिष्ट प्रकार का ऑडिट जो उस सटीक थ्रेशोल्ड पर विभिन्न समूहों के लिए मिस किए गए निदानों की दर की जाँच करता है जिसे मॉडल व्यवहार में उपयोग करता है। इस ऑडिट ने लगभग सभी स्थापित विफलताओं को पकड़ लिया, जबकि मानक जाँचों ने उनमें से अधिकांश को मिस कर दिया। शोधकर्ताओं ने निष्कर्ष निकाला कि रोगियों को इस तरह के चुपचाप होने वाले कम निदान से बचाने का एकमात्र तरीका समग्र प्रदर्शन स्कोर पर भरोसा करना बंद करना और निर्णय लेने के सटीक क्षण में विशिष्ट उपसमूहों (subgroups) के लिए त्रुटि दर की कड़ाई से जाँच करना है। उन्होंने यह भी नोट किया कि अस्पतालों में अपूर्ण जनसांख्यिकीय रिकॉर्ड एक अंध बिंदु (blind spot) बनाते हैं, जिससे बड़ी संख्या में रोगी असुरक्षित रह जाते हैं क्योंकि ऑडिट उन्हें देख नहीं सकता यदि उनकी पृष्ठभूमि की जानकारी गायब है।
यह कार्य यह सुझाव नहीं देता है कि सभी मेडिकल एआई खराब हैं या ये हमले न्यूनतम प्रयास के साथ करना आसान है। शोधकर्ताओं ने जोर देकर कहा कि इस हमले के लिए प्रशिक्षण लेबल्स तक उच्च स्तर की पहुँच की आवश्यकता होती है और विफलता की लागत उपयोग किए गए विशिष्ट कंप्यूटर नेटवर्क के आधार पर भिन्न होती है। हालाँकि, अध्ययन यह सिद्ध करता है कि तोड़फोड़ का मार्ग मौजूद है और वर्तमान में मौजूद बचाव पर्याप्त नहीं हैं। इस पद्धति से होने वाला नुकसान उसी प्रकार के पूर्वाग्रह (bias) के समान है जो पहले से ही स्वास्थ्य सेवा में मौजूद है, जिससे इसे डेटा की कमी के बजाय प्रशिक्षण प्रक्रिया के जानबूझकर या आकस्मिक भ्रष्टाचार के रूप में पहचानना आसान बना दिया जाता है। शोधकर्ता तर्क देते हैं कि समाधान छवि में छिपे हुए मार्कर को खोजने में नहीं है, बल्कि लेबल्स की स्वयं ऑडिट करने में और यह सुनिश्चित करने में है कि मॉडल का प्रदर्शन प्रत्येक समूह के लिए सटीक निदान के समय सत्यापित किया जाए। समग्र रैंकिंग से विशिष्ट त्रुटि दरों की ओर ध्यान केंद्रित करके, अस्पताल अंततः उन विफलताओं को देख सकते हैं जो सामने ही छिपी हुई थीं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।