When high AUROC does not travel: internal-to-external performance differences in machine-learning models for antimicrobial resistance
यह मेटा-अनुसंधान अध्ययन प्रकट करता है कि रोगाणुरोधी प्रतिरोध (एंटीमाइक्रोबियल रेजिस्टेंस) के लिए मशीन लर्निंग मॉडल आंतरिक से बाहरी सत्यापन (वैल्यूएशन) की ओर बढ़ने पर अक्सर प्रदर्शन में महत्वपूर्ण गिरावट प्रदर्शित करते हैं, जिसमें इस अंतर का परिमाण व्यापक रूप से भिन्न होता है और रिपोर्ट किए गए AUROCs के लिए एक सार्वभौमिक सुधार कारक के उपयोग को रोकता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
सुपरबग्स के खिलाफ लड़ाई में, डॉक्टर और वैज्ञानिक यह अनुमान लगाने के लिए कि कौन सा बैक्टीरिया किस एंटीबायोटिक के प्रति प्रतिरोधी (रेसिस्टेंट) होगा, तेजी से कंप्यूटर की ओर मुड़ रहे हैं। मशीन लर्निंग का उपयोग करके बनाए गए ये कंप्यूटर प्रोग्राम, अत्यधिक प्रशिक्षित पैटर्न-पहचान विशेषज्ञों की तरह कार्य करते हैं। वे चिकित्सा डेटा की विशाल मात्रा—जैसे रोगी के रिकॉर्ड, लैब परीक्षण परिणाम और जेनेटिक सीक्वेंस—को स्कैन करते हैं ताकि यह अनुमान लगाया जा सके कि क्या कोई विशिष्ट संक्रमण एक मानक दवा उपचार से बच निकलेगा। जब इन प्रोग्रामों का उसी अस्पताल में परीक्षण किया जाता है जहाँ उन्हें बनाया गया था, तो वे अक्सर आधुनिक चिकित्सा के चमत्कार की तरह दिखते हैं, जो उच्च सटीकता के साथ प्रतिरोधी बैक्टीरिया की सही पहचान करते हैं। यह सफलता शोधकर्ताओं और चिकित्सकों को उम्मीद देती है कि इन उपकरणों को जल्द ही जीवन रक्षक उपचार निर्णयों के मार्गदर्शन के लिए वैश्विक स्तर पर तैनात किया जा सकता है।
हालाँकि, एक कंप्यूटर प्रोग्राम जो एक अस्पताल के डेटा से सीखता है, वह स्वचालित रूप से दूसरे अस्पताल के डेटा को पढ़ना नहीं जानता। ठीक वैसे ही जैसे एक व्यक्ति जो किसी छोटे शहर की शांत सड़कों पर गाड़ी चलाना सीखता है, वह एक बड़े शहर के व्यस्त राजमार्गों पर संघर्ष कर सकता है, ये मॉडल अपने मूल वातावरण को छोड़ने पर एक छिपी हुई चुनौती का सामना करते हैं। एक नए देश, एक अलग समय अवधि, या यहाँ तक कि एक पड़ोसी शहर में मिलने वाला डेटा सूक्ष्म रूप से भिन्न दिख सकता है, जिसका कारण स्थानीय बैक्टीरिया के स्ट्रेन, लैब उपकरण या रोगी आबादी में भिन्नता हो सकती है। मेडिकल एआई (AI) के भविष्य के लिए महत्वपूर्ण प्रश्न केवल यह नहीं है कि ये मॉडल घर पर कितनी अच्छी तरह प्रदर्शन करते हैं, बल्कि यह है कि जब उन्हें काम करने के लिए नई जगहों पर भेजा जाता है, तो उनकी सटीकता में कितनी गिरावट आती है।
एक नए अध्ययन ने ठीक इसी प्रदर्शन की गिरावट को मापने का प्रयास किया। शोधकर्ता, ड्रिप्तो रॉय ने प्रकाशित मशीन-लर्निंग अध्ययनों का एक संग्रह एकत्र किया जिन्होंने अपने मॉडलों का दो स्थानों पर परीक्षण करने का कठिन कार्य किया था: पहले उस अस्पताल में जहाँ मॉडल बनाया गया था, और फिर एक पूरी तरह से स्वतंत्र अस्पताल या डेटासेट में। लक्ष्य सरल लेकिन महत्वपूर्ण था: यह देखना कि घर पर मॉडल का आत्मविश्वास और विदेश में उसका वास्तविक प्रदर्शन के बीच क्या अंतर है। जोड़े गए परीक्षणों के स्कोर की तुलना करके, अध्ययन का उद्देश्य यह निर्धारित करना था कि क्या वैज्ञानिक पत्रों में रिपोर्ट की गई उच्च सफलता दर भविष्य की सफलता का एक विश्वसनीय वादा है, या क्या यह अक्सर एक भ्रम है जो यात्रा करने पर फीका पड़ जाता है।
यह जांच एक विशिष्ट समूह के अध्ययनों पर केंद्रित थी जिन्होंने एक ही मॉडल और एक ही भविष्यवाणी कार्य के लिए एक आंतरिक स्कोर और एक बाहरी स्कोर दोनों रिपोर्ट किए थे। कुल मिलाकर, शोधकर्ता ने आठ स्वतंत्र शोध पत्रों से लिए गए सैंतालीस अलग-अलग तुलनाओं का विश्लेषण किया। इन तुलनाओं में MRSA और ड्रग-रेसिस्टेंट निमोनिया जैसे खतरनाक बैक्टीरिया के लिए भविष्यवाणियां शामिल थीं, जिसमें इलेक्ट्रॉनिक हेल्थ रिकॉर्ड, होल-जीनोम सीक्वेंसिंग और क्लिनिकल लैब रिपोर्ट का उपयोग किया गया था। शोधकर्ता ने प्रत्येक तुलना के लिए आंतरिक स्कोर और बाहरी स्कोर के बीच के अंतर की गणना की ताकि यह देखा जा सके कि प्रदर्शन में कितना परिवर्तन आया।
परिणामों ने एक स्पष्ट, हालांकि सूक्ष्म, पैटर्न प्रकट किया। व्यक्तिगत तुलनाओं के विशाल बहुमत में—सैंतालीस में से छत्तीस बार—मॉडल ने उस डेटा की तुलना में खराब प्रदर्शन किया जिस पर उसे प्रशिक्षित किया गया था, जब उसे नए, बाहरी डेटा पर परखा गया। औससे, सटीकता में गिरावट उल्लेखनीय थी, जिसमें बाहरी स्कोर आंतरिक स्कोर से एक मापने योग्य अंतर से नीचे गिर गया। इसने इस "आशावाद" की पुष्टि की कि विकास सेटिंग में एक उच्च स्कोर देखना एक वास्तविक घटना है; मॉडल अपने मूल वातावरण को छोड़ने पर अपनी धार खो देते हैं।
हालाँकि, बड़े परिदृश्य को देखते समय कहानी अधिक जटिल हो जाती है। शोधकर्ता ने महसूस किया कि प्रत्येक तुलना को साक्ष्य के समान टुकड़े के रूप में गिनना भ्रामक था। कुछ शोध पत्र दर्जनों अलग-अलग मॉडल विविधताएं या एंटीबायोटिक लक्ष्य रिपोर्ट करते हैं, जो सभी एक ही रोगियों के समूह और एक ही डेटा प्रोसेसिंग चरणों से प्राप्त होते हैं। यदि एक ही पेपर के इन कई परिणामों को समान रूप से गिना जाता है, तो वे अन्य पेपरों को दबा देंगे जिन्होंने केवल एक या दो तुलनाएँ रिपोर्ट की हैं। जब शोधकर्ता ने विश्लेषण को इस तरह समायोजित किया कि प्रत्येक संपूर्ण शोध पत्र को साक्ष्य की एक इकाई माना जाए, जिससे हर पेपर को उसके द्वारा दी गई संख्याओं की संख्या की परवाह किए बिना एक समान आवाज मिले, तो तस्वीर काफी बदल गई।
इस अधिक संतुलित दृष्टिकोण के तहत, प्रदर्शन में गिरावट काफी कम हो गई। हालाँकि मॉडल अभी भी अपने मूल वातावरण के बाहर आम तौर पर खराब प्रदर्शन करते थे, लेकिन अंतर शुरुआती गणना की तुलना में बहुत कम था। वास्तव में, जब आठ अध्ययनों को समग्र रूप से देखा गया, तो औसत अंतर इतना छोटा था कि वह आसानी से शून्य हो सकता था। इसका मतलब है कि जबकि कुछ मॉडल परिवहन के दौरान महत्वपूर्ण सटीकता खो देते हैं, अन्य आश्चर्यजनक रूप से मजबूत रहते हैं, और क्षेत्र को एक एकल, सार्वभौमिक दंड का सामना नहीं करना पड़ता है। गिरावट का आकार पूरी तरह से विशिष्ट अध्ययन, उपयोग किए गए डेटा और इस बात पर निर्भर करता है कि परिणामों को कैसे गिना जाता है।
अध्ययन ने यह भी रेखांकित किया कि वर्तमान परिदृश्य में क्या गायब है। जबकि अधिकांश समीक्षा किए गए पेपरों ने अपने मॉडलों को नए परिवेश में परखने का प्रयास किया था, बहुत कम ने आगे बढ़कर यह जांचा कि क्या मॉडल अच्छी तरह से कैलिब्रेटेड (calibrated) थे। कैलिब्रेशन एक महत्वपूर्ण अवधारणा है जो केवल सटीकता से परे जाती है; यह पूछती है कि क्या मॉडल द्वारा दिए गए संभाव्यता अंक वास्तव में वास्तविक दुनिया के जोखिम से मेल खाते हैं। उदाहरण के लिए, यदि एक मॉडल भविष्यवाणी करता है कि एक रोगी में प्रतिरोध की 20% संभावना है, तो क्या उस रोगी में वास्तव में पांच में से एक बार प्रतिरोध होता है? समीक्षा में पाया गया कि यह महत्वपूर्ण जाँच शायद ही कभी रिपोर्ट की गई थी। इसके अलावा, बहुत कम अध्ययनों ने अपने मॉडलों का समय के साथ परीक्षण किया कि क्या वे बैक्टीरिया के विकसित होने के साथ सटीक बने रहते हैं, या उन्हें भविष्योन्मुखी (prospective) तरीके से परखा कि वे उन रोगियों के लिए परिणामों की भविष्यवाणी करते हैं जो अस्पताल में आते हैं।
निष्कर्ष मेडिकल एआई के बारे में हमारे दृष्टिकोण के लिए एक चेतावनी भरे सबक के रूप में कार्य करते हैं। अध्ययन का तर्क है कि हम केवल एक पेपर से उच्च सटीकता स्कोर लेकर यह मान नहीं सकते कि यह हर जगह सच होगा। प्रदर्शन के अंतर का आभासी आकार इस बात के प्रति अत्यधिक संवेदनशील है कि हम साक्ष्य को कैसे गिनते हैं। यदि हम एक पेपर में प्रत्येक मॉडल विविधता को एक अलग तथ्य के रूप में गिनते हैं, तो हम समस्या को बढ़ा चढ़ाकर पेश करते हैं। यदि हम प्रत्येक पेपर को एक एकल कहानी के रूप में देखते हैं, तो समस्या छोटी दिखती है लेकिन फिर भी वास्तविक है। शोध निष्कर्ष निकालता है कि कोई सरल गणितीय समाधान या सार्वभौमिक सुधार कारक नहीं है जिसे सभी प्रकाशित स्कोर पर लागू किया जा सके ताकि उनके वास्तविक दुनिया के प्रदर्शन की भविष्यवाणी की जा सके।
इसके बजाय, आगे का रास्ता अधिक पारदर्शिता और कठोरता की मांग करता है। शोधकर्ताओं को यह स्पष्ट करने की आवश्यकता है कि उन्होंने अपने डेटा को कैसे विभाजित किया ताकि यह सुनिश्चित हो सके कि परीक्षण चरण से कोई भी जानकारी प्रशिक्षण चरण में लीक न हो। उन्हें न केवल यह रिपोर्ट करना चाहिए कि उनका मॉडल रोगियों को कैसे रैंक करता है, बल्कि यह भी कि उनके संभाव्यता अनुमान वास्तविकता से कितनी अच्छी तरह मेल खाते हैं। सबसे महत्वपूर्ण बात यह है कि उन्हें अपने मॉडलों को वास्तव में स्वतंत्र वातावरण में मान्य करने की आवश्यकता है, जिसमें घर और नए परिवेश दोनों में रोगियों की विशिष्ट संख्या और प्रतिरोध की व्यापकता (prevalence) की रिपोर्ट दी गई हो। जब तक ये मानक सामान्य नहीं बन जाते, तब तक साहित्य में रिपोर्ट किए गए उच्च स्कोर एक ऐसा वादा रहेंगे जो अभी तक पूरी तरह से निभाया नहीं गया है, और एक सफल कंप्यूटर मॉडल से डॉक्टर के लिए एक विश्वसनीय उपकरण बनने की यात्रा अभी भी एक अधूरा कार्य बनी रहेगी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।