External validation reveals poor calibration despite preserved discrimination for a vasopressin treatment-signal prediction model across ICU databases
यह अध्ययन प्रदर्शित करता है कि जबकि एक वैसोप्रेसिन उपचार-संकेत भविष्यवाणी मॉडल विभिन्न आईसीयू डेटाबेस में विभेदन बनाए रखता है, यह बाहरी सत्यापन में खराब अंशांकन (कैलिब्रेशन) और अति-पूर्वानुमान से ग्रस्त है, जो यह दर्शाता है कि यह बिना किसी अतिरिक्त पुन: अंशांकन के पूर्ण जोखिम का विश्वसनीय रूप से अनुमान लगाने या सीधे उपचार अनुशंसाओं का समर्थन करने में सक्षम नहीं है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
इंटेंसिव केयर यूनिट (ICU) के उच्च-जोखिम वाले वातावरण में, मरीज अक्सर इतने कम रक्तचाप के साथ आते हैं कि उनका शरीर महत्वपूर्ण अंगों तक पर्याप्त रक्त पंप नहीं कर पाता। उन्हें जीवित रखने के लिए, डॉक्टर वैसोप्रेसर्स नामक शक्तिशाली दवाएं देते हैं जो रक्त वाहिकाओं को सिकोड़ती हैं और दबाव बढ़ाती हैं। कभी-कभी, पहली दवा पर्याप्त नहीं होती है, और मेडिकल टीम को मरीज को स्थिर रखने के लिए वैसोप्रेसिन जैसी दूसरी दवा देनी पड़ती है। यह अनुमान लगाना कि कब एक मरीज को दूसरी दवा की आवश्यकता होगी, एक जटिल चुनौती है। यह केवल मरीज की जीव विज्ञान के बारे में नहीं है; यह इस बारे में भी है कि विभिन्न अस्पताल अपने कार्यों को कैसे रिकॉर्ड करते हैं, उनके पास कौन सी दवाएं उपलब्ध हैं, और वे देखभाल के स्तर को कब बढ़ाते हैं। शोधकर्ता लंबे समय से ऐसे कंप्यूटर मॉडल बनाने की आशा कर रहे थे जो मरीज के वर्तमान डेटा—जैसे कि उनकी हृदय गति, रक्त रसायन और वर्तमान दवा की खुराक—को देख सकें और निश्चित रूप से भविष्यवाणी कर सकें कि कब एक नई दवा का आदेश दिया जाएगा। यदि ऐसा मॉडल पूरी तरह से काम करता, तो यह डॉक्टरों को मामले की समीक्षा करने के लिए पहले ही सतर्क कर सकता था, जिससे संभावित रूप से संकट होने से पहले ही उसे रोका जा सके।
शोधकर्ताओं की एक टीम ने एक विशिष्ट प्रेडिक्शन मॉडल का परीक्षण करने के लिए हाथ मिलाया, जिसे वैसोप्रेसिन देने से ठीक पहले के संकेत को पहचानने के लिए डिज़ाइन किया गया था। उन्होंने संयुक्त राज्य अमेरिका के एक एकल, बड़े शैक्षणिक अस्पताल के डेटा का उपयोग करके अपना मॉडल बनाया, जिसमें हजारों मरीज के रिकॉर्ड का विश्लेषण करके उन पैटर्न को खोजा गया जो दवा देने से पहले मौजूद थे। मॉडल को पंद्रह अलग-अलग जानकारियों को देखने के लिए प्रशिक्षित किया गया था, जैसे कि पहली दवा की वर्तमान खुराक, हृदय गति और रक्त में कुछ रसायनों का स्तर। लक्ष्य एक ऐसा उपकरण बनाना था जो डॉक्टर को बता सके, "इस मरीज को अगले 24 घंटों में वैसोप्रेसिन की आवश्यकता होने का उच्च जोखिम है।" यह देखने के लिए कि क्या यह उपकरण वास्तव में उपयोगी था, शोधकर्ताओं ने इसे केवल उसी अस्पताल के डेटा पर टेस्ट नहीं किया जहाँ इसे बनाया गया था। उन्होंने बिल्कुल उसी मॉडल को, बिना एक भी संख्या बदले, देश भर के दर्जनों अस्पतालों के एक नेटवर्क से प्राप्त डेटा के एक पूरी तरह से अलग सेट पर लागू किया। यह किसी भी चिकित्सा भविष्यवाणी उपकरण के लिए अंतिम परीक्षण है: क्या यह एक नई जगह पर, अलग मरीजों और अलग डॉक्टरों के साथ काम कर सकता है, या यह केवल उसी विशिष्ट वातावरण में काम करता है जहाँ इसे बनाया गया था?
इस परीक्षण के परिणामों ने एक महत्वपूर्ण और कुछ हद तक आश्चर्यजनक अंतर प्रकट किया। जब मॉडल ने मरीजों के नए समूह को देखा, तो यह अभी भी उन्हें रैंक करने में बहुत अच्छा था। यदि आप मरीजों को निम्नतम जोखिम से उच्चतम जोखिम के क्रम में खड़ा करते, तो मॉडल ने उन मरीजों को सही ढंग से सूची के शीर्ष पर रखा जिन्हें वास्तव में दवा मिली थी। सांख्यिकीय शब्दों में, मॉडल ने उन लोगों के बीच अंतर करने की अपनी क्षमता को बनाए रखा जिन्हें दवा मिलेगी और जिन्हें नहीं मिलेगी। हालांकि, मॉडल वास्तविक संख्याओं के बारे में सच बताने में पूरी तरह विफल रहा। मूल अस्पताल में, मॉडल ने भविष्यवाणी की थी कि लगभग 14 प्रतिशत मरीजों को दवा की आवश्यकता होगी, और यह वास्तविकता से मेल खाता था। लेकिन जब इसे नए अस्पतालों पर लागू किया गया, तो मॉडल ने भविष्यवाणी की कि 16 प्रतिशत मरीजों को इसकी आवश्यकता होगी, जबकि वास्तव में केवल 9 प्रतिशत को ही इसकी आवश्यकता थी। मॉडल लगातार जोखिम को बढ़ा-चढ़ाकर बता रहा था। यह एक मौसम पूर्वानुमान की तरह था जो सही ढंग से भविष्यवाणी करता था कि किन दिनों में वास्तव में बारिश होगी, लेकिन उन दिनों भी बारिश की 90 प्रतिशत संभावना बताता था जब केवल 30 प्रतिशत संभावना थी।
रैंकिंग और वास्तविक संभावना के बीच यह बेमेल होना एक महत्वपूर्ण निष्कर्ष है क्योंकि यह इस बात को बदल देता है कि उपकरण का उपयोग कैसे किया जा सकता है। शोधकर्ताओं ने पाया कि मॉडल की भविष्यवाणियां केवल थोड़ी बहुत गलत नहीं थीं; वे इस तरह से विकृत थीं कि उनसे सीधे चिकित्सा निर्णय लेना अविश्वसनीय हो गया था। नए अस्पतालों में, मॉडल की भविष्यवाणियां बहुत अधिक फैली हुई थीं, जिसका अर्थ था कि यह चरम सीमाओं के बारे में बहुत अधिक आश्वस्त था। इसे लगा कि कुछ मरीजों को दवा मिलने की लगभग निश्चितता है और कुछ को बिल्कुल नहीं, जबकि वास्तविकता बहुत अधिक मध्यम थी। यहाँ तक कि जब शोधकर्ताओं ने मॉडल को समायोजित करने की कोशिश की, जिसमें केवल औसत भविष्यवाणी को नई वास्तविकता से मिलाने के लिए ऊपर या नीचे खिसकाया गया, तो इससे समस्या हल नहीं हुई। भविष्यवाणियों का आकार गलत बना रहा। यह सुझाव देता है कि विभिन्न अस्पतालों द्वारा देखभाल को रिकॉर्ड करने का तरीका, या वे निर्णय लेने के लिए जो थ्रेशोल्ड (सीमा) उपयोग करते हैं, इतने अलग हैं कि एक एकल मॉडल को एक स्थान से दूसरे स्थान पर बस कॉपी और पेस्ट नहीं किया जा सकता है।
अध्ययन ने यह भी देखा कि क्या मॉडल को नए डेटा से सीखकर सुधारा जा सकता है। उन्होंने एक ऐसी विधि का परीक्षण किया जहाँ मॉडल को स्थानीय अस्पतालों से कुछ नई जानकारी देकर उसके आंतरिक सेटिंग्स को समायोजित करने का अवसर दिया गया। उन्होंने पाया कि इस 'लोकल लर्निंग' के साथ भी, मॉडल पूरी तरह से अनुकूलन करने में संघर्ष करता है, विशेष रूप से पूरे समूह के बजाय व्यक्तिगत अस्पतालों को देखते समय। वास्तव में, नए नेटवर्क के कई व्यक्तिगत अस्पतालों में बहुत कम मरीज थे जिन्हें दवा मिली थी, जिससे प्रत्येक के लिए एक विश्वसनीय, कस्टम संस्करण बनाना सांख्यिकीय रूप से असंभव हो गया था। शोधकर्ताओं ने निष्कर्ष निकाला कि हालांकि मॉडल मरीजों को प्राथमिकता देने के लिए उन्हें रैंक करने वाले एक उपयोगी उपकरण के रूप में काम कर सकता है, लेकिन इसका उपयोग यह बताने के लिए नहीं किया जा सकता कि किसी मरीज को दवा की आवश्यकता होने की सटीक प्रतिशत संभावना क्या है। यह डॉक्टर को यह नहीं बता सकता कि, "इस मरीज को वैसोप्रेसिन की 40 प्रतिशत आवश्यकता है," क्योंकि वह संख्या संभवतः गलत होगी।
अंततः, यह शोध इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड का उपयोग करके चिकित्सा उपचार की भविष्यवाणी करने की एक मौलिक सीमा को उजागर करता है। मॉडल जिस परिणाम की भविष्यवाणी करने की कोशिश कर रहा था, वह कोई जैविक घटना नहीं थी जैसे कि हार्ट अटैक, बल्कि एक मानवीय निर्णय था जिसे कंप्यूटर सिस्टम में रिकॉर्ड किया गया था। क्योंकि वह निर्णय स्थानीय आदतों, उपलब्ध दवाओं और दस्तावेजीकरण शैलियों पर निर्भर करता है, इसलिए मॉडल द्वारा पहचाना जाने वाला "सिग्नल" मरीज की शारीरिक क्रिया और अस्पताल की संस्कृति का मिश्रण है। मॉडल ने पहले अस्पताल की संस्कृति को इतनी अच्छी तरह से सीख लिया था कि वह इसे नए स्थान पर जाने पर मरीज की जीव विज्ञान से अलग नहीं कर सका। शोधकर्ता इस बात पर जोर देते हैं कि इस उपकरण का उपयोग स्वचालित रूप से उपचार शुरू करने या किसी मरीज के भविष्य के बारे में निश्चित दावे करने के लिए नहीं किया जाना चाहिए। इसके बजाय, यह "साइलेंट मोड" में उपयोगी हो सकता है, जहाँ यह मानव डॉक्टर द्वारा समीक्षा किए जाने वाले उच्च-जोखिम वाले मरीजों को चुपचाप चिह्नित करता है, बशर्ते कि स्थानीय टीम पहले अपनी अस्पताल की वास्तविकता के अनुसार संख्याओं की जांच और समायोजन करे। यह अध्ययन एक अनुस्मारक है कि चिकित्सा में, एक मॉडल जो एक जगह काम करता है, वह दूसरी जगह काम करने की गारंटी नहीं देता है, और यह समझना कि मरीजों को रैंक करना और उनकी सटीक जोखिम की भविष्यवाणी करना अलग है, सुरक्षित और प्रभावी देखभाल के लिए आवश्यक है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।