Interoperability of standardised electronic healthcare records facilitates transfer learning of clinical language models
यह अध्ययन प्रदर्शित करता है कि इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड को OMOP कॉमन डेटा मॉडल के अनुरूप मानकीकृत करना विविध यूके (UK) डेटासेटों में क्लिनिकल लैंग्वेज मॉडल्स के ट्रांसफर लर्निंग को प्रभावी ढंग से सक्षम बनाता है, जो जनसांख्यिकीय अंतरों और शब्दावली की सीमाओं के बावजूद आपातकालीन अस्पताल पुन: प्रवेश के लिए उच्च भविष्य कहनेवाला प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
अस्पताल और डॉक्टरों के क्लिनिक मरीजों के बारे में डिजिटल नोट्स का एक विशाल, निरंतर प्रवाह उत्पन्न करते हैं। इन इलेक्ट्रॉनिक रिकॉर्ड्स में हर दौरे, हर नुस्खे (प्रिस्क्रिप्शन) और हर टेस्ट के परिणाम का इतिहास होता है। हालाँकि, विभिन्न प्रणालियाँ इस जानकारी को लिखने के तरीके में अक्सर असंगत होती हैं। एक क्लिनिक उच्च रक्तचाप के रीडिंग के लिए एक विशिष्ट कोड का उपयोग कर सकता है, जबकि दूसरा बिल्कुल अलग कोड का उपयोग कर सकता है जो ठीक उसी चीज़ के लिए हो। एकरूपता की इस कमी के कारण विभिन्न स्थानों से डेटा को संयोजित करना, पैटर्न खोजने या कंप्यूटर को स्वास्थ्य रुझानों को पहचानने के लिए सिखाना कठिन हो जाता है। इसे हल करने के लिए, शोधकर्ताओं ने चिकित्सा डेटा के लिए एक सार्वभौमिक अनुवादक विकसित किया है जिसे 'कॉमन डेटा मॉडल' कहा जाता है। इसे एक साझा शब्दकोश के रूप में समझें जो विभिन्न कोडिंग सिस्टम को एक चिकित्सा घटना के अर्थ पर सहमत होने के लिए मजबूर करता है, जिससे स्थानीय संक्षिप्त शब्दावली के एक अराजक मिश्रण को एक एकल, मानकीकृत भाषा में बदल दिया जाता है। उम्मीद यह है कि यदि कंप्यूटर इस सार्वभौमिक भाषा को मरीजों के एक समूह से सीख सकते हैं, तो वे इस ज्ञान को कहीं और मरीजों के पूरी तरह से अलग समूह पर लागू कर पाएंगे, बिना फिर से शुरुआत से प्रशिक्षित हुए।
एक हालिया अध्ययन में, शोधकर्ताओं ने यह परीक्षण करने के लिए कि क्या यह विचार वास्तविक दुनिया में काम करता है, यूनाइटेड किंगडम के स्वास्थ्य रिकॉर्ड के दो बड़े संग्रहों का उपयोग किया। उन्होंने एक विशिष्ट कार्य पर ध्यान केंद्रित किया: यह भविष्यवाणी करना कि क्या किसी मरीज को अस्पताल से छुट्टी मिलने के तीस दिनों के भीतर आपातकालीन स्थिति में वापस अस्पताल आने की आवश्यकता होगी। उन्होंने जिन दो डेटा स्रोतों को चुना वे काफी भिन्न थे। एक डेटासेट पूरे इंग्लैंड में सामान्य प्रथाओं (जनरल प्रैक्टिसेस) के एक नेटवर्क से आया था, जबकि दूसरा केवल लंदन के प्रैक्टिस से आया था। ये समूह आयु, जातीयता और आर्थिक पृष्ठभूमि में भिन्न थे, और प्रत्येक प्रणाली के कंप्यूटरों ने मूल रूप से उनके चिकित्सा इतिहास को विभिन्न कोडिंग सिस्टम का उपयोग करके रिकॉर्ड किया था। शोधकर्ताओं ने पहले दोनों रिकॉर्ड सेटों को ऊपर बताए गए मानक सार्वभौमिक भाषा में अनुवादित किया। फिर उन्होंने एक परिष्कृत कंप्यूटर प्रोग्राम, जिसे 'क्लिनिकल लैंग्वेज मॉडल' कहा जाता है, को पहले डेटासेट के पैटर्न को समझने के लिए प्रशिक्षित किया। इस प्रोग्राम ने चिकित्सा घटनाओं के अनुक्रम को पढ़ना और भविष्य में आपातकालीन पुन: प्रवेश की संभावना का अनुमान लगाना सीखा।
महत्वपूर्ण परीक्षण तब आया जब शोधकर्ताओं ने इस प्रशिक्षित प्रोग्राम को दूसरे डेटासेट (लंदन वाले डेटासेट) को देखने के लिए कहा, बिना उसे कोई नया प्रशिक्षण दिए। वे यह देखना चाहते थे कि पहले समूह से प्राप्त ज्ञान दूसरे समूह में स्थानांतरित हो पाता है या नहीं। परिणाम उत्साहजनक थे। मॉडल, जिसने लंदन के डेटा को पहले कभी नहीं देखा था, उस समूह पर लगभग उतना ही अच्छा प्रदर्शन कर रहा था जिसके लिए मॉडल को शुरुआत से ही विशेष रूप से प्रशिक्षित किया गया था। इसने उच्च सटीकता के साथ जोखिम वाले मरीजों की सही पहचान की, और उस मॉडल से कहीं बेहतर प्रदर्शन किया जिसे बिना किसी पूर्व शिक्षण के शून्य से बनाया गया था। यह सुझाव देता है कि डेटा के मानकीकरण ने कंप्यूटर को स्वास्थ्य जोखिमों के उन सामान्य सिद्धांतों को सीखने में मदद की जो विभिन्न आबादी पर लागू होते हैं, भले ही वे आबादी कागज़ पर बहुत अलग दिखती हो।
शोधकर्ताओं ने यह समझने के लिए भी गहराई से जांच की कि चिकित्सा रिकॉर्ड के कौन से हिस्से इन भविष्यवाणियों को संचालित कर रहे थे। उन्होंने पाया कि सबसे महत्वपूर्ण जानकारी मरीज की स्थितियों के इतिहास और डॉक्टरों द्वारा किए गए अवलोकन से आई, जैसे कि लक्षणों पर नोट्स या शारीरिक परीक्षण के निष्कर्ष। दिलचस्प बात यह है कि अन्य कारकों, जैसे कि दवाओं की सूची या विशिष्ट माप संख्याओं की महत्ता, उस डेटासेट के आधार पर बदल गई जिसका उपयोग किया जा रहा था। एक समूह में, दवाओं के डेटा को हटाने से वास्तव में मॉडल के प्रदर्शन में सुधार हुआ, जबकि दूसरे में, माप डेटा को हटाने का समान प्रभाव पड़ा। यह इंगित करता है कि जबकि सार्वभौमिक भाषा ने कंप्यूटर को बड़ी तस्वीर समझने में मदद की, लेकिन सबसे अधिक मायने रखने वाले विशिष्ट विवरण अभी भी इस बात पर निर्भर कर सकते हैं कि डेटा को मूल रूप से कैसे एकत्र और व्यवस्थित किया गया था।
इन सफलताओं के बावजूद, अध्ययन ने कुछ व्यावहारिक सीमाओं को भी रेखांकित किया। रिकॉर्ड को मानक भाषा में अनुवादित करने की प्रक्रिया पूर्ण नहीं थी; कुछ जानकारी खो गई क्योंकि कुछ स्थानीय कोडों का सार्वभौमिक शब्दकोश में सीधा मिलान नहीं था। कंप्यूटर प्रोग्राम की शब्दावली सीमित थी, जिसका अर्थ था कि वह नए डेटासेट में मिले प्रत्येक कोड को पहचान नहीं सका। फिर भी, मुख्य निष्कर्ष सुदृढ़ बना हुआ है: अव्यवस्थित, स्थानीय चिकित्सा रिकॉर्ड को एक मानकीकृत प्रारूप में बदलकर, शोधकर्ता शक्तिशाली उपकरण बना सकते हैं जो विभिन्न अस्पतालों और क्षेत्रों में काम करते हैं। यह दृष्टिकोण चिकित्सा भविष्यवाणी उपकरणों को बनाने के लिए एक आशाजनक मार्ग प्रदान करता है जो एक एकल प्रणाली तक सीमित नहीं हैं, जिससे एक समुदाय से प्राप्त अंतर्दृष्टि संभावित रूप से दूसरे समुदाय के मरीजों को लाभ पहुँचा सकती है, चाहे उनकी स्थानीय कोडिंग आदतों या जनसांख्यिकीय संरचना में कितना भी अंतर क्यों न हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।