A federated learning and recalibration pipeline for clinical prediction across heterogeneous regions: 30-day mortality after acute myocardial infarction
यह अध्ययन प्रदर्शित करता है कि एक फेडरेटेड लर्निंग पाइपलाइन को एक हल्के पुनर्मिलान (recalibration) प्रक्रिया के साथ संयोजित करके, तीव्र मायोकार्डियल इंफार्क्शन (acute myocardial infarction) के लिए 30-दिवसीय मृत्यु दर भविष्यवाणी मॉडल को विषम क्षेत्रों में केंद्रीकृत शिक्षण के तुलनीय प्रदर्शन के साथ प्रभावी रूप से विकसित और मान्य किया जा सकता है, जबकि रोगी डेटा की गोपनीयता बनी रहती है और स्थानीय मॉडलों की खराब परिवहन क्षमता (transportability) की बाधा को दूर किया जाता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
चिकित्सा के आधुनिक युग में, डॉक्टर किसी मरीज के भविष्य के स्वास्थ्य की भविष्यवाणी करने में मदद करने के लिए कंप्यूटर प्रोग्रामों पर तेजी से निर्भर होते जा रहे हैं। ये उपकरण, जिन्हें क्लिनिकल प्रेडिक्शन मॉडल (नैदानिक भविष्यवाणी मॉडल) कहा जाता है, किसी व्यक्ति के वर्तमान लक्षणों और चिकित्सा इतिहास का विश्लेषण करके किसी विशिष्ट परिणाम की संभावना का अनुमान लगाते हैं, जैसे कि दिल के दौरे के बाद जीवित रहने की संभावना। इन कार्यक्रमों के सटीक होने के लिए, उन्हें आमतौर पर कई अलग-अलग लोगों के विशाल डेटा पर प्रशिक्षित होने की आवश्यकता होती है। हालाँकि, एक महत्वपूर्ण बाधा मौजूद है: मेडिकल रिकॉर्ड में अत्यंत निजी जानकारी होती है। अस्पताल और अनुसंधान केंद्र सख्त गोपनीयता कानूनों और नैतिक चिंताओं के कारण अपने कच्चे रोगी डेटा को एक-दूसरे के साथ साझा नहीं कर सकते हैं। यह एक दुविधा पैदा करता है जहाँ सर्वोत्तम मॉडलों के लिए उस डेटा की आवश्यकता होती है जिसे स्थानांतरित नहीं किया जा सकता, जबकि जो डेटा उपलब्ध है वह अलग-थलग पड़े साइलो (isolated silos) में बंद है। इस समस्या को हल करने के लिए, वैज्ञानिकों ने 'फेडरेटेड लर्निंग' (federated learning) नामक एक विधि विकसित की है। सभी रोगी रिकॉर्डों को एक केंद्रीय डेटाबेस में एकत्र करने के बजाय, यह दृष्टिकोण प्रत्येक अस्पताल को अपना डेटा अपने स्वयं के कंप्यूटरों पर रखने की अनुमति देता है। फिर ये कंप्यूटर आपस में बात करते हैं, और केवल उन गणितीय पाठों को साझा करते हैं जो उन्होंने अपने स्थानीय रोगियों से सीखे हैं, बिना कभी मरीजों की पहचान या विशिष्ट विवरण प्रकट किए।
शोधकर्ताओं की एक टीम ने यह परीक्षण करने के लिए एक प्रयास किया कि क्या यह विधि तीव्र मायोकार्डियल इंफार्क्शन (हृदय घात का एक गंभीर प्रकार) से पीड़ित रोगियों में 30-दिवसीय मृत्यु दर की भविष्यवाणी करने के लिए प्रभावी ढंग से काम कर सकती है। उन्होंने GUSTO-I नामक एक प्रमुख अंतरराष्ट्रीय परीक्षण के एक विशाल, सुविख्यात डेटासेट का उपयोग किया, जिसमें दुनिया के 16 विभिन्न क्षेत्रों के 40,000 से अधिक रोगी शामिल थे। लक्ष्य यह देखना था कि क्या सभी क्षेत्रों के ज्ञान को संयोजित करके बनाया गया मॉडल, सभी कच्चे डेटा को एक साथ मिलाने से बने मॉडल की तरह ही सटीकता से मृत्यु की भविष्यवाणी कर सकता है, और क्या यह संयुक्त दृष्टिकोण केवल एक एकल क्षेत्र में प्रशिक्षित मॉडल पर निर्भर रहने की तुलना में बेहतर है। शोधकर्ताओं ने इन भविष्यवाणी उपकरणों को बनाने के तीन अलग-अलग तरीकों की तुलना की। पहला एक पारंपरिक दृष्टिकोण था जहाँ सभी रोगी डेटा को एक केंद्रीय स्थान पर एकत्रित किया गया था। दूसरा इसमें प्रत्येक के लिए एक अलग मॉडल (16 क्षेत्रों के लिए) प्रशिक्षित किया गया था जिसमें केवल उस क्षेत्र के डेटा का उपयोग किया गया था। तीसरा फेडरेटेड दृष्टिकोण था, जहाँ 16 क्षेत्रों ने अपने मॉडल स्थानीय रूप से प्रशिक्षित किए और केवल परिणामी गणितीय गुणांकों (coefficients) को साझा किया ताकि एक एकल वैश्विक मॉडल बनाया जा सके, जिसके बाद समग्र जोखिम भविष्यवाणियों को सही ढंग से कैलिब्रेट करने के लिए एक त्वरित समायोजन किया गया।
परिणामों ने यह स्पष्ट पैटर्न दिखाया कि ये मॉडल एक स्थान से दूसरे स्थान पर जाने में कितने सक्षम थे। जब शोधकर्ताओं ने उन मॉडलों का परीक्षण उसी विशिष्ट क्षेत्र के भीतर किया जहाँ उन्हें बनाया गया था, तो वे काफी अच्छा प्रदर्शन करते थे। हालाँकि, जब उन्होंने एक क्षेत्र में प्रशिक्षित मॉडल को दूसरे क्षेत्र में उपयोग करने का प्रयास किया, तो उनकी सटीकता अक्सर काफी गिर गई। कुछ मॉडल जो स्थानीय स्तर पर अच्छा काम करते थे, अन्य स्थानों पर लागू होने पर अविश्वसनीय हो गए, जिससे वे उन रोगियों के बीच अंतर करने में अक्षम रहे जो जीवित बचेंगे और जो नहीं बचेंगे। इसने एक प्रमुख मुद्दे को उजागर किया: स्थानीय स्थितियाँ, रोगी जनसांख्यिकी और देखभाल के तरीके इतने भिन्न होते हैं कि एक क्षेत्र के लिए बनाया गया मॉडल स्वतः ही दूसरे क्षेत्र के लिए काम नहीं करता है। इसके विपरीत, जो मॉडल सभी क्षेत्रों के डेटा को मिलाकर बनाए गए थे—चाहे पारंपरिक केंद्रीय एकत्रीकरण के माध्यम से या नए फेडरेटेड तरीके से—वे सभी 16 क्षेत्रों में स्थिर और सटीक रहे। इन वैश्विक मॉडलों ने लगातार उच्च स्तर की सटीकता प्राप्त की, रोगियों को जोखिम के आधार पर सही ढंग से वर्गीकृत किया (AUC 0.82 के साथ), और उन्होंने यह प्रदर्शन बनाए रखा चाहे किसी भी क्षेत्र का परीक्षण किया जा रहा हो।
अध्ययन ने यह भी पुष्टि की कि फेडरेटेड लर्निंग विधि पारंपरिक केंद्रीय एकत्रीकरण पद्धति के प्रदर्शन से लगभग पूरी तरह मेल खा सकती है। फेडरेटेड दृष्टिकोण के माध्यम से निर्मित वैश्विक मॉडल, जहाँ कोई भी रोगी डेटा अपने मूल अस्पताल से बाहर नहीं गया, ठीक उतना ही अच्छा प्रदर्शन करता है जितना कि एकत्रित डेटासेट से बने मॉडल ने किया। यह एक महत्वपूर्ण निष्कर्ष था क्योंकि इसने प्रदर्शित किया कि गोपनीयता और उच्च-गुणवत्ता वाली भविष्यवाणी परस्पर अनन्य (mutually exclusive) नहीं हैं। हालाँकि, शोधकर्ताओं ने फेडरेटेड प्रक्रिया में एक छोटी तकनीकी बाधा का उल्लेख किया। जब विभिन्न क्षेत्रों के गणितीय गुणांकों को केवल औसत निकाला गया, तो परिणामी मॉडल ने मृत्यु के समग्र जोखिम का थोड़ा अधिक अनुमान लगाया। इसे ठीक करने के लिए, टीम ने अंत में एक हल्का 'रीकैलिब्रेशन' (पुनः अंशांकन) चरण जोड़ा। इस चरण ने अस्पतालों के बीच साझा किए गए सारांश सांख्यिकी का उपयोग करके अंतिम भविष्यवाणियों को समायोजित किया, जिससे व्यक्तिगत रोगी रिकॉर्ड देखे बिना ही पूर्वाग्रह को प्रभावी ढंग से ठीक किया गया। इस समायोजन के बाद, फेडरेटेड मॉडल की भविष्यवाणियाँ केंद्रीकृत मॉडल के साथ पूरी तरह से संरेखित हो गईं।
शोधकर्ताओं ने इन मॉडलों की आंतरिक संरचना की भी जांच की ताकि यह समझ सकें कि वे कैसे काम करते हैं। उन्होंने पाया कि फेडरेटेड मॉडल द्वारा सीखे गए गणितीय नियम केंद्रीकृत मॉडल द्वारा सीखे गए नियमों के बहुत समान थे, जो यह सुझाव देते हैं कि वितरित पद्धति ने रोग और जोखिम के समान अंतर्निहित पैटर्न को सफलतापूर्वक कैप्चर किया है। इसके विपरीत, एकल क्षेत्रों में प्रशिक्षित मॉडलों ने बहुत अधिक भिन्नता दिखाई, जिसने समझाया कि वे अन्य क्षेत्रों में लागू होने पर संघर्ष क्यों करते हैं। एक विशेष क्षेत्र ने, जो अन्य क्षेत्रों से काफी भिन्न था और अन्य जगहों पर परीक्षण किए जाने पर खराब प्रदर्शन करता था, एक ऐसा मॉडल तैयार किया जिसने भविष्यवाणियों को नाजुक बना दिया, जो इस विचार को पुष्ट करता है कि एकल स्थानीय डेटासेट पर निर्भर रहना कमजोर भविष्यवाणियों की ओर ले जा सकता है। अध्ययन ने निष्कर्ष निकाला कि जबकि स्थानीय मॉडल अपने स्वयं के दायरे में उपयोगी हो सकते हैं, वे अक्सर नए परिवेश में विफल हो जाते हैं। फेडरेटेड लर्निंग दृष्टिकोण, एक सरल सुधार के साथ, मजबूत भविष्यवाणी उपकरण बनाने का एक व्यावहारिक और सुरक्षित तरीका प्रदान करता है जो विभिन्न देशों और स्वास्थ्य प्रणालियों में काम करते हैं, और साथ ही प्रत्येक अस्पताल की दीवारों के भीतर संवेदनशील रोगी डेटा को सुरक्षित रखता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।