Privacy Preserving Disease Prediction Across Multiple Hospitals Using CKKS Based Homomorphic Federated Learning
यह शोध पत्र एक CKKS-आधारित होमोमॉर्फिक फेडरेटेड लर्निंग फ्रेमवर्क का प्रस्ताव करता है जो सदस्यता अनुमान हमलों (membership inference attacks) को रोकने के लिए मॉडल अपडेट को एन्क्रिप्ट करके कई अस्पतालों में गोपनीयता-संरक्षित रोग भविष्यवाणी सक्षम करता है, हालांकि यह बढ़ी हुई सुरक्षा प्लेनटेक्स्ट दृष्टिकोणों की तुलना में महत्वपूर्ण संचार ओवरहेड और कम भविष्य कहने वाली उपयोगिता की कीमत पर आती है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
चिकित्सा के आधुनिक युग में, एक डॉक्टर की किसी मरीज के भविष्य के स्वास्थ्य की भविष्यवाणी करने की क्षमता इस बात पर निर्भर करती है कि वे कितने व्यापक डेटा को देख सकते हैं। मशीन लर्निंग एल्गोरिदम, जो पैटर्न से सीखने वाले कंप्यूटर प्रोग्राम हैं, अस्पताल में दोबारा भर्ती होने या बीमारी के बढ़ने जैसे जोखिमों को पहचानने के लिए शक्तिशाली उपकरण बनते जा रहे हैं। हालाँकि, ये उपकरण केवल उतने ही अच्छे हैं जितना कि वह डेटा जो उन्हें दिया जाता है। समस्या यह है कि यह जानकारी—संवेदनशील विवरणों वाले इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड—हजारों अस्पतालों में बिखरी हुई है, जो सख्त गोपनीयता कानूनों और संस्थागत नियमों द्वारा सुरक्षित है। अस्पताल बेहतर मॉडल बनाने के लिए किसी केंद्रीय प्राधिकरण के साथ अपनी कच्ची (raw) रोगी फाइलें साझा नहीं कर सकते, क्योंकि इससे रोगी का विश्वास टूट जाएगा और कानूनी नियमों का उल्लंघन होगा।
इसे हल करने के लिए, शोधकर्ताओं ने 'फेडरेटेड लर्निंग' नामक एक विधि विकसित की है। कल्पना कीजिए कि शेफों का एक समूह है जिसके पास प्रत्येक के पास एक गुप्त पारिवारिक रेसिपी है। अपनी रेसिपी चोरी होने या कॉपी होने के डर से उन्हें एक केंद्रीय रसोई में भेजने के बजाय, वे स्थानीय रूप से अपने व्यंजन पकाने और केवल अंतिम स्वाद को एक केंद्रीय निर्णायक को भेजने के लिए सहमत होते हैं। निर्णायक उन स्वादों को मिलाकर एक मास्टर रेसिपी बनाता है, जिसे अगले प्रयास के लिए शेफों को वापस भेजा जाता है। इस डिजिटल संस्करण में, "रेसिपी" डेटा है, "शेफ" अस्पताल हैं, और "स्वाद" कंप्यूटर मॉडल का गणितीय अपडेट है। कच्चा रोगी डेटा अस्पताल को कभी नहीं छोड़ता है। फिर भी, इस पद्धति में भी एक खामी है: वापस भेजा गया "स्वाद" कभी-कभी उपयोग की गई विशिष्ट सामग्रियों के बारे में बहुत अधिक जानकारी प्रकट कर सकता है, जिससे एक जिज्ञासु पर्यवेक्षक यह अनुमान लगा सकता है कि प्रशिक्षण सेट में कौन से मरीज शामिल थे। इसे ठीक करने के लिए, वैज्ञानिक अब 'होमोमोर्फिक एन्क्रिप्शन' नामक एक तकनीक की खोज कर रहे हैं, जो एन्क्रिप्टेड डेटा पर गणना करने की अनुमति देता है, जिससे यह सुनिश्चित होता है कि संयोजन करने वाला व्यक्ति भी कच्चे नंबरों को नहीं देख सकता।
MIT स्कूल ऑफ इंजीनियरिंग, पुणे, भारत के शोधकर्ताओं की एक टीम ने हाल ही में इस अवधारणा को एक सिम्युलेटेड वातावरण में परखा, जिसे दस अस्पतालों के नेटवर्क की नकल करने के लिए डिज़ाइन किया गया था। उनका लक्ष्य यह देखना था कि क्या वे यह भविष्यवाणी करने के लिए एक मशीन लर्निंग मॉडल बना सकते हैं कि मधुमेह वाले मरीज को तीस दिनों के भीतर अस्पताल में दोबारा भर्ती किया जाएगा या नहीं, और यह सब रोगी के डेटा को पूरी तरह से छिपाकर और मॉडल अपडेट को एन्क्रिप्ट करके किया जा सकता है। उन्होंने CKKS नामक एक विशिष्ट प्रकार के डिजिटल लॉक का उपयोग किया, जो एन्क्रिप्टेड नंबरों पर अनुमानित गणित (approximate math) की अनुमति देता है, जो एक आवश्यक विशेषता है क्योंकि चिकित्सा डेटा में केवल पूर्ण संख्याओं के बजाय दशमलव और भिन्न (fractions) शामिल होते हैं।
शोधकर्ताओं ने एक सार्वजनिक डेटासेट का उपयोग करके एक वर्चुअल प्रयोग स्थापित किया जिसमें 130 वास्तविक अस्पतालों के रिकॉर्ड थे, जिसे उन्होंने दस अलग-अलग संस्थानों का प्रतिनिधित्व करने के लिए दस भागों में विभाजित किया। प्रत्येक वर्चुअल अस्पताल ने अपने स्थानीय डेटा पर अपने स्वयं के प्रेडिक्शन मॉडल का प्रशिक्षण लिया। एक मानक, बिना एन्क्रिप्शन वाले परिदृश्य में, ये अस्पताल अपने मॉडल अपडेट सीधे एक केंद्रीय सर्वर को भेजते। हालाँकि, इस नए प्रयोग में, अस्पताल पहले अपने अपडेट को CKKS पद्धति का उपयोग करके एक डिजिटल तिजोरी के अंदर लॉक करते। केंद्रीय सर्वर, जो एक 'ईमानदार-लेकिन-जिज्ञासु' (honest-but-curious) समन्वयक के रूप में कार्य करता था, उसे लॉक किए गए पैकेज प्राप्त हुए। उसने व्यक्तिगत योगदानों को खोले बिना उन्हें औसत निकालने के लिए गणितीय गणना की। औसत पूरा होने के बाद ही अंतिम परिणाम को अनलॉक करने और ग्लोबल मॉडल को अपडेट करने के लिए एक विश्वसनीय पक्ष को वापस भेजा गया।
इस प्रयोग के परिणामों ने गोपनीयता और प्रदर्शन के बीच एक स्पष्ट और कठिन समझौते (trade-off) को उजागर किया। जब शोधकर्ताओं ने बिना एन्क्रिप्शन के वही कार्य चलाया, तो सिस्टम अविश्वसनीय रूप से प्रभावी था, जिसने उच्च सटीकता के साथ पुन: भर्ती के जोखिमों की सही पहचान की। मॉडल ने तेजी से सीखा और विश्वसनीय भविष्यवाणियां कीं। हालाँकि, इस बिना एन्क्रिप्शन वाली स्थिति में, सिस्टम असुरक्षित था; एक हमलावर अपडेट को देखकर सफलतापूर्वक अनुमान लगा सकता था कि किसी विशिष्ट मरीज का डेटा प्रशिक्षण का हिस्सा था या नहीं, जो गोपनीयता के वादे को तोड़ देता था।
जब शोधकर्ताओं ने एन्क्रिप्शन चालू किया, तो गोपनीयता सुरक्षा ठीक उसी तरह काम कर रही थी जैसा कि अध्ययन किए गए विशिष्ट हमले के मार्ग के लिए अपेक्षित था। सिस्टम ने प्रशिक्षण सेट में मरीज के डेटा के होने का अनुमान लगाने की हमलावर की क्षमता को यादृच्छिक संभावना (random chance) के स्तर तक कम कर दिया, जिससे सफलता दर ठीक पचास प्रतिशत हो गई, जो कि एक सिक्का उछालने के समान है। यह एक ईमानदार-लेकिन-जिज्ञासु सर्वर के विरुद्ध मूल्यांकित प्रोटोकॉल के खिलाफ सुरक्षा के अनुरूप है, हालांकि यह सभी गोपनीयता हमलों या सभी प्रतिकूल स्थितियों के विरुद्ध प्रतिरक्षा की गारंटी नहीं है। अस्पताल का डेटा वास्तव में निजी रहा, और केंद्रीय सर्वर को लॉक किए गए नंबरों के अलावा कुछ भी दिखाई नहीं दिया।
हालाँकि, इस गोपनीयता की एक बड़ी कीमत थी। एन्क्रिप्टेड सिस्टम बहुत धीमा था और इसे नेटवर्क पर भेजने के लिए बहुत अधिक डेटा की आवश्यकता थी। प्रत्येक अस्पताल से भेजे जाने वाले डेटा पैकेज का आकार चौबीस गुना बढ़ गया, जिसका अर्थ है कि प्रशिक्षण के प्रत्येक दौर के लिए संचार ट्रैफ़िक लगभग 3 मेगाबाइट से बढ़कर लगभग 38 मेगाबाइट हो गया। इसके अलावा, मॉडल की भविष्य बताने की शक्ति में उल्लेखनीय गिरावट आई। जबकि बिना एन्क्रिप्शन वाले मॉडल ने पुन: भर्ती की सही पहचान करने के लिए एक उच्च स्कोर प्राप्त किया था, एन्क्रिप्टेड संस्करण संघर्ष करता रहा, जिसकी क्षमता जो मरीजों के वापस आने और न आने के बीच अंतर करती थी, एक ऐसे स्तर तक गिर गई जो यादृच्छिक अनुमान से तो बेहतर था, लेकिन नैदानिक निर्णय लेने के लिए बहुत कम उपयोगी था। मॉडल को स्थिर होने में भी अधिक समय लगा, जिससे यह लॉक किए गए डेटा से सीखने के दौरान अधिक अस्थिर व्यवहार प्रदर्शित करने लगा।
अध्ययन यह निष्कर्ष निकालता है कि हालांकि इस पद्धति का उपयोग करके बहु-अस्पताल रोग भविष्यवाणी के लिए गोपनीयता-संरक्षण प्रणाली बनाना तकनीकी रूप से संभव है, लेकिन यह अभी तक एक पूर्ण समाधान नहीं है। तकनीक ने सफलतापूर्वक उन विशिष्ट गोपनीयता लीक को रोका जिनका शोधकर्ताओं ने परीक्षण किया था, लेकिन यह सिस्टम को बहुत भारी और कम सटीक बनाकर किया गया है। शोधकर्ताओं ने पाया कि इस विशिष्ट सेटअप के लिए, भविष्यवाण की गुणवत्ता में कमी और डेटा ट्रांसमिशन आवश्यकताओं में भारी वृद्धि महत्वपूर्ण बाधाएं हैं। वे सुझाव देते हैं कि इस दृष्टिकोण को वास्तविक दुनिया में उपयोगी बनाने के लिए, भविष्य के कार्यों को एन्क्रिप्टेड डेटा के आकार को कम करने और डिजिटल लॉक के बावजूद प्रभावी ढंग से सीखने की मॉडल की क्षमता में सुधार करने पर ध्यान केंद्रित करना चाहिए। तब तक, एक अत्यधिक सटीक मॉडल जो गोपनीयता को जोखिम में डालता है और एक पूरी तरह से निजी मॉडल जो कम सटीक है, के बीच चुनाव करना स्वास्थ्य सेवा संस्थानों के लिए एक कठिन संतुलन बना हुआ है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।