← नवीनतम पेपर
💻 computer science

Client-Side Ephemeral De-Identification of Protected Health Information (PHI) in Multi-Center Clinical Trial Analysis and Large Language Model Workflows: Validating Zero-Trust Data Sanitization Under HIPAA Safe Harbor Section 164.514(b)

यह शोध पत्र ज़ीरो-ट्रस्ट डेटा सैनिटाइजेशन (ZTDS) को प्रस्तुत और मान्य करता है, जो एक क्लाइंट-साइड, ऑन-डिवाइस आर्किटेक्चरल फ्रेमवर्क है, जो ट्रांसमिशन से पहले वोलेटाइल मेमोरी के भीतर संरक्षित स्वास्थ्य जानकारी (PHI) का रीयल-टाइम, HIPAA सेफ़ हार्बर-अनुपालक डी-आइडेंटिफिकेशन करता है, जिससे बिना किसी बिजनेस एसोसिएट एग्रीमेंट की आवश्यकता के या डेटा एक्सफ़िल्ट्रेशन के जोखिम के, क्लिनिकल रिसर्च में सार्वजनिक लार्ज लैंग्वेज मॉडल्स के सुरक्षित, ज़ीरो-ट्रस्ट उपयोग को सक्षम बनाया जा सके।

मूल लेखक: Ilya Sibiryakov

प्रकाशित 2026-09-22
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ilya Sibiryakov

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक अस्पताल में, डॉक्टर के नोट्स केवल एक मरीज के दौरे का रिकॉर्ड मात्र नहीं होते; वे चिकित्सा तथ्यों के साथ बुने गए व्यक्तिगत इतिहास का एक जटिल ताना-बाना होते हैं। इन दस्तावेजों में नाम, जन्म तिथि, विशिष्ट स्थान और अद्वितीय पहचान संख्याएँ शामिल होती हैं, जो सभी सख्त गोपनीयता कानूनों द्वारा संरक्षित हैं जिन्हें मरीज की पहचान सुरक्षित रखने के लिए बनाया गया है। साथ ही, बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) के रूप में ज्ञात शक्तिशाली कंप्यूटर प्रोग्रामों की एक नई लहर उभरी है। ये उपकरण सेकंडों में हजारों पन्नों के चिकित्सा पाठ को पढ़ सकते हैं, जिससे शोधकर्ताओं को बीमारियों के पैटर्न पहचानने, जटिल परीक्षण परिणामों का सारांश निकालने या नैदानिक रिपोर्ट तैयार करने में अविश्वसनीय गति से मदद मिलती है। हालाँकि, इन दोनों दुनियाओं के बीच एक महत्वपूर्ण बाधा खड़ी है। इन शक्तिशाली उपकरणों का उपयोग करने के लिए, एक अस्पताल को आमतौर पर अपने निजी मरीज के नोट्स एक प्रौद्योगिकी कंपनी के स्वामित्व वाले रिमोट सर्वर पर भेजने पड़ते हैं। यह स्थानांतरण एक कानूनी और सुरक्षा संबंधी दुविधा पैदा करता है: तीसरे पक्ष को कच्चे मरीज के डेटा को भेजने के लिए अक्सर लंबे कानूनी अनुबंधों की आवश्यकता होती है और इस बात का जोखिम रहता है कि संवेदनशील जानकारी लीक हो सकती है या जहाँ नहीं होनी चाहिए वहाँ संग्रहीत की जा सकती है।

इल्या सिबिर्याकोव नामक एक शोधकर्ता ने इस अंतर को पाटने का एक अलग तरीका प्रस्तावित किया है, जो काम को धीमा किए बिना डेटा को सुरक्षित रखता है। क्लाउड पर कच्चे नोट्स भेजने के बजाय, उनकी टीम ने एक ऐसा सिस्टम विकसित किया है जो डॉक्टर के कंप्यूटर पर सीधे बैठे एक फिल्टर की तरह कार्य करता है। यह सिस्टम, जिसे 'जीरो-ट्रस्ट डेटा सैनिटाइजेशन' कहा जाता है, टेक्स्ट को टाइप या पेस्ट होते ही स्कैन करता है। यह तुरंत हर व्यक्तिगत जानकारी की पहचान करता है और डेटा के कंप्यूटर छोड़ने से पहले ही उसे एक सामान्य, अर्थहीन कोड से बदल देता है। कंप्यूटर फिर केवल इन कोड्स को आर्टिफिशियल इंटेलिजेंस (AI) को भेजता है। AI चिकित्सा जानकारी को प्रोसेस करता है और कोड का उपयोग करके उत्तर वापस करता है। अंत में, सिस्टम डॉक्टर के कंप्यूटर पर उन कोड्स को मूल नामों और नंबरों के साथ बदल देता है, जिससे डॉक्टर अंतिम रिपोर्ट को ऐसे पढ़ पाता है जैसे कुछ भी न बदला हो। यह प्रक्रिया इतनी तेज़ी से और पूरी तरह से कंप्यूटर की अस्थायी मेमोरी के भीतर होती है कि डेटा कभी भी अपने मूल रूप में हार्ड ड्राइव या रिमोट सर्वर को नहीं छूता है।

इस कार्य का मूल एक ऐसी विधि है जिसे स्वास्थ्य बीमा पोर्टेबिलिटी और जवाबदेही अधिनियम (HIPAA) के सख्त नियमों, विशेष रूप से "सेफ हार्बर" नामक एक खंड को संतुष्ट करने के लिए डिज़ाइन किया गया है। यह नियम बताता है कि यदि किसी दस्तावेज़ से व्यक्तिगत पहचानकर्ताओं के सभी 18 प्रकारों को हटा दिया जाता है, तो इसे अब निजी स्वास्थ्य जानकारी नहीं माना जाता है और इसे स्वतंत्र रूप से साझा किया जा सकता है। शोधकर्ताओं ने एक ऐसा टूल बनाया है जो स्वचालित रूप से इन 18 श्रेणियों को खोजता है, जिनमें नाम, पते, फोन नंबर, सामाजिक सुरक्षा नंबर, मेडिकल रिकॉर्ड नंबर और यहाँ तक कि जन्मदिन या प्रवेश की तारीखों जैसे विशिष्ट विवरण शामिल हैं। 2,500 कृत्रिम (सिंथेटिक) चिकित्सा दस्तावेजों के एक परीक्षण में, जो इन प्रकार की सूचनाओं से भरे हुए थे, सिस्टम ने व्यक्तिगत विवरणों की सफलतापूर्वक 99.94% पहचान की और उन्हें बदला। यह सिस्टम उल्लेखनीय रूप से तेज़ भी था, जिसने एक मानक क्लिनिकल नोट को साफ करने में औसतन केवल 1.84 मिलीसेकंड का समय लिया। इसकी तुलना में, पारंपरिक तरीके जो सफाई के लिए डेटा को केंद्रीय सर्वर पर भेजते हैं, उन्हें 242 मिलीसेकंड से अधिक का समय लगता है, जिससे यह नया दृष्टिकोण सौ गुना से भी अधिक तेज़ हो जाता है।

जो चीज़ इस दृष्टिकोण को विशिष्ट बनाती है, वह है कि सफाई कहाँ होती है। पारंपरिक मॉडल में, कच्चा टेक्स्ट इंटरनेट के माध्यम से एक सर्वर तक जाता है, जहाँ इसे साफ किया जाता है और फिर वापस भेजा जाता है। यह यात्रा एक भेद्यता (vulnerability) की खिड़की बनाती है जहाँ डेटा नेटवर्क पर मौजूद होता है और इसे संभावित रूप से इंटरसेप्ट किया जा सकता है या सेवा प्रदाता द्वारा संग्रहीत किया जा सकता है। नया सिस्टम यह सुनिश्चित करता है कि सफाई पूरी तरह से उपयोगकर्ता के डिवाइस पर, कंप्यूटर की अस्थिर मेमोरी (volatile memory) के भीतर हो, जो एक प्रकार का अस्थायी स्टोरेज है जो प्रोग्राम बंद होते ही गायब हो जाता है। शोधकर्ताओं ने यह सत्यापित करने के लिए सिस्टम का परीक्षण तब किया जब कंप्यूटर पूरी तरह से इंटरनेट से डिस्कनेक्ट था। इस ऑफलाइन स्थिति में भी, सिस्टम ने व्यक्तिगत जानकारी की सफलतापूर्वक पहचान की और उसे बदल दिया, जिससे यह सिद्ध हुआ कि यह कार्य करने के लिए किसी बाहरी कनेक्शन पर निर्भर नहीं है। इसके अलावा, जब सिस्टम का परीक्षण इंटरनेट कनेक्शन के साथ किया गया, तो नेटवर्क मॉनिटरिंग टूल्स ने पुष्टि की कि वास्तविक व्यक्तिगत जानकारी का शून्य बाइट भी नेटवर्क के पार प्रसारित नहीं हुआ।

अध्ययन ने स्वचालित सफाई उपकरणों के साथ जुड़ी एक सामान्य समस्या को भी संबोधित किया है: यह डर कि वे गलती से महत्वपूर्ण चिकित्सा शब्दों को हटा सकते हैं। उदाहरण के लिए, एक साधारण फ़िल्टर किसी व्यक्ति के नाम के रूप में चिकित्सा संक्षिप्त नाम (abbreviation) को गलत समझ सकता है और उसे हटा सकता है, जिससे नोट का अर्थ बिगड़ सकता है। इसे रोकने के लिए, सिस्टम में 12,000 से अधिक चिकित्सा शब्दों और संक्षिप्त रूपों की एक विशेष सूची शामिल है। परीक्षणों में, इसने सिस्टम को व्यक्तिगत डेटा को साफ करने के साथ-साथ महत्वपूर्ण चिकित्सा भाषा को अछूता रखने में सक्षम बनाया, जिसके परिणामस्वरूप त्रुटि दर बहुत कम यानी 0.12% रही। शोधकर्ताओं ने प्रदर्शित किया कि यह विधि अस्पतालों और अनुसंधान टीमों को प्रौद्योगिकी कंपनियों के साथ जटिल कानूनी समझौतों पर हस्ताक्षर किए बिना उन्नत आर्टिफिशियल इंटेलिजेंस टूल का उपयोग करने की अनुमति देती है, क्योंकि कंपनियों को वास्तव में निजी मरीज का डेटा प्राप्त ही नहीं होता है।

इस कार्य के निहितार्थ कई अस्पतालों में क्लिनिकल ट्रायल्स के प्रबंधन के तरीके तक विस्तृत हैं। दर्जनों चिकित्सा केंद्रों वाले एक बड़े अध्ययन में, शोधकर्ताओं को अक्सर यह पता लगाने के लिए कि दवा कैसे काम करती है, विभिन्न साइटों के नोट्स को संयोजित करने की आवश्यकता होती है। आमतौर पर, इसके लिए यह सुनिश्चित करने के लिए एक विशाल कानूनी और प्रशासनिक प्रयास की आवश्यकता होती है कि प्रत्येक साइट का डेटा सुरक्षित रूप से साझा किया जाए। इस नए सिस्टम के साथ, किसी भी अस्पताल का शोधकर्ता एक सुरक्षित इंटरफ़ेस में नोट्स टाइप कर सकता है, उन्हें व्यक्तिगत विवरणों से तुरंत मुक्त करवा सकता है, और उन्हें एक केंद्रीय विश्लेषण टूल को भेज सकता है। अंतिम परिणाम केवल अधिकृत शोधकर्ता के लिए मूल रोगी पहचान को बहाल करके वापस किए जाएंगे। शोधकर्ताओं ने पुष्टि की है कि यह प्रक्रिया कंप्यूटर के हार्ड ड्राइव पर कोई निशान नहीं छोड़ती है; एक बार सत्र समाप्त होने के बाद, कोड को वास्तविक नामों से जोड़ने वाला अस्थायी मानचित्र तुरंत नष्ट हो जाता है।

यह शोध स्वास्थ्य सेवा में गोपनीयता की आवश्यकता और नवाचार की इच्छा के बीच बढ़ते तनाव का एक व्यावहारिक समाधान प्रस्तुत करता है। सुरक्षा चरण को प्रक्रिया के बिल्कुल प्रारंभ में, ठीक उसी क्षण, स्थानांतरित करके जब डॉक्टर एक नोट टाइप करता है, यह सिस्टम डेटा को ट्रांसमिशन के दौरान कभी भी असुरक्षित स्थिति में जाने की आवश्यकता को समाप्त कर देता है। लेखक इस बात पर जोर देते हैं कि यह कोई सैद्धांतिक अवधारणा नहीं है बल्कि एक कार्यशील प्रणाली है जिसका कड़े नियामक मानकों के विरुद्ध परीक्षण किया गया है। यह एक ऐसा मार्ग प्रदान करता है जहाँ अस्पताल रोगी देखभाल में सुधार करने और अनुसंधान को गति देने के लिए आधुनिक आर्टिफिशियल इंटेलिजेंस का लाभ उठा सकते हैं, और साथ ही डेटा गोपनीयता के उच्चतम मानकों को बनाए रखते हुए कानून का पालन भी कर सकते हैं। यह कार्य सुझाव देता है कि सही तकनीकी सुरक्षा उपायों के साथ, डेटा उल्लंघन का डर आज के चिकित्सा क्षेत्र में उपलब्ध सबसे उन्नत उपकरणों का उपयोग करने में बाधा नहीं बनना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →