Institution-Specific LLM Prompting Recovers PHI That De-identification Systems and Their Gold Standards Both Miss
यह अध्ययन प्रदर्शित करता है कि संस्थान-विशिष्ट लार्ज लैंग्वेज मॉडल प्रॉम्प्टिंग पारंपरिक वि-पहचान (de-identification) प्रणालियों और उनके स्वर्ण मानकों (gold standards) द्वारा छूटे हुए स्थानीय रूप से निर्धारित संरक्षित स्वास्थ्य सूचनाओं को प्रभावी ढंग से पुनर्प्राप्त करती है, जो संदर्भ एनोटेशन त्रुटियों के ऑडिटिंग और सुधार को सक्षम करने के साथ-साथ बेहतर रिकॉल और प्रिसिजन प्राप्त करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
अस्पताल लिखित रिकॉर्डों की एक निरंतर धारा उत्पन्न करते हैं, जिसमें प्रवेश नोट से लेकर डिस्चार्ज सारांश तक, एक मरीज के जीवन के अंतरंग विवरण दर्ज होते हैं। अनुसंधान के लिए या देखभाल प्रणालियों को बेहतर बनाने के लिए इन रिकॉर्डों का उपयोग करने हेतु, डॉक्टरों और वैज्ञानिकों को पहले किसी भी ऐसी चीज़ को हटाना होता है जो किसी विशिष्ट व्यक्ति की पहचान कर सके, जैसे कि नाम, तिथियां, या मेडिकल रिकॉर्ड नंबर। यह प्रक्रिया, जिसे 'डी-आइडेंटिफिकेशन' (de-identification) कहा जाता है, एक कानूनी आवश्यकता है जिसे चिकित्सा डेटा साझा करने की अनुमति देते हुए गोपनीयता की रक्षा के लिए बनाया गया है। दशकों से, कंप्यूटरों को नियमों और पैटर्न का उपयोग करके इन विवरणों को खोजने और छिपाने का कार्य सौंपा गया है। हालाँकि, ये प्रणालियाँ अक्सर उस जानकारी के साथ संघर्ष करती हैं जो किसी विशिष्ट अस्पताल या क्लिनिक के लिए विशिष्ट होती है। किसी इमारत का एक साधारण संक्षिप्त रूप (abbreviation), किसी विभाग का एक अनूठा आंतरिक कोड, या किसी स्थानीय सुविधा का उपनाम, एक सामान्य कंप्यूटर प्रोग्राम के लिए अर्थहीन हो सकता है, लेकिन उस विशिष्ट संस्थान से परिचित व्यक्ति के लिए तुरंत मरीज की पहचान उजागर कर सकता है।
बेयलर कॉलेज ऑफ मेडिसिन और टेक्सस चिल्ड्रन्स हॉस्पिटल के शोधकर्ताओं की एक टीम ने यह परीक्षण करने के लिए हाथ मिलाया कि क्या उन्नत कंप्यूटर प्रोग्रामों की एक नई पीढ़ी, जिन्हें 'लार्ज लैंग्वेज मॉडल्स' (large language models) कहा जाता है, इस विशिष्ट समस्या को हल कर सकती है। ये मॉडल विशाल मात्रा में टेक्स्ट पर प्रशिक्षित होते हैं और पुराने सॉफ्टवेयर की तुलना में संदर्भ (context) को समझने की क्षमता रखते हैं। शोधकर्ता यह देखना चाहते थे कि क्या वे इन मॉडलों को केवल यह निर्देश देकर उन अस्पताल-विशिष्ट विवरणों को खोजने के लिए तैयार कर सकते हैं जिन्हें पारंपरिक प्रणालियाँ छोड़ देती हैं, बिना उन्हें शुरू से फिर से प्रशिक्षित (retrain) किए। वे यह भी देखना चाहते थे कि क्या यह दृष्टिकोण एक सामान्य जाल से बच सकता है: इतनी अधिक जानकारी हटा देना कि मेडिकल नोट्स बेकार हो जाएं, या बहुत अधिक जानकारी छोड़ देना जिससे गोपनीयता भंग होने का जोखिम हो।
टीम ने बाल चिकित्सा ऑन्कोलॉजी (pediatric oncology) के रोगियों के सौ वास्तविक क्लिनिकल नोट्स एकत्र किए, जो कैंसर से पीड़ित बच्चों के रिकॉर्ड हैं। इन नोट्स की मानव विशेषज्ञों द्वारा सावधानीपूर्वक समीक्षा की गई थी जिन्होंने हर उस निजी जानकारी को चिह्नित किया जिसे वे ढूंढ सकते थे, जिससे एक सख्त चेकलिस्ट तैयार हुई कि क्या छिपाया जाना चाहिए। इस चेकलिस्ट में नाम और तिथियों जैसी मानक चीजें शामिल थीं, लेकिन इसमें कठिन, स्थानीय विवरण भी शामिल थे जैसे कि किसी विशिष्ट अस्पताल विंग का नाम या किसी स्टाफ सदस्य का पेजर नंबर। शोधकर्ताओं ने इन नोट्स को प्रोसेस करने के लिए आठ अलग-अलग लार्ज लैंग्वेज मॉडल्स को कहा। उन्होंने मॉडलों का तीन अलग-अलग तरीकों से परीक्षण किया। सबसे पहले, उन्होंने मॉडलों को संघीय गोपनीयता कानूनों पर आधारित निर्देशों का एक मानक सेट दिया। इसके बाद, उन्होंने स्थानीय, अस्पताल-विशिष्ट विवरणों को खोजने के लिए विशिष्ट निर्देश जोड़े जिन्हें मानक नियम अक्सर अनदेखा कर देते हैं। अंत में, उन्होंने निर्देश का एक तीसरा स्तर जोड़ा ताकि मॉडलों को ठीक से बताया जा सके कि क्या नहीं छिपाना है, यह सुनिश्चित करते हुए कि दवा की खुराक या लैब परिणामों जैसे महत्वपूर्ण चिकित्सा तथ्य गलती से न हटा दिए जाएं।
परिणामों ने दिखाया कि नए कंप्यूटर मॉडल मौजूदा विशेष सॉफ्टवेयर की तुलना में अपने काम में काफी बेहतर थे। सबसे अच्छे मॉडल ने लगभग सभी निजी जानकारी को खोजा और छिपाया, जिसमें वे कठिन, स्थानीय विवरण भी शामिल थे जिन्हें पुराने सिस्टम मिस कर गए थे। जब शोधकर्ताओं ने अस्पताल के अपने संक्षिप्त रूपों और इमारतों के नामों के बारे में विशिष्ट निर्देश जोड़े, तो मॉडलों ने उन विवरणों में से लगभग अस्सी प्रतिशत को सफलतापूर्वक प्राप्त कर लिया जिन्हें मानक नियमों ने पकड़ने में विफल रहा था। महत्वपूर्ण रूप से, शोधकर्ताओं ने पाया कि वे मॉडलों की बहुत अधिक आक्रामक होने की प्रवृत्ति को केवल उन्हें यह बताकर ठीक कर सकते थे कि किन चीजों को छोड़ देना है। इसने मॉडलों को गोपनीयता के प्रति बहुत सावधान और चिकित्सा पाठ को उपयोगी बनाए रखने के प्रति भी बहुत सावधान रहने की अनुमति दी।
अध्ययन ने एक अधिक जटिल विचार का भी परीक्षण किया: क्या कंप्यूटर प्रोग्रामों की एक टीम मिलकर काम कर सकती है, जहाँ एक दूसरे के काम की जाँच करता है, क्या वे एक अकेले प्रोग्राम की तुलना में बेहतर काम कर सकते हैं? शोधकर्ताओं ने मल्टी-स्टेप टीमों के विभिन्न संयोजनों का परीक्षण किया, लेकिन उनमें से कोई भी एक ही पास (pass) में काम करने वाले एक एकल, अच्छी तरह से निर्देशित मॉडल से बेहतर प्रदर्शन नहीं कर सका। वास्तव में, जटिल टीमें अक्सर कम सुसंगत थीं और उनके लिए अधिक कंप्यूटिंग पावर की आवश्यकता थी। सबसे प्रभावी दृष्टिकोण बस एक एकल मॉडल को यह स्पष्ट और विस्तृत सूची देना था कि क्या देखना है और क्या बचना है।
सबसे आश्चर्यजनक खोज तब हुई जब शोधकर्ताओं ने मॉडलों द्वारा की गई गलतियों का बारीकी से निरीक्षण किया। उन्होंने पाया कि मॉडल अक्सर उन सूचनाओं को छिपाने में सही थे जिन्हें मानव विशेषज्ञों ने मिस कर दिया था। जब शोधकर्ताओं ने नोट्स की पुन: जांच की, तो उन्होंने पुष्टि की कि मॉडलों ने जिन वस्तुओं को छिपाया था, वे वास्तव में निजी जानकारी थीं जिन्हें मूल चेकलिस्ट ने अनदेखा कर दिया था। यह सुझाव देता है कि इन प्रiy प्रणालियों को प्रशिक्षित और परीक्षण करने के लिए उपयोग की जाने वाली मानक सूचियाँ अक्सर अधूरी होती हैं। मॉडल केवल नियमों का पालन नहीं कर रहे थे; वे प्रभावी रूप से नियमों का स्वयं ऑडिट कर रहे थे, उन अंतरालों को ढूंढ रहे थे जिन्हें मानव एनोटेटरों ने मिस कर दिया था।
शोधकर्ताओं ने निष्कर्ष निकाला कि बेहतर गोपनीयता सुरक्षा की कुंजी अधिक जटिल कंप्यूटर टीमें बनाना नहीं है, बल्कि मॉडलों को बेहतर निर्देश देना है। अस्पताल को किन विशिष्ट, स्थानीय विवरणों की रक्षा करने की आवश्यकता है इसे नाम देकर और मॉडलों को बहुत अधिक जानकारी न हटाने की चेतावनी देकर, एक एकल कंप्यूटर कॉल उस स्तर की सुरक्षा और सटीकता प्राप्त कर सकती है जिसे पुराने सिस्टम महंगे रिट्रेनिंग के बिना प्राप्त नहीं कर सकते। यह दृष्टिकोण किसी भी विशिष्ट अस्पताल या क्लिनिक के लिए गोपनीयता सुरक्षा को अनुकूलित करने का एक लचीला तरीका प्रदान करता है, यह सुनिश्चित करते हुए कि मरीज का डेटा सुरक्षित रहे बिना उन चिकित्सा विवरणों को खोए जो जीवन बचाने के लिए आवश्यक हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।