Developing an open-source framework for LLM evaluation of patients using EHR clinical documentation; performance of LLMs relative to medical professionals
यह अध्ययन प्रदर्शित करता है कि वर्तमान लार्ज लैंग्वेज मॉडल्स ईएनटी (ENT) इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड से संरचित नैदानिक जानकारी निकालने में चिकित्सा पेशेवरों के तुलनीय इंटर-रेटर विश्वसनीयता प्राप्त करने में विफल रहते हैं, जो यह सुझाव देता है कि वे स्वायत्त नैदानिक तैनाती के बजाय मानव सत्यापन की आवश्यकता वाले प्रारंभिक डेटा निष्कर्षण के लिए सबसे उपयुक्त हैं।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
आज के अस्पतालों में लिखित रिकॉर्ड का एक विशाल महासागर उत्पन्न होता है। हर मरीज का दौरा, हर परीक्षण का परिणाम और उपचार का हर निर्णय डिजिटल नोट्स के रूप में दर्ज किया जाता है जिन्हें इलेक्ट्रॉनिक हेल्थ रिकॉर्ड कहा जाता है। ये दस्तावेज़ विवरणों से समृद्ध होते हैं, जिनमें उन विशिष्ट शब्दों का समावेश होता है जिनका उपयोग डॉक्टर लक्षणों का वर्णन करने, स्थितियों का निदान करने और देखभाल की योजना बनाने के लिए करते हैं। दशकों से, इन असंरचित कहानियों को व्यवस्थित, खोजने योग्य डेटा में बदलना एक कठिन कार्य रहा है, जिसमें अक्सर मनुष्यों को जानकारी को हाथ से पढ़ने और फिर से लिखने की आवश्यकता होती थी। हाल ही में, 'लार्ज लैंग्वेज मॉडल' नामक एक नए प्रकार के कंप्यूटर प्रोग्राम का उदय हुआ है। ये सिस्टम भारी मात्रा में टेक्स्ट पर प्रशिक्षित होते हैं और मानवीय भाषा को आश्चर्यजनक प्रवाह के साथ पढ़, समझ और सारांशित कर सकते हैं। उन्होंने दिखाया है कि वे चिकित्सा संबंधी प्रश्नों के उत्तर दे सकते हैं और लाइसेंसिंग परीक्षाओं को पास कर सकते हैं, जिससे कई लोग यह सोचने पर मजबूर हैं कि क्या वे रोगी के रिकॉर्ड को भी पढ़ सकते हैं और उनके भीतर मौजूद महत्वपूर्ण तथ्यों को स्वचालित रूप से निकाल सकते हैं।
यह प्रश्न केवल समय बचाने के बारे में नहीं है; यह सुरक्षा और सटीकता के बारे में भी है। यदि कोई कंप्यूटर डॉक्टरों को रोगी की देखभाल प्रबंधित करने में मदद करने वाला है, तो उसे बिना कुछ मनगढ़ंत बनाए या महत्वपूर्ण विवरणों को छोड़े बिना सही जानकारी ढूंढनी चाहिए। एक नए अध्ययन ने इस क्षमता का सीधे परीक्षण करने का निर्णय लिया। शोधकर्ताओं ने कान, नाक और गले के क्लीनिकों के लगभग सौ वास्तविक रोगी रिकॉर्ड एकत्र किए और मानव डॉक्टरों और सात अलग-अलग लार्ज लैंग्वेज मॉडल्स दोनों से उन्हें पढ़ने के लिए कहा। कार्य विशिष्ट तथ्यों को निकालना था, जैसे कि रोगी की आयु, उनके लक्षण, उनका निदान और उन्हें मिले उपचार। यह सुनिश्चित करने के लिए कि हर कोई एक ही भाषा बोल रहा है, शोधकर्ताओं ने यह आवश्यक बनाया कि प्रत्येक जानकारी को एक मानकीकृत कोड में अनुवादित किया जाए जिसका उपयोग दुनिया भर के अस्पतालों में किया जाता है। इसने इस बात की सटीक तुलना करने की अनुमति दी कि मशीनें मनुष्यों के मुकाबले कैसा प्रदर्शन करती हैं।
परिणामों ने मानवीय विशेषज्ञता और वर्तमान कृत्रिम बुद्धिमत्ता के बीच एक स्पष्ट अंतर को प्रकट किया। जब अध्ययन के चौदह डॉक्टरों ने उन्हीं रिकॉर्ड्स को पढ़ा, तो वे निकाली गई जानकारी के बारे में 81 प्रतिशत समय एक-दूसरे से सहमत थे। सहमति के इस उच्च स्तर ने दिखाया कि डॉक्टर नोट्स की व्याख्या निरंतरता के साथ कर रहे थे। हालाँकि, जब कंप्यूटर मॉडल्स की तुलना डॉक्टरों से की गई, तो सहमति काफी गिरकर लगभग 66 प्रतिशत रह गई। दूसरे शब्दों में, मशीनें अभी भी एक ही टेक्स्ट से समान तथ्यों की पहचान करने में मनुष्यों जितनी विश्वसनीय नहीं थीं। अध्ययन ने विभिन्न आकारों के मॉडल्स का परीक्षण किया, जिनमें सैकड़ों अरबों कनेक्शन वाले विशाल सिस्टम से लेकर छोटे मॉडल तक शामिल थे जो स्थानीय कंप्यूटरों पर चल सकते हैं। उनमें से कोई भी चिकित्सा पेशेवरों द्वारा दिखाई गई निरंतरता के स्तर तक नहीं पहुँच सका।
प्रदर्शन इस बात पर निर्भर करता था कि किस प्रकार की जानकारी निकाली जा रही है। मॉडल उपचार और परीक्षण परिणामों को खोजने में काफी अच्छे थे, जो अक्सर स्पष्ट और मानक तरीकों से लिखे जाते हैं। वे संकेतों और निदान के मामले में कम सफल रहे, जिनके लिए अक्सर नैदानिक संदर्भ (क्लिनिकल कॉन्टेक्स्ट) की गहरी समझ की आवश्यकता होती है। दिलचस्प बात यह है कि कंप्यूटरों ने डॉक्टरों की तुलना में अधिक जानकारी खोजी, विशेष रूप से जोखिम कारकों (रिस्क फैक्टर्स) के संबंध में। जहाँ डॉक्टर अक्सर तात्कालिक समस्या पर ध्यान केंद्रित करते हैं, वहीं मॉडल टेक्स्ट में उल्लेखित हर संभावित जोखिम को चिह्नित करते प्रतीत होते हैं। यह सुझाव देता है कि मशीनें केवल मानवीय व्यवहार की नकल नहीं कर रही हैं, बल्कि वे टेक्स्ट को अलग तरह से प्रोसेस कर रही हैं, कभी-कभी उन विवरणों को पकड़ लेती हैं जिन्हें एक मानव अनदेखा कर सकता है, लेकिन संभावित रूप से ऐसी चीजें भी चिह्नित कर सकती हैं जो नैदानिक रूप से प्रासंगिक नहीं हैं।
इन अंतरों के बावजूद, मशीनों ने दिखाया कि यदि सही ढंग से उपयोग किया जाए तो वे उपयोगी उपकरण हो सकती हैं। अध्ययन में पाया गया कि जब मॉडल्स ने किसी जानकारी की पहचान की, तो वे आमतौर पर सही थे, जिसकी शुद्धता दर (प्रिसिजन रेट) 97 प्रतिशत थी। इसका अर्थ है कि वे वहां मौजूद तथ्यों को बहुत कम गलत बताते हैं। हालाँकि, वे लगभग 15 प्रतिशत समय कुछ जानकारी को मिस (छोड़) देते हैं। यह पैटर्न इन उपकरणों के भविष्य के लिए एक विशिष्ट भूमिका की ओर संकेत करता है: वे एक 'प्रथम चरण' (फर्स्ट पास) के रूप में कार्य करने के लिए सबसे उपयुक्त हैं, जो डॉक्टर की समीक्षा के लिए संभावित उम्मीदवारों को निकालने हेतु रिकॉर्ड को तेजी से स्कैन कर सकें। अंतिम निर्णय और सत्यापन अभी भी एक मानव द्वारा किया जाना आवश्यक होगा। शोधकर्ताओं ने निष्कर्ष निकाला कि हालांकि ये मॉडल्स शक्तिशाली हैं, लेकिन वे अभी तक क्लिनिकल सेटिंग में अकेले काम करने के लिए तैयार नहीं हैं। उन्हें सहायकों के रूप में देखा जाना चाहिए जो चिकित्सा डेटा के प्रवाह को व्यवस्थित करने में मदद कर सकते हैं, बशर्ते कि उनके काम की जांच के लिए एक मानव विशेषज्ञ हमेशा मौजूद हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।