Automated Identification of Complex Percutaneous Coronary Intervention from Cardiac Catheterization Reports Using Large Language Models
यह अध्ययन प्रदर्शित करता है कि उच्च-क्षमता वाले ओपन-सोर्स लार्ज लैंग्वेज मॉडल्स, विशेष रूप से Llama 3.3 70B, मुक्त-पाठ (free-text) कार्डियक कैथीटेराइजेशन रिपोर्टों से जटिल परक्यूटेनियस कोरोनरी इंटरवेंशन प्रक्रियाओं को सटीक और स्वचालित रूप से पहचान सकते हैं और प्रमुख चरों (variables) को निकाल सकते हैं, जो हृदय रोग संबंधी अनुसंधान के लिए श्रम-गहन मैन्युअल एब्स्ट्रैक्शन के एक स्केलेबल विकल्प की पेशकश करते हैं।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
अस्पतालों में हर दिन असंरचित (unstructured) टेक्स्ट का एक विशाल महासागर उत्पन्न होता है। इनमें सबसे महत्वपूर्ण दस्तावेजों में से एक हार्ट कैथेटराइजेशन के बाद लिखे गए नैरेटिव रिपोर्ट हैं, जो एक ऐसी प्रक्रिया है जहाँ डॉक्टर हृदय की रक्त वाहिकाओं की जांच करने के लिए धमनियों के माध्यम से एक पतली ट्यूब डालते हैं। ये रिपोर्ट मरीज के हृदय की शारीरिक रचना और रुकावटों को ठीक करने के लिए उपयोग की जाने वाली विशिष्ट तकनीकों के बारे में विवरणों से समृद्ध होती हैं, लेकिन वे चेक-बॉक्स वाले व्यवस्थित क्षेत्रों के बजाय मुक्त-प्रवाह वाले अनुच्छेदों (paragraphs) में लिखी जाती हैं। शोधकर्ताओं और गुणवत्ता सुधार टीमों के लिए, यह एक बड़ी बाधा उत्पन्न करता है। यह अध्ययन करने के लिए कि ये प्रक्रियाएं कितनी अच्छी तरह काम करती हैं या पूरे स्वास्थ्य तंत्र में मामलों की जटिलता को ट्रैक करने के लिए, मानव विशेषज्ञों को हजारों इन रिपोर्टों को मैन्युअल रूप से पढ़ना पड़ता है और विशिष्ट डेटा बिंदुओं को निकालना पड़ता है। यह प्रक्रिया धीमी, महंगी और स्केल करने में कठिन है, जो अक्सर महत्वपूर्ण चिकित्सा अध्ययनों के आकार और गति को सीमित कर देती है।
लार्ज लैंग्वेज मॉडल्स (Large Language Models) का उदय, जो मानव जैसी भाषा समझने और उत्पन्न करने में सक्षम कृत्रिम बुद्धिमत्ता (AI) का एक प्रकार है, इस समस्या का एक संभावित समाधान प्रदान करता है। इन प्रणालियों को जटिल दस्तावेजों को पढ़ने और विशिष्ट तथ्यों को निकालने के लिए प्रशिक्षित किया जा सकता है, बिल्कुल एक बहुत तेज़, अथक शोध सहायक की तरह। हालांकि, यह स्पष्ट नहीं था कि क्या ये उपकरण हृदय प्रक्रिया संबंधी नोट्स में पाई जाने वाली सूक्ष्म और विशिष्ट भाषा को संभाल सकते हैं, विशेष रूप से तब जब उन्हें उन "जटिल" मामलों की पहचान करने के लिए कहा जाए जिनमें कई रुकावटें या कठिन तकनीकें शामिल हों। शोधकर्ताओं की एक टीम ने वास्तविक दुनिया की हार्ट कैथेटराइजेशन रिपोर्ट के एक बड़े संग्रह का उपयोग करके इस प्रश्न का परीक्षण करने का निर्णय लिया।
शोधकर्ताओं ने येल न्यू हेवन हेल्थ सिस्टम के तीन अलग-अलग अस्पतालों से 1,412 डी-आइडेंटिफाइड (de-identified) प्रक्रिया नोट्स एकत्र किए। ये दस्तावेज 2011 से 2017 के बीच की गई प्रक्रियाओं को कवर करते थे और इनमें डायग्नोस्टिक परीक्षणों और वास्तविक हस्तक्षेपों (interventions) का मिश्रण शामिल था, जहाँ डॉक्टरों ने स्टेंट लगाए या अवरुद्ध धमनियों को खोलने के लिए गुब्बारों (balloons) का उपयोग किया। एक विश्वसनीय मानक बनाने के लिए, विशेषज्ञ हृदय विशेषज्ञों के एक समूह ने प्रत्येक नोट को मैन्युअल रूप से पढ़ा। उन्होंने पहले यह निर्धारित किया कि क्या एक रिपोर्ट उस प्रक्रिया का वर्णन करती है जहाँ कोरोनरी धमनी के उपचार के लिए वास्तव में स्टेंट या बैलून का उपयोग किया गया था। जिन मामलों में ऐसा था, उन्होंने फिर छह विशिष्ट विवरण निकाले जो एक "जटिल" प्रक्रिया को परिभाषित करते हैं: उपचारित रक्त वाहिकाओं की संख्या, ठीक की गई विशिष्ट रुकावटों की संख्या, लगाए गए स्टेंट की कुल संख्या, क्या एक शाखा वाली वाहिका (branching vessel) के लिए विशिष्ट दो-स्टेंट तकनीक का उपयोग किया गया था, स्टेंट की कुल संयुक्त लंबाई, और क्या एक क्रोनिक टोटल ऑक्लूजन (complete, long-standing blockage) का उपचार किया गया था।
इस मानव-सत्यापित "गोल्ड स्टैंडर्ड" के साथ, टीम ने तीन अलग-अलग आर्टिफिशियल इंटेलिजेंस मॉडल्स का परीक्षण किया ताकि यह देखा जा सके कि क्या वे विशेषज्ञों के कार्य की नकल कर सकते हैं। उन्होंने ऐसे मॉडल्स चुने जो ओपन-सोर्स थे, जिसका अर्थ है कि उनका कोड और वेट्स (weights) सार्वजनिक रूप से उपलब्ध थे, जिससे शोधकर्ताओं को रोगी की गोपनीयता की रक्षा के लिए उन्हें सुरक्षित, स्थानीय कंप्यूटरों पर चलाने की अनुमति मिली। एक मॉडल एक विशाल, सामान्य-उद्देश्य वाला सिस्टम था जिसमें 70 बिलियन पैरामीटर्स थे, जो इसके आकार और तर्क करने की क्षमता का एक माप है। अन्य दो छोटे मॉडल्स थे जो विशेष रूप से मेडिकल लिटरेचर पर प्री-ट्रेन किए गए थे, जिनमें से प्रत्येक में 7 बिलियन पैरामीटर्स थे, जिन्हें क्लिनिकल शब्दावली को समझने के लिए डिज़ाइन किया गया था। शोधकर्ताओं ने सभी तीन मॉडल्स को समान टेक्स्ट प्रॉम्प्ट और रिपोर्ट दी, और उनसे यह पहचानने के लिए कहा कि क्या कोई प्रक्रिया हुई थी और छह विशिष्ट वेरिएबल्स को निकालने के लिए कहा।
परिणामों ने क्षमता में एक स्पष्ट अंतर दिखाया। बड़ा, सामान्य-उद्देश्य वाला मॉडल दो छोटे, मेडिकल-विशिष्ट मॉडल्स की तुलना में काफी बेहतर प्रदर्शन करता है। केवल यह पहचानने के लिए कि क्या एक रिपोर्ट हृदय प्रक्रिया का वर्णन करती है, बड़े मॉडल ने पूर्ण संवेदनशीलता (sensitivity) प्राप्त की, जिसका अर्थ है कि उसने वास्तविक प्रक्रियाओं को शून्य मिस किया, और गैर-प्रक्रियाओं को उच्च सटीकता के साथ सही ढंग से पहचाना। इसके विपरीत, छोटे मॉडल्स संघर्ष करते दिखे, जिनमें से एक अक्सर गैर-प्रक्रिया नोट्स को प्रक्रियाओं के रूप में गलत पहचानता था और दूसरा वास्तविक प्रक्रियाओं को पहचानने में लगभग पूरी तरह विफल रहा।
जब कार्य के लिए छह जटिल विवरणों को निकालना आवश्यक था, तो यह अंतर और बढ़ गया। बड़े मॉडल ने स्टेंट की संख्या और स्टेंट की कुल लंबाई को बहुत उच्च सटीकता के साथ सफलतापूर्वक पहचाना, जो अक्सर 90 प्रतिशत से अधिक था। इसने उपचारित वाहिकाओं की संख्या की पहचान करने में भी अच्छा प्रदर्शन किया। हालांकि, इसका प्रदर्शन उन वेरिएबल्स पर थोड़ा कम हो गया जिनमें अधिक व्याख्या (interpretation) की आवश्यकता थी, जैसे कि सटीक रूप से अलग-अलग रुकावटों की गिनती करना या यह निर्धारित करना कि क्या एक शाखा वाली वाहिका के लिए विशिष्ट दो-स्टेंट तकनीक का उपयोग किया गया था। इन मामलों में, मॉडल कभी-कभी विवरणों को मिस कर देता था या संदर्भ की गलत व्याख्या करता था, हालांकि यह अभी भी छोटे मॉडल्स की तुलना में बहुत अधिक सटीक बना हुआ था। छोटे मेडिकल मॉडल्स, अपने विशेष प्रशिक्षण के बावजूद, इन विवरणों को लगातार निकालने में विफल रहे, और अक्सर ऐसे परिणाम देते थे जो अनुसंधान के उपयोग के लिए बहुत अविश्वसनीय थे।
अध्ययन ने यह भी जांचा कि क्या मॉडल्स तीनों अस्पताल स्थलों पर अलग-अलग प्रदर्शन करते हैं। जबकि बड़े मॉडल ने तीनों स्थानों पर उच्च सटीकता बनाए रखी, प्रत्येक साइट पर इसके प्रदर्शन में उल्लेखनीय भिन्नताएं देखी गईं, जो संभवतः इस कारण से थीं कि प्रत्येक अस्पताल के डॉक्टरों ने अपने नोट्स कैसे लिखे थे। छोटे मॉडल्स ने और भी अधिक अस्थिरता दिखाई, जहाँ उनका प्रदर्शन स्थान के आधार पर अत्यधिक उतार-चढ़ाव भरा था। यह सुझाव देता है कि जबकि बड़ा मॉडल मजबूत (robust) है, सूचना को कैसे प्रलेखित (document) किया जाता है, वह परिणामों को प्रभावित कर सकता है।
शोधकर्ताओं ने सबसे अच्छा प्रदर्शन करने वाले मॉडल द्वारा की गई त्रुटियों का विश्लेषण किया ताकि यह समझा जा सके कि वह कहाँ संघर्ष करता है। उन्होंने पाया कि गलतियाँ अक्सर तब होती थीं जब दस्तावेज़ीकरण अस्पष्ट या खंडित (fragmented) होता था। उदाहरण के लिए, मॉडल कभी-कभी एक डायग्नोस्टिक टेस्ट को उपचार के रूप में भ्रमित कर देता था, या उसे एक ऐसे स्टेंट के बीच अंतर करने में कठिनाई होती थी जिसे सफलतापूर्वक लगाया गया था और एक ऐसे स्टेंट के बीच जिसे लगाने का प्रयास किया गया था लेकिन तैनात नहीं किया गया था। उसे तब भी कठिनाई हुई जब किसी रिपोर्ट में ऐसी रुकावट का उल्लेख था जिसका वास्तव में उपचार नहीं किया गया था, या जब क्रोनिक टोटल ऑक्लूजन का विवरण स्पष्ट होने के बजाय निहित (implied) था। ये त्रुटियां इस बात को रेखांकित करती हैं कि हालांकि यह तकनीक शक्तिशाली है, लेकिन यह मानव चिकित्सा लेखन की अव्यवस्थित और असंगत वास्तविकता को नेविगेट करने में अभी भी पूर्ण नहीं है।
अंततः, यह अध्ययन प्रदर्शित करता है कि एक बड़ा, ओपन-सोर्स आर्टिफिशियल इंटेलिजेंस मॉडल असंरचित हृदय प्रक्रिया रिपोर्टों से जटिल डेटा को सटीक रूप से निकाल सकता है, जो एक ऐसा कार्य है जिसके लिए पारंपरिक रूप से घंटों के मैन्युअल श्रम की आवश्यकता होती है। निष्कर्ष बताते हैं कि कई वेरिएबल्स के लिए, विशेष रूप से वे जो स्पष्ट रूप से बताए गए हैं जैसे कि स्टेंट की संख्या, ये उपकरण सटीकता का एक स्तर प्राप्त कर सकते हैं जो अनुसंधान के लिए उपयुक्त है। हालांकि, उन वेरिएबल्स के लिए जिनमें गहरे प्रासंगिक अर्थ (contextual interpretation) की आवश्यकता होती है, तकनीक अभी भी चुनौतियों का सामना करती है। यह कार्य इंगar करता है कि हृदय संबंधी अनुसंधान का भविष्य बड़े, शक्तिशाली मॉडल्स का उपयोग करके डेटा निष्कर्षण के बड़े हिस्से को संभालने में निहित हो सकता है, जिसे सबसे कठिन मामलों के लिए मानव निरीक्षण के साथ जोड़ा जा सकता है, बजाय इसके कि केवल छोटे, विशेष मॉडल्स या मैन्युअल समीक्षा पर निर्भर रहा जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।