← नवीनतम पेपर
💻 computer science

Evaluating Clinical Symptom Extraction and Reasoning in Local Large Language Models: A Proof-of-Concept Study of Symptom-Specific Performance in Cardiology

यह प्रूफ-ऑफ-कॉन्सेप्ट अध्ययन जापानी कार्डियोलॉजी डिस्चार्ज सारांशों पर स्थानीय रूप से तैनात लार्ज लैंग्वेज मॉडल्स (Gemma3 और Qwen3.5) का मूल्यांकन करता है, जो यह प्रकट करता है कि हालांकि समग्र लक्षण निष्कर्षण सटीकता उच्च है, प्रदर्शन विशिष्ट लक्षणों के आधार पर भिन्न होता है और मॉडल अक्सर स्पष्ट रोगी शिकायतों के बजाय वस्तुनिष्ठ नैदानिक निष्कर्षों से धड़कन (palpitations) या थकान (fatigability) जैसी स्थितियों का अनुमान लगाते हैं।

मूल लेखक: Shun Kitamura, Eisuke Amiya, Yoshihiro Izawa, Risa Kishikawa, Takenobu Shimada, Junichi Ishida, Satoshi Kodera, Norihiko Takeda

प्रकाशित 2026-09-17
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shun Kitamura, Eisuke Amiya, Yoshihiro Izawa, Risa Kishikawa, Takenobu Shimada, Junichi Ishida, Satoshi Kodera, Norihiko Takeda

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

अस्पतालों में हर दिन लिखित रिकॉर्ड की एक विशाल मात्रा उत्पन्न होती है, जिसमें रोगी के दर्द के शुरुआती विवरण से लेकर उनकी रिकवरी पर अंतिम टिप्पणियों तक सब कुछ शामिल होता है। इस जानकारी का बहुत सा हिस्सा मुक्त-प्रवाह वाले अनुच्छेदों (paragraphs) के भीतर बंद रहता है, जिससे इसे जल्दी से छाँटना, खोजना या विश्लेषण करना कठिन हो जाता है। दशकों से, डॉक्टर और शोधकर्ता इन नोट्स को पढ़ने और विशिष्ट विवरण निकालने के लिए मानवीय प्रयास पर निर्भर रहे हैं, जो एक धीमी और उबाऊ प्रक्रिया है और जिसमें मानवीय त्रुटि की संभावना बनी रहती है। हाल ही में, एक प्रकार का नया कंप्यूटर प्रोग्राम उभरा है जिसे 'लार्ज लैंग्वेज मॉडल' कहा जाता है, जो एक संभावित समाधान के रूप में सामने आया है। ये सिस्टम विशाल टेक्स्ट पुस्तकालयों पर प्रशिक्षित होते हैं और मानव भाषा को इतनी अच्छी तरह समझ सकते हैं कि वे एक मेडिकल नोट को पढ़ सकें और विशिष्ट तथ्यों की पहचान कर सकें, जैसे कि क्या रोगी ने सांस फूलने या सीने में दर्द महसूस करने का उल्लेख किया है। क्योंकि ये उपकरण अस्पताल के अपने सुरक्षित कंप्यूटरों के भीतर पूरी तरह से काम कर सकते हैं और निजी डेटा को बाहरी दुनिया में नहीं भेजते हैं, इसलिए वे बिखरे हुए हस्तलिखित या टाइप किए गए नोट्स को स्वच्छ, व्यवस्थित डेटा में बदलने का एक आशाजनक तरीका प्रदान करते हैं, जिसका उपयोग रोगी की देखभाल में सुधार के लिए किया जा सकता है।

टोक्यो विश्वविद्यालय के शोधकर्ताओं की एक टीम ने यह परीक्षण करने के लिए कि दो स्थानीय कंप्यूटर प्रोग्राम इस कार्य को हृदय विफलता (heart failure) के विशिष्ट और उच्च-जोखिम वाले क्षेत्र में कितनी अच्छी तरह कर सकते हैं। उन्होंने उन रोगियों पर ध्यान केंद्रित किया जो उन्नत हृदय विफलता से ग्रस्त थे और जिनका हृदय प्रत्यारोपण (heart transplant) के लिए मूल्यांकन किया जा रहा था, जो कि एक ऐसा समूह है जिनके लक्षण जटिल और विविध होते हैं। शोधकर्ताओं ने अपने स्वयं के अस्पताल के दस वास्तविक रोगी रिकॉर्ड चुने, जो 2017 से 2023 के बीच के थे। ये रिकॉर्ड जापानी भाषा में लिखे गए थे और इनमें प्रत्येक रोगी के अस्पताल में रहने की पूरी कहानी शामिल थी, जिसमें उनकी शिकायतें, डॉक्टरों द्वारा जांच के दौरान पाए गए तथ्य और समय के साथ उनकी स्थिति में आए बदलाव शामिल थे। टीम ने कंप्यूटर प्रोग्रामों से इन दस कहानियों को देखने और प्रत्यारोपण के लिए आवश्यक आठ विशिष्ट लक्षणों की उपस्थिति या अनुपस्थिति की पहचान करने के लिए कहा, जैसे कि धड़कन (palpitations), अत्यधिक थकान और बेहोशी। यह सुनिश्चित करने के लिए कि कंप्यूटर के उत्तर सटीक हों, पांच विशेषज्ञ हृदय विशेषज्ञों ने स्वतंत्र रूप से उन्हीं दस कहानियों की समीक्षा की और प्रत्येक लक्षण के लिए एक "ग्राउंड ट्रुथ" (सत्य आधार) पर सहमति व्यक्त की, जिससे मशीनों को मापने के लिए एक विश्वसनीय मानक तैयार हुआ।

शोधकर्ताओं ने यह देखने के लिए कि अनुरोध की शब्दावली से परिणामों में कैसे बदलाव आता है, विभिन्न प्रकार के निर्देशों के तहत कंप्यूटर प्रोग्रामों का परीक्षण किया। एक परिदृश्य में, प्रोग्रामों को पूरे चिकित्सा इतिहास को स्कैन करने के लिए कहा गया ताकि लक्षणों का कोई भी उल्लेख मिल सके। दूसरे परिदृश्य में, उन्हें स्पष्ट रूप से उन लक्षणों को अनदेखा करने के लिए कहा गया जो रोगी के पिछले इतिहास में बताए गए हो सकते थे और केवल इस विशिष्ट अस्पताल में भर्ती होने के दौरान क्या हो रहा है, उस पर ध्यान केंद्रित करने के लिए कहा गया। उन्होंने यह भी परीक्षण किया कि क्या प्रोग्रामों को "सोचकर बताने" (think out loud) और उत्तर देने से पहले अपने तर्क को समझाने के लिए कहने से उनकी सटीकता में सुधार होगा। अध्ययन में पाया गया कि दोनों कंप्यूटर प्रोग्राम सामान्य तौर पर इस कार्य में काफी अच्छे थे, और अधिकांश मामलों में लक्षणों की उपस्थिति या अनुपस्थिति की सही पहचान की। हालांकि, प्रदर्शन पूर्ण नहीं था, और त्रुटियां यादृच्छिक (random) नहीं थीं। प्रोग्रामों को दो विशिष्ट लक्षणों के साथ सबसे अधिक संघर्ष करना पड़ा: धड़कन (palitpations), जो दिल की धड़कन तेज होने या धड़कने का अहसास है, और थकान (fatigability), या अत्यधिक थकावट का अहसास।

जब शोधकर्ताओं ने उन गलतियों की जांच की जो कंप्यूटरों ने की थीं, तो उन्होंने यह समझने में एक स्पष्ट पैटर्न पाया कि मशीनें कैसे सोच रही थीं। धड़कन के लक्षण के लिए, प्रोग्रामों ने अक्सर यह निर्णय लिया कि रोगी को धड़कन हो रही है क्योंकि मेडिकल रिकॉर्ड में असामान्य हृदय लय या तेज़ हृदय गति दिखाई दी थी, भले ही रोगी ने कभी यह नहीं लिखा या कहा था कि उसने अपने दिल के तेज़ होने को महसूस किया है। कंप्यूटर ने प्रत्यक्ष रोगी की शिकायत के बजाय वस्तुनिष्ठ चिकित्सा डेटा से लक्षण का अनुमान लगाया। इसी तरह, थकान के लिए, प्रोग्रामों ने अक्सर यह निष्कर्ष निकाला कि रोगी थका हुआ है क्योंकि रोगी को हार्ट फेलियर है, जो कि एक ऐसी स्थिति है जो थकान का कारण बनती है, भले ही विशिष्ट नोट में थकान का उल्लेख बिल्कुल न किया गया हो। कंप्यूटर ने केवल टेक्स्ट तक सीमित रहने के बजाय चिकित्सा तर्क के साथ रिक्त स्थानों को भर दिया था। यह प्रवृत्ति इतनी मजबूत थी कि कुछ मामलों में, कंप्यूटर ने सही ढंग से पहचान लिया कि एक रोगी को अनियमित हृदय गति है लेकिन फिर भी गलत तरीके से दावा किया कि रोगी को धड़कन महसूस हो रही थी, जबकि अन्य मामलों में, समान चिकित्सा निष्कर्षों के साथ, इसने सही ढंग से कहा कि रोगी को वे महसूस नहीं हो रहे थे, जो इसके तर्क में विसंगति को दर्शाता है।

अध्ययन से यह भी पता चला कि निर्देशों के बोलने का तरीका महत्वपूर्ण था। जब शोधकर्ताओं ने एक प्रोग्राम को पिछले चिकित्सा इतिहास को अनदेखा करने और केवल वर्तमान अस्पताल प्रवास पर ध्यान केंद्रित करने के लिए कहा, तो प्रोग्राम लक्षणों को खोजने के मामले में बहुत अधिक सतर्क हो गया, लेकिन उसने कई ऐसे लक्षण भी छोड़ दिए जो वास्तव में मौजूद थे। वह किसी भी चीज़ को अनदेखा करने के बारे में इतना सख्त हो गया जो वर्तमान संदर्भ में स्पष्ट रूप से नहीं लिखा गया था कि वह उन लक्षणों को पकड़ने में विफल रहा जो स्पष्ट रूप से रोगी की वर्तमान स्थिति का हिस्सा थे। यह सुझाव देता है कि हालांकि ये कंप्यूटर प्रोग्राम शक्तिशाली उपकरण हैं, वे केवल मनुष्यों की तरह शब्दों को नहीं पढ़ते; वे चिकित्सा संबंधी जुड़ाव और पैटर्न के आधार पर पाठ की व्याख्या करते हैं। वे अनुमान लगा सकते हैं कि कोई लक्षण मौजूद है, जो मददगार हो सकता है लेकिन इससे त्रुटियां भी होती हैं जब वह अनुमान गलत होता है। शोधकर्ताओं ने उल्लेख किया कि ये निष्कर्ष मामलों की एक छोटी संख्या पर आधारित हैं और प्रोग्राम दिए गए विशिष्ट निर्देशों के आधार पर अलग तरह से व्यवहार करते हैं, जो यह दर्शाता है कि यह तकनीक अभी भी विकसित हो रही है।

अंततः, यह कार्य यह दर्शाता है कि हालांकि स्थानीय कंप्यूटर प्रोग्राम चिकित्सा जानकारी निकालने की प्रक्रिया को स्वचालित कर सकते हैं, वे अभी तक एक मानव पाठक के विवेक का स्थान नहीं ले सकते। मशीनें चिकित्सा नोट के संदर्भ को समझने में सक्षम हैं, लेकिन कभी-कभी वे अपने ज्ञान को इस बात पर हावी होने देती हैं कि वास्तव में पृष्ठ पर क्या लिखा है। इन उपकरणों को अस्पताल के वातावरण में वास्तव में उपयोगी बनाने के लिए, डेवलपर्स को यह समझने की आवश्यकता होगी कि प्रोग्राम निदान के माध्यम से कैसे तर्क करते हैं और उन्हें चिकित्सा धारणाओं के बजाय स्पष्ट रोगी शिकायतों पर निर्भर रहने के लिए कैसे निर्देशित किया जाए। यह अध्ययन एक 'प्रूफ ऑफ कॉन्सेप्ट' के रूप में कार्य करता है, जो प्रदर्शित करता है कि ये सिस्टम अस्पताल के सुरक्षित नेटवर्क के भीतर काम कर सकते हैं और जटिल चिकित्सा पाठ को संभाल सकते हैं, लेकिन यह सावधानीपूर्वक निगरानी की आवश्यकता को भी उजागर करता है ताकि यह सुनिश्चित किया जा सके कि लक्षणों का स्वचालित निष्कर्षण सटीक और विश्वसनीय बना रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →