← नवीनतम पेपर
📄 health informatics

Hybrid lexical-semantic retrieval over SNOMED CT: combining two retrieval paradigms to facilitate clinical data entry

यह शोध पत्र यह प्रदर्शित करता है कि नियतकालिक लेक्सिकल मिलान (deterministic lexical matching) को सीखे गए सिमेंटिक सर्च (learned semantic semantic), क्वेरी नॉर्मलाइजेशन और रैंक फ्यूजन के साथ संयोजित करने वाला एक हाइब्रिड रिट्रीवल आर्किटेक्चर इन दोनों प्रतिमानों को बिना किसी समझौते के SNOMED CT पर सुरक्षित रूप से सह-अस्तित्व में रहने में सक्षम कर सकता है, जिससे सटीक शब्दावली और अस्पष्ट, संक्षिप्त इनपुट दोनों के लिए नैदानिक डेटा प्रविष्टि की सटीकता में सुधार होता है और श्रम-गहन स्थानीय शब्दावली क्यूरेशन की आवश्यकता कम होती है।

मूल लेखक: Lopez Osornio, A., Randorff Hoejen, A., Kewley, K.

प्रकाशित 2026-09-13
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lopez Osornio, A., Randorff Hoejen, A., Kewley, K.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

आधुनिक अस्पतालों के डिजिटल रिकॉर्ड में, प्रत्येक लक्षण, निदान और प्रक्रिया को एक सार्वभौमिक कोड में अनुवादित किया जाता है। यह प्रणाली, जिसे SNOMED CT के रूप में जाना जाता है, चिकित्सा के लिए एक विशाल, सूक्ष्मता से व्यवस्थित शब्दकोश के रूप में कार्य करती है, यह सुनिश्चित करती है कि एक देश के डॉक्टर और दूसरे देश के शोधकर्ता जब किसी विशिष्ट बीमारी के बारे में चर्चा करें, तो वे एक ही भाषा बोल रहे हों। हालाँकि, जो लोग इस प्रणाली का दैनिक उपयोग करते हैं—डॉक्टर, नर्स और अन्य चिकित्सक—वे पूर्ण शब्दकोश परिभाषाओं में बात नहीं करते हैं। वे खंडों, संक्षिप्त रूपों और शॉर्टहैंड में टाइप करते हैं, अक्सर भाषाओं को मिलाते हैं या स्थितियों का वर्णन इस तरह करते हैं जो उनके लिए स्वाभाविक लगता है लेकिन आधिकारिक शब्दों जैसा बिल्कुल नहीं दिखता। चुनौती लंबे समय से इस अंतर को पाटने की रही है: यह कैसे होने दिया जाए कि एक चिकित्सक "heart attack" या "inf myo" जैसा त्वरित, अव्यवस्थित नोट टाइप करे और कंप्यूटर तुरंत सटीक, औपचारिक चिकित्सा अवधारणा को खोज ले, बिना उपयोगकर्ता को सटीक शब्दावली सीखने के लिए मजबूर किए या हर उस तरीके की अलग, कस्टम सूची बनाए जिससे एक डॉक्टर किसी स्थिति का वर्णन कर सकता है।

SNOMED इंटरनेशनल के शोधकर्ताओं की एक टीम ने दो बहुत अलग खोज विधियों को एक एकल, सुचारू अनुभव में जोड़कर इस समस्या को हल करने का एक नया तरीका प्रस्तावित किया है। एक कठोर, अक्षर-दर-अक्षर खोज या एक लचीली, अर्थ-आधारित खोज में से किसी एक को चुनने के बजाय, उन्होंने एक ऐसी प्रणाली बनाई है जो इन दोनों का एक साथ उपयोग करती है। उनका कार्य प्रदर्शित करता है कि ये दो विपरीत प्रौद्योगिकियां एक-दूसरे के काम में बाधा डाले बिना एक साथ काम कर सकती हैं। अपने परीक्षणों में, सिस्टम ने वास्तविक दुनिया के अव्यवस्थित मेडिकल नोट्स को सही आधिकारिक कोड से लगभग 60% बार पहली बार में ही सफलतापूर्वक मिला दिया, और इसने 80% मामलों में सही उत्तर को शीर्ष दस विकल्पों में रखा। महत्वपूर्ण रूप से, उन्होंने पाया कि लचीली, अर्थ-आधारित खोज जोड़ने से सख्त, अक्षर-आधारित खोज की सटीकता खराब नहीं हुई; इसके बजाय, दोनों विधियों ने एक-दूसरे की कमियों को पूरा किया, जिससे डेटा प्रविष्टि के लिए एक अधिक मजबूत उपकरण तैयार हुआ।

समस्या का मूल मानवीय भाषण और कंप्यूटर तर्क के बीच का बेमेल होना है। जब एक डॉक्टर कोई क्वेरी टाइप करता है, तो वह एक पूर्ण वाक्यांश, एक आंशिक शब्द, या एक संक्षिप्त रूप दर्ज कर सकता है। एक पारंपरिक खोज इंजन जो सटीक अक्षर मिलान की तलाश करता है, वह तेज़ और सटीक है लेकिन यदि उपयोगकर्ता की वर्तनी थोड़ी भी गलत है या यदि वह एक अलग भाषा का उपयोग करता है, तो वह पूरी तरह विफल हो जाता है। दूसरी ओर, नए आर्टिफिशियल इंटेलिजेंस उपकरण शब्दों के पीछे के अर्थ को समझ सकते हैं, यह पहचानते हुए कि "water on the knee" एक विशिष्ट चिकित्सा स्थिति को संदर्भित करता है, भले ही उन शब्दों का आधिकारिक शब्द के साथ कोई अक्षर साझा न हो। हालाँकि, ये अर्थ-आधारित उपकरण छोटे अंशों या संक्षिप्त रूपों के साथ संघर्ष करते हैं, और वे मानवीय अभिव्यक्ति की विशाल विविधता से भ्रमित हो सकते हैं। वर्षों तक, इस दुविधा का समाधान विशेषज्ञों को नियुक्त करना था जो मैन्युअल रूप से उन सभी तरीकों की लंबी सूचियाँ बना सकें जिनसे एक डॉक्टर किसी स्थिति का वर्णन कर सकता है, एक ऐसी प्रक्रिया जो धीमी, महंगी और चिकित्सा ज्ञान के विकास के साथ तालमेल बिठाने में कठिन है।

शोधकर्ताओं ने पूछा कि क्या यह संभव है कि मैन्युअल सूची बनाने को छोड़ दिया जाए और इसके बजाय कंप्यूटर को ऑन-द-फ्लाई (तुरंत) संबंध खोजने दिया जाए, जो एक हाइब्रिड दृष्टिकोण का उपयोग करता है। उन्होंने एक प्रोटोटाइप सिस्टम बनाया है जो दो खोजों को एक साथ चलाता है। पहली खोज एक सख्त, नियतात्मक इंजन है जो उपयोगकर्ता द्वारा टाइप किए गए विशिष्ट अक्षरों को देखता है, चाहे उनका क्रम कुछ भी हो। यदि एक डॉक्टर "myo inf" टाइप करता है, तो यह इंजन उन शब्दों को खोजने के लिए जानता है जो उन अक्षरों से शुरू होते हैं, जैसे "myocardial infarction"। उसी समय, एक दूसरा, सीखा हुआ (learned) इंजन इनपुट के समग्र अर्थ को देखता है, जो समानता के आधार पर मिलान खोजने के लिए एक विशाल चिकित्सा अवधारणा डेटाबेस का उपयोग करता है। सिस्टम फिर दोनों खोजों के परिणामों को मर्ज करता है। यह सुनिश्चित करने के लिए कि एक विशिष्ट क्वेरी के लिए कमजोर खोज, मजबूत खोज को दबा न दे, एक अंतिम चरण संयुक्त सूची का पुनर्मूल्यांकन करता है, सबसे प्रासंगिक उत्तर को शीर्ष पर लाता है और अप्रासंगिक मिलानों को नीचे धकेलता है।

यह परीक्षण करने के लिए कि क्या यह विचार वास्तव में काम करता है, टीम ने दो अलग-अलग डेटा सेटों का उपयोग करके अपने सिस्टम का मूल्यांकन किया। पहला स्पेनिश मेडिकल केस रिपोर्ट का एक संग्रह था, जहाँ लक्ष्य यह देखना था कि क्या सिस्टम एक स्पेनिश बीमारी के नाम को सही अंग्रेजी मेडिकल कोड में बदल सकता है। दूसरा संयुक्त राज्य अमेरिका के वास्तविक इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड का एक विशाल सेट था, जिसमें डॉक्टरों द्वारा अंग्रेजी में लिखे गए हजारों डिस्चार्ज सारांश शामिल थे। ये रिकॉर्ड अव्यवस्थित थे, संक्षिप्त रूपों और शॉर्टहैंड से भरे थे जो दैनिक अभ्यास में सामान्य हैं लेकिन कंप्यूटर के लिए व्याख्या करना कठिन है। शोधकर्ताओं ने इस बात को मापा कि सिस्टम कितनी बार सही मेडिकल कोड को सूची के बिल्कुल शीर्ष पर, या कम से कम पहले दस विकल्पों में रख पाता है जो एक उपयोगकर्ता को अपनी स्क्रीन पर दिखाई देते हैं।

परिणामों ने दिखाया कि हाइब्रिड दृष्टिकोण अत्यधिक प्रभावी था। स्पेनिश टेस्ट सेट पर, सिस्टम ने बीमारी के उल्लेखों के लिए 60% बार सटीक सही कोड को शीर्ष परिणाम के रूप में पाया। शीर्ष दस परिणामों को देखते समय, सही कोड 80% बार मौजूद था। यह प्रदर्शन बिना किसी विशिष्ट स्पेनिश शब्दों के मैन्युअल प्रशिक्षण के प्राप्त किया गया; सिस्टम ने भाषा के अंतर को पाटने के लिए केवल चिकित्सा अवधारणाओं की अपनी समझ का उपयोग किया। शोधकर्ताओं ने यह भी पाया कि दोनों खोज विधियाँ वास्तव में पूरक थीं। सख्त अक्षर-मिलान इंजन संक्षिप्त इनपुट जैसे संक्षिप्त रूपों को संभालने में उत्कृष्ट था, जबकि अर्थ-आधारित इंजन पूर्ण वाक्यांशों और विभिन्न भाषाओं को संभालने में बेहतर था। जब उन्हें मिलाया गया, तो सिस्टम अकेले किसी भी विधि की तुलना में अधिक मजबूत था, और दूसरी विधि की उपस्थिति ने पहली विधि के प्रदर्शन को कम नहीं किया।

एक प्रमुख निष्कर्ष यह था कि सिस्टम को यह जानने की आवश्यकता नहीं थी कि किसी विशिष्ट क्वेरी के लिए कौन सी खोज सबसे अच्छा काम करेगी। अतीत में, डेवलपर्स शायद यह अनुमान लगाने की कोशिश करते थे कि उपयोगकर्ता एक पूर्ण वाक्य टाइप कर रहा है या कुछ अक्षर, और तदनुसार खोज को निर्देशित करते थे। यह नया सिस्टम बस दोनों पथों को चलाता है और अंतिम री-रैंकिंग चरण को यह तय करने देता है कि सबसे अच्छा उत्तर कौन सा है। यह डिज़ाइन मानव टाइपिंग की अप्रत्याशित प्रकृति के विरुद्ध सिस्टम को मजबूत बनाता है। हालाँकि, शोधकर्ताओं ने यह भी नोट किया कि सिस्टम पूर्ण नहीं है। यह अत्यधिक सघन, अस्पष्ट संक्षिप्त रूपों के साथ संघर्ष करता है जो संदर्भ पर बहुत अधिक निर्भर करते हैं, जैसे कि अक्षरों की एक स्ट्रिंग जिसके आसपास के टेक्स्ट के आधार पर कई अलग-अलग अर्थ हो सकते हैं। इन कठिन मामलों में, सिस्टम को कभी-कभी दूसरे नज़रिए की आवश्यकता होती थी, जो अर्थ को स्पष्ट करने के लिए मेडिकल नोट के आसपास के टेक्स्ट का उपयोग करता है, जिससे उन विशिष्ट कठिन-से-हल होने वाले प्रश्नों के लिए इसकी सफलता दर में काफी सुधार हुआ।

अध्ययन ने यह भी रेखांकित किया कि भविष्य में चिकित्सा शब्दावली प्रणालियों का रखरखाव कैसे किया जा सकता है। वर्तमान में, अस्पताल अक्सर डॉक्टरों को सही कोड खोजने में मदद करने के लिए अपने स्वयं के कस्टम शब्दों की सूचियाँ बनाने और अपडेट करने में महत्वपूर्ण संसाधन खर्च करते हैं। शोधकर्ता सुझाव देते हैं कि यह हाइब्रिड खोज विधि ऐसे व्यापक मैन्युअल सूचियों की आवश्यकता को कम कर सकती है। आधिकारिक चिकित्सा शब्दकोश पर भरोसा करके और भाषा एवं वर्तनी की विविधताओं को संभालने के लिए कंप्यूटर का उपयोग करके, अस्पताल हजारों पर्यायवाची शब्दों को मैन्युअल रूप से लिखने के बजाय, सिस्टम के शासन और परिणामों के सत्यापन पर अपना ध्यान केंद्रित कर सकते हैं। यह नए शब्दों को लिखने की आवश्यकता को समाप्त नहीं करता है, लेकिन यह कार्य की प्रकृति को नए शब्दों को लिखने से बदलकर उन्हें खोजने वाले उपकरणों के प्रबंधन में बदल देता है।

शोधकर्ताओं ने सावधानीपूर्वक नोट किया कि उनके निष्कर्ष सॉफ्टवेयर और मॉडलों के एक विशिष्ट विन्यास पर आधारित हैं, और सिस्टम अभी भी और अधिक परीक्षण के बिना लाइव अस्पताल वातावरण में उपयोग के लिए तैयार नहीं है। उन्होंने इस बात पर जोर दिया कि जबकि सिस्टम ने टेस्ट डेटा पर अच्छा प्रदर्शन किया, वास्तविक दुनिया के क्लिनिकल उपयोग में उच्च जोखिम और अधिक जटिल परिदृश्य शामिल होते हैं। यह अध्ययन एक 'प्रूफ ऑफ कॉन्सेप्ट' के रूप में कार्य करता है, जो यह प्रदर्शित करता है कि इन दो विपरीत खोज तकनीद्योगिकियों को एक एकल, सुरक्षित और प्रभावी वर्कफ़्लो में संयोजित करना तकनीकी रूप से संभव है। यह एक ऐसे पथ की ओर संकेत करता जहाँ सटीक डेटा प्रविष्टि और मानवीय भाषा की लचीलापन सह-अस्तित्व में रह सकते हैं, जिससे संभावित रूप से चिकित्सकों के लिए कंप्यूटर प्रणाली की कठोर मांगों से दबे बिना रोगी की जानकारी को सटीक रूप से रिकॉर्ड करना आसान हो सकता है।

अंततः, यह कार्य सुझाव देता है कि क्लिनिकल डेटा प्रविष्टि के भविष्य के लिए डॉक्टरों को बोलने या लिखने के तरीके को बदलने की आवश्यकता नहीं है, और न ही अस्पतालों को विशाल, कस्टम शब्दकोश बनाने की आवश्यकता है। इसके बजाय, यह एक ऐसी प्रणाली की ओर इशारा करता है जो टाइप किए गए सटीक अक्षरों और उनके पीछे के इरादे, दोनों को समझती है, और सही उत्तर खोजने के लिए इन दोनों दृष्टिकोणों को मिलाती है। यह सिद्ध करके कि ये दो अलग-अलग खोज विधियाँ एक-दूसरे के प्रभाव को कम किए बिना एक साथ काम कर सकती हैं, शोधकर्ताओं ने मानव चिकित्सा ज्ञान को आधुनिक स्वास्थ्य सेवा को संचालित करने वाले संरचित डेटा से जोड़ने के अधिक सहज और कुशल तरीकों के द्वार खोल दिए हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →