← नवीनतम पेपर
💬 NLP

A Dataset and Resources for Identifying Patient Health Literacy Information from Clinical Notes

यह शोध पत्र HEALIX को प्रस्तुत करता है, जो रोगी स्वास्थ्य साक्षरता स्तरों के स्वचालित पता लगाने की सुविधा के लिए डिज़ाइन किए गए 589 नैदानिक नोट्स का पहला सार्वजनिक रूप से उपलब्ध एनोटेटेड डेटासेट है, और चार ओपन-सोर्स लार्ज लैंग्वेज मॉडल्स में ज़ीरो-शॉट और फ्यू-शॉट प्रॉम्प्टिंग रणनीतियों के बेंचमार्किंग के माध्यम से इसकी उपयोगिता को प्रदर्शित करता है।

मूल लेखक: Madeline Bittner, Dina Demner-Fushman, Yasmeen Shabazz, Davis Bartels, Dukyong Yoon, Brad Quitadamo, Rajiv Menghrajani, Leo Celi, Sarvesh Soni

प्रकाशित 2026-03-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Madeline Bittner, Dina Demner-Fushman, Yasmeen Shabazz, Davis Bartels, Dukyong Yoon, Brad Quitadamo, Rajiv Menghrajani, Leo Celi, Sarvesh Soni

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक डॉक्टर हैं जो एक मरीज की मदद करने की कोशिश कर रहे हैं, लेकिन आपके पास एक गुप्त बाधा है: आपको नहीं पता कि मरीज वास्तव में आपकी बात समझ रहा है या नहीं। क्या उन्हें पता है कि उनकी दवा किस लिए है? क्या उन्हें पता है कि उन्हें अगली जांच के लिए कब वापस आना है? या वे बस सिर हिला रहे हैं, इस उम्मीद में कि वे भ्रमित न दिखें?

यही हेल्थ लिटरेसी (स्वास्थ्य साक्षरता) की समस्या है। यह एक नक्शे या अनुवादक के बिना किसी विदेशी देश में यात्रा करने जैसा है। यदि मरीज नक्शा नहीं पढ़ सकता (अपनी सेहत को नहीं समझ सकता), तो वे रास्ता भटक सकते हैं, दोबारा इमरजेंसी रूम में पहुँच सकते हैं, या उनकी देखभाल के बारे में गलत निर्णय ले सकते हैं।

आमतौर पर, डॉक्टरों को यह जानने के लिए मरीजों को एक लंबा, उबाऊ क्विज़ देना पड़ता है। लेकिन एक व्यस्त इमरजेंसी रूम में, किसी के पास 20-प्रश्नों वाला टेस्ट लेने का समय नहीं होता। इसलिए, डॉक्टर अक्सर अपनी टिप्पणियाँ मरीज की फाइल में एक डायरी प्रविष्टि (diary entry) की तरह लिख देते हैं: "मरीज योजना को लेकर भ्रमित लग रहा है" या "मरीज ने सर्जरी के बारे में बहुत अच्छे सवाल पूछे।"

समस्या क्या है? ये डायरी प्रविष्टियाँ अव्यवस्थित और अनस्ट्रक्चर्ड टेक्स्ट में छिपी होती हैं। एक कंप्यूटर सुराग खोजने के लिए इन्हें आसानी से नहीं पढ़ सकता।

पेश है HEALIX: "हेल्थ लिटरेसी डिटेक्टिव" डेटासेट

यह पेपर HEALIX को पेश करता है, जो शोधकर्ताओं द्वारा बनाया गया एक नया टूल है ताकि कंप्यूटर को इन बिखरे हुए नोट्स को पढ़ना और स्वास्थ्य साक्षरता के सुराग पहचानना सिखाया जा सके। HEALIX को एक सुपर-स्मार्ट AI जासूस के लिए 'ट्रेनिंग मैनुअल' के रूप में समझें।

यहाँ बताया गया है कि उन्होंने इसे कैसे बनाया, एक सरल उपमा (analogy) का उपयोग करते हुए:

1. खजाने की खोज (डेटा संग्रह)

शोधकर्ताओं को अध्ययन करने के लिए मेडिकल नोट्स के ढेर की आवश्यकता थी। वे अस्पताल के रिकॉर्ड्स की एक विशाल डिजिटल लाइब्रेरी (जिसे MIMIC-III कहा जाता है) में गए।

  • रैंडम डाइव (Random Dive): उन्होंने सामाजिक कार्यकर्ताओं (social workers) द्वारा लिखे गए नोट्स को रैंडम तरीके से चुनना शुरू किया, क्योंकि उनका अनुमान था कि मरीज की समझ का उल्लेख इन्हीं में होने की सबसे अधिक संभावना है।
  • कीवर्ड नेट (Keyword Net): उन्होंने "समझता है" (understands), "भ्रमित" (confused), या "अनुपालन" (adherence) जैसे विशिष्ट शब्दों का उपयोग करके एक विस्तृत जाल बुना ताकि प्रासंगिक नोट्स पकड़े जा सकें।
  • AI असिस्टेंट: उन्होंने एक स्मार्ट AI (एक LLM) का उपयोग करके "मुश्किल-से-पहचाने जाने वाले" नोट्स को खोजने में मदद ली। उन्होंने AI से पूछा, "आप किन नोट्स को लेकर अनिश्चित हैं?" और फिर इंसानों ने उन विशिष्ट कठिन नोट्स को लेबल किया। यह एक शिक्षक की तरह है जो छात्र से पूछता है, "आपको कौन से प्रश्न सबसे कठिन लगते हैं?" ताकि वे वहीं अपना ध्यान केंद्रित कर सकें।

2. गोल्ड स्टैंडर्ड (एनोटेशन)

एक बार जब उनके पास 589 नोट्स आ गए, तो उन्होंने विशेषज्ञों को उन्हें पढ़ने और लेबल करने के लिए काम पर लगाया। उन्होंने केवल "अच्छा" या "बुरा" नहीं कहा। उन्होंने ट्रैफिक लाइट सिस्टम का उपयोग किया:

  • 🟢 उच्च (हरा): मरीज एक एक्सपर्ट है। वे निदान को समझते हैं, समझदारी भरे सवाल पूछते हैं, और सूचित विकल्प बना सकते हैं।
  • 🟡 सामान्य (पीला): मरीज बुनियादी बातें समझता है। वे योजना का पालन कर सकते हैं, लेकिन वे गहराई में नहीं जाते हैं।
  • 🔴 निम्न (लाल): मरीज खोया हुआ है। वे योजना को नहीं समझते, निर्देशों का पालन नहीं कर पाते, या भ्रमित हैं।
  • संबंधित नहीं (सफेद): नोट का समझ से कोई लेना-देना नहीं है (जैसे कि केवल एक टूटी हुई हड्डी का उल्लेख करना)।

दो लोगों ने हर नोट को लेबल किया ताकि यह सुनिश्चित हो सके कि वे सहमत हैं। यदि वे असहमत थे, तो तीसरे व्यक्ति ने विवाद सुलझाने में मदद की। इससे एक "गोल्ड स्टैंडर्ड" डेटासेट तैयार हुआ।

3. टेस्ट ड्राइव (मॉडल मूल्यांकन)

अब, वे देखना चाहते थे कि क्या कंप्यूटर इस मैनुअल से सीख सकते हैं। उन्होंने HEALIX डेटासेट पर कई "AI दिमागों" (LLaMA और Qwen जैसे Large Language Models) का परीक्षण किया।

  • परिणाम: AI मॉडल स्पष्ट "लाल" और "हरे" नोट्स को पहचानने में सक्षम थे।
  • संघर्ष: वे "पीले" नोट्स को लेकर भ्रमित हो गए। यह समझना एक कंप्यूटर के लिए कठिन है कि मरीज वास्तव में समझ रहा है या केवल दिखावा कर रहा है, या एक परिवार का सदस्य भ्रमित मरीज की ओर से सवाल पूछ रहा है।
  • उपमा: कल्पना कीजिए कि एक रोबोट अनुमान लगाने की कोशिश कर रहा है कि आप खुश हैं या नहीं। यदि आप चिल्ला रहे हैं "मैं खुश हूँ!" (उच्च साक्षरता), तो रोबोट समझ जाएगा। यदि आप रो रहे हैं "मैं दुखी हूँ!" (निम्न साक्षरता), तो भी वह समझ जाएगा। लेकिन यदि आप अपनी उदास आँखों के साथ बस विनम्रता से मुस्कुरा रहे हैं (सामान्य/जटिल साक्षरता), तो रोबोट अक्सर गलत अनुमान लगा लेता है।

यह क्यों मायने रखता है?

वर्तमान में, यदि डॉक्टर को यह नहीं पता कि मरीज की हेल्थ लिटरेसी कम है, तो वे एक जटिल दवा व्यवस्था निर्धारित कर सकते हैं जिसका मरीज पालन नहीं कर पाएगा। मरीज घर जाता है, बीमार पड़ता है, और दोबारा अस्पताल पहुँच जाता है।

HEALIX के साथ, हम कंप्यूटर को अस्पताल के रिकॉर्ड में मौजूद "डायरी प्रविष्टियों" को पढ़ना सिखा रहे हैं।

  • लक्ष्य: भविष्य में, जैसे ही एक डॉक्टर नोट टाइप करेगा, कंप्यूटर तुरंत एक चेतावनी पॉप-अप दे सकता है: "अलर्ट: इस मरीज में कम स्वास्थ्य साक्षरता के लक्षण दिख रहे हैं। कृपया अपने निर्देश सरल बनाएं।"
  • प्रभाव: यह जीवन बचा सकता है, अस्पताल में दोबारा भर्ती होने की दर को कम कर सकता है, और यह सुनिश्चित कर सकता है कि मरीज केवल सिर न हिला रहे हों, बल्कि वास्तव में अपनी सेहत को समझ रहे हों।

चुनौती

पेपर स्वीकार करता है कि यह तो बस शुरुआत है। यह डेटासेट एक विशिष्ट अस्पताल प्रणाली से आता है, इसलिए यह सभी का सटीक प्रतिनिधित्व नहीं कर सकता है। साथ ही, उपयोग किए गए AI मॉडल "ऑफ-द-शेल्फ" (तैयार) थे (विशेष रूप से प्रशिक्षित नहीं)। यह इंजन को ट्यून किए बिना रेस ट्रैक पर कार का परीक्षण करने जैसा है। अधिक प्रशिक्षण के साथ, ये AI जासूस और भी अधिक तेज हो सकते हैं।

संक्षेप में: इस पेपर ने AI के लिए पहला "ट्रेनिंग स्कूल" बनाया है ताकि वह मेडिकल नोट्स के बीच के छिपे हुए अर्थों को पढ़ना सीख सके, जिससे डॉक्टरों को उन मरीजों को पहचानने में मदद मिले जिन्हें अपनी देखभाल समझने के लिए अतिरिक्त सहायता की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →