← नवीनतम पेपर
💬 NLP

Toward Automatic Filling of Case Report Forms: A Case Study on Data from an Italian Emergency Department

यह शोध पत्र एक नए इतालवी आपातकालीन विभाग (Emergency Department) डेटासेट को पेश करके, कार्य और मूल्यांकन मेट्रिक्स को परिभाषित करके, और यह प्रदर्शित करके कि जबकि अत्याधुनिक लार्ज लैंग्वेज मॉडल्स (LLMs) ज़ीरो-शॉट सेटिंग में इस कार्य को करने में सक्षम हैं, उनके आउटपुट को अत्यधिक सावधानी जैसे अंतर्निहित पूर्वाग्रहों के लिए सुधार की आवश्यकता होती है, स्वचालित केस रिपोर्ट फॉर्म (CRF) भरने के लिए एनोटेटेड डेटा की कमी को संबोधित करता है।

मूल लेखक: Gabriela Anna Kaczmarek, Pietro Ferrazzi, Lorenzo Porta, Vicky Rubini, Bernardo Magnini

प्रकाशित 2026-02-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gabriela Anna Kaczmarek, Pietro Ferrazzi, Lorenzo Porta, Vicky Rubini, Bernardo Magnini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त इमरजेंसी रूम (आपातकालीन कक्ष) में काम करने वाले डॉक्टर हैं। जब भी कोई मरीज आता है, तो आपको जो हुआ उसका एक विवरण लिखना होता है: उनके लक्षण, उनका इतिहास, आपने कौन से टेस्ट किए, और आपको क्या लगता है कि उन्हें क्या समस्या है। आप इसे एक मुक्त-प्रवाह वाली, अव्यवस्थित शैली में लिखते हैं, जैसे कि एक डायरी का पन्ना हो। इसे क्लिनिकल नोट (Clinical Note) कहा जाता है।

अब, कल्पना कीजिए कि बाद में, एक शोधकर्ता इन मरीजों का अध्ययन करना चाहता है ताकि वे पैटर्न खोज सकें (जैसे कि "क्या तेज़ बुखार वाले लोगों को एक विशिष्ट प्रकार का सिरदर्द होता है?")। इसके लिए, वे हजारों अव्यवस्थित डायरी प्रविष्टियों को नहीं पढ़ सकते। उन्हें डेटा व्यवस्थित, सुव्यवस्थित और एक विशिष्ट बॉक्स फॉर्मेट में चाहिए। इस बॉक्स फॉर्मेट को केस रिपोर्ट फॉर्म (CRF) कहा जाता है।

समस्या: "कॉपी-पेस्ट" का दुःस्वप्न

परंपरागत रूप से, एक इंसान को उस अव्यवस्थित डायरी प्रविष्टि को पढ़ना पड़ता है और फिर मैन्युअल रूप से उस व्यवस्थित बॉक्स को भरना पड़ता है। यह धीमा, उबाऊ और गलतियाँ (typos) होने वाला काम है।

हाल के वर्षों में, हमने बहुत ही स्मार्ट एआई कंप्यूटर (जिन्हें लार्ज लैंग्वेज मॉडल्स (LLMs) कहा जाता है) बनाए हैं जो भाषा को पढ़ने और समझने में माहिर हैं। विचार सरल है: एआई को वह अव्यवस्थित डायरी पढ़ने दें और हमारे लिए स्वचालित रूप से वह व्यवस्थित बॉक्स भरने दें।

लेकिन एक पेच है: एआई को यह सिखाने के लिए कि यह कैसे किया जाए, आपको हजारों ऐसे उदाहरणों की आवश्यकता होती है जहाँ किसी ने पहले ही काम को पूरी तरह से किया हो (एक अव्यवस्थित नोट के बगल में एक पूरी तरह से भरा हुआ बॉक्स)। लंबे समय तक, ऐसे उदाहरण मौजूद नहीं थे, विशेष रूप से इतालवी (Italian) भाषा में। यह ऐसा था जैसे किसी रोबोट को सड़क की तस्वीर दिखाए बिना कार चलाना सिखाना।

समाधान: एक नया "ट्रेनिंग जिम"

यह शोध पत्र एआई के लिए एक नया "ट्रेनिंग जिम" पेश करता है। शोधकर्ताओं ने ट्यूरिन, इटली के सैन जियोवानी बोस्को अस्पताल में जाकर 290 वास्तविक इमरजेंसी रूम नोट्स एकत्र किए। फिर उन्होंने वास्तविक डॉक्टरों से प्रत्येक नोट के लिए सावधानीपूर्वक संबंधित "व्यवस्थित बॉक्स" (CRFs) भरवाए।

जिस CRF का उन्होंने उपयोग किया वह बहुत बड़ा है—इसमें 134 अलग-अलग प्रश्न हैं (जैसे "क्या मरीज को बुखार था?", "ब्लड प्रेशर क्या था?", "अंतिम निदान क्या है?")।

डेटा के साथ पेच:
कड़े गोपनीयता कानूनों के कारण, उन्हें सभी नाम और आईडी हटाकर (scrub) हटाना पड़ा। इसका मतलब है कि एआई एक मरीज की पूरी कहानी समय के साथ नहीं देख सकता (जैसे सुबह का एक नोट और शाम का एक नोट जो एक ही व्यक्ति का हो)। यह केवल एक बार में एक ही नोट देखता है। यह काम को कठिन बनाता है, लेकिन यह मरीज की गोपनीयता के लिए अधिक सुरक्षित है।

प्रयोग: एआई को सिखाना

शोधकर्ताओं ने एक शक्तिशाली, ओपन-सोर्स एआई (LLaMA-3) लिया और उसे एक सरल परीक्षण दिया:

  1. इनपुट: इमरजेंसी रूम से एक अव्यवस्थित इतालवी नोट।
  2. कार्य: "यहाँ 134 प्रश्नों की एक सूची है। नोट को पढ़ें और उनका उत्तर दें। यदि नोट में उत्तर नहीं दिया गया है, तो 'Unknown' (अज्ञात) लिखें।"
  3. आउटपुट: एक भरा हुआ फॉर्म।

उन्होंने यह "जीरो-शॉट" (Zero-Shot) सेटिंग में किया, जिसका अर्थ है कि उन्होंने इस विशिष्ट डेटा पर एआई को पहले से प्रशिक्षित करने में महीनों खर्च नहीं किए। उन्होंने बस इसे तुरंत काम करने के लिए कहा, जैसे किसी बुद्धिमान छात्र को उस विशिष्ट पाठ्यपुस्तक को पहले से पढ़े बिना परीक्षा देने के लिए कहना।

परिणाम: अच्छा, लेकिन सतर्क

यहाँ क्या हुआ:

  • "आलसी" बेसलाइन (The "Lazy" Baseline): यदि आप केवल एआई को हर सवाल के लिए "Unknown" कहने के लिए कहते, तो यह लगभग 96% बार सही होता। क्यों? क्योंकि ज्यादातर मामलों में, नोट में उन सभी 134 प्रश्नों के उत्तर मौजूद नहीं होते हैं। (कल्पना कीजिए कि टूटी हुई टांग के बारे में एक नोट है; वह मरीज की आँखों के रंग का उल्लेख नहीं करेगा, इसलिए "Unknown" ही सही उत्तर है)।
  • एआई का प्रदर्शन: एआई समग्र रूप से थोड़ा कम सटीक (92%) था क्योंकि उसने मददगार होने की कोशिश की और अनिश्चित होने पर अनुमान लगाने का प्रयास किया। हालांकि, यह उन दुर्लभ, महत्वपूर्ण उत्तरों को खोजने में बहुत बेहतर था जिन्हें "आलसी" बेसलाइन मिस कर देती।
  • "सतर्कता" का पूर्वाग्रह (The "Cautious" Bias): एआई थोड़ा शर्मीला था। इसने गलत होने के जोखिम के बजाय "Unknown" कहना पसंद किया। चिकित्सा में, बहुत अधिक सतर्क होना वास्तव में ठीक है (गलत निदान देने के बजाय यह कहना बेहतर है कि "मुझे नहीं पता")। लेकिन एक कंप्यूटर के लिए वास्तव में उपयोगी होने के लिए, हमें इसे बिना गलती किए छिपे हुए सुरागों को खोजने के लिए पर्याप्त साहसी बनाना होगा।

बड़ी तस्वीर

इस शोध पत्र को एक नई इमारत की नींव रखने के रूप में देखें।

  1. नींव: उन्होंने इतालवी इमरजेंसी नोट्स के साथ संरचित (structured) फॉर्म का पहला सार्वजनिक डेटासेट बनाया।
  2. ब्लूप्रिंट: उन्होंने यह परिभाषित किया कि एआई यह कैसे मापा जाए कि वह अच्छा काम कर रहा है या नहीं।
  3. तनाव परीक्षण (Stress Test): उन्होंने दिखाया कि वर्तमान एआई यह काम कर सकता है, लेकिन इसे पूर्ण होने के लिए और अधिक प्रशिक्षण और ट्यूनिंग की आवश्यकता है।

सरल शब्दों में: शोधकर्ताओं ने यह साबित किया कि एआई इतालवी इमरजेंसी रूम नोट्स को पढ़ सकता है और स्वचालित रूप से जटिल मेडिकल फॉर्म भर सकता है। यह अभी भी पूरी तरह से परफेक्ट नहीं है (यह थोड़ा अधिक सतर्क है), लेकिन अब हमारे पास डेटा और पद्धति उपलब्ध है, इसलिए हम डॉक्टरों और शोधकर्ताओं को समय बचाने और जीवन बचाने में मदद करने के लिए बेहतर, स्मार्ट उपकरण बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →