← नवीनतम पेपर
💬 NLP

Evaluating ChatGPT on Medical Information Extraction Tasks: Performance, Explainability and Beyond

यह शोध पत्र चार चिकित्सा सूचना निष्कर्षण कार्यों में ChatGPT के प्रदर्शन का मूल्यांकन करता है, जिसमें यह पाया गया है कि हालांकि यह उच्च गुणवत्ता वाले स्पष्टीकरण प्रदान करता है और स्रोत ग्रंथों के प्रति वफादार रहता है, लेकिन यह फाइन-ट्यून्ड मॉडलों की तुलना में कम प्रदर्शन करता है और अति-आत्मविश्वास एवं जनरेशन अनिश्चितता से ग्रस्त है।

मूल लेखक: Liz Li, Wei Zhu

प्रकाशित 2026-02-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Liz Li, Wei Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

"प्रतिभाशाली लेकिन लापरवाह मेडिकल इंटर्न" का रूपक

कल्पना कीजिए कि आपके पास एक नया मेडिकल इंटर्न है जिसका नाम ChatGPT है।

ChatGPT अविश्वसनीय रूप से सुशिक्षित है। इसने अब तक लिखी गई लगभग हर मेडिकल टेक्स्टबुक, रिसर्च पेपर और पेशेंट चार्ट को पढ़ा है। यदि आप उससे पूछें कि हृदय कैसे कार्य करता है, तो वह आपको एक सुंदर, काव्यमय और अत्यंत विस्तृत व्याख्या देगा। वह संचार का एक उस्ताद है।

हालाँकि, यह शोध पत्र मूल रूप से एक "परफॉरमेंस रिव्यू" (कार्य प्रदर्शन समीक्षा) है, जो शोधकर्ताओं द्वारा यह देखने के लिए किया गया है कि क्या ChatGPT वास्तव में एक मेडिकल क्लर्क के कठिन और सटीक कार्य को कर सकता है—विशेष रूप से, मेडिकल इंफॉर्मेशन एक्सट्रैक्शन (MedIE)। यह काम एक अस्त-व्यस्त डॉक्टर के नोट को पढ़ने और उसमें से विशिष्ट तथ्यों को निकालने का है: "बीमारी क्या है? कौन सी दवा दी गई? उसकी खुराक क्या थी?"

यहाँ समीक्षा का विवरण दिया गया है:


1. प्रदर्शन: "वह बुद्धिमान छात्र जो परीक्षा में फेल हो जाता है"

निष्कर्ष: ChatGPT की सटीकता विशेष रूप से प्रशिक्षित (fine-tuned) मॉडलों (ऐसे AI जिन्हें केवल मेडिकल डेटा पर प्रशिक्षित किया गया है) की तुलना में काफी कम है।

रूपक: कल्पना कीजिए कि एक छात्र जो सामान्य साहित्य में जीनियस है, लेकिन एक अत्यधिक विशिष्ट सर्जिकल परीक्षा दे रहा है। वह परीक्षा की भाषा को समझता है, लेकिन वह सूक्ष्म, तकनीकी विवरणों को चूक जाता रहता है। जहाँ एक विशेष मेडिकल AI 20 साल के अनुभव वाले सर्जन की तरह है, वहीं ChatGPT एक बहुत ही बुद्धिमान छात्र की तरह है जो सामान्य ज्ञान के आधार पर "काम चला रहा है"। वह सरल कार्यों (जैसे कि एक बुनियादी बीमारी की पहचान करना) के लिए अच्छा है, लेकिन जटिल कार्यों (जैसे कि यह मैप करना कि एक विशिष्ट लक्षण एक विशिष्ट दवा से कैसे संबंधित है) में लड़खड़ा जाता है।

2. व्याख्यात्मकता (Explainability): "आत्मविश्वासी कहानीकार"

निष्कर्ष: जब ChatGPT कोई निर्णय लेता है, तो वह इसे इस तरह से समझा सकता है कि यह बहुत प्रभावशाली लगता है।

रूपक: यदि आप इंटर्न से पूछते हैं, "आपने इसे लक्षण के रूप में क्यों लेबल किया?", तो वे केवल यह नहीं कहेंगे कि "क्योंकि मैंने ऐसा कहा है।" वे आपको एक तार्किक, चरण-दर-चरण तर्क देंगे। समस्या क्या है? भले ही वे पूरी तरह से गलत हों, वे अपनी गलती को इतने आत्मविश्वास और वाक्पटुता के साथ समझाते हैं कि आप वास्तव में उन पर विश्वास कर सकते हैं। वे तर्क की "भ्रमित व्याख्या" (hallucinating logic) करते हैं—यानी अपनी गलती के बारे में एक बहुत ही विश्वसनीय कहानी सुनाते हैं।

3. आत्मविश्वास बनाम वास्तविकता: "अति-आत्मविश्वासी इंटर्न"

निष्कर्ष: ChatGPT "अति-आत्मविश्वास" (over-confidence) का शिकार है। यह अपने सही उत्तरों और गलत उत्तरों, दोनों के लिए उच्च आत्मविश्वास स्कोर देता है।

रूपक: कल्पना कीजिए कि एक इंटर्न कमरे में आता है और कहता है, "मुझे 99% यकीन है कि इस मरीज को टाइप 2 डायबिटीज है," जबकि वास्तव में, वह केवल अनुमान लगा रहा है। चिकित्सा में, यह खतरनाक है। एक अच्छे डॉक्टर को कहना चाहिए, "मुझे लगता है कि यह डायबिटीज है, लेकिन मैं केवल 60% निश्चित हूँ; आइए कुछ और टेस्ट करते हैं।" ChatGPT में इस "आत्म-संदेह" (कैलिब्रेशन) की कमी है, जिससे यह जानना मुश्किल हो जाता है कि उस पर कब भरोसा किया जाए।

4. निष्ठा (Faithfulness): "एक अच्छा श्रोता"

निष्कर्ष: ChatGPT वास्तव में निर्देशों का पालन करने और दिए गए टेक्स्ट के प्रति सच्चा रहने में काफी अच्छा है।

रूपक: अपने अन्य दोषों के बावजूद, इंटर्न एक अच्छा श्रोता है। यदि आप उन्हें श्रेणियों की एक विशिष्ट सूची देते हैं जिन्हें उन्हें खोजना है, तो वे आम तौर पर उसी सूची का पालन करते हैं। वे आमतौर पर मूल नोट में मौजूद न होने वाले रैंडम मेडिकल शब्द नहीं बनाते हैं। वे स्रोत सामग्री के प्रति "निष्ठावान" हैं।

5. अनिश्चितता (Uncertainty): "एक चंचल कार्यकर्ता"

निष्कर्ष: ChatGPT जिस तरह से टेक्स्ट जनरेट करता है, उसके कारण यह असंगत हो सकता है। यदि आप उससे एक ही प्रश्न पांच बार पूछते हैं, तो आपको थोड़े अलग उत्तर मिल सकते हैं।

रूपक: यह एक ऐसे इंटर्न की तरह है जो थोड़ा "चंचल" है। यदि आप उन्हें एक फाइल कैबिनेट व्यवस्थित करने के लिए कहते हैं, तो वे सुबह 9:00 बजे इसे एक तरीके से कर सकते हैं, लेकिन 9:05 बजे तक, उन्होंने सिस्टम को थोड़ा बदल दिया होगा। यह विसंगति (अनिश्चितता) उन्हें उच्च-जोखिम वाले, दोहराव वाले मेडिकल डेटा एंट्री के लिए उपयोग करना कठिन बना देती है जहाँ सटीकता ही सब कुछ है।


निष्कर्ष (The Bottom Line)

शोधकर्ता यह कह रहे हैं: ChatGPT एक अद्भुत वार्तालापकार है, लेकिन एक अस्थिर मेडिकल क्लर्क है।

यह चीजों को समझाने में बहुत कुशल है, लेकिन जब यह गलत होता है तो बहुत अधिक आत्मविश्वासी होता है, काम करते समय बहुत अधिक असंगत होता है, और विशेष मेडिकल टूल्स की तुलना में बिल्कुल भी सटीक नहीं है। फिलहाल, हमें "इंटर्न" को एक बहुत अनुभवी "सीनियर डॉक्टर" की निगरानी के बिना आधिकारिक मेडिकल रिकॉर्ड संभालने की अनुमति नहीं देनी चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →