← नवीनतम पेपर
📄 pharmacology and therapeutics

Biomedical Large Language Models and Prompt Engineering for Causality Assessment of Individual Case Safety Reports in Pharmacovigilance

इस अध्ययन ने 150 व्यक्तिगत केस सेफ्टी रिपोर्ट्स पर विशिष्ट प्रॉम्प्टिंग रणनीतियों और कॉज़ैलिटी एल्गोरिदम के साथ संयुक्त बायोमेडिकल लार्ज लैंग्वेज मॉडल्स के प्रदर्शन का मूल्यांकन किया, जिसमें यह पाया गया कि हालांकि मेडिसिन LLaMA-3 8B मॉडल ने चेन-ऑफ-थॉट प्रॉम्प्टिंग के साथ मानव विशेषज्ञों के साथ उच्चतम सहमति (64%) प्राप्त की, फिर भी ये मॉडल फार्माकोविजिलेंस में विश्वसनीय व्यक्तिगत-स्तरीय कॉज़ैलिटी मूल्यांकन के लिए उप-इष्टतम बने हुए हैं।

मूल लेखक: Heckmann, N. S., Papoutsi, D. G., Barbieri, M. A., Battini, V., Molgaard, S. N., Schmidt, S. O., Melskens, L., Sessa, M.

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Heckmann, N. S., Papoutsi, D. G., Barbieri, M. A., Battini, V., Molgaard, S. N., Schmidt, S. O., Melskens, L., Sessa, M.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं एक जासूस के रूप में: क्या किसी विशेष दवा ने मरीज की खराब प्रतिक्रिया (reaction) का कारण बनी, या यह सिर्फ एक संयोग था?

चिकित्सा की दुनिया में, इसे कॉज़ैलिटी असेसमेंट (Causality Assessment) कहा जाता है। यह एक महत्वपूर्ण काम है। यदि कोई दवा खतरनाक है, तो हमें जनता को चेतावनी देने की आवश्यकता है। यदि वह सुरक्षित है, तो हम अनावश्यक रूप से घबराना नहीं चाहते।

पारंपरिक रूप से, यह काम मानव विशेषज्ञों (जैसे वरिष्ठ डॉक्टरों और फार्मासिस्टों) द्वारा किया जाता है जो बिखरी हुई, अधूरी मरीज की रिपोर्ट को पढ़ते हैं और खुद से चेकलिस्ट के कुछ सवाल पूछते हैं: क्या गोली लेने के तुरंत बाद प्रतिक्रिया हुई? क्या गोली बंद करने पर यह रुक गई? क्या इसका कोई दूसरा स्पष्टीकरण है?

यह शोध पत्र एक नए प्रयोग के बारे में है: क्या हम एक सुपर-स्मार्ट कंप्यूटर (एक AI) को इस जासूस के रूप में सिखा सकते हैं?

प्रयोग: AI जासूस

शोधकर्ताओं ने केवल कोई भी कंप्यूटर इस्तेमाल नहीं किया। उन्होंने बायोमेडिकल लार्ज लैंग्वेज मॉडल्स (LLMs) का उपयोग किया। इन्हें "ऐसे जासूस समझें जिन्होंने लाइब्रेरी में मौजूद हर मेडिकल किताब को पढ़ा है" बजाय सामान्य AI के जिसने इंटरनेट की पूरी दुनिया (जिसमें बहुत सी बकवास भी शामिल है) को पढ़ा है।

उन्होंने पाँच अलग-अलग जासूसी टीमों का परीक्षण किया, जिनमें से प्रत्येक में शामिल थे:

  1. AI मॉडल: तीन अलग-अलग "दिमाग" (TinyLlama, Medicine LLaMA-3, और MedLLaMA)।
  2. प्रॉम्प्ट रणनीति (Prompt Strategy): वे AI से कैसे सोचने के लिए कह रहे थे। क्या उन्होंने कहा, "बस अनुमान लगाओ"? या उन्होंने कहा, "इंसानों की तरह कदम-दर-कदम सोचो" (Chain-of-Thought)? या "समस्या को छोटे-छोटे टुकड़ों में बांट दो" (Decomposition)?
  3. नियम पुस्तिका (Rulebook): दो अलग-अलग आधिकारिक चेकलिस्ट जिनका उपयोग वास्तविक डॉक्टर करते हैं (Naranjo Scale और WHO-UMC विधि)।

उन्होंने इन AI टीमों को 150 वास्तविक जीवन के रहस्यमय मामले दिए (कुछ सामान्य दवाओं के, कुछ टीकों के) और उन्हें मामले सुलझाने के लिए कहा। फिर, उन्होंने AI के उत्तरों की तुलना दो वास्तविक मानव विशेषज्ञों द्वारा दिए गए उत्तरों से की।

परिणाम: अच्छा, बुरा और "लगभग"

1. "मेडिकल स्कूल" का लाभ
विशेष रूप से मेडिकल किताबों पर प्रशिक्षित AI मॉडल सामान्य AI मॉडल की तुलना में बहुत बेहतर प्रदर्शन करते हैं। यह एक ऐसे जासूस की तुलना करने जैसा है जिसने क्राइम एनसाइक्लोपीडिया पढ़ा है बनाम उस जासूस की जिसने केवल विकिपीडिया पढ़ा है। मेडिकल AI ने मानव विशेषज्ञों के साथ लगभग 64% सहमति दर्ज की। यह पिछले अध्ययनों में देखी गई 34% सहमति से एक बड़ी छलांग है।

2. "कदम-दर-कदम" बनाम "कहानी"
AI ने Naranjo नियम पुस्तिका का उपयोग करते समय आश्चर्यजनक रूप से अच्छा प्रदर्शन किया। यह नियम पुस्तिका एक गणित के टेस्ट की तरह है: "प्रश्न 1: हाँ/नहीं। प्रश्न 2: हाँ/नहीं। अंक जोड़ें।" AI इन कठोर चरणों का पालन करने में अच्छा था।
हालाँकि, AI WHO नियम पुस्तिका के साथ संघर्ष करता रहा। यह नियम पुस्तिका अधिक एक निबंध लिखने या मरीज के बारे में कहानी सुनाने जैसी है। AI भ्रमित हो गया, अक्सर ऐसे उत्तर दिए जो मानव विशेषज्ञों से बिल्कुल मेल नहीं खाते थे। ऐसा लगता है कि AI एक सुसंगत मेडिकल कहानी लिखने के बजाय गणित में बेहतर है।

3. "भ्रम" (Hallucination) की समस्या
यहाँ तक कि सबसे अच्छे AI टीम ने भी गलतियाँ कीं।

  • "गूँज" का प्रभाव (The "Echo" Effect): कभी-कभी, AI सवाल का जवाब देने के बजाय बस उसे दोहरा देता था (एक तोते की तरह)।
  • "आत्मविश्वास के साथ गलत" प्रभाव (The "Confident Wrong" Effect): यदि मरीज की रिपोर्ट में जानकारी गायब थी, तो मानव विशेषज्ञ कहता, "मुझे नहीं पता।" हालाँकि, AI आत्मविश्वास के साथ एक उत्तर का अनुमान लगा लेता था। यह एक ऐसे छात्र की तरह है जिसे उत्तर नहीं पता लेकिन वह एक लंबा, आत्मविश्वासी पैराग्राफ लिख देता है।
  • "कमी वाली कड़ी" (The "Missing Link"): AI यह जाँचने में खराब था कि क्या कोई साइड इफेक्ट दवा की मैनुअल में सूचीबद्ध है (क्योंकि परीक्षण के दौरान AI के पास वह विशिष्ट मैनुअल उपलब्ध नहीं था) और वह यह पहचानने में भी खराब था कि क्या किसी अन्य बीमारी ने समस्या पैदा की थी।

मुख्य निष्कर्ष

क्या हम इस काम के लिए मानव डॉक्टरों को AI से बदल सकते हैं? अभी नहीं।

AI एक बहुत तेज़, बहुत जानकार इंटर्न है, लेकिन यह अभी सीनियर डिटेक्टिव नहीं बना है।

  • यह तेज़ है: यह रिपोर्टों को तुरंत पढ़ सकता है।
  • यह जानकार है: यह मेडिकल शब्दों को अच्छी तरह जानता है।
  • लेकिन इसमें निर्णय क्षमता की कमी है: यह हमेशा "शायद" और "निश्चित रूप से" के बीच अंतर नहीं कर पाता, और कभी-कभी अपने उत्तर का समर्थन करने के लिए कारण भी बना लेता है।

भविष्य

लेखक सुझाव देते हैं कि भविष्य में, हमें केवल AI से "मामला सुलझाने" के लिए नहीं कहना चाहिए। इसके बजाय, हमें एक हाइब्रिड दृष्टिकोण अपनाना चाहिए:

  • AI को भारी काम करने दें (रिपोर्ट पढ़ना, तथ्यों की जाँच करना)।
  • मानव विशेषज्ञ को अंतिम निर्णय लेने दें, AI के काम का उपयोग एक सहायक के रूप में करते हुए।

इसे GPS बनाम मानव ड्राइवर की तरह समझें। GPS (AI) सड़कों और यातायात नियमों को जानने में बहुत अच्छा है, लेकिन जब सड़क कीचड़ भरी हो या मानचित्र गलत हो, तो अंतिम निर्णय लेने के लिए मानव ड्राइवर (विशेषज्ञ) की अभी भी आवश्यकता होती है।

संक्षेप में: बायोमेडिकल AI एक मेडिकल जासूस बनने में बहुत बेहतर हो रहा है, लेकिन यह सुनिश्चित करने के लिए कि फैसला निष्पक्ष, सटीक और सुरक्षित है, इसे अभी भी एक मानव साथी की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →