← नवीनतम पेपर
💬 NLP

Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs

यह शोध पत्र एक अर्थ-संरक्षण करने वाले प्रॉम्प्ट परिवर्तनों के विरुद्ध 16 नैदानिक और सामान्य-उद्देश्य वाले LLMs की स्थिरता का मूल्यांकन करने के लिए एक सिमेंटिक सत्यापन ढांचा और नए मेट्रिक्स प्रस्तावित करता है, जो यह प्रकट करता है कि डोमेन विशेषज्ञता स्वास्थ्य सेवा परिवेश में निरंतर अधिक सुदृढ़ता की गारंटी नहीं देती है।

मूल लेखक: Mahdi Alkaeed, Adnan Qayyum, Nabeel Abo Kashreef, Muhammad Bilal, Junaid Qadir

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mahdi Alkaeed, Adnan Qayyum, Nabeel Abo Kashreef, Muhammad Bilal, Junaid Qadir

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: वही मरीज़, अलग शब्द, अलग निदान?

कल्पना कीजिए कि आप एक डॉक्टर हैं। आपके पास एक विशिष्ट लक्षणों वाला एक मरीज़ है। आप उस मामले का वर्णन करते हुए एक नोट लिखते हैं। फिर, आप एक कंप्यूटर प्रोग्राम (एक AI) से निदान का अनुमान लगाने के लिए कहते हैं।

अब, कल्पना कीजिए कि आप उस नोट को फिर से लिखते हैं। आप अलग शब्दों का उपयोग करते हैं, वाक्य की संरचना बदलते हैं, या किसी मेडिकल शब्द को सामान्य शब्द से बदल देते हैं (जैसे "मायोकार्डियल इन्फार्क्शन" के बजाय "हार्ट अटैक" कहना)। अर्थ बिल्कुल वही है। मरीज़ नहीं बदला है।

समस्या: यह शोध पत्र पूछता है: यदि आप AI से बिल्कुल वही सवाल अलग तरीके से पूछते हैं, तो क्या वह आपको एक ही जवाब देगा?

दुर्भाग्य से, शोधकर्ताओं ने पाया कि ये AI मॉडल अक्सर अनिश्चित मौसम पूर्वानुमानकर्ताओं (fickle weather forecasters) की तरह होते हैं। यदि आप पूछते हैं, "क्या बारिश होगी?" तो आपको "हाँ" मिल सकता है। लेकिन यदि आप पूछते हैं, "क्या वर्षा की संभावना है?" तो वही AI अचानक "नहीं" कह सकता है, भले ही मौसम न बदला हो। अस्पताल में, इस तरह की अस्थिरता खतरनाक है।

समाधान: एक "सत्य फ़िल्टर" (Truth Filter)

इसे ठीक से परखने के लिए, शोधकर्ताओं को बहुत सावधान रहना पड़ा। वे केवल AI को पुनर्गठित करने के लिए नहीं कह सकते थे, क्योंकि कभी-कभी AI अनजाने में अर्थ बदल देता है (जैसे "कोई दर्द नहीं" को "दर्द" में बदल देना)।

उन्होंने एक बहु-स्तरीय सत्य फ़िल्टर (multi-layered truth filter) बनाया ताकि यह सुनिश्चित हो सके कि प्रश्न वास्तव में समान अर्थ वाले हों:

  1. तर्क की जाँच (NLI): उन्होंने एक विशेष "लॉजिक रोबोट" का उपयोग किया जो यह जाँचता है कि क्या दो वाक्य तार्किक रूप से एक-दूसरे का संकेत देते हैं। यदि वाक्य A का अर्थ वाक्य B है, और वाक्य B का अर्थ वाक्य A है, तो वे जुड़वां हैं।
  2. AI जज: उन्होंने लॉजिक रोबोट के काम की दोबारा जाँच करने के लिए एक दूसरे, बहुत स्मार्ट AI का उपयोग किया।
  3. मानव डॉक्टर: अंत में, एक वास्तविक, लाइसेंस प्राप्त डॉक्टर ने यह सुनिश्चित करने के लिए समीक्षा की कि चिकित्सा तथ्य (खुराक, लक्षण, समय) अनजाने में बदले तो नहीं गए हैं।

केवल वे प्रश्न जो इन तीनों परीक्षणों में पास हुए, उन्हें ही प्रयोग के लिए उपयोग किया गया।

प्रयोग: सामान्य बनाम विशिष्ट डॉक्टर

शोधकर्ताओं ने 16 अलग-अलग AI मॉडलों का परीक्षण किया। उन्होंने उन्हें दो समूहों में विभाजित किया:

  • सामान्य-उद्देश्य वाले (General-Purpose - GP): ये स्मार्ट जनरलिस्ट की तरह हैं। इन्होंने इंटरनेट पर सब कुछ पढ़ा है और कई चीजों में अच्छे हैं, लेकिन ये प्रशिक्षण के आधार पर चिकित्सा विशेषज्ञ नहीं हैं।
  • डोमेन-विशिष्ट (Domain-Specific - DS): ये विशेषज्ञ रेजिडेंट्स की तरह हैं। इन्हें विशेष रूप से मेडिकल किताबों और रोगी रिकॉर्ड पर प्रशिक्षित किया गया था।

परिकल्पना (Hypothesis): हर कोई मान रहा था कि शब्दावली बदलने पर "विशेषज्ञ रेजिडेंट्स" (DS मॉडल), "जनरलिस्ट" (GP मॉडल) की तुलना में अधिक स्थिर और विश्वसनीय होंगे।

आश्चर्य: विशेषज्ञ मॉडलों ने लगातार जीत हासिल नहीं की।

  • कभी-कभी विशेषज्ञ मॉडल अधिक स्थिर थे।
  • कभी-कभी सामान्य मॉडल अधिक स्थिर थे।
  • अक्सर, वे दोनों ही समान रूप से अस्थिर थे।

उपमा (Analogy): यह दो शेफों का परीक्षण करने जैसा है। एक मास्टर शेफ है जो केवल इतालवी भोजन बनाता है (विशेषज्ञ), और दूसरा एक महान रसोइया है जो हर तरह का व्यंजन जानता है (सामान्य)। आप उनसे एक पास्ता डिश बनाने के लिए कहते हैं। यदि आप उस डिश का वर्णन थोड़ा अलग तरीके से करते हैं ("नूडल्स उबालें" बनाम "पास्ता पकाएं"), तो आप उम्मीद कर सकते हैं कि इतालवी शेफ अधिक सुसंगत होगा। लेकिन अध्ययन में पाया गया कि कभी-कभी इतालवी शेफ नए शब्दों से भ्रमित हो जाता है, जबकि सामान्य रसोइया शांत रहता है। केवल विशेषज्ञता स्थिरता की गारंटी नहीं देती।

आत्मविश्वास का जाल: "मैं आश्वस्त हूँ, लेकिन मैं गलत हूँ"

शोधकर्ताओं ने यह भी देखा कि AI अपने उत्तरों में कितना आत्मविश्वासी था।

  • निष्कर्ष: AI अक्सर एक ऐसे अति-आत्मविश्वासी छात्र (cocky student) की तरह व्यवहार करता है जो गलत है लेकिन सोचता है कि वह सही है।
  • यहाँ तक कि जब AI ने शब्दावली बदलने के कारण अपना उत्तर बदल दिया (जो दर्शाता है कि वह अस्थिर था), तब भी वह अक्सर उसी उच्च स्तर का आत्मविश्वास बनाए रखता था।
  • उपमा: एक छात्र की कल्पना करें जो परीक्षा दे रहा है। यदि आप प्रश्न को फिर से लिखते हैं, तो वह अपना उत्तर "A" से बदलकर "B" कर सकता है। लेकिन यदि आप पूछते हैं, "आप कितने निश्चित हैं?" तो वह अभी भी कहता है, "100% निश्चित!" शोध में पाया गया कि उच्च आत्मविश्वास इस बात का अच्छा संकेत नहीं है कि AI वास्तव में सही या स्थिर है।

मुख्य निष्कर्ष

  1. छोटे बदलाव मायने रखते हैं: मेडिकल प्रॉम्प्ट में कुछ शब्दों को बदलने से AI पूरी तरह से अलग निदान दे सकता है, भले ही अर्थ वही हो।
  2. प्रशिक्षण एक जादुई ढाल नहीं है: केवल इसलिए कि एक AI को मेडिकल डेटा पर प्रशिक्षित किया गया है, इसका मतलब यह नहीं है कि भाषा बदलने पर वह अधिक विश्वसनीय होगा।
  3. आत्मविश्वास भ्रामक है: एक AI का यह कहना कि वह "99% सुनिश्चित" है, इसका मतलब यह नहीं है कि वह अपना विचार नहीं बदलेगा यदि आप प्रश्न को थोड़ा अलग तरीके से पूछते हैं।
  4. हमें बेहतर परीक्षण की आवश्यकता है: अस्पतालों में इन AI पर भरोसा करने से पहले, हमें उन्हें केवल इस आधार पर नहीं परखना चाहिए कि वे एक बार सही उत्तर देते हैं या नहीं, बल्कि इस आधार पर भी कि क्या वे शब्दों के बदलने पर भी सुसंगत रहते हैं।

संक्षेप में: यह शोध पत्र चेतावनी देता है कि वर्तमान मेडिकल AI अविश्वसनीय अनुवादकों की तरह हैं। यदि आप उनसे "मेडिकल इंग्लिश" में बात करते हैं, तो वे एक उत्तर दे सकते हैं। यदि आप "कैजुअल इंग्लिश" में बात करते हैं (भले ही उसका अर्थ वही हो), तो वे एक अलग उत्तर दे सकते हैं। डॉक्टरों को मरीजों का इलाज करने में मदद करने से पहले हमें इस विसंगति को ठीक करने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →