← नवीनतम पेपर
💻 computer science

Possible or Definite? A Benchmark for Evaluating Diagnostic Uncertainty Preservation in Clinical Text

यह शोध पत्र 1,200 नैदानिक दस्तावेजों के एक बेंचमार्क को प्रस्तुत करता है ताकि यह मूल्यांकन किया जा सके कि लार्ज लैंग्वेज मॉडल्स नैदानिक अनिश्चितता (डायग्नोस्टिक अनसर्टेन्टी) को कितनी अच्छी तरह सुरक्षित रखते हैं, जो यह प्रकट करता है कि वर्तमान मॉडल अक्सर इन महत्वपूर्ण बारीकियों को बनाए रखने में विफल रहते हैं, जिससे सुरक्षित नैदानिक परिनियोजन के लिए जोखिम उत्पन्न होता है।

मूल लेखक: Hongbo Du, Zixin Lu, Jiaming Qu

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hongbo Du, Zixin Lu, Jiaming Qu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: "शायद" बनाम "निश्चित रूप से" की समस्या

कल्पना कीजिए कि आप एक डॉक्टर हैं जो किसी मरीज के बारे में रिपोर्ट लिख रहे हैं। आप 100% सुनिश्चित नहीं हैं कि उन्हें निमोनिया है, इसलिए आप लिखते हैं: "संभावित निमोनिया" (Possible pneumonia)।

चिकित्सा जगत में, यह शब्द "संभावित" एक सुरक्षा वाल्व की तरह है। यह अगले डॉक्टर को बताता है, "हमें और जांच करने की जरूरत है; अभी भारी उपचार शुरू न करें।" यदि आप इसे बदलकर केवल "निमोनिया" कर देते हैं, तो अर्थ पूरी तरह बदल जाता है। अब, अगला डॉक्टर सोच सकता है, "ठीक है, यह पुष्टि हो गई है," और ऐसा उपचार शुरू कर सकता है जिसकी आवश्यकता नहीं थी या महत्वपूर्ण परीक्षणों को छोड़ सकता है।

यह शोध पत्र एक सरल लेकिन डरावना सवाल पूछता है: यदि हम एक स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल) से इन मेडिकल नोट्स को फिर से लिखने या सारांशित करने के लिए कहते हैं, तो क्या वह "शायद" वाले भाव को बरकरार रखता है, या क्या वह अनजाने में "शायद" को "निश्चित रूप से" में बदल देता है?

प्रयोग: AI के लिए एक "तनाव परीक्षण" (Stress Test) बनाना

शोधकर्ताओं ने केवल अनुमान नहीं लगाया; उन्होंने यह देखने के लिए कि AI कैसा व्यवहार करता है, एक विशाल "तनाव परीक्षण" बनाया।

  1. प्रशिक्षण का मैदान: उन्होंने अस्पतालों और कैंसर डेटाबेस से 1,200 वास्तविक चिकित्सा दस्तावेज़ (जैसे डिस्चार्ज सारांश और लैब रिपोर्ट) एकत्र किए।
  2. मानचित्र (The Map): उन्होंने इन ग्रंथों में 9,000 से अधिक विशिष्ट स्थानों को चिह्नित किया जहाँ एक डॉक्टर ने अनिश्चितता व्यक्त की थी। उन्होंने एक 5-स्तरीय पैमाना बनाया, जो इस प्रकार था:
    • स्तर 1 (निश्चित रूप से अनुपस्थित): "नहीं, मरीज को यह निश्चित रूप से नहीं है।"
    • स्तर 2 (संभावित/प्रायों): "इसकी संभावना है, लेकिन 100% नहीं।"
    • स्तर 3 (संभव/हो सकता है): "यह हो सकता है, लेकिन हम पक्का नहीं जानते।"
    • स्तर 4 (अनिश्चित): "हमारे पास बताने के लिए पर्याप्त जानकारी नहीं है।"
    • स्तर 5 (गैर-पुष्ट): "हमें बाद में इसकी जांच करनी होगी।"
  3. परीक्षण: उन्होंने इन दस्तावेजों को तीन लोकप्रिय AI मॉडलों (OpenAI, Google और Anthropic से) में डाला और उन्हें दो काम करने के लिए कहा:
    • सारांशित करना (Summarize): अन्य डॉक्टरों के लिए एक छोटा संस्करण लिखें।
    • पुनर्लेखन (Rewrite): मरीज के लिए तकनीकी भाषा को सरल अंग्रेजी (या सामान्य भाषा) में बदलें।

उन्होंने AI का परीक्षण दो तरीकों से किया:

  • "सामान्य" तरीका: केवल सारांशित/पुनर्लेखन करने के लिए कहना।
  • "सुरक्षित" तरीका: उसे एक सख्त नियम देना: "अनिश्चितता के स्तर को न बदलें। यदि यह 'शायद' कहता है, तो इसे 'शायद' ही रहने दें।"

परिणाम: AI एक "आत्मविश्वासी" ओवर-एडिटर है

परिणामों से पता चला कि AI में बहुत अधिक आत्मविश्वासी होने की गंभीर आदत है।

1. "कॉन्फिडेंस ट्रैप" (आत्मविश्वास का जाल)
जब AI ने टेक्स्ट को फिर से लिखा, तो उसने अक्सर "शायद" वाले शब्दों को पूरी तरह से हटा दिया।

  • उपमा (Analogy): कल्पना कीजिए कि एक मौसम विज्ञानी कहता है, "बारिश होने की संभावना है।" यदि आप पिकनिक प्लानर के लिए इसका सारांश लिखने को कहें, तो AI कह सकता है, "बारिश होगी।" इसने बारिश के होने के बारे में झूठ नहीं बोला, लेकिन इसने अनिश्चितता को हटा दिया, जिससे पूर्वानुमान एक गारंटी जैसा लगने लगा।
  • आंकड़ा: भले ही AI ने चिकित्सा तथ्य (जैसे, "निमोनिया") को बरकरार रखा, लेकिन वह अनिश्चितता के सही स्तर को 50% से भी कम समय में ही रख पाया।
  • सबसे बड़ी गलती: लगभग 40% मामलों में, AI ने एक "संभावित" निदान को "निश्चित" निदान में बदल दिया। यह सबसे खतरनाक प्रकार की त्रुटि है क्योंकि यह आधिकारिक लगता है लेकिन वास्तव में केवल एक अनुमान है।

2. "मरीज" बनाम "डॉक्टर" का अंतर
AI डॉक्टरों के लिए टेक्स्ट को फिर से लिखने की तुलना में मरीजों के लिए पुनर्लेखन करने में अधिक खराब प्रदर्शन करता था।

  • उपमा: डॉक्टरों से बात करते समय, AI एक सावधान संपादक की तरह व्यवहार करता था, बारीकियों को बनाए रखता था। मरीजों से बात करते समय, वह एक कहानीकार की तरह व्यवहार करता था जो कहानी को सरल बनाने की कोशिश करता है, और अक्सर कहानी के प्रवाह को बेहतर बनाने के लिए "कहानी के छिद्रों" (अनिश्चितताओं) को काट देता है।
  • परिणाम: जब AI टेक्स्ट को "मरीज के अनुकूल" बनाने की कोशिश कर रहा था, तब उसने अधिक चिकित्सा तथ्यों को छोड़ दिया और अधिक अनिश्चितताओं को बदल दिया।

3. "जादुई प्रॉम्प्ट" काम नहीं आया
शोधकर्ताओं ने AI को एक सख्त निर्देश देकर इसे ठीक करने की कोशिश की: "कृपया अनिश्चितता को बनाए रखें!"

  • परिणाम: इससे थोड़ा सुधार हुआ (सटीकता में लगभग 10-20% का सुधार), लेकिन इसने समस्या को ठीक नहीं किया। AI अभी भी "संभावित" को "निश्चित" में बहुत अधिक बार बदल देता था। यह एक छात्र को यह कहने जैसा है कि, "परीक्षा में अनुमान न लगाएं," और वह फिर भी अनुमान ही लगाता है।

4. "रैंकिंग" परीक्षण
एक दूसरे परीक्षण में, उन्होंने AI को वाक्यों की एक सूची दी और उन्हें "सबसे निश्चित" से "सबसे कम निश्चित" के क्रम में रैंक करने के लिए कहा।

  • परिणाम: AI "निश्चित रूप से नहीं" और "निश्चित रूप से हाँ" के बीच अंतर बताने में ठीक था। लेकिन जब उसे "संभावित" और "संभव" के बीच अंतर बताने के लिए कहा गया, तो वह बहुत भ्रमित हो गया। वह संदेह के समान स्तरों के बीच की सूक्ष्म रेखाओं को समझने में संघर्ष कर रहा था।

निष्कर्ष (Takeaway)

यह शोध पत्र निष्कर्ष निकालता है कि हालांकि ये AI मॉडल प्रवाहपूर्ण होने और व्याकरणिक रूप से सही वाक्य बनाने में बहुत अच्छे हैं, लेकिन वे वर्तमान में चिकित्सा भाषा में "ग्रे शेड्स" (धुंधली रेखाओं/बारीकियों) को बनाए रखने में खराब हैं।

वे अक्सर "शायद" को "हाँ" में बदल देते हैं। अस्पताल में, यह केवल एक टाइपिंग की गलती नहीं है; यह चिकित्सा अर्थ में एक बदलाव है जो गलत परीक्षणों या उपचारों की ओर ले जा सकता है। लेखक चेतावनी देते हैं कि हम इन AI उपकरणों पर तब तक भरोसा नहीं कर सकते जब तक कि हम उन्हें "निश्चित" शब्द जितना ही "संभव" शब्द का सम्मान करना न सिखा दें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →