← नवीनतम पेपर
🤖 AI

PSEBench: A Controllable and Verifiable Benchmark for Evaluating LLMs in Patient Safety Event Triage

यह शोध पत्र PSEBench प्रस्तुत करता है, जो एक स्केलेबल और सत्यापन योग्य बेंचमार्क है जिसे "क्लॉज कार्ड्स" का उपयोग करते हुए एक नीति-आधारित पद्धति के माध्यम से निर्मित किया गया है ताकि रोगी सुरक्षा घटना ट्राइएज (triage) पर LLMs का मूल्यांकन किया जा सके, जो निरंतर क्षमता प्रवृत्तियों को प्रकट करता है और साक्ष्य-आधारित तर्क, सूचना प्राप्ति, और सिद्धांतबद्ध रूप से परहेज करने (abstention) के प्रबंधन में महत्वपूर्ण अंतराल की पहचान करता है।

मूल लेखक: Keqi Han, Ryan Young, Annabel Strauss, Lindsey Hughes, Katharine M. Nesbitt, Nicole Schueler, Che Ngufor, Carl Yang, Yuan Xue, Zhijun Yin

प्रकाशित 2026-06-05
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Keqi Han, Ryan Young, Annabel Strauss, Lindsey Hughes, Katharine M. Nesbitt, Nicole Schueler, Che Ngufor, Carl Yang, Yuan Xue, Zhijun Yin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ PSEBench पेपर का सरल, रोज़मर्रा की भाषा में विवरण दिया गया है, जिसमें अवधारणाओं को स्पष्ट करने के लिए उपमाओं (analogies) का उपयोग किया गया है।

बड़ी तस्वीर: "सुरक्षा निरीक्षक" (Safety Inspector) की समस्या

कल्पना कीजिए कि एक अस्पताल एक विशाल, व्यस्त हवाई अड्डे की तरह है। हर दिन, सैकड़ों चीजें थोड़ी बहुत गलत या पूरी तरह से गलत होती हैं (एक मरीज को गलत दवा मिल जाती है, एक मशीन फेल हो जाती है, कोई गिर जाता है)। इन्हें पेशेंट सेफ्टी इवेंट्स (Patient Safety Events) कहा जाता है।

कानून के अनुसार, हवाई अड्डे (अस्पताल) को "फेडरल एविएशन एडमिनिस्ट्रेशन" (सरकारी स्वास्थ्य विभाग) को कुछ विशिष्ट प्रकार की गंभीर दुर्घटनाओं की रिपोर्ट करनी होती है। हालाँकि, क्या रिपोर्ट करना है इसके नियम अविश्वसनीय रूप से जटिल हैं, जो घने कानूनी शब्दों में लिखे गए हैं और सूक्ष्म विवरणों पर निर्भर करते हैं।

वर्तमान में, एक मानव सुरक्षा विशेषज्ञ को हर एक रिपोर्ट को पढ़ना पड़ता है और यह तय करना पड़ता है: "क्या हमें यह सरकार को रिपोर्ट करना चाहिए, या यह केवल एक मामूली आंतरिक मुद्दा है?" यह एक उच्च-दांव वाला काम है। यदि वे एक रिपोर्ट छोड़ देते हैं, तो अस्पताल मुसीबत में पड़ जाता है। यदि वे बहुत अधिक मामूली चीजों की रिपोर्ट करते हैं, तो सरकार पर बोझ बढ़ जाता है।

शोधकर्ताओं ने यह देखना चाहा कि क्या AI (लार्ज लैंग्वेज मॉडल्स) यह काम हमारे लिए कर सकते हैं। लेकिन AI को टेस्ट करने के लिए, उन्हें एक निष्पक्ष और सटीक टेस्ट की आवश्यकता थी। वहीं PSEBench आता है।


पिछले परीक्षणों के साथ समस्या

कल्पना कीजिए कि आप एक छात्र को ऐसे टेस्ट देकर गाड़ी चलाना सिखाने की कोशिश कर रहे हैं जहाँ सवाल मौके पर ही बनाए जाते हैं।

  • समस्या: यदि आप बस AI से कहें कि "एक कहानी पढ़ें और मुझे बताएं कि क्या यह रिपोर्ट करने योग्य है," तो AI गलत कारणों से सही उत्तर का अनुमान लगा सकता है, या वह ऐसी बातें बना सकता है जो वहां मौजूद ही नहीं हैं।
  • कमी: वास्तविक सुरक्षा विशेषज्ञ केवल अनुमान नहीं लगाते। वे गायब तथ्यों को देखते हैं ("क्या वास्तव में मरीज की मृत्यु हुई?") वे यह भी जानते हैं कि कब कहना है "मुझे नहीं पता" (यदि नियम अस्पष्ट हों), और वे उस सटीक कानून का हवाला देते हैं जिसका वे उपयोग कर रहे हैं। पिछले परीक्षणों में इन कौशलों की जांच नहीं की गई थी।

समाधान: PSEBench (एक "परफेक्ट टेस्ट")

लेखकों ने PSEBench नामक एक नया बेंचमार्क बनाया है। इसे एक वीडियो गेम लेवल डिज़ाइनर के रूप में सोचें जो AI के लिए हजारों अद्वितीय, सटीक टेस्ट परिदृश्य (scenarios) बनाता है।

1. "क्लॉज कार्ड" (The Recipe - रेसिपी)

सिर्फ एक कहानी लिखने के बजाय, शोधकर्ताओं ने पहले प्रत्येक नियम के लिए एक "रेसिपी कार्ड" बनाया।

  • कल्पना करें कि केक बनाने की एक रेसिपी है। कार्ड में सूचीबद्ध है कि किन सामग्रियों (तथ्यों) की आवश्यकता है, केक कैसा दिखना चाहिए (निर्णय), और आप किस नियम पुस्तिका के पेज का पालन कर रहे हैं (कानून)।
  • मानव ऑडिटर्स ने इन कार्डों की जांच की ताकि यह सुनिश्चित हो सके कि तर्क (logic) एकदम सटीक है। यही "ग्राउंड ट्रुथ" (वास्तविक सत्य) है।

2. "एंकर" (The Real-World Flavor - वास्तविक दुनिया का स्वाद)

कहानियों को वास्तविक बनाने के लिए, उन्होंने जापान की वास्तविक, गुमनाम दुर्घटना रिपोर्टों (जैसे वास्तविक समाचार क्लिपिंग) को लिया और उन्हें "एंकर" के रूप में उपयोग किया।

  • उन्होंने AI से केवल एक कहानी लिखने के लिए नहीं कहा। उन्होंने कहा, "यहाँ एक टूटे हुए IV पोल के बारे में एक वास्तविक कहानी है। अब, एक ऐसी कहानी लिखें जो इस विशिष्ट रेसिपी कार्ड के अनुकूल हो।"
  • यह सुनिश्चित करता है कि कहानियाँ वास्तविक अस्पताल की रिपोर्ट जैसी लगें, न कि रोबोट की बड़बड़ाहट जैसी।

3. "क्लोज्ड-लूप" (The Double-Check - दोहरा जांच)

यह सबसे महत्वपूर्ण हिस्सा है। इस सिस्टम में एक वेरिफायर (Verifier) होता है (एक सख्त संपादक की तरह)।

  • चरण 1: AI रेसिपी कार्ड के आधार पर एक कहानी लिखता है।
  • चरण 2: वेरिफायर कहानी पढ़ता है और पूछता है, "क्या इस कहानी में वास्तव में रेसिपी कार्ड वाले तथ्य शामिल हैं? क्या इसने गलती से कोई महत्वपूर्ण विवरण छोड़ दिया? क्या इसने गलती से टेक्स्ट में ही उत्तर प्रकट कर दिया?"
  • चरण 3: यदि कहानी विफल होती है, तो AI को इसे फिर से लिखना पड़ता है। यह तब तक लिखता रहता है जब तक कि वेरिफायर "पास" न दे दे।
  • परिणाम: PSEBench में प्रत्येक टेस्ट केस तार्किक रूप से पूर्ण होने की गारंटी देता है। हम जानते हैं कि उत्तर क्या होना चाहिए क्योंकि हमने इसे उसी तरह बनाया है।

4. तीन प्रकार के टेस्ट

यह बेंचमार्क AI को तीन अलग-अलग तरीकों से टेस्ट करता है, ठीक वैसे ही जैसे एक वास्तविक सुरक्षा विशेषज्ञ का सामना होता है:

  • पूर्ण मामला (The Complete Case): रिपोर्ट में सभी तथ्य मौजूद हैं। क्या AI सही निर्णय ले पाता है?
  • लापता जानकारी वाला मामला (The Missing Information Case): रिपोर्ट अस्पष्ट है (जैसे, "मरीज की प्रतिक्रिया हुई," लेकिन यह नहीं बताया गया कि कितनी गंभीर थी)। क्या AI यह पहचान पाता है कि जानकारी गायब है और उत्तर पाने के लिए प्रश्न पूछ सकता है? (अधिकांश AI केवल अनुमान लगाते हैं; यह टेस्ट यह जांचता है कि क्या वे प्रश्न पूछते हैं)।
  • अनिश्चित मामला (The Uncertain Case): तथ्य स्पष्ट हैं, लेकिन कानून मौन है या विरोधाभासी है। क्या AI यह कह पाता है कि, "मुझे नहीं पता, एक इंसान को इस पर निर्णय लेना होगा," बजाय इसके कि वह गलत उत्तर देने की कोशिश करे?

उन्होंने क्या पाया (परिणाम)

उन्होंने इस बेंचमार्क पर 15 अलग-अलग AI मॉडल्स (OpenAI, Google और Anthropic जैसी बड़ी टेक कंपनियों और मेडिकल-विशिष्ट मॉडल्स सहित) का परीक्षण किया।

अच्छी खबर:

  • सबसे स्मार्ट, महंगे AI मॉडल (जैसे GPT-5.5 और Gemini 3.1 Pro) स्पष्ट मामलों में लगभग 90-95% बार सही अंतिम "हाँ/नहीं" उत्तर दे रहे हैं।

बुरी खबर (द "गॉट्स" - छिपी हुई कमियां):

  • "अनुमान लगाने" की समस्या: जब नियम अस्पष्ट थे (अनिश्चित मामले), तो कई AI ने जबरदस्ती "हाँ, रिपोर्ट करें" का उत्तर दे दिया। वे बहुत अधिक आत्मविश्वासी थे।
    • उपमा: यह एक ऐसे छात्र की तरह है जिसे गणित के सवाल का जवाब नहीं पता, लेकिन वह खाली छोड़ने के बजाय "42" लिख देता है क्योंकि वह खाली छोड़ने से डरता है। यह अस्पतालों में खतरनाक है क्योंकि इससे झूली चेतावनियों की बाढ़ आ सकती है।
  • "खामोशी" की समस्या: जब जानकारी गायब थी, तो कई AI (विशेष रूपकर छोटे या मेडिकल-स्पेशलाइज्ड मॉडल) ने कभी मदद नहीं मांगी। उन्होंने बस एक उत्तर मनगढ़ंत बना लिया।
    • उपमा: एक जासूस जो एक गायब सुराग देखता है लेकिन लैब से परिणाम मांगने के बजाय खुद ही एक संदिग्ध का आविष्कार कर देता है।
  • मेडिकल मॉडल्स विफल रहे: आश्चर्यजनक रूप से, विशेष रूप से मेडिकल टेक्स्टबुक पर प्रशिक्षित AI मॉडल इस विशिष्ट कानूनी कार्य पर सामान्य स्मार्ट मॉडल्स की तुलना में बदतर प्रदर्शन करते हैं। वे चिकित्सा संबंधी प्रश्नों का उत्तर देने में बेहतरीन थे लेकिन जटिल कानूनी रिपोर्टिंग नियमों का पालन करने में कमजोर थे।

निष्कर्ष

PSEBench यह सिद्ध करता है कि हालांकि AI कहानियाँ पढ़ने में अच्छा हो रहा है, लेकिन यह अभी भी अपने आप "सुरक्षा निरीक्षक" बनने के लिए तैयार नहीं है।

  • यह बता सकता है कि क्या कोई कहानी रिपोर्ट करने योग्य घटना जैसी दिखती है।
  • लेकिन इसे यह समझने में संघर्ष करना पड़ता है कि कब रुकना है और अधिक जानकारी मांगनी है, या कब यह स्वीकार करना है कि उसे नहीं पता

लेखक निष्कर्ष निकालते हैं कि हमें ऐसा AI बनाने की आवश्यकता है जो अधिक विनम्र (यह जानता हो कि कब रुकना है) और अधिक जिज्ञासु (यह जानता हो कि कब प्रश्न पूछना है) हो, इससे पहले कि हम रोगी सुरक्षा के लिए इस पर भरोसा कर सकें।

सारांश उपमा

इसे AI के लिए ड्राइविंग टेस्ट के रूप में सोचें।

  • पिछले टेस्ट केवल AI को "सीधी सड़क पर गाड़ी चलाने" के लिए कहते थे।
  • PSEBench आपको एक ड्राइविंग सिम्युलेटर में डालता है जहाँ:
    1. सड़क साफ है (पूर्ण मामला)।
    2. कोहरा इतना घना है कि आप स्टॉप साइन नहीं देख पा रहे हैं, इसलिए आपको दिशा-निर्देशों के लिए यात्री से पूछना होगा (लापता जानकारी)।
    3. सड़क के संकेत विरोधाभासी हैं, इसलिए आपको अंधे होकर गाड़ी चलाने के बजाय रुककर सुपरवाइजर को कॉल करना होगा (अनिश्चित मामला)।

परिणाम बताते हैं कि हालांकि AI सीधी सड़क पर एक अच्छा ड्राइवर है, लेकिन जब रास्ता कठिन होता है, तो वह घबरा जाता है या अनुमान लगाने लगता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →