← नवीनतम पेपर
📄 medicine

Evaluating Safety-Critical Communication Behavior of Large Language Models Using Workflow-Embedded Multi-Agent Clinical Simulation

यह अध्ययन प्रदर्शित करता है कि एक रोल-लॉक्ड, मल्टी-एजेंट क्लिनिकल सिमुलेशन में लार्ज लैंग्वेज मॉडल्स को एम्बेड करने से यह स्पष्ट होता है कि जबकि संरचित ISBAR हैंडओवर मतिभ्रम (hallucinations) को कम करते हैं और संचार दक्षता में सुधार करते हैं, वे सुरक्षा-महत्वपूर्ण चूक (safety-critical omissions) को समाप्त करने में विफल रहते हैं, जो क्लिनिकल सुरक्षा के आकलन के लिए स्वचालित मूल्यांकन प्रणालियों पर विशेषज्ञ मानव निरीक्षण की निरंतर आवश्यकता को रेखांकित करता है।

मूल लेखक: David Power, Theresa Power

प्रकाशित 2026-09-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: David Power, Theresa Power

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

अस्पताल मरीजों की सुरक्षा बनाए रखने के लिए संचार की एक नाजुक कड़ी पर निर्भर करते हैं। जब एक नर्स देखती है कि मरीज की स्थिति बिगड़ रही है, तो उन्हें समस्या की रिपोर्ट करने और निर्देश प्राप्त करने के लिए तुरंत एक वरिष्ठ डॉक्टर को बुलाना होता है, जिसे रजिस्ट्रार (registrar) कहा जाता है। यह एस्केलेशन (escalation) का क्षण अत्यंत महत्वपूर्ण होता; यदि नर्स कोई मुख्य विवरण भूल जाती है, या यदि डॉक्टर तात्कालिकता को गलत समझ लेता है, तो मरीज को रोकी जा सकने वाली क्षति हो सकती है। मदद के लिए, कई अस्पताल ISBAR नामक एक मानक चेकलिस्ट का उपयोग करते हैं, जो 'Identify' (पहचान), 'Situation' (स्थिति), 'Background' (पृष्ठभूमि), 'Assessment' (आकलन), और 'Recommendation' (सिफारिश) के लिए है। यह उपकरण बोलने वाले को बोलने से पहले अपने विचारों को व्यवस्थित करने के लिए मजबूर करता है, जिससे यह सुनिश्चित होता है कि महत्वपूर्ण जानकारी जैसे कि वाइटल साइन्स (vital signs) और विशिष्ट अनुरोध छूट न जाएं।

जैसे-जैसे अस्पताल इन बातचीत में सहायता के लिए आर्टिफिशियल इंटेलिजेंस (AI) का उपयोग करने की संभावना तलाश रहे हैं, एक नया प्रश्न उठता है: क्या एक कंप्यूटर प्रोग्राम इस उच्च-दांव वाले संचार को सुरक्षित रूप से संभाल सकता है? लार्ज लैंग्वेज मॉडल्स (Large Language Models), जो आधुनिक चैटबॉट्स के पीछे की तकनीक है, मानव जैसा टेक्स्ट उत्पन्न करने में उत्कृष्ट हैं। हालांकि, वे अपने आप को स्वतंत्र छोड़ने पर कभी-कभी तथ्य गढ़ने या महत्वपूर्ण विवरणों को चूक जाने के लिए भी जाने जाते हैं। किसी भी ऐसे सिस्टम पर वास्तविक अस्पताल में भरोसा करने से पहले, शोधकर्ताओं को यह परीक्षण करने के तरीके की आवश्यकता थी कि क्या ये प्रोग्राम केवल स्क्रीन पर सरल प्रश्नों के उत्तर देने के बजाय, एक यथार्थवादी, समय-दबाव वाले मेडिकल वर्कफ़्लो के भीतर सुरक्षित रूप से व्यवहार करेंगे।

इसका उत्तर देने के लिए, यूनिवर्सिटी कॉलेज कॉर्क के शोधकर्ताओं की एक टीम ने एक डिजिटल सिमुलेशन बनाया जो एक अस्पताल के वार्ड के सटीक प्रवाह की नकल करता है। उन्होंने वास्तविक मरीजों या वास्तविक डॉक्टरों का उपयोग नहीं किया। इसके बजाय, उन्होंने एक नियंत्रित वातावरण बनाया जहाँ आर्टिफिशियल इंटेलिजेंस एजेंट विशिष्ट भूमिकाएँ निभाते थे: एक एजेंट वार्ड नर्स के रूप में कार्य करता था, दूसरा सीनियर रजिस्ट्रार के रूप में, और तीसरा नर्स मैनेजर के रूप में। ये एजेंट "रोल-लॉक्ड" (role-locked) थे, जिसका अर्थ था कि कंप्यूटर प्रोग्रामों को सख्ती से अपने चरित्र में रहने के निर्देश दिए गए थे, ताकि वे कहानी सुनाने या किसी अन्य व्यक्ति की तरह व्यवहार करने के लिए अपनी निर्धारित भूमिका को न तोड़ें। शोधकर्ताओं ने इन एजेंटों को सिंथेटिक केस फाइलें दीं जिनमें बीमार होते मरीजों का वर्णन था, जैसे कि गंभीर संक्रमण या रक्तस्राव वाले घाव वाला व्यक्ति। लक्ष्य यह देखना था कि मरीज की स्थिति बिगड़ने पर AI एजेंट आपस में कैसे बात करते हैं।

शोधकर्ताओं ने प्रत्येक मरीज के मामले के लिए एक ही परिदृश्य को दो बार चलाकर एक निष्पक्ष परीक्षण स्थापित किया। पहले संस्करण में, नर्स एजेंट ने स्वाभाविक, असंरचित तरीके से बातचीत शुरू की, ठीक वैसे ही जैसे एक इंसान बिना किसी स्क्रिप्ट के बोलता है। दूसरे संस्करण में, नर्स के लिए ISBAR चेकलिस्ट का उपयोग करना अनिवार्य था, जिसमें जानकारी को विशिष्ट, व्यवस्थित प्रारूप में प्रस्तुत किया गया था। रजिस्ट्रार एजेंट ने दोनों प्रकार की कॉलों पर प्रतिक्रिया दी, और शोधकर्ताओं ने होने वाली बातचीत के हर शब्द को रिकॉर्ड किया। फिर उन्होंने सैकड़ों ऐसी बातचीत को पढ़ने के लिए एक परिष्कृत स्वचालित प्रणाली का उपयोग किया, जो विशिष्ट प्रकार की त्रुटियों की तलाश कर रही थी। उन्होंने यह जांचा कि क्या नर्स ने जीवन रक्षक विवरण छोड़ दिए थे, क्या डॉक्टर ने फॉलो-अप के लिए विशिष्ट समय के साथ एक स्पष्ट योजना दी थी, और क्या AI ने मरीज की फाइल में मौजूद तथ्यों को मनगढ़ंत बनाया था।

परिणामों ने सफलता और विफलता का एक आश्चर्यजनक मिश्रण प्रकट किया। जब नर्स ने ISBR संरचना का उपयोग किया, तो बातचीत बहुत अधिक कुशल हो गई। संवाद छोटा था, निर्णय तक पहुँचने के लिए इसमें कम दौर लगे, और AI द्वारा फर्जी चिकित्सा तथ्य गढ़ने की संभावना बहुत कम हो गई। असंरचित बातचीत में, AI ने लगभग 26.5 प्रतिशत मामलों में मरीज की स्थिति के बारे में विवरण गढ़े, लेकिन जब चेकलिस्ट का उपयोग किया गया, तो वह संख्या घटकर 10.0 प्रतिशत रह गई। यह सुझाव देता है कि AI को एक सख्त प्रारूप देने से उसे प्रदान किए गए तथ्यों तक सीमित रहने में मदद मिलती है।

हालाँकि, अध्ययन ने एक छिपे हुए खतरे को भी उजागर किया। जबकि संरचित बातचीत अधिक साफ-सुथरी और तेज़ थी, इसने संचार को सबसे महत्वपूर्ण तरीके से सुरक्षित नहीं बनाया। शोधकर्ताओं ने पाया कि महत्वपूर्ण जानकारी छूट जाने की दर, जिसे 'सेफ्टी-क्रिटिकल ओमिशन' (safety-critical omission) कहा जाता है, कम नहीं हुई। वास्तव में, संरचित बातचीत में इन खतरनाक कमियों की दर थोड़ी अधिक थी, जो असंरचित बातचीत में 11.5 प्रतिशत की तुलना में 16.0 प्रतिशत थी। शोधकर्ताओं को संदेह है कि जब AI एक कठोर चेकलिस्ट का पालन करता है, तो वह यह मान लेता है कि उसने सब कुछ कवर कर लिया है और उन स्पष्टीकरण वाले प्रश्नों को पूछना बंद कर देता है जो एक इंसान खाली जगहों को भरने के लिए पूछ सकता है। चेकलिस्ट ने AI को चीजें गढ़ने से तो रोका, लेकिन इसे आवश्यक बातें बोलने से नहीं रोका।

यह सुनिश्चित करने के लिए कि उनका कंप्यूटर विश्लेषण सटीक था, शोधकर्ताओं ने दो अनुभवी इंटेंसिव केयर नर्सों को इन बातचीत के एक छोटे से चयन की समीक्षा करने के लिए कहा। मानव विशेषज्ञों ने उन्हीं चीजों की तलाश की जो कंप्यूटर ने की थीं: छूटे हुए विवरण, मनगढ़ंत तथ्य और स्पष्ट कार्य योजनाएं। मानव नर्सों और स्वचालित प्रणाली के बीच हमेशा सहमति नहीं थी। कंप्यूटर संभावित छूटी हुई जानकारी को पहचानने में बहुत अच्छा था, लेकिन यह अक्सर बहुत सख्त था, और उन कमियों को भी चिह्नित कर देता था जिन्हें मानव नर्सें महत्वहीन मानती थीं। इसके विपरीत, कंप्यूटर कभी-कभी उन सूक्ष्म तरीकों को मिस कर देता था जिनसे एक योजना वास्तविक दुनिया की सुरक्षा के लिए अपर्याप्त होती थी। इस अंतर ने दिखाया कि जबकि कंप्यूटर तेजी से हजारों बातचीत को स्कैन कर सकते हैं, वे अभी भी मानव विशेषज्ञ की तरह नैदानिक सुरक्षा की बारीकियों को पूरी तरह से नहीं समझते हैं।

अंततः, यह कार्य यह प्रदर्शित करता है कि आर्टिफिशियल इंटेलिजेंस को समझने के लिए कि वह वास्तविक दुनिया में कैसा व्यवहार करेगा, एक यथार्थवादी, रोल-प्लेइंग सिमुलेशन में परीक्षण करना आवश्यक है। अध्ययन ने दिखाया कि केवल एक संचार चेकलिस्ट का पालन करने से सिस्टम की दक्षता में सुधार होता है और झूठ बोलने की उसकी प्रवृत्ति कम होती है, लेकिन यह गारंटी नहीं देता कि वह महत्वपूर्ण सुरक्षा विवरणों को मिस नहीं करेगा। शोधकर्ताओं ने निष्कर्ष निकाला कि इससे पहले कि ऐसे उपकरणों का उपयोग अस्पतालों में किया जाए, उनका मूल्यांकन केवल इस आधार पर नहीं किया जाना चाहिए कि वे कितने विनम्र लगते हैं या वे एक प्रारूप का पालन करते हैं, बल्कि इस आधार पर किया जाना चाहिए कि क्या वे मरीज की स्थिति की पूरी तस्वीर को विश्वसनीय रूप से संप्रेषित कर सकते हैं। सुरक्षित मेडिकल AI का मार्ग केवल बेहतर सॉफ्टवेयर से नहीं, बल्कि एक कठोर परीक्षण प्रक्रिया से होकर गुजरता है जो स्वचालित जांच को मानव विशेषज्ञों के अपरिहार्य निर्णय के साथ जोड़ती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →