← नवीनतम पेपर
📄 health informatics

Multi-model LLM assessment of Quality Control Circle methodological quality: a designed-anchor reliability study

यह अध्ययन प्रदर्शित करता है कि कई बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) का एक पैनल क्वालिटी कंट्रोल सर्कल रिपोर्ट की पद्धतिगत गुणवत्ता का विश्वसनीय और निरंतर मूल्यांकन कर सकता है, जो कीवर्ड-आधारित विधियों की तुलना में मजबूत अंतर-मॉडल सहमति प्राप्त करता है और प्लांट की गई पद्धतिगत कमजोरियों का प्रभावी ढंग से पता लगाता है।

मूल लेखक: LIn, H., Lyu, J.

प्रकाशित 2026-10-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: LIn, H., Lyu, J.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

पूर्वी और दक्षिण-पूर्व एशिया के कई अस्पतालों में, अग्रिम पंक्ति के कर्मचारियों की छोटी टीमें समस्याओं को हल करने और रोगी देखभाल में सुधार करने के लिए मिलकर काम करती हैं। वे एक सख्त, चरण-दर-चरण प्रक्रिया का पालन करते हैं: वे एक विषय चुनते हैं, वर्तमान स्थिति को मापते हैं, एक लक्ष्य निर्धारित करते हैं, समस्याओं के मूल कारणों का पता लगाते हैं, और फिर समाधानों का परीक्षण करते हैं कि क्या वे काम करते हैं। एक बार जब एक चक्र पूरा हो जाता है, तो टीम अपनी यात्रा का दस्तावेजीकरण करने के लिए एक औपचारिक रिपोर्ट लिखती है। ये रिपोर्ट अत्यंत महत्वपूर्ण हैं। अस्पताल इनका उपयोग देखभाल की गुणवत्ता का आकलन करने, पुरस्कारों के लिए प्रतिस्पर्धा करने और यह साबित करने के लिए करते हैं कि वे सुरक्षा मानकों को पूरा करते हैं। हालाँकि, इन रिपोर्टों को पढ़ना और ग्रेड देना एक भारी बोझ है। मानव विशेषज्ञों को हर पृष्ठ को पढ़ना पड़ता है, विशिष्ट विवरणों की जाँच करनी पड़ती है, और एक अंक देना पड़ता है। इसमें बहुत समय लगता है, और विभिन्न विशेषज्ञ अक्सर इस बात पर असहमत होते हैं कि एक अच्छी रिपोर्ट कैसी दिखनी चाहिए। जैसे-जैसे रिपोर्टों की संख्या बढ़ती है, उन सभी की पूरी तरह से और निरंतर समीक्षा करना मनुष्यों के लिए लगभग असंभव हो जाता है।

यहीं से आर्टिफिशियल इंटेलिजेंस (कृत्रिम बुद्धिमत्ता) का उपयोग करने का विचार सामने आता है। लार्ज लैंग्वेज मॉडल्स (बड़े भाषा मॉडल) ऐसे कंप्यूटर प्रोग्राम हैं जो टेक्स्ट को पढ़ सकते हैं, संदर्भ को समझ सकते हैं, और मनुष्यों की तरह जटिल निर्देशों के माध्यम से तर्क कर सकते हैं। शोधकर्ताओं ने सोचा कि क्या इन कार्यक्रमों को इन अस्पताल रिपोर्टों को पढ़ने और उन्हें निष्पक्ष रूप से ग्रेड देने के लिए प्रशिक्षित किया जा सकता है। बड़ा सवाल केवल यह नहीं था कि कंप्यूटर एक स्कोर दे सकता है या नहीं, बल्कि यह था कि क्या विभिन्न कंप्यूटर प्रोग्राम एक-दूसरे के साथ सहमत होंगे। यदि एक प्रोग्राम कहता है कि एक रिपोर्ट उत्कृष्ट है और दूसरा कहता है कि यह खराब है, तो सिस्टम पर भरोसा नहीं किया जा सकता। इसका उत्तर खोजने के लिए, शोधकर्ताओं की एक टीम ने एक विशेष परीक्षण डिजाइन किया ताकि यह देखा जा सके कि क्या आर्टिफिशियल इंटेलिजेंस मॉडल्स का एक समूह इन सुधार रिपोर्टों की गुणवत्ता को विश्वसनीय रूप से आंक सकता है।

शोधकर्ताओं ने तीस नकली रिपोर्टों का एक सेट बनाया जो ताइवानी अस्पतालों की वास्तविक रिपोर्टों की तरह ही दिखती थीं। उन्होंने इन रिपोर्टों को पारंपरिक चीनी भाषा में लिखा, जो वास्तविक दस्तावेजों की तरह ही समान संरचना और शैली का उपयोग करती थी। परीक्षण को कठोर बनाने के लिए, उन्होंने इन रिपोर्टों में गुप्त रूप से विशिष्ट गलतियाँ डालीं, जैसे कि विश्लेषण में छूटे हुए चरण या समाधानों के लिए कमजोर साक्ष्य। उन्होंने प्रत्येक रिपोर्ट के लिए एक "गोल्ड स्टैंडर्ड" स्कोर भी बनाया, जो परीक्षण के लिए सही उत्तर कुंजी के रूप में कार्य करता था। इसके बाद उन्होंने पांच अलग-अलग आर्टिफिशियल इंटेलिजेंस मॉडल्स को ये रिपोर्टें पढ़ने के लिए कहा। मॉडल्स को सही स्कोर या गलतियों के विशिष्ट स्थान के बारे में नहीं बताया गया था; उन्होंने केवल रिपोर्ट के टेक्स्ट को देखा। हालाँकि, मॉडल्स को दिए गए निर्देशों में स्कोरिंग करने से पहले किए जाने वाले नौ विशिष्ट पद्धतिगत जाँचों की स्पष्ट सूची दी गई थी, जो डाली गई दस प्रकार की गलतियों में से नौ के अनुरूप थे। प्रत्येक मॉडल से गुणवत्ता के आठ अलग-अलग पहलुओं पर रिपोर्ट को रेट करने के लिए कहा गया था, जैसे कि विश्लेषण कितना गहरा था, क्या डेटा ठोस था, और क्या समाधान अच्छी तरह से व्यवस्थित थे। परिणामों को स्थिर सुनिश्चित करने के लिए, प्रत्येक मॉडल ने प्रत्येक रिपोर्ट को तीन बार पढ़ा।

अध्ययन में पाया गया कि जब चार अलग-अलग मॉडल्स ने मिलकर काम किया, तो वे एक-दूसरे के साथ बहुत अच्छी तरह से सहमत हुए। उनके स्कोर इतने सुसंगत थे कि उन्हें विश्वसनीय माना जा सकता था, जिसमें सहमति का एक स्तर था जिसे शोधकर्ता "अच्छा" बताते हैं। इसका अर्थ यह है कि यदि आप इन विभिन्न प्रोग्रामों से एक ही रिपोर्ट को ग्रेड करने के लिए कहेंगे, तो वे संभवतः एक समान स्कोर देंगे। मॉडल्स छिपी हुई गलतियों को पकड़ने में भी आश्चर्यजनक रूप से अच्छे थे। जब शोधकर्ताओं ने मॉडल्स से उनके द्वारा पाई गई समस्याओं को सूचीबद्ध करने के लिए कहा, तो मॉडल्स ने लगभग सभी मामलों में डाली गई त्रुटियों की पहचान की। यह एक साधारण कंप्यूटर खोज से कहीं अधिक प्रभावी था जो केवल विशिष्ट कीवर्ड्स को खोजता है। साधारण खोज कई त्रुटियों को पकड़ने में विफल रही क्योंकि मॉडल्स केवल शब्दों को ही नहीं, बल्कि टेक्स्ट के अर्थ को भी समझते थे।

हालाँकि, अध्ययन ने यह भी दिखाया कि कंप्यूटर पूर्ण नहीं थे। जबकि वे एक-दूसरे के साथ सहमत थे, उनके स्कोर हमेशा "गोल्ड स्टैंडर्ड" उत्तर कुंजी से मेल नहीं खाते थे। कुछ मामलों में, वे बहुत उदार थे, जिससे महत्वपूर्ण खामियों वाली रिपोर्टों को भी उच्च स्कोर मिल रहा था। अन्य मामलों में, वे बहुत सख्त थे। शोधकर्ताओं ने नोट किया कि मॉडल्स लंबी रिपोर्टों को उच्च स्कोर देने की ओर प्रवृत्त थे, जिससे पता चलता है कि वे टेक्स्ट की लंबाई को कार्य की गुणवत्ता के साथ भ्रमित कर रहे होंगे। इसके अलावा, तुलना के लिए उपयोग किए गए "गोल्ड स्टैंडर्ड" स्कोर उसी प्रकार के कंप्यूटर प्रोग्राम द्वारा बनाए गए थे जिसने नकली रिपोर्ट लिखी थी, जिसका अर्थ है कि उत्तर कुंजी में भी कुछ पूर्वाग्रह हो सकता है। इस कारण से, शोधकर्ता सावधानी बरतते हुए कहते हैं कि हालांकि कंप्यूटर एक-दूसरे के साथ सहमत हो सकते हैं, लेकिन उन्होंने अभी तक यह सिद्ध नहीं किया है कि वे मानव विशेषज्ञों के साथ सहमत हैं या वे मानव निर्णय का स्थान ले सकते हैं।

सबसे महत्वपूर्ण निष्कर्ष यह है कि विभिन्न आर्टिफिशियल इंटेलिजेंस मॉडल्स की एक टीम उच्च स्तर की निरंतरता के साथ इन रिपोर्टों को ग्रेड करने के लिए मिलकर काम कर सकती है। वे साधारण कीवर्ड सर्च की तुलना में टेक्स्ट में छिपी कमजोरियों को बहुत बेहतर तरीके से पहचान सकते हैं। यह सुझाव देता है कि भविष्य में, इन उपकरणों का उपयोग हजारों रिपोर्टों को छाँटने के लिए किया जा सकता है, जो उन रिपोर्टों को चिह्नित कर सकें जिन्हें मानव विशेषज्ञ के ध्यान की आवश्यकता है और स्पष्ट, उच्च-गुणवत्ता वाली रिपोर्टों को तेजी से संसाधित होने के लिए छोड़ सकें। लेकिन अध्ययन यह कहने से पहले रुक जाता है कि कंप्यूटर पूरी तरह से कार्यभार संभालने के लिए तैयार हैं। शोधकर्ता इस बात पर जोर देते हैं कि अगला कदम यह परीक्षण करना है कि क्या ये मॉडल्स वास्तविक अस्पतालों की वास्तविक रिपोर्टों पर परीक्षण कर सकते हैं ताकि यह देखा जा सके कि क्या वे अनुभवी मानव समीक्षकों के निर्णय से मेल खाते हैं। तब तक, ये उपकरण मानव विशेषज्ञता के विकल्प के बजाय, मनुष्यों को कार्यभार प्रबंधित करने में मदद करने के लिए एक आशाजनक तरीका बने हुए हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →