← नवीनतम पेपर
💻 computer science

Auditing Data Leakage Candidate Coverage and Calibration in Clinical Abbreviation Disambiguation Benchmarks

यह शोधपत्र नैदानिक संक्षिप्तीकरण विसंकेतन (clinical abbreviation disambiguation) के लिए एक ऑडिट योग्य मूल्यांकन प्रोटोकॉल प्रस्तुत करता है जो यह उजागर करता है कि कैसे उच्च बेंचमार्क सटीकता अक्सर डेटा लीकेज और उम्मीदवार कवरेज संबंधी समस्याओं को छिपा लेती है, और यह प्रदर्शित करता है कि विश्वसनीय नैदानिक एनएलपी मूल्यांकन के लिए केवल एकल सटीकता स्कोर पर निर्भर रहने के बजाय लीकेज सुदृढ़ता, उम्मीदवार समर्थन और कैलिब्रेटेड विश्वसनीयता की अलग से रिपोर्टिंग आवश्यक है।

मूल लेखक: Tianze Yang, Qiqing Li, Jialun Wu, Xinyu Qiu

प्रकाशित 2026-09-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tianze Yang, Qiqing Li, Jialun Wu, Xinyu Qiu

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

चिकित्सा रिकॉर्डों की विशाल, असंरचित दुनिया में, डॉक्टर और नर्स संक्षिप्त टिप्पणियाँ लिखते हैं जो संक्षिप्तीकरण (शॉर्टहैंड) से भरी होती हैं। समय बचाने के लिए, वे संक्षिप्तीकरण (एब्रिविएशन) का उपयोग करते हैं, लेकिन ये शॉर्टकट अक्सर अस्पष्ट होते हैं। अक्षरों का एक ही छोटा समूह कार्डियोलॉजी रिपोर्ट में एक अर्थ रख सकता है और न्यूरोलॉजी नोट में कुछ बिल्कुल अलग। कंप्यूटरों को डॉक्टरों की मदद करने के लिए, उन्हें पहले इस पहेली को सुलझाना सीखना होगा, जिसे 'एब्रिविएशन डिसएम्बिग्यूएशन' (संक्षिप्तीकरण का अर्थ स्पष्ट करना) कहा जाता है। शोधकर्ताओं ने सार्वजनिक परीक्षण, या बेंचमार्क बनाए हैं, यह देखने के लिए कि कंप्यूटर प्रोग्राम इन शॉर्टकट के सही अर्थ का अनुमान लगाने में कितने कुशल हैं। ये परीक्षण आमतौर पर एक एकल संख्या, एक प्रतिशत उत्पन्न करते हैं, जिसका उद्देश्य यह दर्शाना है कि कंप्यूटर कितना सटीक है। यदि कोई प्रोग्राम नब्बे प्रतिशत का स्कोर करता है, तो अक्सर यह मान लिया जाता है कि वह लगभग पूर्ण है। हालांकि, यह संख्या भ्रामक हो सकती है यदि परीक्षण में ही छिपे हुए दोष हों, जैसे कि सीखने के चरण और परीक्षण के चरण दोनों में एक ही वाक्यों को दोहराना, या यदि कंप्यूटर के सामने पहुँचने से पहले ही परीक्षण से कठिन मामलों को हटा दिया गया हो।

शोधकर्ताओं की एक टीम ने इन परीक्षणों का ऑडिट करने के लिए हाथ बढ़ाया, न केवल यह देखने के लिए कि कंप्यूटर कितने स्मार्ट थे, बल्कि यह देखने के लिए कि क्या परीक्षण निष्पक्ष थे। उन्होंने पचहत्तर विभिन्न संक्षिप्तीकरणों वाले चिकित्सा नोट्स के एक व्यापक रूप से उपयोग किए जाने वाले संग्रह पर ध्यान केंद्रित किया। उनका लक्ष्य मूल्यांकन करने का एक नया तरीका बनाने का था जो अंतिम स्कोर के पीछे की वास्तविकता को देख सके। उन्होंने पाया कि परीक्षण चलाने का मानक तरीका अक्सर दो बड़ी समस्याओं को छिपा देता है। पहला, एक ही वाक्य गलती से प्रशिक्षण डेटा (जहाँ कंप्यूटर सीखता है) और परीक्षण डेटा (जहाँ उसकी ग्रेडिंग होती है) दोनों में दिखाई दे सकता है। यह एक छात्र को अभ्यास परीक्षा देने जैसा है जिसमें अंतिम परीक्षा के ठीक वही प्रश्न शामिल हों; उच्च स्कोर समझ के बजाय स्मृति (याददाश्त) को दर्शाता है। दूसरा, परीक्षण अक्सर संक्षिप्तीकरण के दुर्लभ अर्थों को हटा देते हैं क्योंकि उनके केवल कुछ ही उदाहरण होते हैं। यह सुरक्षा की एक झूठी भावना पैदा करता है, क्योंकि वास्तविक दुनिया में, कंप्यूटर अंततः इन दुर्लभ मामलों का सामना करेगा और उसके पास चुनने के लिए कोई सही उत्तर नहीं होगा।

इसे ठीक करने के लिए, शोधकर्ताओं ने एक सख्त प्रोटोकॉल डिजाइन किया जो एक कठोर गुणवत्ता नियंत्रण जांच की तरह कार्य करता है। डेटा को सीखने और परीक्षण समूहों में विभाजित करने से पहले, उन्होंने डुप्लिकेट वाक्यों को स्कैन किया और अतिरिक्त वाक्यों को हटा दिया, यह सुनिश्चित करते हुए कि परीक्षण सेट का प्रत्येक वाक्य कंप्यूटर के लिए वास्तव में नया हो। उन्होंने दुर्लभ अर्थों को हटाने से भी इनकार कर दिया। इसके बजाय, उन्होंने इन कठिन मामलों को एक अलग "स्ट्रेस टेस्ट" समूह में स्थानांतरित कर दिया। इस समूह ने उन्हें यह देखने की अनुमति दी कि क्या होता है जब एक कंप्यूटर से ऐसे अर्थ का अनुमान लगाने को कहा जाता है जिसे उसने कभी पहचाना ही नहीं है। उन्होंने कंप्यूटर के आत्मविश्वास की भी जाँच की। एक अच्छा सिस्टम न केवल सही अनुमान लगाता है, बल्कि उसे यह भी पता होना चाहिए कि वह कब अनुमान लगा रहा है। शोधकर्ताओं ने यह मापा कि क्या कंप्यूटर एक ऐसी स्थिति और एक ऐसी स्थिति के बीच अंतर कर सकता था जहाँ उसके पास एक अच्छा उत्तर था और एक ऐसी स्थिति के बीच जहाँ उसे अंधेरे में अनुमान लगाने के लिए मजबूर किया गया था।

जब उन्होंने इस नए, अधिक सख्त प्रोटोकॉल को पचहत्तर संक्षिप्तीकरणों पर लागू किया, तो परिणाम काफी महत्वपूर्ण रहे। कंप्यूटर सिस्टम अभी भी अच्छा प्रदर्शन कर रहे थे, लेकिन शोधकर्ताओं ने पाया कि पहले रिपोर्ट किए गए उच्च स्कोर पूरी तरह से सिस्टम की बुद्धिमत्ता के कारण नहीं थे। प्रशिक्षण और परीक्षण सेटों के बीच लीक हुए डुप्लिकेट वाक्यों को हटाने से, स्कोर केवल लगभग शून्य दशमलव शून्य दो प्रतिशत अंक से गिरा। यह छोटा सा बदलाव बताता है कि हालांकि डेटा लीकेज मौजूद था, लेकिन यह इस विशिष्ट डेटासेट में उच्च स्कोर का मुख्य कारण नहीं था। हालांकि, असली कहानी तब सामने आई जब उन्होंने दुर्लभ अर्थों को देखा। जब कंप्यूटर को विकल्पों की ऐसी सूची में से चुनने के लिए मजबूर किया गया जिसमें सही उत्तर शामिल नहीं था, तब भी वह आधे से अधिक बार आत्मविश्वास के साथ गलत अनुमान लगाता रहा। विशेष रूप से, जब सही अर्थ उसके विकल्पों की सूची में मौजूद नहीं था, तब भी सिस्टम पचास आठ प्रतिशत मामलों में एक 'कॉन्फिडेंस चेक' (विश्वास जाँच) को पास कर गया, जिसे खराब अनुमानों को छानने के लिए बनाया गया था। इसका अर्थ है कि कंप्यूटर अक्सर अपने गलत उत्तरों के प्रति बहुत आश्वस्त था।

अध्ययन ने विभिन्न प्रकार के कंप्यूटर मॉडल की तुलना की, न केवल सटीकता पर बल्कि इस पर भी कि उन्हें कितनी कंप्यूटिंग शक्ति की आवश्यकता है। उन्होंने पाया कि एक अधिक जटिल मॉडल आवश्यक रूप से एक सरल मॉडल से बेहतर प्रदर्शन नहीं करता है, और जब वह करता भी है, तो सुधार इतना कम होता है कि इसे चलाने के लिए आवश्यक समय और ऊर्जा के भारी इजाफे के लायक नहीं होता। एक मॉडल दूसरे की तुलना में बयालीस गुना बड़ा और सैकड़ों गुना धीमा था, फिर भी इसने प्रदर्शन में केवल एक मामूली बढ़त दी। यह इस बात को रेखांकित करता है कि किसी सिस्टम का आकलन करने के लिए "सटीकता" जैसा एकल अंक पर्याप्त नहीं है। यह सिस्टम चलाने की लागत को छिपा देता है और यह नहीं बताता कि अज्ञात का सामना करते समय सिस्टम कितना विश्वसनीय है।

शोधकर्ताओं ने निष्कर्ष निकाला कि चिकित्सा आर्टिफिशियल इंटेलिजेंस (कृत्रिम बुद्धिमत्ता) के मूल्यांकन के तरीके को बदलने की आवश्यकता है। हम इस पर भरोसा नहीं कर सकते कि एक एकल स्कोर हमें बताएगा कि क्या कोई सिस्टम वास्तविक दुनिया के लिए तैयार है। इसके बजाय, हमें साक्ष्यों के एक पैकेज की आवश्यकता है जिसमें यह शामिल हो कि परीक्षण कैसे बनाया गया था, क्या सिस्टम दुर्लभ मामलों को संभाल सकता है, और इसे चलाने की लागत कितनी है। इन विभिन्न कारकों को अलग करके, डॉक्टर और डेवलपर्स बेहतर निर्णय ले सकते हैं। वे देख सकते हैं कि क्या कोई सिस्टम वास्तव में मजबूत है या वह केवल परीक्षा को रटने में अच्छा है। अंत में, लक्ष्य केवल एक ऐसा कंप्यूटर बनाना नहीं है जो एक परीक्षा में उच्च ग्रेड प्राप्त करे, बल्कि एक ऐसा उपकरण बनाना है जिस पर एक डॉक्टर द्वारा भ्रमित नोट के आधार पर महत्वपूर्ण निर्णय लेते समय भरोसा किया जा सके। शोधकर्ताओं ने दिखाया कि परीक्षण का स्वयं ऑडिट करके, हम उन नंबरों पर भरोसा करना बंद कर सकते हैं जो अच्छे दिखते हैं लेकिन शायद सच्चाई को छिपा रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →