← नवीनतम पेपर
💻 computer science

A simulation-based framework for sizing paired benchmarks in the evaluation of clinical artificial intelligence, applied to 168 expert-level dyslipidaemia items

यह शोध पत्र पारंपरिक विधियों की सीमाओं को संबोधित करने के लिए युग्मित (paired) नैदानिक एआई बेंचमार्क मूल्यांकनों में आवश्यक नमूना आकार निर्धारित करने हेतु एक सिमुलेशन-आधारित ढांचे को प्रस्तुत करता है, जो एक डिस्लिपिडेमिया अध्ययन के माध्यम से यह प्रदर्शित करता है कि केवल सिस्टम प्रदर्शन ही नहीं, बल्कि पूर्व-निर्धारित बैंक आकार यह निर्धारित करता है कि तुलनात्मक निष्कर्ष सांख्यिकीय रूप से प्राप्त करने योग्य हैं या नहीं।

मूल लेखक: Mete Ucdal, Karya Yurtsever, Pınar Yıldız, Ayşen Akalın, Kadir Uğur Mert, Gülay Sain Güven

प्रकाशित 2026-09-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mete Ucdal, Karya Yurtsever, Pınar Yıldız, Ayşen Akalın, Kadir Uğur Mert, Gülay Sain Güven

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

चिकित्सा प्रौद्योगिकी की तेजी से बदलती दुनिया में, बीमारियों के निदान और उपचार की सिफारिश करने के लिए कृत्रिम बुद्धिमत्ता (AI) की एक नई पीढ़ी को प्रशिक्षित किया जा रहा है। ये सिस्टम, जो अक्सर डेटा के विशाल नेटवर्क पर आधारित होते हैं, उन्हें यह देखने के लिए तेजी से मानव विशेषज्ञों के विरुद्ध परखा जा रहा है कि कौन बेहतर प्रदर्शन करता है। उनकी तुलना करने का मानक तरीका यह है कि कंप्यूटर और डॉक्टर दोनों को चिकित्सा संबंधी प्रश्नों का एक ही सेट दिया जाए और सही उत्तरों की गिनती की जाए। हालांकि, इस क्षेत्र में एक गंभीर समस्या उभर कर आई है: शोधकर्ता अक्सर यह नहीं जानते कि निष्पक्ष तुलना करने के लिए कितने प्रश्नों की आवश्यकता है। यदि परीक्षण बहुत छोटा है, तो एक स्मार्ट कंप्यूटर संयोगवश हर उत्तर सही दे सकता है, जिससे यह बताना असंभव हो जाता है कि वह वास्तव में मानव से बेहतर है या केवल भाग्यशाली है। इसके विपरीत, यदि दो प्रणालियों के बीच का अंतर बहुत कम है, तो एक छोटा परीक्षण उसे पूरी तरह से अनदेखा कर सकता है, जिससे वैज्ञानिक गलत निष्कर्ष निकाल सकते हैं कि दोनों प्रणालियाँ समान हैं, जबकि वे वास्तव में नहीं हैं। बिना किसी स्पष्ट योजना के कि कितने प्रश्न पूछे जाने चाहिए, इन उच्च-दांव वाली तुलनाओं के परिणाम भ्रामक हो सकते हैं, जिससे अस्पताल और रोगी इस बात को लेकर अनिश्चित रह जाते हैं कि कौन सी तकनीक सुरक्षित और प्रभावी उपयोग के लिए है।

शोधकर्ताओं की एक टीम ने इन परीक्षणों को डिजाइन करने के लिए एक नया ढांचा तैयार करके इस मापन की समस्या को हल करने का प्रयास किया, और फिर इसे एक जटिल चिकित्सा चुनौती: उच्च कोलेस्ट्रॉल और संबंधित रक्त वसा विकारों के प्रबंधन पर लागू किया। उन्होंने केवल एक परीक्षण नहीं चलाया; पहले उन्होंने सटीक रूप से गणना की कि प्रदर्शन में विशिष्ट अंतरों का पता लगाने के लिए कितने प्रश्नों की आवश्यकता थी। हजारों संभावित परीक्षण परिणामों का अनुकरण करने वाली एक विधि का उपयोग करते हुए, उन्होंने यह निर्धारित किया कि किसी प्रणाली में एक छोटे लेकिन सार्थक लाभ को विश्वसनीय रूप से पहचानने के लिए, उन्हें प्रश्नों के एक ऐसे बैंक की आवश्यकता थी जो पिछले अध्ययनों में उपयोग किए जाने वाले दर्जनों से कहीं अधिक बड़ा हो। इसके बाद उन्होंने इस बड़े परीक्षण का निर्माण किया, जिसमें 168 विशेषज्ञ-स्तरीय चिकित्सा परिदृश्य शामिल थे, और इसे परीक्षण के लिए रखा। लक्ष्य एक नए प्रकार के कृत्रिम बुद्धिमत्ता का मूल्यांकन करना था जो एक शक्तिशाली भाषा मॉडल (language model) को सख्त सुरक्षा नियमों के एक सेट के साथ जोड़ता है, यह जांचने के लिए कि क्या यह संयोजन अकेले भाषा मॉडल, अन्य उन्नत कंप्यूटरों और अभ्यास करने वाले डॉक्टरों की तुलना में सटीकता और सुरक्षा में सुधार करता है।

इस सावधानीपूर्वक आकार दिए गए प्रयोग के परिणामों ने प्रदर्शन का एक स्पष्ट पदानुक्रम प्रकट किया। नया सिस्टम, जो अपने स्वयं के कार्य की जांच के लिए स्थापित चिकित्सा नियमों के विरुद्ध एक "न्यूरोसिंबोलिक" दृष्टिकोण का उपयोग करता है, ने 97 प्रतिशत प्रश्नों का सही उत्तर दिया। यह अपने स्वयं के अंतर्निहित इंजन की तुलना में एक महत्वपूर्ण सुधार था, जिसने 88 प्रतिशत सही उत्तर दिए थे, और इसने सर्वश्रेष्ठ व्यक्तिगत डॉक्टरों और अन्य अग्रणी कृत्रिम बुद्धिमत्ता मॉडलों को भी पीछे छोड़ दिया। शोधकर्ता यह बताने में सक्षम रहे कि यह सुधार वास्तव में कहाँ से आया। उन्होंने पाया कि सिस्टम का जटिल आंतरिक संगठन, जहाँ AI के विभिन्न हिस्से एक-दूसरे से बात करते हैं, अपने आप में बहुत कम मूल्य जोड़ता है। वास्तविक लाभ 'सिंबोलिक वेरीफायर' (symbolic verifier) से आया, जो एक सख्त संपादक की तरह कार्य करता है, जो AI के तर्क की स्थापित चिकित्सा नियमों के विरुद्ध जांच करता है। इस नियम-जांच चरण ने सटीकता में अधिकांश वृद्धि की, जिससे उन त्रुटियों को सुधारा गया जो बिना सत्यापित सिस्टम द्वारा की जातीं।

साधारण सटीकता से परे, अध्ययन ने इस बात की भी जांच की कि सिस्टम कठिन या अस्पष्ट चिकित्सा मामलों को कैसे संभालते हैं जहाँ एकल सही उत्तर मौजूद नहीं हो सकता है। यहाँ, नए सिस्टम ने सुरक्षा के मामले में एक विशिष्ट लाभ दिखाया। इन संदिग्ध स्थितियों का सामना करने पर, नियम-जांचकर्ता वाले पूर्ण सिस्टम ने 85 प्रतिशत समय उत्तर देने से इनकार कर दिया, और इसके बजाय मामले को मानव समीक्षा के लिए चिह्नित करने का विकल्प चुना। इसके विपरीत, बिना नियम-जांचकर्ता वाले अंतर्निहित इंजन ने केवल 4 प्रतिशत समय हिचकिचाहट दिखाई, और अक्सर एक संभावित असुरक्षित सिफारिश देने के लिए जल्दबाजी की। यह व्यवहार प्रदर्शित करता है कि सिस्टम के डिजाइन ने आत्मविश्वास के ऊपर सावधानी को प्राथमिकता दी, जो चिकित्सा उपकरणों के लिए एक महत्वपूर्ण गुण है। शोधकर्ताओं ने यह भी नोट किया कि प्रश्नों की गुणवत्ता मायने रखती थी; सिस्टम का लाभ सबसे उच्च-गुणवत्ता वाले, सबसे स्पष्ट रूप से परिभाषित चिकित्सा मामलों पर सबसे अधिक स्पष्ट था, जो यह सुझाव देता है कि नियम-आधारित जांच तब सबसे अच्छा काम करती है जब नियम स्वयं स्पष्ट और असंदिग्ध हों।

शायद इस अध्ययन का सबसे महत्वपूर्ण निष्कर्ष यह नहीं था कि कौन सा सिस्टम जीता, बल्कि यह था कि परीक्षण को कैसे डिजाइन किया गया था। शोधकर्ताओं ने अपने नए, बड़े पैमाने के परिणामों की तुलना उसी सिस्टम पर किए गए एक पिछले, छोटे अध्ययन से की, जिसमें केवल 24 प्रश्नों का उपयोग किया गया था। उस पहले, छोटे परीक्षण में, सिस्टम और उसका अंतर्निहित इंजन दोनों ने पूर्ण अंक प्राप्त किए थे, जिससे उनके बीच अंतर करना असंभव हो गया था। नए, बड़े परीक्षण ने सिद्ध किया कि पिछला परिणाम परीक्षण के बहुत छोटा होने के कारण उत्पन्न हुआ एक कृत्रिम प्रभाव (artifact) था। पहले से ही आवश्यक आकार की गणना करके, टीम ने यह सुनिश्चित किया कि उनके निष्कर्ष मजबूत हों। उन्होंने यह भी पहचाना कि कौन सी तुलनाएं अभी भी मानव-आकार के परीक्षण के साथ हल करने के लिए बहुत कठिन थीं, यह नोट करते हुए कि सिस्टम के आंतरिक हिस्सों के बीच बहुत छोटे अंतरों का पता लगाने के लिए एक हजार से अधिक प्रश्नों के टेस्ट बैंक की आवश्यकता होगी, जो वर्तमान में मैन्युअल विशेषज्ञ परीक्षण की पहुंच से बाहर है।

अध्ययन यह निष्कर्ष निकालता है कि चिकित्सा कृत्रिम बुद्धिमत्ता के मूल्यांकन का भविष्य केवल एक त्वरित तुलना चलाने के बजाय कठोर योजना पर निर्भर है। शोधकर्ताओं का तर्क है कि इन उपकरणों का परीक्षण करने वाले संस्थानों को शुरू करने से पहले आवश्यक प्रश्नों की संख्या की गणना करनी चाहिए, यह सुनिश्चित करते हुए कि परीक्षण इतना लंबा हो कि रोगी सुरक्षा के लिए महत्वपूर्ण अंतरों का पता लगाया जा सके। उन्होंने पाया कि हालांकि नया सिस्टम श्रेष्ठ है, लेकिन इसके लाभ विशिष्ट हैं: यह स्पष्ट मामलों पर सख्त नियमों को लागू करने और अनिश्चित मामलों में पीछे हटने में उत्कृष्ट है। अध्ययन यह दावा नहीं करता है कि यह सिस्टम रोगी देखभाल के लिए तत्काल उपयोग के लिए तैयार है, क्योंकि इसमें किसी वास्तविक रोगी को शामिल नहीं किया गया था, लेकिन यह एक स्पष्ट, साक्ष्य-आधारित मार्ग प्रदान करता है। यह दिखाता है कि सही आकार और डिजाइन के साथ, हम अनुमान लगाने से आगे बढ़ सकते हैं और चिकित्सा कृत्रिम बुद्धिमत्ता की वास्तविक क्षमताओं और सीमाओं को उस सटीकता के साथ माप सकते है जिसकी यह मांग करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →