Performance, safety, and repeated-query stability of large language models versus early-career urologists in urological oncology: a source-masked vignette benchmark
यह अध्ययन प्रदर्शित करता है कि जहाँ शुरुआती करियर के यूरोलॉजिस्ट यूरोलॉजिकल ऑन्कोलॉजी के संबंध में समग्र सटीकता, सुरक्षा और प्रतिक्रिया स्थिरता के मामले में उपभोक्ता-केंद्रित लार्ज लैंग्वेज मॉडल्स से काफी बेहतर प्रदर्शन करते हैं, वहीं मॉडल्स की बार-बार होने वाली सुरक्षा-महत्वपूर्ण त्रुटियाँ और असंगत आउटपुट स्वायत्त तैनाती के बजाय नैदानिक पर्यवेक्षण की आवश्यकता को रेखांकित करते हैं।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक चिकित्सा के तेजी से बदलते परिदृश्य में, आर्टिफिशियल इंटेलिजेंस (कृत्रिम बुद्धिमत्ता) ने एक नए प्रकार की सहायता प्रदान करना शुरू कर दिया है, जो चिकित्सा साहित्य के विशाल पुस्तकालयों को पढ़ने और सेकंडों में जटिल प्रश्नों के उत्तर देने में सक्षम है। ये प्रणालियाँ, जिन्हें लार्ज लैंग्वेज मॉडल्स (बड़े भाषा मॉडल) के रूप में जाना जाता है, एक प्रॉम्प्ट के बाद आने वाले सबसे संभावित शब्दों की भविष्यवाणी करके कार्य करती हैं, जिससे वे नैदानिक परिदृश्यों के लिए सुसंगत और अक्सर विश्वसनीय प्रतिक्रियाएं उत्पन्न करने में सक्षम होती हैं। डॉक्टरों के लिए, यह तकनीक सूचना को व्यवस्थित करने, दिशानिर्देशों की जांच करने और निर्णय लेने में सहायता करने के लिए एक शक्तिशाली उपकरण का वादा करती है। हालाँकि, चिकित्सा क्षेत्र सटीकता और सुरक्षा की नींव पर बना है, जहाँ निर्णय में एक एकल त्रुटि भी जीवन बदलने वाले परिणाम दे सकती है। चिकित्सा समुदाय के सामने महत्वपूर्ण प्रश्न केवल यह नहीं है कि क्या ये मशीनें जानकार लग सकती हैं, बल्कि यह है कि क्या उन्हें तब सुरक्षित, सुसंगत और पूर्ण निर्णय लेने के लिए भरोसेमंद माना जा सकता है जब किसी रोगी का स्वास्थ्य दांव पर हो।
इसका उत्तर देने के लिए, तुर्की के शोधकर्ताओं की एक टीम ने यह देखने के लिए एक कठोर परीक्षण डिजाइन किया कि तीन लोकप्रिय उपभोक्ता-उन्मुख आर्टिफिशियल इंटेलिजेंस प्रणालियाँ यूरोलॉजिकल ऑन्कोलॉजी (मूत्र प्रणाली के कैंसर से संबंधित क्षेत्र) की उच्च-जोखिम वाली दुनिया में कैसा प्रदर्शन करती हैं। उन्होंने एक सौ विस्तृत, कृत्रिम रोगी कहानियाँ बनाईं, जिनमें पाँच विभिन्न प्रकार के कैंसर और देखभाल के विभिन्न चरण शामिल थे, प्रारंभिक निदान से लेकर दीर्घकालिक अनुवर्ती (फॉलो-अप) तक। ये कहानियाँ तीन आर्टिफिशियल इंटेलिजेंस मॉडलों के साथ-साथ दो शुरुआती करियर के यूरोलॉजिस्ट्स (मूत्र रोग विशेषज्ञ) को भी प्रस्तुत की गईं, जिन्होंने हाल ही में अपना विशेष प्रशिक्षण पूरा किया था। डॉक्टरों और मशीनों को बिल्कुल समान निर्देश दिए गए थे और उन्हें उत्तर खोजने या बाहरी संसाधनों का उपयोग करने की अनुमति नहीं थी। दो स्वतंत्र विशेषज्ञों ने, जो यह नहीं जानते थे कि उत्तर मानव से आया है या मशीन से, यूरोपीय एसोसिएशन ऑफ यूरोलॉजी द्वारा स्थापित सख्त दिशानिर्देशों के आधार पर प्रत्येक प्रतिक्रिया का मूल्यांकन किया। स्कोरिंग चार चीजों की तलाश करती थी: क्या सलाह वर्तमान चिकित्सा दिशानिर्देशों से मेल खाती थी, क्या यह रोगी के लिए सुरक्षित थी, क्या इसमें सभी आवश्यक चरणों को शामिल किया गया था, और क्या रोग के चरण की सही पहचान की गई थी।
परिणामों ने मानव डॉक्टरों और आर्टिफिशियल इंटेलिजेंस प्रणालियों के प्रदर्शन के बीच एक स्पष्ट अंतर प्रकट किया। दोनों शुरुआती करियर के यूरोलॉजिस्ट्स ने उच्च स्तर की सफलता प्राप्त की, और पचासी और निवासी प्रतिशत मामलों में सुरक्षित और पूर्ण उत्तर दिए। इसके विपरीत, आर्टिफिशियल इंटेलिजेंस मॉडल केवल साठ से सत्तर प्रतिशत मामलों में सफल रहे। हालाँकि मशीनें अक्सर ऐसे उत्तर देती थीं जो सतही तौर पर सही दिखते थे, लेकिन वे अक्सर महत्वपूर्ण विवरणों को छोड़ देती थीं या विशिष्ट सुरक्षा चेतावनियों को शामिल करने में विफल रहती थीं जिन्हें मानव डॉक्टरों ने पकड़ लिया था। सबसे चिंताजनक निष्कर्ष रोगी सुरक्षा से संबंधित था। आर्टिफिशियल इंटेलिजेंस प्रणालियों की लगभग हर चार में से एक प्रतिक्रिया में ऐसी त्रुटि थी जो गंभीर नुकसान पहुंचा सकती थी, जैसे कि रोगी के लिए खतरनाक उपचार की सिफारिश करना या किसी महत्वपूर्ण चेतावनी संकेत को अनदेखा करना। तुलनात्मक रूप से, मानव डॉक्टरों ने ऐसे सुरक्षा-महत्वपूर्ण त्रुटियाँ केवल एक या दो प्रतिशत मामलों में कीं।
उत्तरों की सटीकता के अलावा, अध्ययन ने इस बात की भी जांच की कि जब एक ही प्रश्न को कई बार पूछा जाता है तो आर्टिफिशियल इंटेलिजेंस प्रणालियाँ कितनी विश्वसनीय होती हैं। वास्तविक दुनिया में, एक डॉक्टर उसी रोगी के लिए हर बार वही सलाह देगा जब वह मामले की समीक्षा करेगा। शोधकर्ताओं ने पाया कि आर्टिफिशियल इंटेलिजेंस मॉडल आश्चर्यजनक रूप से असंगत थे। जब एक ही रोगी की कहानी को लगातार तीन बार पूछा गया, तो सिस्टम सफलता या विफलता का बिल्कुल वही वर्गीकरण आधे से भी कम समय में देता था। इससे भी अधिक परेशान करने वाली बात यह थी कि सिस्टम कभी-कभी पहली बार में सुरक्षित उत्तर देता था, दूसरी बार में असुरक्षित उत्तर देता था, और तीसरी बार में फिर से सुरक्षित उत्तर देता था। स्थिरता की इस कमी का अर्थ है कि इन उपकरणों का आउटपुट अप्रत्याशित रूप से बदल सकता है, जिससे निरंतर चिकित्सा सलाह के लिए उन पर भरोसा करना कठिन हो जाता है।
शोधकर्ताओं ने निष्कर्ष निकाला कि हालांकि ये आर्टिफिशियल इंटेलिजेंस सिस्टम उपयोगी जानकारी उत्पन्न कर सकते हैं, लेकिन वे अभी क्लिनिकल सेटिंग में स्वतंत्र रूप से काम करने के लिए तैयार नहीं हैं। अध्ययन सुझाव देता है कि इन उपकरणों का वर्तमान में सबसे अच्छा उपयोग एक 'सुपरवाइज्ड असिस्टेंट' (पर्यवेक्षित सहायक) के रूप में है, जहाँ एक मानव डॉक्टर द्वारा प्रत्येक सिफारिश की समीक्षा की जाए, इससे पहले कि उसे रोगी पर लागू किया जाए। मशीनें जानकारी व्यवस्थित करने या विकल्प सुझाने में मदद कर सकती हैं, लेकिन अंतिम निर्णय मानव हाथों में ही रहना चाहिए ताकि सुरक्षा और निरंतरता सुनिश्चित की जा सके। जब तक ये सिस्टम मानव विशेषज्ञों की विश्वसनीयता और सुरक्षा रिकॉर्ड से मेल नहीं खा लेते, तब तक कैंसर देखभाल में उनकी भूमिका स्वायत्त होने के बजाय सहायक होनी चाहिए, जो प्राथमिक निर्णय लेने वाले के बजाय 'सेकंड ओपिनियन' (दूसरी दृष्टि) के रूप में कार्य करे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।