Performance of Large Language Model on Real-World Patient Histories for Imaging Appropriateness.
यह अध्ययन दर्शाता है कि ChatGPT, ACR मानदंडों के आधार पर लम्बर स्पाइन एमआरआई की उपयुक्तता को वर्गीकृत करने में रेडियोलॉजिस्ट के साथ मध्यम सहमति प्राप्त करता है, और इसकी निर्णय विश्वसनीयता तब महत्वपूर्ण रूप से बढ़ जाती है जब इसकी तर्क गुणवत्ता को उच्च रेट किया जाता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
तकनीकी सारांश: इमेजिंग उपयुक्तता के लिए वास्तविक रोगी इतिहास पर लार्ज लैंग्वेज मॉडल का प्रदर्शन
समस्या विवरण
कमर के निचले हिस्से में दर्द (लो बैक पेन - LBP) एक प्रचलित वैश्विक मस्कुलोस्केलेटल शिकायत है, जिससे लंबोसैक्रल स्पाइन एमआरआई (MRI) के बार-बार अनुरोध होते हैं। व्यवस्थित समीक्षाएं संकेत देती हैं कि इन एमआरआई अनुरोधों में से लगभग 29-34% अनुपयुक्त होते हैं, जिनमें अक्सर "रेड फ्लैग्स" जैसे कि संक्रमण, घातक रोग (मैलिग्नेंसी), या आघात (ट्रॉमा) का अभाव होता है। अनावश्यक एमआरआई स्वास्थ्य देखभाल की लागत, रोगी की चिंता और ओवरडायग्नोसिस के जोखिम को बढ़ाते हैं। हालांकि नैदानिक निर्णय सहायता उपकरण और दिशानिर्देश मौजूद हैं, लेकिन उनके वास्तविक कार्यान्वयन में वर्कफ़्लो एकीकरण की चुनौतियां और अलर्ट थकान (अलर्ट फटीग) बाधा उत्पन्न करती हैं। जबकि लार्ज लैंग्वेज मॉडल्स (LLMs) अनावश्यक उपयोग को कम करने के लिए एक स्केलेबल विकल्प के रूप में उभरे हैं, पिछले अध्ययन मुख्य रूप से काल्पनिक नैदानिक परिदृश्यों पर निर्भर रहे हैं, एकल रेडियोलॉजिस्ट संदर्भ मानकों का उपयोग किया है, और तर्क की गुणवत्ता और निर्णय विश्वसनीयता के बीच संबंध का व्यवस्थित मूल्यांकन किए बिना पुराने मॉडल संस्करणों (जैसे, GPT-4) पर केंद्रित रहे हैं।
कार्यप्रणाली
इस क्रॉस-सेक्शनल अध्ययन ने वास्तविक दुनिया के रोगी इतिहास और अमेरिकन कॉलेज ऑफ रेडियोलॉजी (ACR) मानदंडों का उपयोग करके लंबोसैक्रल स्पाइन एमआरआई की उपयुक्तता को वर्गीकृत करने में GPT-5.2 की नैदानिक सटीकता का मूल्यांकन किया।
- डेटा संग्रह: डेटा सितंबर और नवंबर 2025 के बीच लंबोसैक्रल स्पाइन एमआरआई कराने वाले 160 वयस्क रोगियों (औसत आयु 48 ± 15 वर्ष; 58% पुरुष) से पूर्वव्यापी रूप से एकत्र किया गया था। अपर्याप्त इतिहास, पूर्व स्पाइनल सर्जरी, संदिग्ध संक्रमण, या तीव्र आघात वाले रोगियों को बाहर रखा गया था। नैदानिक इतिहास एकत्र करने के लिए पांच विशेषज्ञों द्वारा मान्य एक संरचित प्रश्नावली का उपयोग किया गया था।
- मॉडल प्रॉम्प्टिंग: रोगी के इतिहास को एक संरचित प्रॉम्प्ट के माध्यम से GPT-5.2 में फीड किया गया, जिसमें मॉडल को रेडियोलॉजिस्ट की भूमिका सौंपी गई और उसे ACR दिशानिर्देशों के आधार पर एमआरआई संकेत को "आमतौर पर उपयुक्त" (UA), "उपयुक्त हो सकता है" (MBA), "आमतौर पर उपयुक्त नहीं" (UNA), या "अपर्याप्त नैदानिक जानकारी" (ICI) के रूप में वर्गीकृत करने के लिए कहा गया, जिसमें स्पष्ट तर्क (रीजनिंग) भी शामिल था।
- संदर्भ मानक (रेफरेंस स्टैंडर्ड): दो स्वतंत्र रेडियोलॉजिस्ट (5 और 10 वर्षों के अनुभव के साथ) ने संदर्भ मानक के रूप में कार्य किया।
- चरण 1: रेडियोलॉजिस्टों ने मॉडल के आउटपुट से अनभिज्ञ रहते हुए, उसी प्रॉम्प्ट के आधार पर उपयुक्तता का आकलन किया जो LLM को दिया गया था।
- चरण 2: रेडियोलॉजिस्टों ने LLM की सिफारिशों की सटीकता और उसके नैदानिक तर्क की गुणवत्ता का 5-पॉइंट लिकर्ट स्केल (1–5) का उपयोग करके मूल्यांकन किया, और वे एक-दूसरे के रेटिंग से अनभिज्ञ थे।
- सांख्यिकीय विश्लेषण: सहमति को वेटेड कोहेन का कप्पा () और बोकर टेस्ट ऑफ एसिमेट्री का उपयोग करके मापा गया। बाइनरी विश्लेषण के लिए, UA और MBA को "उपयुक्त" के रूप में समूहबद्ध किया गया, और UNA को "अनुपयुक्त" के रूप में। प्रदर्शन मेट्रिक्स में संवेदनशीलता (Sensitivity), विशिष्टता (Specificity), PPV, NPV और एरिया अंडर द कर्व (AUC) शामिल थे। तर्क की गुणवत्ता (उच्च: 4 बनाम निम्न: <4) के आधार पर उपसमूह विश्लेषण किए गए।
मुख्य परिणाम
- सहमति: GPT-5.2 ने दोनों रेडियोलॉजिस्टों के साथ मध्यम सहमति प्रदर्शित की ( बनाम रेडियोलॉजिस्ट 1; बनाम रेडियोलॉजिस्ट 2)। सहमति का यह स्तर इंटर-रेडियोलॉजिस्ट सहमति () के तुलनीय था।
- बाइनरी वर्गीकरण: मॉडल ने उच्च संवेदनशीलता (~85% दोनों रेडियोलॉजिस्टों के विरुद्ध) दिखाई लेकिन परिवर्तनशील विशिष्टता (रेडियोलॉजिस्ट 1 के विरुद्ध 92.9%; रेडियोलॉजिस्ट 2 के विरुद्ध 61.7%) दिखाई। नेगेटिव प्रेडिक्टिव वैल्यू (NPV) मध्यम थी (R1 के विरुद्ध 57.8%; R2 के विरुद्ध 64.4%), जो रूढ़वादी (प्रतिबंधात्मक) एमआरआई उपयोग की ओर झुकाव को दर्शाता है।
- विभेदक शक्ति (डिस्क्रिमिनेटरी पावर): ROC विश्लेषण ने रेडियोलॉजिस्ट 1 के विरुद्ध अच्छा से उत्कृष्ट विभेदन (AUC 0.891) और रेडियोलॉजिस्ट 2 के विरुद्ध औसत से अच्छा विभेदन (AUC 0.751) दिखाया।
- तर्क गुणवत्ता सहसंबंध: एक महत्वपूर्ण निष्कर्ष तर्क की गुणवत्ता और निर्णय विश्वसनीयता के बीच मजबूत संबंध था। जब रेडियोलॉजिस्टों ने मॉडल के तर्क को उच्च (4) रेट किया, तो उपयुक्तता पर सटीक सहमति उच्च थी (R1 के विरुद्ध 83.3%; R2 के विरुद्ध 90.4%), और विपरीत असंगति (सबसे खतरनाक त्रुटि प्रकार) कम थी (2.3–4.7%)। इसके विपरीत, जब तर्क को निम्न (<4) रेट किया गया, तो सटीक सहमति गिरकर 0–7.1% हो गई, और विपरीत असंगति बढ़कर 71.4–92.8% हो गई।
- विशेषज्ञ मूल्यांकन: रेडियोलॉजिस्टों ने मॉडल के आउटपुट की गुणवत्ता को उच्च रेट किया, जिसमें उपयुक्तता और तर्क दोनों के लिए मेडियन लिकर्ट स्कोर 5 (अधिकतम) रहा।
महत्व और दावे
लेखकों का दावा है कि GPT-5.2 वास्तविक रोगी इतिहास का उपयोग करके लंबोसैक्रल एमआरआई की उपयुक्तता को वर्गीकृत करने में इंटर-रेडियोलॉजिस्ट परिवर्तनशीलता की सीमा के भीतर प्रदर्शन करता है। यह अध्ययन इस बात पर प्रकाश डालता है कि मॉडल के तर्क की गुणवत्ता, निर्णय विश्वसनीयता का एक मजबूत भविष्यवक्ता है। विशेष रूप से, उच्च-गुणवत्ता वाला तर्क आउटपुट, विशेषज्ञ निर्णय के साथ उच्च सहमति से सहसंबंधित है, जबकि निम्न-गुणवत्ता वाला तर्क, महत्वपूर्ण असंगति से सहसंबंधित है।
यह शोध पत्र तर्क देता है कि GPT-5.2 जैसे LLMs के पास अनावश्यक इमेजिंग अनुरोधों को कम करने के लिए प्री-स्क्रीनिंग सहायता उपकरण के रूप में कार्य करने की क्षमता है। हालांकि, लेखक इस बात पर जोर देते हैं कि यह क्षमता मॉडल के तर्क की गुणवत्ता पर निर्भर करती है, जो एक हाइब्रिड वर्कफ़्लो का सुझाव देती है जहाँ निम्न-तर्क वाले आउटपुट को विशेषज्ञ समीक्षा के लिए भेजा जाना चाहिए। अध्ययन निष्कर्ष निकालता है कि हालांकि मॉडल आशाजनक है, सुरक्षित नैदानिक एकीकरण के लिए निरंतर मानव निरीक्षण, भावी बहु-केंद्र सत्यापन और अस्पष्ट मामलों में अंतर-पर्यवेक्षक परिवर्तनशीलता को संबोधित करने के लिए सर्वसम्मति संदर्भ मानकों की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।