Reliability and Clinical Accuracy of ChatGPT in Post-FESS Counselling: A Multi-Reviewer Evaluation.
यह अध्ययन पोस्टऑपरेटिव FESS परामर्श उत्पन्न करने में ChatGPT के प्रदर्शन का मूल्यांकन करता है, जिसमें यह पाया गया है कि जहाँ यह उपयुक्तता पर उच्च अंतर-रेट सहमति के साथ मानकीकृत मार्गदर्शन के लिए स्वीकार्य विश्वसनीयता प्रदान करता है, वहीं इसमें संदर्भ संबंधी सटीकता और पठनीयता की सीमाएँ हैं जो नैदानिक निरीक्षण को आवश्यक बनाती हैं।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि अभी आपकी साइनस को साफ करने की एक जटिल सर्जरी (जिसे FESS कहा जाता है) हुई है। आप अस्पताल से बाहर निकलते हैं और आपके मन में लाखों सवाल हैं: "क्या यह खून बहना सामान्य है?" "मैं काम पर वापस कब जा सकता हूँ?" "मैं अपनी नाक कैसे साफ करूँ?"
अतीत में, आपको डॉक्टर के जवाब देने का इंतज़ार करना पड़ता। लेकिन अब, लोग तुरंत जवाब पाने के लिए ChatGPT जैसे AI चैटबॉट्स की ओर मुड़ रहे हैं। इस अध्ययन ने एक सरल प्रश्न पूछा: यदि कोई रोगी ChatGPT से ये विशिष्ट सर्जरी के बाद वाले प्रश्न पूछता है, तो क्या रोबोट सुरक्षित, सटीक और समझने में आसान सलाह दे रहा है?
यहाँ शोधकर्ताओं ने क्या पाया, इसका विवरण दिया गया है, जिसे कुछ रोजमर्रा के उदाहरणों (analogies) का उपयोग करके समझाया गया है।
सेटअप: "रोबट डॉक्टर" टेस्ट
शोधकर्ताओं ने केवल रैंडम सवाल नहीं पूछे। उन्होंने एक सख्त "परीक्षा" बनाई जिसमें 15 विशिष्ट प्रश्न थे जो वास्तविक मरीज आमतौर पर साइनस सर्जरी के बाद पूछते हैं। ये प्रश्न पांच मुख्य क्षेत्रों को कवर करते थे:
- लक्षण (जैसे, "क्या खून बहना सामान्य है?")
- नाक की सफाई (जैसे, "मैं अपनी नाक कैसे धोऊं?")
- जीवनशैली (जैसे, "मैं काम पर वापस कब जा सकता हूँ?")
- गंध (जैसे, "क्या मेरी सूंघने की शक्ति वापस आएगी?")
- दवा और फॉलो-अप (जैसे, "क्या मुझे हमेशा स्प्रे की आवश्यकता होगी?")
उन्होंने ये प्रश्न ChatGPT (विशेष रूप से 2026 की शुरुआत में उपलब्ध संस्करण) को दिए और फिर चार वास्तविक कान, नाक और गले (ENT) के डॉक्टरों से रोबोट के जवाबों को ग्रेड देने के लिए कहा। डॉक्टरों ने तीन चीजों पर 1 (बहुत खराब) से 5 (उत्कृष्ट) तक स्कोर दिया:
- उपयुक्तता (Appropriateness): क्या जवाब स्थिति के लिए सही था?
- उपयोगिता (Usefulness): क्या यह वास्तव में मरीज के लिए मददगार था?
- सटीकता (Accuracy): क्या चिकित्सा तथ्य 100% सही था?
परिणाम: रोबोट का रिपोर्ट कार्ड
1. समग्र ग्रेड: B+ (स्वीकार्य, लेकिन पूर्ण नहीं)
रोबोट का औसत स्कोर 5 में से 3.9 था।
- अच्छी खबर: रोबोट "उपयुक्तता" (4.1/5) और "उपयोगिता" (4.0/5) के मामले में बहुत अच्छा था। यह एक सहायक की तरह लगा और इसने ऐसी सलाह दी जो सामान्य स्थिति के लिए सही महसूस होती थी।
- बुरी खबर: इसकी "सटीकता" (accuracy) कम थी (3.6/5)। हालांकि सलाह आम तौर पर सुरक्षित थी, लेकिन यह स्वतंत्र रूप से खड़े होने के लिए हमेशा चिकित्सकीय रूप से सटीक नहीं थी।
2. "टेक्स्टबुक" बनाम "वास्तविक दुनिया"
प्रश्नों के प्रकार के आधार पर रोबोट का प्रदर्शन अलग-अलग रहा:
- "टेक्स्टबुक" वाले प्रश्न (उच्च स्कोर): जब मानक नियमों के बारे में पूछा गया जैसे "मैं अपनी नाक कैसे साफ करूँ?" या "मुझे कौन सी दवा लेनी चाहिए?", तो रोबोट उत्कृष्ट था। ये रेसिपी निर्देशों की तरह हैं; ये किताबों में लिखे होते हैं, और रोबोट इन्हें पूरी तरह से कॉपी कर सकता है।
- "वास्तविक दुनिया" वाले प्रश्न (कम स्कोर): जब जीवनशैली से जुड़े मुद्दों के बारे में पूछा गया जैसे "मैं काम पर वापस कब जा सकता हूँ?" या "मुझे कब तक बेहतर महसूस होगा?", तो रोबोट लड़खड़ा गया। ये प्रश्न एक मौसम विज्ञानी से यह पूछने की तरह हैं कि क्या आपका विशिष्ट पिकनिक खराब हो जाएगा। रोबोट को आपका विशिष्ट काम, आपकी विशिष्ट ठीक होने की गति, या आपका विशिष्ट स्वास्थ्य इतिहास नहीं पता है। उसे एक सामान्य उत्तर देना पड़ता है, जो अस्पष्ट या थोड़ा गलत हो सकता है।
3. "भाषा की बाधा" की समस्या
शोधकर्ताओं ने यह भी जांचा कि रोबोट के उत्तर पढ़ने में कितने कठिन थे।
- समस्या: रोबोट ने कॉलेज स्तर (ग्रेड 12.8) की भाषा में लिखा।
- उदाहरण: कल्पना कीजिए कि एक शिक्षक एक बच्चे को एक सरल अवधारणा समझा रहा है, लेकिन "उपयोग करें" के बजाय "उपयोग करना" (utilize) और "फिर" के बजाय "तदुपरांत" (subsequently) जैसे शब्दों का उपयोग कर रहा है। रोबोट के उत्तर बहुत अधिक औपचारिक (fancy) थे। एक सामान्य मरीज इन सलाहों को पढ़ सकता है और सिर हिला सकता है, लेकिन वह वास्तव में इसे समझ नहीं पाएगा क्योंकि भाषा बहुत जटिल है।
4. डॉक्टर सहमत थे
जब चार मानव डॉक्टरों ने रोबोट को ग्रेड दिया, तो वे ज्यादातर एक-दूसरे से सहमत थे (विशेष रूप से इस बात पर कि सलाह कितनी उपयुक्त थी)। इसका मतलब है कि परीक्षण निष्पक्ष था और परिणाम विश्वसनीय हैं।
निचोड़ (The Bottom Line)
अध्ययन यह निष्कर्ष निकालता है कि ChatGPT एक अच्छा "पूरक" (supplementary) उपकरण है, जैसे कि एक स्टडी गाइड या चीट शीट।
- यह क्या कर सकता है: यह मानक निर्देशों (जैसे अपनी नाक कैसे धोएं) को पुख्ता कर सकता है और सामान्य नियमों की याद दिला सकता है।
- यह क्या नहीं कर सकता: यह मानव डॉक्टर की जगह नहीं ले सकता। इसमें आपको विशेष रूप से देखने और यह कहने की क्षमता की कमी है कि, "चूंकि आपकी सर्जरी जटिल थी, इसलिए आपको काम करने से पहले दो सप्ताह इंतजार करने की आवश्यकता है, न कि एक।"
सीख: आप एक त्वरित, सामान्य अवलोकन प्राप्त करने के लिए AI का उपयोग कर सकते हैं, लेकिन अंतिम, व्यक्तिगत निर्णय के लिए आपको अभी भी अपने वास्तविक सर्जन की बात माननी चाहिए। रोबोट एक सहायक है, लेकिन वह बॉस नहीं है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।