Evaluating Five Generative AI Chatbots for Myocarditis-Related Public Health Consultation: A Multidimensional Assessment of Safety, Accuracy, Empathy, Reliability, Quality, and Readability
इस अध्ययन ने मायोकार्डिटिस (myocarditis) से संबंधित सार्वजनिक स्वास्थ्य संबंधी प्रश्नों पर पांच जनरेटिव एआई चैटबॉट्स का मूल्यांकन किया, जिसमें यह पाया गया कि हालांकि अधिकांश प्रतिक्रियाएं आम तौर पर सुरक्षित थीं, लेकिन सटीकता, सहानुभूति और गुणवत्ता में महत्वपूर्ण भिन्नताएं मौजूद थीं, और सभी मॉडल पठनीयता लक्ष्यों को पूरा करने में विफल रहे तथा उनमें ट्राइएज (triage) और उपचार मार्गदर्शन में विशिष्ट जोखिम प्रदर्शित हुए जिनके लिए नैदानिक निरीक्षण की आवश्यकता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपका एक सुपर-स्मार्ट, सर्वज्ञानी रोबोट दोस्त है जो आपके द्वारा पूछे गए किसी भी प्रश्न का उत्तर दे सकता है, चाहे वह "आसमान नीला क्यों है?" से लेकर "मैं अपनी साइकिल कैसे ठीक करूँ?" तक हो। यह रोबोट 'जेनरेटिव एआई' (Generative AI) नामक चीज़ से संचालित है, जो एक प्रकार का कंप्यूटर मस्तिष्क है जो नए, प्रवाहपूर्ण उत्तर बनाने के लिए मानव लेखन के एक विशाल पुस्तकालय से सीखता है। स्वास्थ्य की दुनिया में, लोग इन रोबोटों से ऐसे सवाल पूछना शुरू कर रहे हैं जैसे, "वैक्सीन के बाद मेरे सीने में दर्द हो रहा है; क्या यह गंभीर है?" या "क्या मैं वापस फुटबॉल खेलने जा सकता हूँ?" लेकिन यहाँ एक पेंच है: हालाँकि ये रोबोट आत्मविश्वास से भरे और मिलनसार दिखने में माहिर हैं, लेकिन वे डॉक्टर नहीं हैं। उनका कोई धड़कता हुआ दिल नहीं है, और वे कभी-कभी तथ्य बना सकते हैं या सूक्ष्म लेकिन खतरनाक विवरणों को छोड़ सकते हैं। यह विशेष रूप से 'मायोकार्डिटिस' (myocarditis) नामक स्थिति के लिए सच है, जो हृदय की मांसपेशियों की सूजन के लिए एक फैंसी शब्द है। यह हृदय के इंजन के भीतर जल रही आग की तरह है; कभी-कभी यह एक छोटी सी चिंगारी होती है, और कभी-कभी यह एक भीषण आग होती है जो हृदय को काम करने से रोक सकती है। क्योंकि दांव बहुत ऊंचे हैं, हमें यह जानने की आवश्यकता है कि क्या हमारे रोबोट दोस्त हमारे दिल के बारे में चिंतित होने पर बात करने के लिए सुरक्षित हैं, या वे अनजाने में हमें चेतावनी के संकेत को अनदेखा करने के लिए कह सकते हैं।
शोधकर्ताओं की एक टीम ने इन लोकप्रिय एआई चैटबॉट्स में से पाँच को एक परीक्षण में डालने का निर्णय लिया, उन्हें एक बहुत ही गंभीर परीक्षा देने वाले छात्रों की तरह माना। उन्होंने केवल रैंडम सवाल नहीं पूछे; उन्होंने मायोकार्डिटिस के बारे में लोगों की वास्तविक चिंताओं के 52 वास्तविक जीवन के उदाहरण एकत्र किए, जैसे कि सीने में दर्द, संक्रमण के बाद क्या होता है, क्या टीके सुरक्षित हैं, और कब फिर से व्यायाम करना ठीक है। उन्होंने इन पाँचों चैटबॉट्स (ChatGPT, Gemini, DeepSeek, Doubo, और Copilot) से इन सवालों के जवाब बिल्कुल वैसे ही देने को कहा जैसे एक उपयोगकर्ता देगा, बिना किसी विशेष निर्देश के कि वे बेहतर व्यवहार करें। फिर, पांच विशेषज्ञ हृदय विशेषज्ञों के एक समूह ने, जिन्हें यह नहीं पता था कि किस रोबट ने कौन सा उत्तर दिया है, प्रतिक्रियाओं को "सुरक्षित" से "असुरक्षित", "सटीक" से "गलत", "सहानुभूतिपूर्ण" से "रूखे", और "पढ़ने में आसान" से "भ्रमित करने वाला" के पैमाने पर ग्रेड दिया।
परिणाम अच्छे समाचार और कुछ गंभीर चेतावनियों का मिश्रण थे। सबसे पहले, अच्छी खबर: ज्यादातर समय, रोबोट सुरक्षित थे। लगभग 90% से 94% उनके उत्तरों में खतरनाक सलाह शामिल नहीं थी। हालाँकि, शोधकर्ताओं ने पाया कि "काफी हद तक सुरक्षित" होना "परफेक्ट" होने के समान नहीं है। यहाँ तक कि सबसे अच्छे रोबोट भी पेचीदा स्थितियों में गलतियाँ करते हैं। उदाहरण के लिए, कुछ रोबोट वैक्सीन से संबंधित हृदय संबंधी समस्या को हानिरहित बताकर लोगों को आश्वस्त करने में बहुत जल्दीबाज़ी करते थे, या उन्होंने व्यायाम कब रोकना है इसके बारे में अस्पष्ट सलाह दी, जो जोखिम भरा हो सकता है यदि किसी व्यक्ति का हृदय अभी भी सूजा हुआ है। यह एक रोबोट द्वारा आपको यह बताने जैसा है कि, "आपकी कार का इंजन शायद ठीक है," जबकि वास्तव में उसे तुरंत टो (tow) करके ले जाने की आवश्यकता है।
जब सटीकता और दयालुता की बात आई, तो रोबोट सभी एक जैसे नहीं थे। कुछ, जैसे Gemini, Copilot, और DeepSeek, चिकित्सा तथ्यों को सही ढंग से प्राप्त करने में बहुत अच्छे थे। DeepSeek सबसे "दयालु" था, जो रोगी के डर के प्रति अधिक सहायक और समझदार लग रहा था। लेकिन यहाँ सबसे बड़ी समस्या है: किसी भी रोबोट ने इस तरह से नहीं लिखा जिसे एक आम व्यक्ति आसानी से समझ सके। उन्होंने बहुत जटिल शब्दों का उपयोग किया, जैसे कि एक प्रोफेसर एक सरल अवधारणा को डिक्शनरी से भरे भारी शब्दों के साथ समझा रहा हो। शोधकर्ता चाहते थे कि उत्तर छठी कक्षा के छात्र के स्तर तक पठनीय हों, लेकिन हर एक रोबोट इस परीक्षण में विफल रहा। उनके उत्तर एक दोस्ताना बातचीत के बजाय एक कॉलेज की पाठ्यपुस्तक की तरह थे।
अध्ययन यह निष्कर्ष निकालता है कि हालांकि ये एआई उपकरण हृदय स्वास्थ्य के बारे में सामान्य तथ्यों के बारे में सीखने के लिए सहायक हो सकते हैं, लेकिन वे एक वास्तविक डॉक्टर के विकल्प के रूप में उपयोग किए जाने के लिए तैयार नहीं हैं। आपको उनसे यह तय करने के लिए नहीं पूछना चाहिए कि क्या आपको दिल का दौरा पड़ा है, या वे आपको दवा लेना बंद करने के लिए कहें, या आपको मैराथन दौड़ने की हरी झंडी दें। रोबोट एक बहुत ही सुशिक्षित पुस्तकालय सहायक की तरह हैं जो आपको सही किताब की ओर इशारा कर सकते हैं, लेकिन वे आपके लिए कार नहीं चला सकते। यदि आप उनका उपयोग करते हैं, तो आपको उनके उत्तरों की जाँच करने, भारी शब्दों को सरल अंग्रेजी में अनुवाद करने और यह सुनिश्चित करने के लिए एक वास्तविक मानव डॉक्टर की आवश्यकता है कि आप किसी खतरे के संकेत को मिस न कर दें। रोबोट बेहतर हो रहे हैं, लेकिन आपके दिल जैसी नाजुक चीज़ के लिए, उन्हें अभी भी एक मानव पर्यवेक्षक की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।