Assessing the Quality, Safety, and Readability of Large Language Model Responses from ChatGPT and Gemini for Knee Osteoarthritis Patient Education
नी-ऑस्टियोआर्थराइटिस (घुटने के गठिया) रोगी शिक्षा के एक तुलनात्मक मूल्यांकन में, चैटजीपीटी (ChatGPT) ने जेमिनी (Gemini) की तुलना में नैदानिक रूप से रेट की गई उच्च सटीकता और पूर्णता प्रदर्शित की, हालांकि दोनों मॉडलों द्वारा निर्मित सामग्री की पठनीयता स्तर अनुशंसित मानकों से अधिक था और नैदानिक उपयोग से पहले पेशेवर समीक्षा की आवश्यकता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके घुटने में दर्द है और आप जानना चाहते हैं कि इसे कैसे ठीक किया जाए। डॉक्टर को कॉल करने के बजाय, आप दो अलग-अलग सुपर-स्मार्ट, रोबोट लाइब्रेरी कीपर से पूछते हैं: ChatGPT और Gemini। आप उनसे आपके घुटने के दर्द के बारे में 36 अलग-अलग सवाल पूछते हैं, जो "कौन सी एक्सरसाइज मदद करती है?" से लेकर "क्या मैं यह विशिष्ट यूनानी दवा ले सकता हूँ?" तक विस्तृत हैं।
यह अध्ययन इस बात की तुलना करने वाला एक रिपोर्ट कार्ड है कि इन दो रोबोट लाइब्रेरी कीपर्स ने आपके सवालों के जवाब कितनी अच्छी तरह दिए। शोधकर्ताओं ने जो पाया, उसे यहाँ सरल भाषा में समझाया गया है:
सेटअप: एक ब्लाइंड टेस्ट (बिना पहचान देखे परीक्षण)
शोधकर्ताओं ने केवल रोबोट से ही नहीं पूछा; उन्होंने पाँच अनुभवी घुटने के डॉक्टरों (जिन्होंने 10 वर्षों से अधिक समय तक अभ्यास किया था) से जवाबों को ग्रेड देने के लिए कहा। डॉक्टर यह नहीं जानते थे कि कौन सा जवाब किस रोबोट ने लिखा था—वे ब्रांड की पहचान से "अंधे" थे। उन्होंने पाँच चीजों पर जवाबों को ग्रेड दिया:
- सटीकता (Accuracy): क्या तथ्य सच है?
- पूर्णता (Completeness): क्या उन्होंने पूरी कहानी बताई, या सिर्फ उसका एक हिस्सा?
- स्पष्टता (Clarity): क्या इसे समझना आसान था?
- सुरक्षा (Safety): क्या उन्होंने ऐसी सलाह दी जिससे आपको चोट लग सकती थी?
- विश्वसनीयता (Trustworthiness): क्या वे भरोसेमंद लग रहे थे?
उन्होंने यह भी जांचा कि पढ़ने का स्तर कितना "कठिन" था, जैसे यह देखना कि कोई किताब छठी कक्षा के बच्चे के लिए लिखी गई है या कॉलेज प्रोफेसर के लिए।
परिणाम: कौन जीता?
1. "फैक्ट-चेकर" स्कोर (सटीकता और पूर्णता)
- विजेता: ChatGPT।
- उपमा: कल्पना कीजिए कि आप केक बना रहे हैं। यदि आप रेसिपी मांगते हैं, तो Gemini ने आपको एक ऐसी रेसिपी दी जो काफी हद तक सही थी लेकिन उसमें कुछ मुख्य सामग्रियां छूट गईं (जैसे यह बताना भूल जाना कि आपको अंडों की आवश्यकता है)। ChatGPT ने आपको एक ऐसी रेसिपी दी जो न केवल सही थी बल्कि इसमें सभी चरण और चेतावनियाँ भी शामिल थीं।
- डेटा: डॉक्टरों ने सटीकता और पूर्णता के लिए ChatGPT को उच्च अंक दिए। यह अंतर इतना मजबूत था कि यह केवल एक तुक्का नहीं था।
2. "सुरक्षा और विश्वास" स्कोर
- परिणाम: यह एक टाई (बराबरी) थी।
- उपमा: दोनों रोबमा समान रूप से सावधान थे कि वे आपको कुछ खतरनाक करने के लिए न कहें (जैसे डॉक्टर से पूछे बिना अपनी दवा बंद करना)। दोनों में से कोई भी महत्वपूर्ण रूप से अधिक सुरक्षित या अधिक विश्वसनीय नहीं था।
3. "पढ़ने का स्तर" स्कोर
- विजेता: Gemini (एक छोटे अंतर से)।
- उपमा: पढ़ने के स्तर को एक बाड़ (fence) की ऊंचाई की तरह सोचें। दोनों रोबोटों ने ऐसी बाड़ बनाई जो औसत व्यक्ति के लिए आसानी से कूदने के लिए बहुत ऊँची थी। हालाँकि, Gemini की बाड़ ChatGPT की तुलना में थोड़ी कम ऊँची (कूदने में आसान) थी।
- सावधानी: भले ही Gemini "सरल" था, लेकिन दोनों रोबोट ऐसे स्तर पर लिख रहे थे जो औसत व्यक्ति के लिए बहुत कठिन है। वे कॉलेज के छात्रों की तरह लिख रहे थे, जबकि स्वास्थ्य संबंधी सलाह छठी या आठवीं कक्षा के स्तर की होनी चाहिए।
"मानवीय कारक" की समस्या
इस अध्ययन का पेचीदा हिस्सा यह है कि जवाबों को ग्रेड देने वाले पाँचों डॉक्टर आपस में हमेशा सहमत नहीं थे।
- उपमा: कल्पना कीजिए कि पाँच जज एक टैलेंट शो में हैं। यदि एक जज किसी गायक को 5 में से 4 अंक देता है और दूसरा 5 में से 2 अंक देता है, तो यह जानना मुश्किल है कि कौन सही है।
- इसका अर्थ: डॉक्टर इस बात पर सहमत होने में संघर्ष कर रहे थे कि जवाब कितने "स्पष्ट" या "सुरक्षित" थे। हालाँकि, जब उन्होंने सभी पाँचों डॉक्टरों के औसत को देखा, तो सटीकता के मामले में ChatGPT और Gemini के बीच का अंतर देखने के लिए पर्याप्त स्पष्ट था।
"यूनानी" मोड़
अध्ययन में यूनानी चिकित्सा (दक्षिण एशिया में लोकप्रिय एक पारंपरिक उपचार प्रणाली) और फर्श पर प्रार्थना करने जैसी सांस्कृतिक आदतों के बारे में प्रश्न शामिल थे। शोधकर्ता यह देखना चाहते थे कि क्या रोबोट इन विशिष्ट सांस्कृतिक संदर्भों को समझते हैं। हालांकि अध्ययन में इन सवालों को शामिल किया गया था, लेकिन मुख्य निष्कर्ष समग्र गुणवत्ता के बारे में था, न कि विशेष रूप से यह कि उन्होंने यूनानी चिकित्सा को कितनी अच्छी तरह संभाला।
निचोड़ (Bottom Line)
यदि आप घुटने के दर्द से पीड़ित एक मरीज हैं और मदद के लिए इन रोबोटों से पूछ रहे हैं:
- ChatGPT आपको अधिक पूर्ण और सटीक जानकारी देने की प्रवृत्ति रखता है, जैसे कि एक विस्तृत विश्वकोश।
- Gemini को पढ़ना थोड़ा आसान है, लेकिन बहुत मामूली अंतर से।
- दोनों ऐसे स्तर पर लिख रहे हैं जो औसत व्यक्ति के लिए समझने में बहुत जटिल हो सकता है।
अंतिम चेतावनी: शोधकर्ताओं का कहना है कि भले ही ChatGPT बेहतर था, लेकिन किसी भी रोबोट का उपयोग तब तक नहीं किया जाना चाहिए जब तक कि कोई मानव डॉक्टर पहले काम की जाँच न कर ले। आपको रोबोट के जवाब को अंतिम शब्द के रूप में नहीं मानना चाहिए; एक वास्तविक डॉक्टर को यह सुनिश्चित करने के लिए इसकी समीक्षा करनी चाहिए कि यह आपके लिए सुरक्षित और सही है।
संक्षेप में: ChatGPT एक बेहतर "पाठ्यपुस्तक" था, लेकिन दोनों को छात्र (मरीज) को पाठ समझाने के लिए एक शिक्षक (डॉक्टर) की आवश्यकता होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।