Generative AI Responses to Patient-Presented Orthodontic Misinformation and Controversial Claims: A Comparative Cross-Sectional Evaluation of Safety, Accuracy, Evidence Concordance, Misinformation Correction, Uncertainty Communication, Transparency, and Actionability
यह तुलनात्मक क्रॉस-सेक्शनल अध्ययन रोगी-केंद्रित ऑर्थोडोंटिक प्रश्नों पर पांच जनरेटिव एआई चैटबॉट्स का मूल्यांकन करता है, जिसमें यह पाया गया है कि हालांकि अधिकांश स्पष्ट रूप से असुरक्षित सलाह देने से बचते हैं, वे सटीकता, साक्ष्य संरेखण और सुधारात्मक क्षमताओं में महत्वपूर्ण अंतर प्रदर्शित करते हैं, जो पेशेवर मूल्यांकन के विकल्प के बजाय उन्हें सहायक उपकरण के रूप में उपयोग करने की आवश्यकता को रेखांकित करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
लोग अपने स्वास्थ्य के बारे में उत्तर खोजने के लिए तेजी से सर्च इंजन, सोशल मीडिया और लघु वीडियो की ओर मुड़ रहे हैं। ये माध्यम जानकारी को ढूंढना आसान बनाते हैं, लेकिन यह भी तय करना कठिन बना देते हैं कि कौन सच बोल रहा है। यह विशेष रूप से ऑर्थोडोंटिक्स (orthodontics) के लिए सच है, जो दंत चिकित्सा का वह क्षेत्र है जो दांतों को सीधा करता है और जबड़ों को संरेखित करता है। ऑनलाइन मिलने वाली सलाह अक्सर तथ्यों को अतिशयोक्ति, व्यक्तिगत कहानियों या बिक्री के दावों के साथ मिला देती है। एक रोगी यह पढ़ सकता है कि ब्रेसेस का एक विशिष्ट प्रकार उनके चेहरे का आकार बदल सकता है, या वे रबर बैंड के साथ घर पर ही अपने दांतों को सीधा कर सकते हैं। हालांकि इनमें से कुछ जानकारी हानिरहित है, अन्य दावे अवास्तविक अपेक्षाओं, चिकित्सा देखभाल में देरी, या यहां तक कि शारीरिक चोट का कारण बन सकते हैं। जब कोई व्यक्ति किसी भ्रमित करने वाले या खतरनाक दावे का सामना करता है, तो उन्हें आगे क्या करना है यह तय करने में मदद करने के लिए एक स्पष्ट, सुरक्षित और सटीक स्पष्टीकरण की आवश्यकता होती है।
हाल के वर्षों में, लोगों को जानकारी व्यवस्थित करने में मदद करने के लिए एक नए प्रकार के उपकरण का उदय हुआ है: जनरेटिव आर्टिफिशियल इंटेलिजेंस (generative artificial intelligence)। ये प्रणालियाँ बातचीत कर सकती हैं और स्वाभाविक भाषा में प्रश्नों के उत्तर दे सकती हैं। वे दैनिक जीवन में आम हो रहे हैं, और अब कई लोग उनसे स्वास्थ्य संबंधी सलाह मांगते हैं। हालांकि, यह स्पष्ट नहीं है कि क्या ये प्रणालियाँ गलत चिकित्सा दावों को सुधारने के कठिन कार्य को बिना अनजाने में खतरनाक निर्देश दिए संभाल सकती हैं। एक कंप्यूटर प्रोग्राम बहुत आत्मविश्वासी और विनम्र लग सकता है, जबकि वह किसी महत्वपूर्ण चेतावनी को छोड़ देता है या यह समझाने में विफल रहता है कि कोई लोकप्रिय विचार गलत क्यों है। इन उपकरणों के वास्तविक दुनिया के परिदृश्य में प्रदर्शन को समझने के लिए, शोधकर्ताओं को उन विशिष्ट भ्रामक प्रश्नों के विरुद्ध परीक्षण करने की आवश्यकता थी जो वास्तव़ में रोगी पूछते हैं।
चीन के अस्पतालों के शोधकर्ताओं की एक टीम ने पांच सबसे लोकप्रिय उपभोक्ता-केंद्रित आर्टिफिशियल इंटेलिजेंस चैटबॉट्स का परीक्षण करने के लिए एक प्रयास किया। वे यह देखना चाहते थे कि जब उपयोगकर्ता उन्हें ऑर्थोडोंटिक उपचार के बारे में गलत या विवादास्पद दावे प्रस्तुत करते हैं, तो ये प्रणालियाँ कैसे प्रतिक्रिया देती हैं। अध्ययन ने पांच विशिष्ट प्रणालियों पर ध्यान केंद्रित किया: ChatGPT, Gemini, Microsoft Copilot, DeepSeek, और Doubao। शोधकर्ताओं ने इन प्रणालियों से "दांत क्या है?" जैसे सरल प्रश्न नहीं पूछे। इसके बजाय, उन्होंने वास्तविक दुनिया के दुष्प्रचार पर आधारित साठ और आठ विशिष्ट प्रॉम्प्ट (prompts) बनाए। इन प्रॉम्प्ट्स में दांत निकालने, चेहरे की विशेषताओं को बदलने, 'डू-इट-योरसेल्फ' (do-it-yourself) अलाइनर का उपयोग करने, या अप्रमाणित तरीकों के साथ उपचार में तेजी लाने जैसे गलत विचार शामिल थे। प्रत्येक प्रॉम्प्ट को एक गलत धारणा के साथ बनाया गया था जिसे चैटबॉट को पहचानना और सुधारना होता।
शोधकर्ताओं ने प्रत्येक साठ और आठ प्रश्नों को सभी पांच चैटबॉट्स को सबमिट किया, जिससे कुल तीन सौ और चालीस प्रतिक्रियाएं उत्पन्न हुईं। उन्होंने परिणामों को सुसंगत बनाने के लिए प्रत्येक प्रश्न को एक एकल, एक-बार की बातचीत के रूप में माना। उत्तरों का मूल्यांकन करने के लिए, पांच अनुभवी ऑर्थोडोंटिक डॉक्टरों ने स्वतंत्र रूप से पाठ की समीक्षा की। उन्होंने कई प्रमुख गुणों की जांच की। सबसे पहले, उन्होंने सुरक्षा की जांच की: क्या प्रतिक्रिया ने किसी ऐसे व्यवहार को प्रोत्साहित किया जो रोगी को नुकसान पहुंचा सकता है, जैसे कि पेशेवर जांच के बिना दांतों को हिलाने का प्रयास करना? दूसरा, उन्होंने सटीकता को मापा: क्या जानकारी तथ्यात्मक रूप से सही थी? तीसरा, उन्होंने मूल्यांकन किया कि उत्तर स्थापित चिकित्सा साक्ष्यों के साथ कितनी अच्छी तरह मेल खाता है। उन्होंने यह भी जांचा कि क्या चैटबॉट ने प्रश्न में दी गई गलत धारणा को सक्रिय रूप से सुधारा, न कि केवल उसे अनदेखा कर एक सामान्य उत्तर दिया। अंत में, उन्होंने मूल्यांकन किया कि क्या प्रतिक्रिया ने अनिश्चितता को उचित रूप से संप्रेषित किया, क्या वह अपने स्रोतों के बारे में पारदर्शी थी, और क्या उसने रोगी को आगे बढ़ने के लिए एक स्पष्ट, सुरक्षित अगला कदम दिया।
परिणामों से पता चला कि पांचों चैटबॉट्स आम तौर पर सबसे स्पष्ट खतरों से बचने में अच्छे थे। तीन सौ और चालीस प्रतिक्रियाओं में से तीन सौ और सात को सुरक्षित वर्गीकृत किया गया, जिसका अर्थ है कि उनमें तत्काल शारीरिक नुकसान पहुंचा सकने वाली सलाह शामिल नहीं थी। हालांकि, प्रणालियाँ अन्य चीजों में समान रूप से अच्छी नहीं थीं। शोधकर्ताओं ने पाया कि चैटबॉट्स द्वारा अपने उत्तरों की गुणवत्ता को संभालने के तरीके में महत्वपूर्ण अंतर थे। ChatGPT ने लगातार सबसे सटीक जानकारी प्रदान की और प्रश्नों में प्रस्तुत गलत विचारों को सुधारने में सबसे अच्छा रहा। इसने अपने ज्ञान की सीमाओं को समझाने और रोगी को स्पष्ट, कार्रवाई योग्य कदम उठाने में भी सबसे अच्छा काम किया। Gemini ने कुछ क्षेत्रों में अच्छा प्रदर्शन किया, और चिकित्सा साक्ष्यों के साथ अपने उत्तरों के मिलान के मामले में ChatGPT के बराबर रहा, लेकिन वह अन्य श्रेणियों में कम सुसंगत था। अन्य तीन प्रणालियों, जिनमें Copilot, DeepSeek और Doubao शामिल हैं, ने आमतौर पर सभी स्तरों पर कम स्कोर किया, और अक्सर गलत सूचना को सुधारने या पर्याप्त विस्तृत मार्गदर्शन प्रदान करने में विफल रहे।
अध्ययन का एक महत्वपूर्ण निष्कर्ष यह था कि "सुरक्षित" होने का मतलब यह नहीं है कि कोई उत्तर अकेले उपयोग करने के लिए पर्याप्त है। कई प्रतिक्रियाओं ने खतरनाक सलाह से तो परहेज किया लेकिन रोगी की गलतफहमी को सुधारने या आवश्यक संदर्भ प्रदान करने में विफल रहीं। उदाहरण के लिए, एक चैटबॉट सही ढंग से कह सकता है कि दांतों को ब्रेसेस की आवश्यकता होती है, लेकिन वह यह समझाने में विफल रह सकता है कि प्रश्न में उल्लेखित एक विशिष्ट 'डू-इट-योरसेल्फ' विधि असुरक्षित है। अध्ययन ने दिखाया कि हालांकि इन प्रणालियों ने शायद ही कभी ऐसी निर्देश दिए जिनसे तत्काल चोट पहुंचे, लेकिन उनमें चिकित्सा मार्गदर्शन के लिए आवश्यक गहराई और सूक्ष्मता की कमी थी। शोधकर्ताओं ने नोट किया कि प्रणालियों के बीच अंतर केवल मामूली बदलाव नहीं थे; शीर्ष प्रदर्शन करने वाले मॉडल अन्य की तुलना में जटिल, भ्रामक दावों को संभालने की अपनी क्षमता में स्पष्ट रूप से बेहतर थे।
लेखकों ने निष्कर्ष निकाला कि इन आर्टिफिशियल इंटेलिजेंस उपकरणों को रोगी शिक्षा के सहायक के रूप में देखा जाना चाहिए, न कि दंत चिकित्सक के पास जाने के विकल्प के रूप में। वे जानकारी को व्यवस्थित करने और सामान्य प्रश्नों के उत्तर देने में मदद कर सकते हैं, लेकिन वे पेशेवर जांच, एक्स-रे, या व्यक्तिगत उपचार योजना की आवश्यकता को प्रतिस्थापित नहीं कर सकते। अध्ययन इस बात पर जोर देता है कि रोगियों को इन चैटबॉट्स पर उन दावों को सत्यापित करने के लिए भरोसा नहीं करना चाहिए जो उन्होंने ऑनलाइन देखे हैं, विशेष रूप से जब वे दावों में उनके दांतों या चेहरे को बदलने की बात शामिल हो। इसके बजाय, इन उपकरणों का सबसे अच्छा उपयोग प्रारंभिक जानकारी एकत्र करने और फिर तथ्यों को सत्यापित करने और सुरक्षित कार्रवाई के मार्ग पर चर्चा करने के लिए एक योग्य पेशेवर की तलाश करने में है। शोध सुझाव देता है कि हालांकि तकनीक प्रगति कर रही है, फिर भी यह सुनिश्चित करने के लिए मानवीय निरीक्षण की आवश्यकता है कि दी गई सलाह न केवल सुरक्षित हो बल्कि सटीक, पूर्ण और व्यक्तिगत रोगी के लिए वास्तव में सहायक भी हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।