← 최신 논문
📄 medicine

Generative AI Responses to Patient-Presented Orthodontic Misinformation and Controversial Claims: A Comparative Cross-Sectional Evaluation of Safety, Accuracy, Evidence Concordance, Misinformation Correction, Uncertainty Communication, Transparency, and Actionability

이 비교 단면 연구는 환자 대상의 교정 관련 질의에 대한 다섯 가지 생성형 AI 챗봇을 평가하며, 대부분의 챗봇이 명백히 위험한 조언은 피하고 있으나 정확도, 근거 부합성 및 교정 능력에서 상당한 차이를 보인다는 점을 밝힘으로써 이들을 전문적인 평가를 대체하는 수단이 아닌 보조적 도구로 취급해야 할 필요성을 강조한다.

원저자: Xiaoli Liu, Yan Zhuang, Yulong Wang, Zhaole Gong, Wu Dong

게시일 2026-09-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiaoli Liu, Yan Zhuang, Yulong Wang, Zhaole Gong, Wu Dong

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

사람들은 건강에 관한 답을 찾기 위해 검색 엔진, 소셜 미디어, 그리고 짧은 영상에 점점 더 많이 의존하고 있습니다. 이러한 채널들은 정보를 찾기 쉽게 만들어 주지만, 누가 진실을 말하고 있는지 판단하는 것을 어렵게 만들기도 합니다. 이는 치아를 곧게 펴고 턱을 정렬하는 치과 분야인 교정학에서도 특히 그렇습니다. 온라인에서 발견되는 조언은 종가 사실과 과장, 개인적인 경험담, 또는 판매 목적의 홍보 문구를 혼합하여 제공하곤 합니다. 환자는 특정 유형의 교정 장치가 자신의 얼굴 형태를 바꿀 수 있다거나, 고무줄을 이용해 집에서 스스로 치아를 교정할 수 있다는 글을 읽을 수도 있습니다. 이러한 정보 중 일부는 해롭지 않지만, 다른 주장들은 비현실적인 기대감을 심어주거나, 의료적 처치를 지연시키거나, 심지어 신체적 부상을 초래할 수 있습니다. 혼란스럽거나 위험한 주장에 직면했을 때, 사람들에게는 다음에 무엇을 해야 할지 결정하는 데 도움이 될 명확하고 안전하며 정확한 설명이 필요합니다.

최근 몇 년 사이, 사람들이 정보를 정리하는 데 도움을 주는 새로운 종류의 도구가 등장했습니다. 바로 생성형 인공지능입니다. 이 시스템들은 유창하고 자연스러운 언어로 대화를 나누고 질문에 답할 수 있습니다. 이들은 일상생활에서 흔히 사용되고 있으며, 이제 많은 사람이 건강에 관한 조언을 구하기 위해 이들을 활용합니다. 그러나 이러한 시스템이 잘못된 의학적 주장을 바로잡으면서도 실수로 위험한 지침을 내리지 않을 수 있는지에 대해서는 여전히 불분명합니다. 컴퓨터 프로그램은 중요한 경고를 누락하거나 왜 대중적인 아이디어가 틀렸는지 설명하지 못한 채, 자신감 있고 예의 바른 태도로 답변할 수 있습니다. 이러한 도구들이 실제 상황에서 얼마나 잘 수행되는지 이해하기 위해, 연구자들은 환자들이 실제로 던지는 오해 섞인 질문들을 대상으로 테스트할 필요가 있었습니다.

중국의 병원 연구진은 가장 인기 있는 다섯 가지 소비자용 인공지능 챗봇을 테스트하기 위해 연구를 시작했습니다. 그들은 사용자가 교정 치료에 관한 거짓되거나 논쟁적인 주장을 제시했을 때 이 시스템들이 어떻게 반응하는지 확인하고자 했습니다. 연구는 ChatGPT, Gemini, Microsoft Copilot, DeepSeek, 그리고 Doubao라는 다섯 가지 특정 시스템에 초점을 맞췄습니다. 연구진은 이 시스템들에게 "치아가 무엇인가?"와 같은 단순한 질문을 던지지 않았습니다. 대신, 실질적인 오정보를 바탕으로 만든 68개의 구체적인 프롬프트를 만들었습니다. 이 프롬프트들에는 발치, 안면 특징 변화, 자가 교정 장치 사용, 또는 검증되지 않은 방법을 통한 치료 속도 가속화와 같은 잘못된 생각들이 포함되었습니다. 각 프롬프트는 챗봇이 반드시 인식하고 바로잡아야 할 잘못된 전제를 포함하도록 설계되었습니다.

연구진은 68개의 질문을 다섯 가지 챗봇 모두에 제출하여 총 340개의 응답을 생성했습니다. 결과의 일관성을 보장하기 위해 각 질문을 단 한 번의 대화로 취급했습니다. 답변을 평가하기 위해 다섯 명의 숙련된 교정 전문의들이 독립적으로 텍스트를 검토했습니다. 그들은 몇 가지 핵심적인 특성을 살펴보았습니다. 첫째, 안전성을 확인했습니다. 즉, 전문적인 검진 없이 치아를 움직이려는 시도와 같이 환에게 해를 끼칠 수 있는 행동을 권장하는지 확인했습니다. 둘째, 정확성을 측정했습니다. 즉, 정보가 사실적으로 옳은지 확인했습니다. 셋est, 답변이 확립된 의학적 근거와 얼마나 잘 일치하는지 평가했습니다. 또한 챗봇이 단순히 일반적인 답변을 하는 데 그치지 않고, 질문에 담긴 잘못된 전제를 적극적으로 바로잡았는지도 확인했습니다. 마지막으로, 응답이 불확실성을 적절하게 전달하는지, 출처에 대해 투명한지, 그리고 환자에게 명확하고 안전한 다음 단계가 무엇인지 제시하는지를 평가했습니다.

결과에 따르면, 다섯 가지 챗봇 모두 일반적으로 명백한 위험을 피하는 데는 능숙했습니다. 340개의 응답 중 307개가 안전한 것으로 분류되었는데, 이는 즉각적인 신체적 해를 입힐 수 있는 조언을 포함하지 않았음을 의미합니다. 그러나 시스템들이 모든 면에서 똑같이 우수했던 것은 아닙니다. 연구진은 챗봇이 답변의 질을 다루는 방식에서 상당한 차이가 있음을 발견했습니다. ChatGPT는 지속적으로 가장 정확한 정보를 제공했으며, 질문에 제시된 잘못된 생각을 바로잡는 데 가장 뛰어났습니다. 또한 자신의 지식의 한계를 설명하고 환자에게 명확하고 실행 가능한 단계를 제안하는 데 있어서도 가장 우수한 모습을 보였습니다. Gemini는 일부 영역에서 좋은 성과를 거두며 의학적 근거와의 일치도 측면에서 ChatGPT와 대등한 결과를 보였으나, 다른 범주에서는 일관성이 떨어졌습니다. Copilot, DeepSeek, Douola를 포함한 나머지 세 시스템은 전반적으로 낮은 점수를 받았으며, 오정보를 바로잡거나 충분히 상세한 안내를 제공하지 못하는 경우가 많았습니다.

이 연구의 중요한 발견은 "안전하다"는 것이 곧 그 답변이 단독으로 사용하기에 충분하다는 것을 의미하지는 않는다는 점이었습니다. 많은 응답이 위험한 조언은 피했지만, 여인의 오해를 바로잡거나 필요한 맥락을 제공하는 데는 실패했습니다. 예를 들어, 어떤 챗봇은 치아에 교정기가 필요하다는 점은 맞게 언급하면서도, 질문에 언급된 특정 자가 교정 방법이 왜 안전하지 않은지에 대해서는 설명하지 못할 수 있습니다. 연구는 시스템들이 즉각적인 부상을 일으킬 수 있는 지침을 드물게 제공하긴 했지만, 의학적 지침에 필요한 깊이와 정밀함은 부족한 경우가 많다는 것을 보여주었습니다. 연구진은 시스템 간의 차이가 단순한 변동이 아니라, 상위 성능 모델들이 다른 모델들에 비해 복잡하고 오해의 소지가 있는 주장을 처리하는 능력이 확실히 우월하다고 언급했습니다.

저자들은 이러한 인공지능 도구들이 치과의사를 대신하는 것이 아니라, 환자 교육을 돕는 보조적인 수단으로 간야되어야 한다고 결론지었습니다. 이들은 정보를 정리하고 일반적인 질문에 답하는 데 도움을 줄 수 있지만, 전문적인 검진, X-레이 촬영, 또는 개인별 맞춤형 치료 계획을 대체할 수는 없습니다. 본 연구는 환자들이 특히 치아나 얼굴의 변화와 관련된 주장을 온라인에서 보았을 때, 이를 확인받기 위해 챗봇에 의존해서는 안 된다는 점을 강조합니다. 대신, 이러한 도구들의 최선의 용도는 초기 정보를 수집한 후, 전문가를 찾아 사실을 검증하고 안전한 실행 방안을 논의하는 것입니다. 연구는 기술이 발전하고 있음에도 불구하고, 제공되는 조언이 단순히 안전할 뿐만 아니라 개별 환자에게 정확하고 완전하며 진정으로 도움이 되도록 하기 위해서는 여전히 인간의 감독이 필요함을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →