Large Language Models for Pulmonary Embolism Health Education: A Four- Model Comparison of Reliability, Quality, and Readability
본 연구는 폐색전증 건강 교육에 관한 네 가지 거대 언어 모델을 비교하였으며, Copilot과 Perplexity가 우수한 신뢰성과 출처 제시 능력을 보여주었으나, 모든 모델이 환자 교육을 위한 권장 가독성 기준을 충족하지 못했다는 점을 밝혀내며 전문가의 감독이 필요함을 강조하였다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷을 누구나 들어와서 질문을 던질 수 있는 거대하고 북적이는 도서관이라고 상상해 보세요. 과거에는 무서운 의학적 상태에 대해 물어본다면, 낡은 책 더미나 혼란스러운 신문 기사, 혹은 낯선 사람의 근거 없는 소문을 듣게 될 수도 있었습니다. 하지만 최근에 새로운 종류의 사서가 도착했습니다. 바로 대규모 언어 모델(LLM)입니다. 이들은 인터넷에 쓰인 거의 모든 것을 읽었으며, 평이한 영어로 여러분과 대화할 수 있는 매우 똑똑하고 지치지 않는 로봇이라고 생각하면 됩니다. 이들은 이야기를 쓰거나, 수학 문제를 풀거나, 심지어 건강 질문에 답하는 데도 뛰어납니다.
하지만 여기에 까다로운 문제가 있습니다. 심각한 건강 문제에 있어서는 단순히 이야기를 잘하는 것만으로는 충분하지 않습니다. 사실을 알고, 자신이 확신하지 못할 때는 모른다고 인정하며, 지치고 걱정스러운 사람도 이해할 수 있을 만큼 쉽게 설명할 줄 아는 사서가 필요합니다. 그중 하나가 폐색전증(Pulmonary Embolism, PE)이라는 무서운 질환입니다. 이는 혈전으로 인해 폐에 교통 체증이 생긴 것과 같으며, 매우 위험할 수 있습니다. 이처럼 상황이 심각하기 때문에 사람들은 답을 찾기 위해 서둘러 구글링을 하곤 합니다. 이 논문은 한 가지 큰 질문을 던집니다. 만약 네 명의 서로 다른 AI 사서에게 폐색전증에 대해 묻는다면, 그들은 모두 똑같이 좋은 조언을 해줄까요? 아니면 어떤 이들은 자신만만하게 들리지만 틀린 말을 하거나, 읽기에 너무 어렵게 답할까요?
위대한 AI 대결: 누가 최고의 건강 사서인가?
이 연구에서 신풍현 인민 병원의 연구원들은 가장 인기 있는 네 가지 AI 챗봇을 테스트하기로 했습니다. 그들은 ChatGPT, Gemini, Microsoft Copilot, 그리고 Perplexity AI를 선정했습니다. 공정한 대결을 위해, 연구원들은 로봇들에게 이상하거나 가공의 질문을 던지지 않았습니다. 대신, 지난 5년 동안 사람들이 구글에서 실제로 검색했던 내용들을 살펴보았습니다. 그 결과, 폐색전증에 대해 사람들이 가장 많이 묻는 31가지 질문(예: "증상은 무엇인가요?", "어떻게 치료하나요?", "임신 중에도 위험한가요?" 등)을 찾아냈습니다.
그런데 이 31가지 질문을 네 가지 AI 모델에 각각 입력했습니다. 모델이 4개이고 질문이 31개였으므로, 연구원들은 채점해야 할 124개의 서로 다른 답변을 얻게 되었습니다. 연구원들은 엄격한 선생님이 되어 네 가지 다른 '성적표'를 사용하여 답변을 검토했습니다:
- 신뢰성(Reliability): AI가 자신이 아는 것과 모르는 것을 인정했는가? 출처(근거)를 제시했는가?
- 품질(Quality): 조언이 균형 잡혀 있고 유용한가?
- 가독성(Readability): 언어가 6학년 수준의 학생도 이해할 수 있을 만큼 쉬운가? (의사들은 누구나 정보를 이해할 수 있도록 보통 건강 정보가 이 정도 수준이어야 한다고 권고합니다.)
- 전반적인 흐름(Overall Flow): 글이 매끄럽게 읽히는가?
결과: "좋은" 소식과 "나쁜" 소식
여기 반전이 있습니다: 네 가지 AI 모델 모두 모든 질문에 답변했습니다. 어떤 모델도 작동을 멈추거나 대화를 거부하지 않았습니다. 그들은 모두 자신감 있게 들렸고 명확하고 매끄러운 문장으로 글을 썼습니다. 첫 단락만 읽는다면, 그들은 모두 도움이 되는 전문가처럼 보였습니다.
하지만 연구원들이 자세히 들여다보았을 때, 차이는 엄청났습니다.
"출처" 점수 (JAMA 벤치마크):
자신의 출처를 목록으로 작성해야 점수를 받는 에세이를 상상해 보세요. 두 모델, Copilot과 Perplexity만이 자신의 작업물을 보여주려 노력했습니다. 이들은 인용(정보를 가져온 곳의 링크)을 제공했습니다. 나머지 두 모델인 ChatGPT와 Gemini는 출처를 밝히지 않고 대부분 답변만 내놓았습니다. 실제로 ChatGPT와 Gemini는 출처 제시 항목에서 0점을 받았습니다. 반면 Copilot과 Perplexity는 약간 더 높은 점수(4점 만점에 약 1점 정도)를 받았습니다. 이는 만약 여러분이 AI가 말하는 것이 진실인지 확인하고 싶다면, 앞의 두 모델을 통해서만 가능함을 의미합니다.
"신뢰성" 점수 (DISCORN):
이 점수는 조언이 균형 잡혀 있고 안전한지를 확인합니다.
- Copilot과 Perplexity는 중앙값 41점을 받았습니다.
- ChatGPT는 35점을 받았습니다.
- Gemini는 33점을 받았습니다.
63점이 "우수함", 16점이 "매우 나쁨"인 척도에서, 네 모델 모두 "나쁨"에서 "보통" 범위에 머물렀습니다. "승자"인 Copilot과 Perplexity조차 "좋음" 단계에 도달하지 못했습니다. 그들은 괜찮은 수준이었지만, 훌륭한 수준은 아니었습니다.
"가독성" 문제:
이 부분은 다소 답답한 대목입니다. 미국 의학 협회(AMA)는 교육 수준에 상관없이 누구나 이해할 수 있도록 건강 조언이 6학년 읽기 수준으로 작성되어야 한다고 말합니다.
- 연구원들은 텍esian의 난이도를 측정하기 위해 여섯 가지 다른 수학 공식을 사용하여 답변을 검착했습니다.
- 네 모델 중 어느 것도 이 테스트를 통과하지 못했습니다.
- 가장 쉬운 답변은 여전히 9학년 수준(ChatGPT)으로 작성되었습니다.
- 가장 어려운 답변은 16학년 수준(Copilot)이었는데, 이는 대학 수준의 읽기 능력입니다!
- 'Flesch 읽기 용이성' 점수(높을수록 쉬움)는 모두 35에서 48 사이였습니다. 통과하려면 80 이상이 되어야 했습니다.
기본적으로, AI 로봇들은 일반인이, 특히 의료 비상 상황에서 겁을 먹고 걱정하고 있을 때 빠르게 읽을 수 있는 언어로 글을 쓰고 있었습니다.
결론: 로봇에게 운전대를 맡기지 마세요
연구는 이 AI 모델들이 똑똑하게 들리고 정보를 정리하는 데는 뛰어나지만, 의사를 대체할 준비는 되지 않았다는 것을 발견했습니다.
- Copilot과 Perplexity는 출처를 밝히고 구조가 약간 더 나았기 때문에 "더 나은" 학생이었지만, 여전히 너무 어려운 단어들을 사용했습니다.
- ChatGPT와 Gemini는 문장은 똑같이 매끄러웠지만, 출처를 보여주는 면에서는 다소 떨어졌습니다.
- 결정적으로, 연구는 어떤 모델도 신뢰할 수 있는 사실, 명확한 출처, 그리고 쉬운 언어를 동시에 갖추지 못했다는 것을 밝혀냈습니다.
저자들은 이 AI 도구들이 유능한 부조종사(co-pilot)와 같지만, 결코 운전자가 되어서는 안 된다고 결론지었습니다. 이들은 질병이 무엇인지 설명하거나 의사에게 물어볼 질문을 준비하는 데 도움을 줄 수는 있지만, 여러분을 진단하거나, 여러분이 안전한지 판단하거나, 치료법을 결정할 수는 없습니다. 만약 건강 정보를 위해 AI를 사용한다면, 그것이 자신만만하게 들릴지라도 틀릴 수 있으며, 읽기에 너무 어려울 수 있다는 점을 반드시 기억해야 합니다. 가장 좋은 계획은 AI를 시작점으로 활용하되, 실제 인간 의사에게 그 내용을 확인받는 것입니다.
요약하자면, AI 사서들은 예의 바르고 빠르지만, 아직 "인간의 언어"를 말하고 자신이 지어낸 이야기가 아님을 증명하는 법을 배우는 중입니다. 그들이 더 나아질 때까지, 우리는 계속해서 인간의 개입(human in the loop)이 필요합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.