← 최신 논문
📄 health informatics

Citation reliability of frontier large language models in medical writing and its automated verification

이 연구는 최첨단 거대 언어 모델들이 주로 허구의 생성이 아닌 오기입을 통해 상당한 비율의 신뢰할 수 없는 의학적 인용을 생성한다는 사실을 밝히고 있으며, 자동화된 검증 사슬(Chain-of-Verification) 시스템이 전문가 수준의 정확도로 이러한 오류를 탐지할 수 있음을 보여줌으로써 AI 지원 의학 저술의 인용 무결성을 보장하기 위한 실행 가능한 해결책을 제시한다.

원저자: Shin, R., Lee, J.-M., Park, J., Kwun, J.-S., Cho, H.-W., Kang, S.-H., Jeon, K.-H.

게시일 2026-09-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shin, R., Lee, J.-M., Park, J., Kwun, J.-S., Cho, H.-W., Kang, S.-H., Jeon, K.-H.

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

현대 의학의 실무에서 연구 논문이나 리뷰 논문을 작성하는 것은 절대적인 정밀함을 요구하는 엄격한 과정입니다. 저자들은 복잡한 의학적 지식을 종합할 뿐만 아니라, 모든 주장을 구체적이고 기존에 존재하는 근거에 연결해야 합니다. 이러한 근거는 인용문이며, 이는 과학적 발견의 발자국 역할을 하여 독자들이 새로운 아이디어를 뒷받침하는 원래의 연구로 돌아갈 수 있도록 안내합니다. 수십 년 동안 이 과정은 이름, 날짜, 학술지 명칭을 주의 깊게 확인하여 참조 문헌이 실제로 존재하며 저자가 주장하는 바를 말하고 있는지 확인해야 하는 인간의 과업이었습니다. 그러나 이제 실험실과 도서관에 새로운 도구가 등장했습니다. 바로 대규모 언어 모델(LLM)입니다. 이들은 방대한 양의 텍스트를 학습하여 기사를 초안하고, 연구 결과를 요약하며, 몇 초 만에 참고 문헌 목록을 생성할 수 있는 강력한 컴퓨터 프로그램입니다. 이들은 속도와 효율성의 약속을 제공하지만, 한 가지 중요한 질문이 생겨났습니다. 이 기계들이 올바른 발자국을 찾는 데 신뢰할 수 있을까요, 아니면 때때로 발자국을 지어내기도 할까요?

이 질문은 단순히 학술적인 문제가 아닙니다. 이는 의학적 무결성의 핵심을 찌르는 문제입니다. 만약 컴퓨터가 의학 리뷰를 작성하면서 실제처럼 보이지만 엉뚱한 연구를 가리키거나, 더 심하게는 존재하지도 않는 연구를 포함한다면, 전체 논증이 무너질 수 있습니다. '환각(hallucination)'이라고 알려진 이 현상은 초기 컴퓨터 모델의 알려진 약점이었습니다. 하지만 이러한 도구들이 발전하여 더 빨라지고 실시간으로 인터넷을 검색할 수 있는 능력을 갖추게 됨에 따라, 이들이 마침내 올바르게 인용하는 법을 배웠는지 여부는 불분명해졌습니다. 의학계는 이 새로운 고급 모델들이 진지한 연구에 사용될 만큼 신뢰할 수 있는지, 만약 그렇지 않다면 출판 전 단계에서 실수를 잡아낼 수 있는 실질적인 방법이 있는지 알아야 합니다.

연구팀은 가장 진보된 세 가지 컴퓨터 모델을 엄격하게 테스트함으로써 이 질문들에 답하고자 했습니다. 그들은 각 모델에게 심장 및 혈관 연구 분야인 순환기 내과 내의 9가지 서로 다른 주제에 대해 일련의 짧은 의학 리뷰를 작성하도록 요청했습니다. 주제는 흔한 질환부터 희귀한 시술까지 다양하게 구성하여, 발표된 연구가 많은 주제와 매우 적은 주제를 혼합했습니다. 각 모델은 약 600~900단어 분량의 리뷰를 작성하고 각 논문당 정확히 30개의 참고 문헌을 포함하도록 지시받았으며, 총 270개의 리뷰와 8,000개 이상의 인용문이 생성되었습니다. 결정적으로, 연구진은 모델들이 실제 환경에서 사용자가 사용하는 방식과 동일하게 내장된 웹 검색 도구를 사용할 수 있도록 허용했습니다. 목표는 이 수천 개의 인용문 중 실제로 정확한 것이 얼마나 되는지 확인하는 것이었습니다.

결과는 상당한 차이와 지속적인 오류가 존재하는 풍경을 보여주었습니다. 연구진이 공식 의학 데이터베이스와 대조하여 모든 인용문을 확인했을 때, 모델들이 완벽하지 않다는 사실을 발견했습니다. GPT-5.5 모델이 가장 우수한 성능을 보였으나, 문제 있는 인용을 생성하는 비율은 약 11.5%였습니다. 그러나 다른 두 모델인 Claude Opus 4.8과 Gemini 3.5 Flash는 인용문의 거의 30%에서 오류를 범했습니다. 이는 덜 정확한 모델들의 경우, 생성된 10개의 참조 문헌 중 약 3개가 결함이 있음을 의미합니다. 연구진은 또한 출판된 연구가 적은 주제에서 모델들이 더 어려움을 겪는지 조사했는데, 가용 정보의 부족이 컴퓨터를 혼란스럽게 할 것이라고 우려했기 때문입니다. 조사 결과, 문헌이 더 많은 주제에서 오류율이 약간 낮게 나타나기는 했지만, 그 차이가 확정적인 규칙으로 간주될 만큼 강력하지는 않았습니다. 모델들은 주제에 대한 정보가 얼마나 이용 가능한지와 관계없이 전반적으로 실수를 저질렀습니다.

아마도 가장 드러나는 발견은 실수 자체의 성격이었을 것입니다. 연구진은 컴퓨터가 단순히 가짜 논문을 만들어내는 고전적인 형태의 환각을 많이 발견할 것으로 예상했습니다. 그러나 그들은 대다수의 오류가 훨씬 더 미묘하다는 것을 발견했습니다. 문제 있는 인용의 약 77%는 '오기(misattribution)' 사례였습니다. 이러한 경우, 컴퓨터는 실제 의학 논문에 대한 유효한 식별자를 제공했지만, 그 논문은 모델이 주장하는 것과 일치하지 않았습니다. 마치 컴퓨터가 도서관에서 실제 책을 찾아냈지만, 그것을 엉뚱한 선반에 꽂아 두고 다른 책의 제목을 붙여놓은 것과 같았습니다. 이러한 유형의 오류는 언뜻 보기에 올바르게 보이기 때문에 특히 위험합니다. 인간 독자는 유효한 번호를 보고 신뢰할 수 있다고 가정했다가, 나중에 그 출처가 주장하는 바를 뒷받침하지 않는다는 것을 발견하게 될 수 있습니다. 컴퓨터가 아예 존재하지 않는 논문을 만들어내는 진정한 '조작(fabrication)'은 놀랍게도 드물었으며, 전체 오류의 1% 미만을 차지했습니다.

이러한 미묘한 오류는 체계적인 확인 없이는 인간이 포착하기 어렵다는 점을 인식하여, 연구진은 '검증 사슬(Chain-of-Verification)'이라는 새로운 검증 방법을 테스트했습니다. 이 접근법은 컴퓨터 모델을 사용하되, 다른 방식으로 활용합니다. 모델에게 단순히 참고 문헌을 나열하라고 요청하는 대신, 시스템은 작업을 일련의 작고 독립적인 질문들로 나눕니다. 시스템은 모델에게 제목과 저자를 바탕으로 논문을 찾고, 저널과 연도가 일치하는지 확인하며, 마지막으로 식별자가 올바른 문서를 가리키는지 확인하도록 합니다. 모델이 자신의 기억에 의존하는 대신 데이터베이스에 대해 각 정보를 개별적으로 검증하도록 강제함으로써, 시스템은 스스로의 실수를 잡아낼 수 있습니다. 연구진이 이 방법을 전문가가 직접 확인한 참고 문헌 세트에 대해 테스트했을 때, 자동화된 시스템은 놀라울 정도로 효과적이었습니다. 이 시스템은 오기 및 조작 사례를 모두 포함하여 문제 있는 인용의 96.8%를 정확히 식별해 냈으며, 올바른 인용을 오류로 잘못 표시하는 경우는 거의 없었습니다.

이 연구는 최신 세대의 의학 작성 도구들이 강력하기는 하지만, 아직 감독 없이 신뢰할 수 있는 단계는 아니라고 결론짓습니다. 가장 흔한 실패는 가짜 사실을 만들어내는 것이 아니라, 실제 사실에 잘못된 라벨을 붙이는 것이며, 이는 이를 탐지하기 위한 특정한 종류의 확인 작업이 필요합니다. 연구진은 자동화된 검증 프로세스가 인간 전문가와 대등한 정확도로 이 확인 작업을 수행할 수 있다는 것을 발견했습니다. 이는 미래의 AI 지원 의학 작성이 인간과 기계 사이의 선택이 아니라, 기계가 내용을 초안하고 전문적인 검증 시스템이 모든 인용이 진실을 가리키는지 보장하는 파트너십이 될 것임을 시사합니다. 이러한 검증이 표준 관행으로 자리 잡기 전까지, 이 모델들이 생성한 인용문은 독자를 잘못된 진실의 원천으로 인도할 수 있으므로 주의해서 다루어야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →