← 최신 논문
💬 NLP

Do AI chatbots find what experts would? Effects of model, user role, and sample size on study retrieval for medical questions

이 연구는 세 가지 LLM 챗봇의 의학적 질문 답변 능력을 평가하며, 검색 성능이 모델과 사용자 역할에 따라 크게 달라지고 ChatGPT가 다른 모델들보다 우수한 성능을 보였으며 모든 모델이 대규모 임상 시험을 인용하는 경향을 보인다는 점을 밝혀냈다.

원저자: Qingfang Liu, Qiao Jin, Joe D. Menke, Thorsten Kahnt, Zhiyong Lu

게시일 2026-08-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Qingfang Liu, Qiao Jin, Joe D. Menke, Thorsten Kahnt, Zhiyong Lu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

특정한 요리법을 찾기 위해 셰프에게 묻는 대신, 거의 모든 요리책을 읽은 아주 똑똑한 로봇에게 묻는다고 상상해 보세요. 이 로봇은 문장에서 다음 단어를 예측하며 대화하고, 글을 쓰고, 질문에 답하는 인공지능 챗봇의 일종인 '대규모 언어 모델(LLM)'입니다. 의학 분야에서 이 로봇들은 복잡한 건강 문제를 빠르게 요약하고 조언의 근거가 되는 연구들을 짚어줄 수 있어 인기를 얻고 있습니다. 하지만 여기에는 함정이 있습니다. 때때로 이 로봇들은 존재하지 않는 연구를 인용하며 무언가를 지어내거나, 즉 '환각(hallucination)' 현상을 일으키기도 합니다. 더 심각한 것은, 가장 중요한 연구들을 통째로 놓칠 수도 있다는 점입니다. 이 논문은 단순하지만 매우 중요한 질문을 던집니다. 만약 인간 전문가(예: 의학 연구자)가 특정 의학적 질문에 대해 이미 '완벽한' 연구 목록을 찾아내는 힘든 작업을 마쳤다면, 이 AI 로봇들이 그와 동일한 목록을 얼마나 잘 찾아낼 수 있을까요? 이들은 호기심 많은 환자처럼 행동할까요, 바쁜 의사처럼 행동할까요, 아니면 진지한 연구자처럼 행동할까요? 그리고 연구의 규모가 로봇에게 영향을 미칠까요?

이 연구의 저자들은 가장 최신의, 가장 강력한 세 가지 AI 챗봇을 테스트하기로 했습니다. 그들은 챗봇을 매우 구체적인 시험을 치르는 학생처럼 대우했습니다. '시험 문제'는 전문가 팀이 특정 건강 문제에 대한 최선의 근거를 이미 수집하고 검증해 놓은 골드 스탠다드 라이브러리인 2026년 코크란 체계적 문헌고찰 데이터베이스(Cochrane Database of Systematic Reviews)에서 가져온 20개의 실제 의학 주제였습니다. 연구자들은 각 20개 주제에 대해, 답변을 뒷받침하는 원래의 연구들(원천 자료)을 찾아내라고 챗봇에게 요청했습니다. 로봇의 성격이 중요한지 확인하기 위해, 연구자들은 동일한 질문을 세 가지 다른 방식으로 던졌습니다. 한 번은 환자가 묻는 것처럼, 한 번은 임상의(의사)가 묻는 것처럼, 그리고 한 번은 증거 합성 연구자(데이터를 찾는 데 특화된 과학자)가 묻는 것처럼 말입니다. 결과가 우연이 아님을 확인하기 위해 이 실험 전체를 모든 조합에 대해 네 번 반복하여, 총 720개의 답변을 분석했습니다.

결과는 "나쁘지는 않지만 놀라울 정도로 편향된" 모습이었습니다. 평균적으로, 단일 챗봇의 응답은 인간 전문가가 이미 '정답' 목록으로 식별한 연구의 약 **39.2%**를 찾아냈습니다. 즉, 전문가가 10개의 완벽한 연구를 찾았다면, 로봇은 보통 약 4개 정도만을 찾아낸 것입니다. 하지만 로봇의 유형에 따라 차이가 컸습니다. ChatGPT가 전문가 연구의 **63.1%**를 찾아내며 확실한 승자가 되었습니다. Claude는 **37.0%**로 중간이었으며, Gemini는 단 **17.3%**만을 찾아내며 가장 고전했습니다. 흥미롭게도, 사용자의 '성격' 또한 작은 역할을 했습니다. 프롬프트가 연구자의 관점에서 작성되었을 때 챗봇은 더 많은 연구(42.8%)를 찾아냈으며, 환자(36.1%)나 임상의(38.6%)의 관점일 때보다 더 높은 수치를 보였습니다.

하지만 가장 매혹적인 발견은 챗봇이 어떤 연구를 선택했느냐 하는 것이었습니다. 연구자들은 챗봇이 성공적으로 검색한 연구와 놓친 연구의 특성을 살펴보았습니다. 그 결과, 챗봇은 표본 크기가 큰 연구(즉, 더 많은 사람을 대상으로 치료를 테스트한 연구)에 대해 엄청난 선호도를 보였습니다. 연구의 최신성, 인용 횟수, 또는 무료 열람 가능 여부를 통제하더라도, 표본 크기가 챗봇이 해당 연구를 찾을지 여부를 예측하는 유일하고 신뢰할 수 있는 변수였습니다. 로그 표본 크기가 1단위 증가할 때마다 챗봇이 해당 연구를 찾을 확률은 1.80배 급증했습니다. 이는 마치 챗봇에게 "참가자 수가 엄청나게 많다면, 그것이 가장 중요한 연구임이 틀림없어"라고 생각하는 내재된 편향이 있어, 똑같이 유효한 작은 연구들을 무시하는 것과 같습니다.

또한 연구는 챗봇이 가짜 연구를 만들어내거나 세부 사항을 틀리는지 확인했습니다. 챗봇은 가짜 연구를 많이 지어내지는 않았습니다(고급 추론 능력 덕분에 나타난 긍정적인 신호입니다). 하지만 약 3%의 확률로 '메타데이터 오류'를 범했습니다. 이는 실제 연구를 인용하면서도 저자 이름, 연도, 또는 학술지 명칭을 틀릴 수 있음을 의미합니다. Claude가 이러한 오류를 가장 자주(5.9%) 범했고, Gemini가 가장 정확했습니다(0.2%).

결론적으로, 이 논문은 AI 챗봇이 의학적 근거를 찾는 데 점점 더 나아지고 있지만, 아직 인간 전문가를 완전히 대체하기에는 부족하다고 제안합니다. 이들은 불완전하며, 당신이 누구를 연기하느냐에 따라 답변이 달라지고, 크고 유명한 연구에 대한 강한 편향을 가지고 있습니다. 만약 당신이 의학 연구를 찾기 위해 챗봇을 사용한다면, '히트곡' 목록은 얻을 수 있겠지만, 전문가들이 그만큼 중요하다고 알고 있는 작고 조용한 연구들은 쉽게 놓칠 수 있습니다. 저자들은 이 도구들이 당신에게 방향을 제시해 줄 수 있는 유능한 조수로서의 역할은 할 수 있지만, 의학적 근거가 실제로 무엇을 말하는지에 대한 최종 권위자가 될 수는 없다고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →