← 최신 논문
💻 computer science

Retrieval, not hallucinations, will be the limiting factor for LLM-based clinical AI tools

이 논문은 LLM 기반 임상 AI 도구의 주요 한계가 환루(hallucination)가 아니라 필요한 환자 수준의 데이터를 정확하게 검색하지 못하는 데 있다고 주장하며, 재현율(recall)과 검색 평가를 개선하는 방향으로 초점을 전환할 것을 촉구한다.

원저자: Kirk Roberts, Steven Bedrick, Kurt Miller, William R. Hersh, Hongfang Liu

게시일 2026-07-29
📖 5 분 읽기🧠 심층 분석

원저자: Kirk Roberts, Steven Bedrick, Kurt Miller, William R. Hersh, Hongfang Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미스터리를 풀려고 노력하고 있다고 상상해 보세요. 하지만 탐사관 대신, 초지능형 로봇 비서가 있습니다. 이 로봇은 세상에 존재하는 거의 모든 책을 읽었으며 인간처럼 대화할 수 있습니다. 의학의 세계에서 이러한 로봇들은 거대 언어 모델(LLM)이라고 불립니다. 이들은 환자의 기록을 읽고, 무엇이 문제인지 요약하며, 치료법을 제안함으로써 의사를 돕도록 교육받고 있습니다. 하지만 여기 함정이 있습니다. 로봇은 병원의 전체 데이터베이스를 한꺼번에 읽을 수 없습니다. 너무 방대하기 때문입니다. 그래서 질문에 답하기 전에, 로봇은 환자의 병력 중 중요한 특정 페이지들을 찾아내기 위해 '수색대'를 파견해야 합니다. 이 과정을 **검색(Retrieval)**이라고 부릅니다.

로봇을 뛰어난 요리사로, 환자의 의료 기록을 거대하고 혼란스러운 식료품 저장고라고 생각해 보세요. 요리사(AI)는 요리를 기가 막히게 잘하지만, 만약 수색대(검색 시스템)가 달걀을 가져오는 것을 잊어버린다면, 요리사가 아무리 재능이 뛰어나도 오믈렛을 만들 수 없습니다. 오랫동안 사람들은 요리사가 존재하지 않는 재료를 마치 있는 것처럼 꾸며낼까 봐 걱정해 왔습니다. 예를 들어, 실제로는 없는데 "유니콘 달걀"을 사용했다고 주장하는 것과 같습니다. 이것을 **환각(Hallucination)**이라고 합니다. 하지만 이 논문은 환각처럼 무언가를 지어내는 것도 나쁘지만, 진짜 조용히 다가오는 위험은 수색대가 중요한 재료를 찾지 못해 요리사가 재료를 놓치는 것입니다. 만약 로봇이 거대한 식료품 저장고에서 그 메모를 찾지 못해 환자가 페니실린 알레르기가 있다는 사실을 의사에게 전달하는 것을 잊는다면, 그 결과는 터무니없는 거짓말을 하는 것보다 훨씬 더 심각할 수 있습니다.


논문의 핵심 아이디어: 식료품 저장고 속의 소리 없는 살인자

이 논문은 의료용 AI의 가장 큰 병목 현상이 AI가 거짓말을 하는 것(환각)이 아니라, 애초에 올바른 정보를 찾아내지 못하는 것(재현율 오류)이라고 주장합니다. 전문가들로 구성된 저자들은 대화의 초점을 "AI가 거짓말을 하고 있는가?"에서 "AI가 중요한 것을 놓치고 있는가?"로 전환하고자 합니다.

두 가지 유형의 실수

저자들은 AI의 오류를 두 가지 고전적인 실수 유형에 비유합니다.

  1. "가짜 경보" (정밀도 오류): 이는 AI가 어떤 사실이 맞다고 말하지만, 실제로는 틀린 경우입니다. 의료계에서는 이를 유명한 **환각(Hallucination)**이라 부릅니다. 예를 들어, 환자가 실제로는 해당 질병이 없는데도 AI가 "환자가 희귀 열대 질병을 앓고 있다"라고 말하는 상황입니다. 이는 무서운 일이지만, 보통 찾아내기가 쉽습니다. AI가 황당한 말을 하면, 의사는 근거가 되는 기록을 확인하여 "잠깐, 이건 기록에 없는 내용인데?"라고 말할 수 있습니다. 이는 요리사가 식료품 저장고에 없는 비밀 향신료를 사용했다고 주장하는 것과 같습니다. 그냥 저장고를 확인해서 그것이 없다는 것을 바로 알 수 있기 때문입니다.
  2. "침묵의 누락" (재현율 오류): 이는 기록에 실제로 존재함에도 불구하고 AI가 중요한 내용을 빠뜨리는 경우입니다. 환자가 심한 알레르기가 있거나 어제 나온 중요한 검사 결과가 있을 수 있지만, AI가 이를 언급하지 않고 지나칠 수 있습니다. 이것이 바로 "소리 없는 살인자"입니다. 왜냐하면 AI가 아무 말도 하지 않으면, 의사는 그 정보가 존재하지 않는다고 가정할 수 있기 때문입니다. 이는 요리사가 달걀이 없다는 사실을 말하는 것을 잊어버려, 의사는 오믈렛에 문제가 없다고 생각했다가 나중에 숨겨진 재료 때문에 환자가 반응을 일으키는 것을 발견하게 되는 것과 같습니다.

논문은 우리가 "가짜 경보"를 잡아낼 좋은 방법(근거 기록을 확인하는 방식)을 가지고 있는 반면, "침묵의 누락"을 잡아낼 방법은 거의 없다는 점을 지적합니다. 만약 수색대가 특정 메모를 찾는 데 실패하면, AI는 그것을 보지 못하게 되고 의사 또한 그것이 누락되었다는 사실조차 모르게 됩니다. 이는 소리 없는 실패입니다.

왜 수색대가 약한 고리인가

저자들은 "요리사"(LLM)는 매일 더 똑똑하고 빨라지고 있는 반면, "수색대"(검색 시스템)는 그만큼 빠르게 발전하지 못하고 있다고 설명합니다.

  • 요리사의 성장: AI 모델은 언어와 맥락을 이해하는 능력이 향상되며 빠르게 진화하고 있습니다.
  • 수색대의 정체: 수백만 개의 의료 기록을 검색하는 도구들은 여전히 더 느리고 오래된 방식에 의존하고 있습니다. 우리가 새로운 기술을 사용하여 도움을 주려 노력함에도 불구하고, 문서를 찾는 핵심적인 방식은 크게 변하지 않았습니다.

논문은 검색 도구가 뒤처져 있기 때문에, 이들이 약한 고리가 되고 있다고 제안합니다. 환자의 기록이 점점 더 길고 복잡해짐에 따라(서로 다른 병원들을 연결하는 기술의 발전 덕분에), 수색대의 임무는 더욱 어려워지고 있습니다. 만약 방대한 파일 속에서 단 하나의 결정적인 메모를 놓친다면, 전체 AI 시스템은 실패하게 되며, 너무 늦기 전까지는 아무도 그 사실을 알지 못합니다.

평가의 함정

이 논문에서 가장 흥ًا로운 부분 중 하나는 이러한 시스템을 테스트하는 것이 얼마나 어려운가 하는 점입니다.

  • 요리사 테스트하기: 요리사가 재료를 지어내는지 테스트하는 것은 비교적 쉽습니다. 레시피를 써보라고 한 뒤 재료가 실제로 존재하는지 확인하면 됩니다.
  • 수색대 테스트하기: 수색대가 무언가를 놓쳤는지 테스트하는 것은 믿기 힘들 정도로 어렵습니다. 무언가를 놓쳤는지 알기 위해서는, 무엇이 있었는지 확인하기 위해 환자의 모든 기록을 직접 하나하나 다 읽어야 합니다. 환자의 기록은 수천 페이지에 달할 수 있으므로, 모든 AI 테스트를 위해 이 작업을 수행할 시간은 누구에게도 없습니다.

저자들은 현재의 테스트 방식이 AI가 일부 좋은 정보를 찾아냈는지만 확인할 뿐, 모든 좋은 정보를 찾아냈는지는 확인하지 못한다고 지적합니다. 이는 우리가 AI가 완벽하게 작동하고 있다고 생각할 때, 실제로는 중요한 세부 사항을 놓치고 있을 수도 있음을 의미합니다.

저자들이 말하는 것 (그리고 말하지 않는 것)

이 논문은 환각이 해결되었다거나 환각에 대한 걱정을 멈춰야 한다고 말하는 것이 아닙니다. 저자들은 환각이 "불안한 문제"라는 점을 인정합니다. 그러나 우리는 현재 환각에 집착하느라, 더 크고 감지하기 어려운 문제인 정보 누락을 간과하고 있다고 주장합니다.

그들은 아직 마법 같은 해결책을 가지고 있다고 주장하지 않습니다. 사실, 재현율 오류에 대한 완벽한 해결책은 현재 존재하지 않는다고 말합니다. AI가 놓친 것이 없음을 100% 확신하는 유일한 방법은 인간이 환자의 전체 기록을 직접 읽는 것뿐이며, 이는 시간을 아끼기 위해 AI를 사용하는 목적 자체를 무색하게 만듭니다. 논문은 우리가 "침묵의 누락"을 흘려보내지 않도록, 인간의 확인과 스마트한 자동화 도구를 결합하는 등의 새로운 테스트 방식이 필요하다고 제Suggest합니다.

결론

핵심적인 교훈은 경고입니다: AI가 당신에게 거짓말을 하는 것만 경계하지 마세요. AI가 당신에게 진실을 말하는 것을 잊어버리는 것도 경계하십시오.

의료용 AI가 보편화됨에 따라, 저자들은 가장 큰 장애물이 로봇을 더 똑똑하게 만드는 것이 아니라, 로봇의 수색대가 모든 퍼즐 조각을 찾아낼 만큼 철저한지 확인하는 것이 될 것이라고 믿습니다. 만약 우리가 검색 문제를 해결하지 못한다면, 세계에서 가장 진보된 AI라 할지라도 생명을 구하는 결정적인 세부 사항을 놓칠 수 있으며, 우리는 그것이 일어났다는 사실조차 영영 모를 수도 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →