← 최신 논문
💬 NLP

Verifiable by Construction: Claim-Level Evaluation of Verbatim Citation in Clinical Question Answering

이 논문은 12개의 거대 언어 모델이 사실적 주장(factual claims)에 문구 그대로의 인용문을 첨부함으로써 검증 가능한 임상적 답변을 생성하는 능력을 평가하며, 대부분의 모델이 주장 내용의 90% 이상에 인용문을 성공적으로 첨부할 수 있음에도 불구하고 이러한 인용문들이 해당 주장의 세부 사항을 완전히 입증하는 데 빈번히 실패한다는 점을 밝혀냈다.

원저자: Jiashuo Zhang, Yuling Chen, Yvonne Commodore-Mensah, Michael Oberst

게시일 2026-09-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiashuo Zhang, Yuling Chen, Yvonne Commodore-Mensah, Michael Oberst

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 의학의 고도의 긴박한 세계에서 시간은 종종 가장 희소한 자원입니다. 의사가 복잡한 환자 사례에 직면했을 때, 그들에게 필요한 답변은 정확할 뿐만 아니라 즉각적으로 신뢰할 수 있는 것이어야 합니다. 수년 동안 인공지능은 방대한 양의 의학 문헌을 명확하고 읽기 쉬운 조언으로 합성하여 도움을 주겠다고 약속해 왔습니다. 그러나 이러한 도구들에는 한 가지 지속적인 문제가 그림자를 드리워 왔습니다. 바로 사실을 지어내는 경향인 "환각(hallucination)"이라는 결함입니다. 단 한 번의 오류가 환자에게 해를 끼칠 수 있는 분야에서, 의사는 단순히 컴퓨터의 말을 믿을 수 없습니다. 그들은 모든 진술의 출처를 검증할 수 있어야 합니다. 전통적으로 AI가 인용문과 함께 답변을 제공할 때, 그 인용은 종-종 전체 의료 가이드라인이나 연구 논문과 같은 광범위한 문서를 가리킵니다. 이는 바쁜 임상의가 주장하는 바를 뒷받-받는 특정 문장을 찾기 위해 수백 페이지를 뒤지게 만들며, 이는 효율적인 보조 도구를 갖추는 목적 자체를 무색하게 만듭니다. 따라서 목표는 단순히 출처를 가리키는 것이 아니라, 답변 바로 옆에 원본 소스의 정확한 단어를 보여줌으로써 자신의 작업이 옳음을 증명하는 시스템을 구축하는 것입니다.

존스 홉킨스 대학교의 연구진은 현재의 인공지능 모델이 실제로 이 일을 할 수 있는지 테스트하기 위해 연구를 시작했습니다. 그들은 심장 질환, 혈압, 콜레스테롤, 당뇨병을 다루는 네 가지 주요 의료 가이드라인을 사용하여 임상 질문에 답하도록 설계된 특화된 시스템을 구축했습니다. 연구진은 모델들이 단순히 정보를 요약하게 두는 대신, 모든 사실적 주장마다 원본 가이드라인에서 직접 가져온 단어 그대로의 인용구를 첨부하여 문장 단위로 답변을 구성하도록 지시했습니다. 이것이 효과가 있는지 확인하기 위해, 그들은 디지털 감사관 역할을 하는 엄격한 테스트 프레임워크를 만들었습니다. 이 시스템은 모든 답변을 구성 요소인 개별 주장으로 분해한 다음, 세 가지 특정 기준에 따라 검증했습니다. 첫째, 모델이 주장에 인용구를 첨부했는가? 둘째, 첨부된 인용구가 변경이나 의역 없이 원본 가이드라인의 텍스트와 일치하는 정확한 축자적 복사본인가? 셋째, 독자가 다른 곳을 찾아볼 필요 없이 그 특정 인용구가 해당 주장이 사실임을 입증하기에 충분한 정보를 포함하고 있는가?

연구진은 강력하고 복잡한 시스템부터 작고 빠른 시스템에 이르기까지 12가지의 서로 다른 거대 언열 모델을 사용하여, 가이드라인에서 파생된 222개의 합성 임상 질문을 테스트했습니다. 결과는 이러한 모델들이 할 수 있는 것과 진정한 신뢰성을 위해 요구되는 수준 사이에 상당한 격차가 있음을 드러냈습니다. 대부분의 고급 모델은 놀랍게도 첫 번째와 두 번째 단계에서는 뛰어난 성능을 보였습니다. 그들은 주장 중 90% 이상에 성공적으로 인용구를 첨부했으며, 많은 경우 그들이 제공한 인용구는 원본 텍스트와 정확히 일치했습니다. 그러나 시스템은 마지막이자 가장 결정적인 단계인 '주장을 입증하는 것'에서 극적으로 무너졌습니다. 모델이 완벽한 인용구를 제공하더라도, 그 인용구는 모델이 내린 전체 진술의 무게를 뒷받침하지 못하는 경우가 많았습니다. 예를 들어, 어떤 모델은 특정 집단에 대해 특정 약물이 "선호된다(preferred)"는 문장을 인용하면서, 이를 바탕으로 그 약물이 모든 사람에게 "필수적이다(required)"라는 더 넓은 주장을 뒷받침할 수 있습니다. 한 주목할 만한 사례로, Claude Opus 5라는 최상위 모델은 98%의 주장에 대해 축자적 인용구를 첨부하는 데 성공했지만, 그 인용구만으로 완전히 입증된 주장은 37.1%에 불과했습니다. 인용구는 존재했고 정확했지만, 논점을 증명하기에는 불충분했습니다.

또한 이 연구는 모델의 크기와 유형이 매우 중요하다는 점을 강조했습니다. 작고 가벼운 모델들은 주장에 인용구를 아예 첨부하지 못하거나, 원본의 복사본이 아닌 인용구를 제공하여 검증률이 급락하는 결과를 초랐습니다. 테스트된 가장 작은 모델 중 하나인 Claude Haiku는 약 25%의 주장만을 온전히 뒷받-받았습니다. 반면, 가장 큰 모델들은 훨씬 더 나은 성능을 보였으며, 최고의 시스템들은 약 75%의 주장을 정확하고 충분한 증거로 뒷받침했습니다. 연구진은 실패의 주요 원인이 모델이 거짓말을 하거나 무언가를 지어내기 때문이 아니라, 적절한 증거를 선택하는 데 어려움을 겪고 있기 때문이라는 것을 발견했습니다. 모델들은 종종 주제와 관련은 있지만 전체 문장을 뒷받침하는 데 필요한 구체적인 세부 사항을 포함하지 않는 인용구를 가져왔습니다. 증거가 실제로 존재하는지 테스트하기 위해, 연구진은 별도의 AI에게 원본 문서를 검색하여 주장을 완전히 뒷받침할 수 있는 인용구를 찾도록 요청했습니다. 그 결과, 많은 모델의 경우 누락된 증거가 이미 읽었던 텍스트 안에 바로 그곳에 있었다는 것을 발견했습니다. 모델들은 단지 올바른 조각을 추출하여 첨부하는 데 실패했을 뿐이었습니다.

궁극적으로, 이 연구는 인공지능이 의료 정보를 검색하고 형식을 갖추는 능력은 점점 향상되고 있지만, 임상 현장에서 인간의 감독 없이 완전히 신뢰받을 준비는 아직 되지 않았음을 보여줍니다. 유창한 답변을 생성하는 능력은 검증 가능한 답변을 구축하는 능력과는 별개의 문제입니다. 이 연구는 현재의 모델들이 검증을 위한 원재료를 제공할 수는 있지만, 그것들을 완전하고 자기 완결적인 증거로 조립하는 데는 자주 실패한다는 것을 보여줍니다. 앞으로 나아갈 길은 단순히 출처를 인용하는 시스템이 아니라, 자신의 모든 조언이 원본 가이드라인으로부터 구체적이고, 충분하며, 변형되지 않은 증거에 의해 뒷받-받아지도록 보장하는 시스템을 만드는 것입니다. 모델이 인용구를 갖추는 것과 논점을 증명하는 것 사이의 간극을 일관되적으로 메울 수 있을 때까지, 검증의 책임은 여전히 인간 임상의의 손에 남을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →