← 최신 논문
💻 computer science

Clinical explainable AI evaluations prioritize trust over effective human oversight: a scoping review

49개의 임상 XAI 연구를 대상으로 한 이 범위 검토(scoping review)는 평가가 실패 및 편향 탐지와 같은 비판적 감독 능력보다 사용자 신뢰와 인식을 압도적으로 우선시하며, 검증되지 않은 측정 방식에 크게 의존하고 실제 배포된 시스템에 대한 성능 평가는 거의 이루어지지 않고 있음을 드러낸다.

원저자: Nicolas Frey, Louis Agha-Mir-Salim, Linn Renner, Stefan Haufe, Lily Voge, Felix Balzer

게시일 2026-09-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nicolas Frey, Louis Agha-Mir-Salim, Linn Renner, Stefan Haufe, Lily Voge, Felix Balzer

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 병원에서 의사들은 질병을 진단하고 치료법을 제안하는 데 도움을 받기 위해 점점 더 컴퓨터 프로그램에 의존하고 있습니다. 복잡한 수학적 모델을 기반으로 구축된 이러한 도구들은 인간보다 훨씬 빠르게 방대한 양의 환자 데이터를 처리할 수 있습니다. 그러나 이러한 모델은 종-종 결론에 어떻게 도달했는지 설명하지 않은 채 권고안만을 제시하는 '블랙박스'처럼 작동하곤 합니다. 이러한 불투명성을 해결하기 위해 연구자들은 '설명 가능한 인공지능(explainable AI)'이라는 분야를 발전시켜 왔습니다. 그 목표는 단순합니다. 마치 의사가 칠판에 풀이 과정을 적어 보여주는 것처럼, 컴퓨터의 답변과 함께 그 근거가 되는 논리를 제공하는 것입니다. 이렇게 제안의 이면에 있는 논리를 확인함으로써, 임상의는 그 권고를 신뢰할지, 실수를 발견할지, 혹은 조언이 위험할 경우 이를 거부할지를 결정할 수 있다는 것이 희망적인 기대입니다. 기계를 점검하고 수정할 수 있는 이러한 능력은 '인간의 감독(human oversight)'이라 불리며, 높은 이해관계가 걸린 의료 결정에서 안전을 위해 필수적인 것으로 간고됩니다.

하지만 새로운 과학 연구 리뷰에 따르면, 현재 이러한 설명들을 테스트하는 방식이 직무의 가장 결정적인 부분을 놓치고 있다고 합니다. 니콜라스 프레이(Nicolas Frey)와 그의 동료들은 샤리테 대학 병원(Charité – Universitätsmedizin Berlin) 소속 연구진으로, 의사와 의료 연수생들이 이러한 설명 가능한 도구들과 어떻게 상호작용하는지를 테스트한 2015년부터 2026년 초까지 발표된 49개의 연구를 조사했습니다. 연구진은 해당 연구들이 실제로 설명이 임상의가 오류를 잡아내는 데 도움이 된다는 것을 증명했는지, 아니면 단순히 설명의 외관이 얼마나 마음에 드는지를 측정하고 있는 것인지 알고 싶었습니다. 그들은 중대한 격차를 발견했습니다. 연구들은 빈번하게 의사들에게 설명이 신뢰할 만한지 또는 이해하기 쉬운지를 물었지만, 그 설명이 실제로 의사가 컴퓨터가 틀렸을 때 이를 식으로 잡아내는 데 도움이 되었는지를 테스트한 경우는 거의 없었습니다.

이 리뷰는 이 49개의 연구가 무엇을 측정했는지 정확히 파악했습니다. 결과는 감정과 지각에 과도하게 집중되어 있었습니다. 42개의 연구에서 연구자들은 참가자들에게 시스템을 얼마나 신뢰하는지 물었습니다. 34개의 연구에서는 설명이 유용한지 물었고, 33개에서는 이해하기 쉬운지 물었습니다. 이러한 질문들은 의사가 단순히 "나는 이 답변에 확신을 느낀다"라고 말하는 자기 보고(self-reporting) 방식에 의존합니다. 연구진은 실제 행동을 테스트하기 위해 한 단계 더 나아간 연구가 극히 일부에 불과하다는 것을 발견했습니다. 단 3개의 연구만이 의사가 컴퓨터 논리의 특정 실패를 포착할 수 있는지 테스트했으며, 단 1개의 연구만이 의사가 시스템의 체계적인 편향을 인식할 수 있는지 테스트했습니다. 더욱 놀라운 점은, 새로운 상황에서 컴퓨터가 무엇을 할지 올바르게 예측할 수 있는지 테스트한 연구는 단 하나도 없었다는 것입니다. 이는 진정한 이해를 위한 근본적인 기술입니다.

이러한 증거는 현재의 연구 지형이 안전의 '메커니즘'보다 안전의 '느낌'을 우선시하고 있음을 시사합니다. 대부분의 연구는 실제 바쁜 병원이 아닌 통제되고 시뮬레이션된 환경에서 수행되었습니다. 이러한 시뮬레이션에서 의사들에게 컴퓨터의 정답과 오답이 모두 제시되었지만, 연구들은 의사가 잘못된 조언을 성공적으로 거부했는지 여부를 거의 측정하지 않았습니다. 대신, 그들은 의사가 (그 답이 맞든 틀리든 상관없이) 컴퓨터의 의견에 동의했는지 여부를 측정하곤 했습니다. 연구진은 의사가 시스템에 대해 높은 신뢰를 보고하면서도 여전히 위험한 권고를 맹목적으로 따를 수 있으며, 반대로 설명 때문에 혼란을 느끼면서도 컴퓨터를 무시함으로써 올바른 결정을 내릴 수도 있다는 점에 주목했습니다. 연구들이 전자의 경우, 즉 의사가 무엇을 느꼈는지에 너무 치중했기 때문에, 그 설명이 컴퓨터가 틀렸을 때 의사가 실수를 잡아내는 데 실제로 도움이 되었는지에 대한 증거는 거의 제공하지 못했습니다.

나아가, 데이터를 수집하는 방법 또한 취약한 경우가 많았습니다. 절반 이상의 측정치가 검증된 도구가 아닌 임의적인 질문이나 검증되지 않은 척도에 의존했습니다. 리뷰된 253개의 데이터 포인트 중 검증된 도구(신뢰도나 만족도와 같은 요소에 대한 표준적이고 신뢰할 수 있는 테스트)를 사용한 것은 단 10개뿐이었습니다. 대다수의 데이터는 의사들이 자신의 경험을 척도로 평가하는 간단한 설문조사에서 왔습니다. 또한 리뷰는 49개의 연구 중 실제로 배치되어 실제 임상 현장에서 사용되는 시스템을 다룬 연구는 단 2개뿐이라는 점을 강조했습니다. 나머지 연구들은 연구자에 의해 컴퓨터의 행동이 통제된 실험이었으며, 이는 의사가 시간 압박을 받거나, 피곤하거나, 복잡한 환자 사례를 다루고 있을 때도 그 설명이 유효하게 작동하는지 알 수 없음을 의미합니다.

저자들은 이러한 불균형이 잘못된 안전감을 조성한다고 주장합니다. 그들은 신뢰는 '태도'이지만, 감독은 '행동'이라는 점을 지적합니다. 의사는 시스템을 매우 신뢰할 수 있지만, 여전히 잘못된 권고를 거부하지 못할 수 있습니다. 설명이 진정으로 안전한지 알기 위해서는 구체적인 행동을 테스트해야 합니다. 의사가 다음에 컴퓨터가 무엇이라고 말할지 예측할 수 있는가? 컴퓨터가 틀렸을 때 실수를 찾아낼 수 있는가? 컴퓨터가 특정 환자 집단에 대해 편향을 보일 때 이를 인식할 수 있는가? 리뷰 결과, 이러한 구체적이고 안전에 직결된 기술들은 현재의 문헌에서 거의 완전히 누락되어 있었습니다. 연구들은 설명이 임상의에게 어떻게 느껴지는지는 보여주었지만, 기계가 실패했을 때 그 설명이 임상의가 업무를 더 잘 수행하도록 돕는지는 보여주지 못했습니다.

논문은 설명 가능한 인공지능이 진정으로 유용하고 안전해지기 위해서는 테스트 방식이 바뀌어야 한다고 결론짓습니다. 향후 연구는 의사에게 어떻게 느끼는지 묻는 것을 넘어, 그들이 실제로 무엇을 하는지 테스트해야 합니다. 이는 컴퓨터의 정답 여부를 조작하여 의사가 옳고 그름을 구별할 수 있는지 테스트하는 실험을 설계하는 것을 의미합니다. 또한 단순한 설문조사를 바탕으로 추측하는 것이 아니라, 입증되고 신뢰할 수 있는 도구를 사용하여 태도를 측정하는 것을 의미합니다. 마지막으로, 이 시스템들을 실제 세계에서 시간이 흐름에 따라 테스트하여, 이해관계가 높고 압박이 실재하는 상황에서도 설명이 올바른 의사결정을 계속 지원하는지 확인하는 것을 의미합니다. 이러한 변화가 일어나기 전까지, 의료계는 의사들이 설명을 얼마나 좋아하는지에 대한 명확한 그림은 가질 수 있겠지만, 그 설명이 실제로 환자를 안전하게 지켜준다는 증거는 거의 갖지 못할 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →