← 최신 논문
💻 computer science

AI Evaluation of Expert Testimony in Medical Malpractice

이 연구는 AI 도구가 관련 의학 문헌을 신속하게 검색할 수 있으며, 특히 피고 측 전문가가 원고 측 전문가보다 발표된 데이터와 상충하는 경우가 더 빈번하다는 점을 강조하며 의료 과실 사건 내 전문가 증언에서 근거로부터의 유의미한 일탈을 효과적으로 탐지할 수 있음을 입증한다.

원저자: Mayer Brezis

게시일 2026-07-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mayer Brezis

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

법정을 마치 "진실 혹은 대가"라는 이름의 고액의 판돈이 걸린 게임이라고 상상해 보십시오. 두 팀의 변호사들이 의료 사고에 무엇이 잘못되었는지 설명하기 위해 각자의 개인적인 "구루(guru)"를 데려옵니다. 이 구루들은 의학 전문가들로, 판사와 배심원에게 의학 교과서에 적힌 내용을 정확히 전달해야 하는 중립적인 과학자들입니다. 하지만 여기 함정이 있습니다. 인간은 까다롭습니다. 스포츠 팬이 자신이 응원하는 팀이 승리하는 데 도움이 된 플레이만을 기억하려는 것처럼, 이 전문가들도 자신의 측면을 더 돋보이게 하기 위해 사실을 골라내는 '체리 피킹(cherry-picking)'을 하기도 합니다. 이것을 "편향(bias)"이라고 부릅니다.

이를 해결하기 위해 법조계는 새로운 종류의 심판인 인공지능(AI)을 사용하려고 노력해 왔습니다. AI를 세상에 존재하는 모든 의학 연구를 읽은 초고속 사서라고 생각해 보십시오. 의욕이나 의도를 가진 인간 전문가와 달리, 이 디지털 사서는 몇 초 만에 수백만 페이지를 스캔하여 "골드 스탠다드(표준)" 증거를 찾아낼 수 있습니다. 큰 질문은 간단했습니다. 이 똑똑한 AI가 인간 전문가가 진실을 왜곡하는 것을 포착할 수 있을 것인가? 그리고 만약 AI가 한 가지를 말하고 인간 전문가가 다른 것을 말한다면, 실제로 누가 옳은 것일까?


AI 대 인간 전문가: 탐정 이야기

이 연구에서 연구진은 이 아이디어를 테스트하기로 했습니다. 그들은 디지털 탐정이 되어 두 가지 강력한 AI 도구인 Claude와 OpenEvidence를 사용하여 미국, 영국, 캐나다, 호주의 실제 의료 과실 사건들을 검토했습니다. 그들의 임무는 문헌 속에 숨겨진 "진짜" 의학적 사실을 빠르게 찾아내어, 그것을 실제 법정에서 인간 전문가들이 말했던 내용과 비교하는 것이었습니다.

연구진은 전문가의 증언이 실제 과학적 증거로부터 얼마나 벗어나 있는지를 등급 매기기 위해 **L-스케일(L-scale)**이라 불리는 특별한 "거짓말 탐지기" 척도를 만들었습니다.

  • 1단계 (L1): 전문가는 이용 가능한 가장 강력한 증거를 사용하며 완벽하게 궤도에 올라와 있음.
  • 2단계 (L2): 전문가는 대체로 옳지만, 약간 모호하거나 인용이 누락되었을 수 있음.
  • 3단계 (L3): 전문가는 궤도에서 벗어나고 있으며, 발표된 연구들이 실제로 뒷받침하지 않는 주장을 하고 있음.
  • 4단계 (L4): 전문가는 증거와 완전히 모순되거나, 심지어 사실을 지어내고 있음.

결과: 피고 측 팀의 고전

AI 도구들이 분석을 실행했을 때, 결과는 놀라웠습니다. 대다수의 경우, AI는 인간 판사들이 수년간 숙고해 온 답변을 단 몇 초 또는 몇 분 만에 찾아낼 수 있었습니다. 하지만 진짜 이야기는 전문가들의 행동에 있었습니다.

AI는 거대한 불균형을 발견했습니다. 피고(소송을 당한 의사 또는 병원)가 고용한 전문가들을 조사했을 때, AI는 그들이 종종 목표에서 크게 벗어나 있다는 것을 발견했습니다. 페이즈 2 샘플에서, 무려 **88%**의 피고 측 전문가들이 발표된 증거로부터 "명확한 일탈(clear deviation)"을 보였습니다 (L3 또는 L4 점수). 페이즈 3 샘플에서는 그 수치가 **73%**였습니다. 더욱 심각하게도, 페이즈 3의 피고 측 전문가 중 **55%**는 "심각한 일탈(severe deviation)" 구역(L4)에 속해 있었는데, 이는 그들의 증언이 과학에 의해 명백히 반박되었음을 의미합니다.

반면, 원고(환자 측)가 고용한 전문가들은 진실에 훨씬 가까웠습니다. 페이즈 2에서 원고 측 전문가의 **40%**만이, 페이즈 3에서는 **0%**만이 명확한 일탈을 보였습니다. 그 차이가 너무나 컸기 때문에 연구진은 이것이 단순한 우연이 아님을 확신했습니다. 데이터는 피고 측 전문가들이 원고 측 전문가보다 일관되게 과학적 증거에서 더 멀리 떨어져 있다는 명확한 패턴을 보여주었습니다.

AI가 맞았을까?

여러분은 "AI가 그냥 말을 지어낸 것이 아니라는 것을 어떻게 알 수 있는가?"라고 궁금해할 수 있습니다. 연구진은 여러 가지 검증 과정을 거쳤습니다. 그들은 AI의 답변들을 서로 비교했고, AI에 사건에 대한 다른 세부 정보를 입력했을 때 AI가 생각을 바꾸는지 확인했습니다. AI 도구들은 90% 이상의 확률로 서로 일치했습니다. 또한, AI가 명확한 과학적 답변을 찾아낸 사례의 **91%**에서, 그 답변은 법원의 최종 판결과 일치했습니다. 이는 AI의 "슈퍼 사서" 방식이, 인간 전문가가 진실을 숨기려 할 때조차 진실을 찾는 데 매우 유능했음을 시사합니다.

이것이 의미하는 바 (그리고 의미하지 않는 것)

이 연구는 AI 도구가 법 체계의 게임 체인저가 될 수 있음을 시사합니다. 변호사들이 재판이 시작되기도 전에 AI를 사용하여 전문가의 의견이 과학적 근거를 갖추고 있는지, 아니면 단순히 "말장난(spin)"인지 빠르게 확인할 수 있는 세상을 상상해 보십시오. 이는 사건을 더 빨리 해결하고, 비용을 절감하며, 초점이 '누가 더 설득력 있는 전문가를 고용할 수 있는가'가 아니라 '실제 의학적 사실'에 머물도록 도울 수 있습니다.

하지만 저자들은 이것이 마법의 지팡이는 아니라고 주의를 기울입니다. 그들은 AI가 완벽하지 않으며, 인간이 지켜보지 않으면 여전히 실수하거나 "환각(hallucinate)"을 일으킬 수 있다고 언급합니다. 또한, 이 연구는 AI가 읽을 수 있을 만큼 사실관계가 명확한 특정 유형의 사건들을 대상으로 했습니다. 이 연구는 모든 법적 문제를 해결하지 못했으며, AI가 인간 판사를 대체해야 한다고 입증한 것도 아닙니다. 그러나 이 연구는 강력한 점 하나를 시사했습니다. 혼란스러운 의료 소송의 세계에서, 디지털 도구가 어쩌면 우리가 가진 가장 정직한 심판이 될 수도 있다는 사실입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →