Position: Medical AI Neglects Real Treatment Outcomes
본 입장 논문은 의료용 AI가 관찰 및 실험적 소스로부터 도출된 실제 치료 결과 데이터보다는 인간의 의견과 텍스트 요약에 의존하고 있다는 점이 그 잠재력을 심각하게 제한하고 있으며, 환자의 건강 개선이라는 궁극적인 목표를 더 잘 달성하기 위해서는 훈련과 평가 모두에 실세계 결과 데이터를 통합하는 방향으로 전환이 필요하다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
의학은 언제나 좋은 추측과 생명을 구하는 결정 사이의 차이가 데이터에 달려 있는 분야였습니다. 수십 년 동안 의사들은 개별 전문가의 직관에만 의존하던 방식에서 벗어나, 수천 명의 환자가 축적한 집단적 경험을 기반으로 한 시스템으로 전환해 왔습니다. '근거 기반 의학(evidence-based medicine)'이라 불리는 이 접근법은 모든 결정을 단순히 그 뒤에 숨겨진 이론이 아니라, 치료의 실제 결과에 근거하여 내리고자 합니다. 이는 약물이 무엇을 하기로 되어 있는지가 아니라, 그 약을 복용한 사람들에게 실제로 어떤 일이 일어났는지를 묻는 시스템입니다. 최근 몇 년 사이, 인공지능이라는 새로운 도구가 이 지형에 등장했습니다. 흔히 거대 언어 모델(large language models)이라 불리는 이 컴퓨터 시스템들은 의료 텍스트를 읽고, 질병을 진단하며, 미래의 건강 위험을 예측하는 데 놀라운 능력을 보여주었습니다. 이들은 방대한 양의 의학 저널, 교과서, 임상 가이드라인을 학습하며 인간 전문가의 언어와 추론 방식을 모방하도록 훈련되었습니다.
하지만 이러한 지능형 시스템이 구축되고 테스트되는 방식에는 중대한 격차가 발생했습니다. 이 시스템들이 질병을 식별하거나 누가 병에 걸릴지 예측하는 능력은 향 만큼, 자신이 권고하는 치료가 가져올 진정한 결과가 무엇인지를 이해하도록 교육받지는 못하고 있습니다. 오늘날 연구자들이 직면한 핵심 질문은, 이 기계들이 의학 서적에 쓰인 이야기로부터 배우고 있는 것인지, 아니면 환자의 결과라는 실제적이고 때로는 혼란스러운 현실로부터 배우고 있는 것인지 하는 점입니다. 만약 AI가 전문가의 의견과 가이드라인에 적힌 규칙만을 학습한다면, 그것은 실제 인간에게 치료가 적용되었을 때 어떤 일이 발생하는지를 진정으로 이해하지 못한 채, 단지 의사처럼 말하는 법만을 배울 수 있습니다. 이러한 차이는 단순한 학술적 세부 사항이 아닙니다. 이는 규칙을 암송하는 시스템과 건강을 실질적으로 개선할 수 있는 시스템 사이의 차이입니다.
새로운 포지션 페이퍼(position paper)는 현재 세대의 의료 인공지능이 실제 치료 결과로부터 배우는 데 실패하고 있다고 주장합니다. 하버드 필그림 헬스케어 연구소(Harvard Pilgrim Health Care Institute)와 하버드 의과대학(Harvard Medical School)의 연구진인 저자들은, 이 모델들이 방대한 양의 의학 텍스트를 제공받고 있음에도 불구하고 가장 중요한 데이터, 즉 치료를 받은 후 환자들에게 실제로 어떤 일이 일어났는지에 대한 기록을 놓치고 있다고 단언합니다. 이 논문은 학계가 진단이나 위험 예측과 같은 중간 단계에 너무 집중한 나머지, 의학의 궁극적인 목표인 '치료를 통한 환자의 건강 증진'을 소홀히 하고 있다고 제안합니다. 연구진은 대부분의 의료 AI 모델이 임상 가이드라인, 약물 라벨, 발표된 사례 보고서와 같은 정적인 문서들을 바탕으로 훈련된다는 점을 지적합니다. 이러한 자료들은 특정 시점에서의 의료계의 합의를 나타내지만, 다양한 인구 집단에서 시간이 흐름에 따라 치료가 어떻게 전개되는지에 대한 역동적이고 종단적인 현실을 담아내지는 못합니다.
이러한 정적인 자료에 의존하는 위험성을 설명하기 위해, 연구진은 현재의 AI 모델이 복잡한 의료 시나리오를 어떻게 다루는지 조사했습니다. 그들은 이바카프토르(ivacaftor)라는 약물로 성공적으로 치료된 희귀 췌장염 환자의 특정 사례를 살펴보았습니다. 현실 세계에서 이 치료는 효과가 있었지만, 많은 AI 시스템을 훈련시키는 데 사용되는 정부 승인 문서인 공식 약물 라벨에는 이 특정 용도가 기재되어 있지 않았습니다. 연구진이 AI 모델에게 이 환자에게 해당 약물의 효용성을 평가하도록 요청했을 때, 공식 라벨에 의존한 모델은 해당 약물이 효과가 없을 것이라고 잘못 결론지었습니다. 모델은 환자의 회복이라는 실제 결과보다는 책에 적힌 규칙을 따랐던 것입니다. 이 오류는 AI가 성공적인 치료를 기술한 사례 보고서에 접근할 수 있었음에도 불구하고 발생했습니다. 즉, 모델의 훈련 과정에서 경직된 약물 라벨이 실제 결과의 증거를 압도해 버린 것입니다. 연구진은 이 문제가 광범위하게 나타난다는 것을 발견했습니다. 그들이 다른 모델들을 유사한 임상 가이드라인 관련 시나리오에 대입해 테스트했을 때, 시스템들은 의사가 특정 환자를 돕기 위해 표준 규칙에서 벗어나야 하는 복잡한 상황을 인식하지 못하는 경우가 많았습니다.
논문은 또한 이러한 AI 시스템이 평가되는 방식이 문제의 일부라고 강조합니다. 많은 벤치마크, 즉 AI의 성능을 측정하는 데 사용되는 테스트들은 인간 전문가가 답변을 채점하는 방식에 의존합니다. 연구진은 의사 그룹이 답변에 동의하는 것이 곧 진실을 아는 것과 같지는 않다고 주장합니다. 한 분석에서, 그들은 AI의 답변을 채점하는 기준의 상당 부분이 실제 임상적 성공의 반영이 아니라, 단순히 가이드라인을 직접 인용한 것이라는 점을 발견했습니다. 이는 AI가 가이드라인을 바탕으로 훈련되고, 가이드라인을 기준으로 테스트되며, 가이드라인을 따랐다는 이유로 찬사를 받는 순환 논리를 만듭니다. 설령 그 가이드라인이 시대에 뒤떨어졌거나 모든 개인에게 적용되지 않더라도 말입니다. 연구진은 이러한 접근 방식이 인공지능이 이미 쓰인 내용을 반복하는 수준을 넘어, 새로운 통찰력을 발견할 수 있는 진정한 의학의 파트너가 되는 잠재력을 제한한다고 제사합니다.
저자들은 의료 AI가 개발되는 방식에 대한 근본적인 변화를 제안합니다. 이들은 이러한 시스템을 주로 텍스트로 훈련시키는 대신, 어떤 치료가 시행되었고 그 후에 환자들에게 어떤 일이 일해졌는지를 추적하는 전자 건강 기록(EHR)이나 보험 청구 데이터와 같은 종단적 환자 데이터를 사용할 것을 권고합니다. 이러한 기록들은 치료와 환자의 회복 또는 악화 사이의 인과관계를 보여주는 실세계 증거(real-world evidence)의 원재료를 담고 있습니다. 연구진은 또한 이러한 모델의 테스트가 가이드라인을 암송하도록 요구하는 것에서 벗어나, 실제 세계의 실험 결과를 예측하거나 임상 시험의 결과를 모사하도록 요구하는 방향으로 나아가야 한다고 제안합니다. 훈련과 평가의 근거를 실제 환자의 결과에 둠으로써, 의료 분야는 인공지능이 단순히 이론적으로 타당한 결정을 내리는 것을 넘어, 눈앞에 있는 사람들에게 실질적으로 효과적인 결정을 내릴 수 있도록 도울 수 있는 미래로 나아갈 수 있습니다.
이 논문은 현재의 의료 AI가 쓸모없다거나 기존의 벤치마크가 완전히 가치 없다고 주장하는 것이 아닙니다. 연구진은 이러한 도구들이 빠른 발전을 이루었으며 진단 및 정보 검색 분야에서 가치 있는 능력을 입증했다는 점을 인정합니다. 그러나 그들은 동일한 방식의 훈련과 평가에 계속 의존하는 것은 다음 단계의 도약을 가로막을 것이라고 주장합니다. 목표는 의학 문헌에 담긴 지식을 폐기하는 것이 아니라, 그 지식을 사용하는 인공지능 시스템이 환자 케어의 현실에도 뿌리를 내리게 하는 것입니다. 연구진은 실제 치료 결과를 개발의 핵심에 통합함으로써, 의료 AI가 규칙을 읽는 시스템에서 결과의 의미를 이해하는 시스템으로 진화하여, 궁극적으로 더 나은 가이드라인을 작성하고 전 세계 환자들의 건강을 개선할 수 있을 것이라고 믿습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.