← 최신 논문
💬 NLP

Agentic systems for breast cancer treatment recommendations

본 연구는 72건의 실제 임상 사례와 1,147개의 비대칭 루브릭을 사용하여 유방암 치료 권고를 위한 에이전트 기반 거대 언어 모델 시스템을 평가하였으며, 최적의 성능을 보인 구성이 0.594의 글로벌 점수를 달성했음에도 불구하고 지속적인 임상적 관련 실패가 나타남에 따라 이러한 시스템들이 현재 무감독 임상용으로는 불충분하다는 것을 밝혀냈다.

원저자: Vinicius Anjos de Almeida, Nícolas Henrique Borges, Leonardo Vicenzi, Helena Kociolek, Sarah Miriã de Castro Rocha, Frederico Nassif Gomes, Júlia Cristina Ferreira Ribeiro, Lucas Emanuel Silva e Olive
게시일 2026-07-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Vinicius Anjos de Almeida, Nícolas Henrique Borges, Leonardo Vicenzi, Helena Kociolek, Sarah Miriã de Castro Rocha, Frederico Nassif Gomes, Júlia Cristina Ferreira Ribeiro, Lucas Emanuel Silva e Oliveira

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 의사들이 유방암을 치료하는 최선의 방법을 결정하도록 돕는 궁극적인 "의료 슈퍼 브레인"을 구축하려고 한다고 상상해 보세요. 당신에게는 초기 단계부터 진행된 사례까지 포함된 72개의 실제 환자 이야기가 담긴 라이브러리가 있고, AI 로봇 팀이 이 이야기들을 읽고 완벽한 치료 계획을 작성할 수 있는지 확인하고 싶습니다. 이것이 바로 이 연구가 수행한 작업입니다.

연구진은 72개의 실제 임상 사례를 설정하고, AI의 답변을 채점하기 위한 1,147개의 구체적인 체크리스트(루브릭)를 만들었습니다. 이 체크리스트는 특별한 AI에 의해 만들어졌는데, 이 AI는 테스트를 받는 AI가 접근할 수 없었던 의사들의 실제 결정과 의학 서적들에 대한 정보에 접근할 수 있었습니다. 이 "비밀스러운 우위"는 채점이 공정하고 실제 의료 현실에 근거하도록 보장했습니다.

주요 발견: 로봇이 많다고 해서 항상 더 나은 두뇌가 되는 것은 아니다
팀은 일곱 가지 서로 다른 방식으로 AI를 구성하는 실험을 했습니다. 어떤 방식은 단순한 단일 모델이었고, 다른 방식은 한 명의 메인 로봇이 보스 역할을 하며 수술, 방사선 치료, 또는 약물 요법과 같은 특정 작업을 처리하기 위해 작은 로봇들을 고용하는 복잡한 "에이전트형(agentic)" 시스템이었습니다. 심지에는 이러한 로봇 팀 중 일부는 주장을 검증하기 위한 전담 "사실 확인(fact-checker)" 로봇을 갖추고 있었고, 일부는 추가적인 도움이 필요하다고 느끼면 즉석에서 새로운 로봇을 고용할 수도 있었습니다.

여기서 반전이 있습니다: 도구와 로봇을 더 많이 추가한다고 해서 AI가 자동으로 더 똑똑해지는 것은 아니었습니다.
실제로 어떤 모델들에게는 인터넷이나 PubMed(의학 데이터베이스)에 접근 권한을 주는 것이 오히려 그들의 업무 능력을 떨어뜨리기도 했습니다. 이는 마치 학생에게 도서관 카드와 계산기를 주었지만, 만약 그 학생이 질문을 제대로 던지거나 수학 계산을 확인할 줄 모른다면, 오히려 더 혼란스러워질 수 있는 것과 같습니다. 연구 결과, "최고의" 설정은 강력한 모델(Claude Opus 4.8)을 사용하면서 "분할 정복(Divide and Conquer)" 전략과 사실 확인 로봇, 그리고 새로운 조력자를 생성할 수 있는 능력을 결합한 특정 조합이었습니다. 그럼에도 불구하고, 이 최고 성능의 팀은 완벽한 1.0점 만점에 0.594 ± 0.025점을 기록했습니다.

"충분히 괜찮음"의 문제
이 논문은 이러한 AI 시스템이 의학적으로 타당해 보이는 권고안을 생성할 수는 있지만, 아직 병원에서 단독으로 작동하기에는 충분하지 않다고 시사합니다. 최고의 AI조차도 상당수의 기준을 충족하지 못했습니다.

인간 종양 전문의(암 전문 의사)가 최고 성능의 AI 답변을 자세히 검토했을 때, 그는 AI가 계속해서 실패하는 여덟 가지 구체적인 방식을 발견했습니다:

  1. 잘못된 근거 제시: AI가 정답은 맞혔지만 그 이유를 틀리게 설명했습니다 (예를 들어, "이 알약을 먹으세요"라고 하면서 실제 이유는 "암세포를 죽이기 때문"이 아니라 "이 알약이 파란색이기 때문"이라고 말하는 식입니다).
  2. 누락되거나 잘못된 조언: 필요한 치료법 제안을 잊어버리거나 위험한 치료법을 제안하기도 했습니다.
  3. 가짜 인용: 존재하지 않는 참고 문헌을 만들어내거나, 실제 논문이 말하지 않은 내용을 논문이 말했다고 주장했습니다.
  4. 과도한 자신감: 의학적 근거가 불확실하거나 환자의 정보가 누락된 상황에서도 100% 확신하는 듯한 태도를 보였습니다.
  5. 오래된 정보: 더 이상 표준 치료법이 아닌 치료법을 제안했습니다.

의사는 단 하나의 AI 생성 계획을 검토하는 데 약 1시간 35분을 썼습니다. 이는 만약 의사가 AI의 모든 제안을 이 정도로 일일이 재검토해야 한다면, 차라리 직접 일을 하는 것이 더 빠를 수도 있다는 점을 강조합니다.

"단계"의 놀라움
AI는 더 까다롭고 복잡한 사례(Stage III)보다 초기 단계 암(Stage I)에서 더 좋은 성과를 보였습니다. 이는 초기 단계 치료가 엄격하고 단순한 규칙을 따르는 경우가 많기 때문에 타당한 결과입니다. 하지만 암이 더 복잡해지면 AI는 길을 잃고, 수술, 방사선, 유전학을 동시에 다루는 데 어려움을 겪습니다.

이 논문이 배제하는 것
이 연구는 "더 복잡한 것이 항상 더 낫다"는 생각에 대해 명시적으로 반박합니다. 단순히 사실 확인 기능과 웹 검색 도구를 갖춘 멀티 에이전트 시스템을 구축한다고 해서 반드시 단순한 모델보다 뛰어난 성능을 내는 것은 아닙니다. 어떤 경우에는 추가된 복잡성이 새로운 오류를 유발하기도 했습니다. 또한 이 논문은 이러한 시스템들이 감독 없는 임상 사용에 준비되어 있다는 생각 또한 배제합니다. 즉, 아직 "플러그 앤 플레이(plug-and-play)" 방식의 솔션이 아닙니다.

우리는 얼마나 확신하는가?
저자들은 매우 신중한 언어를 사용하고 있습니다. 그들은 에이전트형 시스템이 유용할 수 있다고 제안하지만, 감독 없는 사용에는 여전히 불충분하다고 보고 있습니다. 그들은 엄격한 채점 시스템을 사용하여 점수를 측정했으며, 인간의 검토를 통해 구체적인 실패 양상을 관찰했습니다. 그들은 AI가 유방암 치료를 "해결했다"고 주장하거나, AI가 인간 의사보다 낫다고 주장하지 않았습니다. 대신, 기술이 유망하긴 하지만, 인간이 옆에서 지켜보지 않고도 생사가 걸린 결정을 내릴 수 있을 만큼 신뢰하기 위해서는 해결해야 할 큰 격차가 여전히 존재한다는 것을 발견했습니다.

요약하자면, 이 AI는 모든 책을 읽었지만 여전히 선임 의사가 숙제를 검사해 주어야 하는 매우 똑똑한 인턴과 같습니다. 왜냐하면 가끔 사실을 지어내기도 하고, 복잡한 사례에서 혼란을 느끼며, 자신의 실수에 대해 지나치게 자신만만하기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →