← 최신 논문
📊 statistics

Formalising Sample Size Calculations for the Development of Risk Prediction Models: The Importance of Accounting for Performance Variability

이 논문은 기대 성능 지표를 목표로 하는 것을 넘어 성능 변동성을 명시적으로 고려함으로써, 수용 가능한 모델 보정 및 강건성을 달성할 높은 확률을 보장하는 위험 예측 모델 개발을 위한 새로운 표본 크기 계산 프레임워크를 제안한다.

원저자: Menelaos Pavlou, Rumana Z. Omar, Gareth Ambler

게시일 2026-07-16
📖 6 분 읽기🧠 심층 분석

원저자: Menelaos Pavlou, Rumana Z. Omar, Gareth Ambler

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 새로운 요리를 위한 완벽한 레시피를 만들려는 셰프라고 상상해 보십시오. 당신은 일련의 재료(예측 변수)를 가지고 있으며, 모든 사람이 맛보았을 때 정확히 옳은 맛이 나는 레시피(모델)를 만들어내고 싶어 합니다. 의학의 세계에서 이러한 '레시피'는 위험 예측 모델이라고 불립니다. 이 모델들은 연령, 체중, 병력과 같은 요소들을 바탕으로 환자에게 특정 건강 사건(심장마비나 감염 등)이 발생할 가능성이 얼마나 높은지 의사들이 추측하도록 돕습니다. 하지만 여기서 까다로운 점이 있습니다. 당신의 주방에서 만든 레시피가 아주 맛있는 결과물을 냈다고 해서, 다른 모든 주방에서도 똑같은 맛이 난다는 보장은 없다는 것입니다. 만약 당신이 레시피를 테스트하기 위해 단 몇 개의 배치(batch)만을 요리한다면, 운 좋게 완벽한 맛을 맞췄거나, 재료를 충분히 섞지 못해 이상하게 짠맛이 나는 배치를 얻었을 수도 있습니다. 이것이 바로 '변동성(variability)'의 문제입니다. 과학자들은 자신들의 레시피가 단순히 운 좋은 결과가 아니라 신뢰할 수 있다는 것을 확신하기 위해, 얼마나 많은 배치(또는 환자)를 테스트해야 하는지 정확히 알아야 합니다.

오랫동안 샘플 크기를 결정하는 표준적인 방법은 '평균적인' 완벽한 결과를 목표로 하는 것이었습니다. 이는 마치 "1,000번의 배치를 요리하면 평균적인 맛은 훌륭할 것이다"라고 말하는 것과 같았습니다. 하지만 이 논문의 저자인 메넬라오스 파블루(Menelaos Pavlou), 루마나 Z. 오마르(Rumana Z. Omar), 가레스 앰블러(Gareth Ambler)는 평균적인 맛을 목표로 하는 것만으로는 부족하다는 점을 깨달았습니다. 때로는 평균이 훌륭하더라도, 재료 운이 나쁘다는 이유만으로 완전히 먹을 수 없는 배치가 나올 수도 있기 때문입니다. 그들은 목표를 바꿔야 한다고 주장합니다. 단순히 평균이 좋기를 바라는 대신, 우리가 만드는 대부분의 배치가 실제로 맛있도록 만드는 것을 목표로 해야 한다는 것입니다. 그들은 이를 '수용 가능한 성능의 확률(Probability of Acceptable Performance)'이라고 부릅니다. 이는 "모든 배치의 평균이 훌륭하기를 바라는 것"이 아니라, "우리가 구워내는 개별 배치 중 80%가 훌륭한 맛이 날 확률이 80%가 되도록 충분한 양의 배치를 요리해야 한다"라고 말하는 것과 같습니다.

이 논문은 기존의 방식이 모델에 포함된 재료(예측 변수)가 적을 때 모델을 불안정하게 만들 수 있다고 지적합니다. 만약 두 가지 재료만 가지고 케이크를 구우려 한다면, 단순히 운 좋게 섞인 것이 아님을 확신하기 위해 훨씬 더 큰 주방(더 많은 데이터)이 필요합니다. 저자들은 컴퓨터 시뮬레이션을 통해, 만약 당신이 이 '변동성'을 무시한다면, 서류상으로는 좋아 보이지만 실제 세상에서는 실패하는 모델을 갖게 될 수도 있다는 것을 보여주었습니다. 그들은 이 위험을 고려한 새로운 방법을 제안하며, 이는 종종 모델의 견고함을 보장하기 위해 더 큰 샘플 크기를 요구합니다. 또한 '축소(shrinkage)'라고 불리는 기법, 즉 레시피를 조금 더 보수적으로 조정하는 것과 같은 기술을 살펴보고, 이것이 도움이 되기는 하지만 애초에 데이터가 충분하지 않다면 문제를 완전히 해결할 수는 없다는 점을 발견했습니다.

신뢰할 수 있는 예측을 위한 레시피

의료 예측 모델을 구축하는 것을 사진 속 고양이를 인식하도록 로봇을 훈련시키는 과정이라고 생각해 보십시오. 당신은 로봇에게 수천 장의 사진을 보여주며 패턴을 학습시킵니다. 만약 열 장의 사진만 보여준다면, 로봇은 그 특정 열 마리의 고양이를 완벽하게 외울 수는 있겠지만, 새로운 고양이를 보게 되면 완전히 실패할 수 있습니다. 이것을 '과적합(overfitting)'이라고 하며, 좋은 예측의 적입니다. 이를 피하기 위해 과학자들은 로봇에게 얼마나 많은 사진(환자)을 보여줘야 하는지 정확히 알아야 합니다.

논문은 얼마나 많은 환자가 필요한지를 결정하는 현재의 규칙이 **기댓값(expected value)**에 초점을 맞추고 있다는 점을 설명하며 시작합니다. 당신이 주사위를 던진다고 상상해 보십시오. '기댓값'은 주사위를 백만 번 던졌을 때 얻는 평균값(3.5)입니다. 기존 방식은 "평균이 3.5가 되도록 주사위를 충분히 던지자"라고 말합니다. 하지만 저자들은 한 가지 결함을 지적합니다. 만약 주사위를 열 번만 던진다면, 매번 6이 나올 수도 있고, 매번 1이 나올 수도 있습니다. 장기적으로는 평균이 3.5가 되겠지만, 당신의 특정 열 번의 투척은 재앙이 될 수 있습니다. 의료적인 관점에서 이는 어떤 모델이 여러 연구에 걸쳐 평균적으로는 완벽해 보일지라도, 바로 당신의 병원에서 구축한 특정 모델은 터무니없이 부정확할 수 있음을 의미합니다.

저자들은 PrAP(Probability of Acceptable Performance)라는 새로운 개념을 도입합니다. 단순히 평균을 신경 쓰는 대신, PrAP는 "우리가 지금 만들고 있는 이 모델이 충분히 좋은가?"라고 묻습니다. 그들은 '충분히 좋다'는 범위를 정의하는데, 예를 들어 교정 기울기(calibration slope)가 0.85에서 1.15 사이(1이 완벽함)인 경우입니다. 목표는 어떤 모델이든 '좋은' 영역에 들어올 확률이, 예를 들어 80%가 되도록 충분히 큰 샘플 크기를 선택하는 것입니다.

시뮬레이션 주방

그들의 아이디어를 테스트하기 위해 저자들은 단순히 추측하는 대신 수천 번의 컴퓨터 시뮬레이션을 실행했습니다. 그들은 4개에서 28개까지 다양한 수의 '재료'(예측 변수)를 가진 가상의 환자 데이터를 생성했습니다. 그들은 다음 두 가지 방식으로 샘플 크기를 결정하는 것을 비교했습니다:

  1. 표준 방식: 평균 성능이 0.9(완벽에 가까움)가 되도록 필요한 크기를 계산합니다.
  2. 새로운 방식: 성능이 0.85에서 1.15 사이가 될 확률이 80%가 되도록 계산합니다.

결과는 놀라웠습니다. 모델의 예측 변수가 적을 때(예: 4개 또는 5개), 표준 방식은 상대적으로 작은 샘플 크기를 제안했습니다. 그러나 실제로 시뮬레이션을 실행했을 때, 이 작은 샘플로 구축된 모델들은 매우 들쭉날쭉하다는 것을 발견했습니다. 때로는 훌륭했지만, 자주 엉망이 되었습니다. '좋은' 모델을 얻을 확률은 약 54%에 불과했습니다. 이는 기본적으로 동전 던지기와 같았습니다!

반면, 새로운 방식은 훨씬 더 큰 샘플 크기를 요구했습니다. 예측 변수가 4개인 모델의 경우, 새로운 방식은 표준 방식보다 2.7배 더 많은 환자를 요구했습니다. 하지만 그 대가는 엄청났습니다. 이 더 큰 샘플을 사용함으로써, '좋은' 모델을 얻을 확률이 목표치인 80%로 급증했습니다. 저자들은 모델의 예측 변수가 많을 때(18개 이상)는 두 방법이 비슷한 샘플 크기를 제안하지만, 더 작고 단순한 모델의 경우에는 그 차이가 매우 크다는 것을 발견했습니다.

"축소(Shrinkage)"라는 지름길?

논문은 또한 **축소(shrinkage)**라고 불리는 인기 있는 기술을 조사했습니다. 당신이 케이크를 구웠는데 너무 달다고 상상해 보십시오. 축소는 케이크를 더 안전하게 만들기 위해 설탕을 아주 조금 빼는 것과 같습니다. 통계학에서 이는 모델의 예측 강도를 약간 줄여 과도한 확신을 방지하는 것을 의미합니다.

저자들은 축소를 사용하는 것이 더 작은 샘플 크기로도 연구를 진행할 수 있게 해주는지 테스트했습니다. 그들은 축소가 평균적인 성능을 개선하여 모델을 완벽에 가깝게 만드는 데 도움이 된다는 것을 발견했습니다. 하지만 축소는 새로운 종류의 흔들림(wobble)을 유발하기도 합니다. 왜냐하면 얼마만큼 축소할지를 추정해야 하는데, 그 추정 자체가 자체적인 불확실성을 더하기 때문입니다. 시뮬레이션 결과, 축소가 좋은 모델을 얻을 확률을 높여주기는 하지만, 샘플 크기가 너무 작을 경우 문제를 완전히 해결하지는 못한다는 것을 보여주었습니다. 실제로 예측 변수가 6개 미만인 매우 작은 모델의 경우, 축소로 인한 추가적인 불확실성 때문에 좋은 모델을 얻을 확률이 크게 개선되지 않았습니다. 저자들은 축소가 유용한 도구이긴 하지만, 충분한 데이터를 수집하는 과정을 건너뛰기 위한 마법 지팡이로 사용되어서는 안 된다고 제ブ합니다.

실제 사례 테스트: 심장 판막 수술

그들의 이론이 단순히 컴퓨터 속의 환상이 아님을 증명하기 위해, 저자들은 16,679명의 환자 데이터를 사용하여 실제 데이터셋에 이 방법들을 적용했습니다. 그들은 입원 중 사망 위험을 예측하는 모델을 구축하고자 했습니다.

표준 방식을 사용했을 때, 그들은 2,250명의 환자가 필요하다고 계산했습니다. 새로운 PrAP 방식을 사용했을 때, 그들은 2,740명의 환자가 필요하다고 계산했습니다. 그런 다음 그들은 실제 데이터에서 이 그룹들을 반복적으로 샘플링하여 어떤 일이 일어나는지 확인하는 시뮬레이션을 실행했습니다.

결과는 그들의 의구심을 확인시켜 주었습니다. 2,250명의 환자 그룹(표준)은 중앙값 성능은 좋았지만, 모델들이 매우 다양하게 나타났습니다. 어떤 것은 훌륭했고, 어떤 것은 형편없었습니다. 2,740명의 환자 그룹(새로운 방식)은 훨씬 더 일관적이었습니다. 이 더 큰 그룹으로 구축된 거의 모든 모델이 '수용 가능한' 범위에 들어왔습니다. 또한, 축소를 결요에 포함했을 때, 더 큰 그룹(2,740명)은 신뢰성 면에서 명확한 개선을 보였으나, 작은 그룹은 별다른 이득을 보지 못했습니다.

핵심 요약

이 논문의 주요 메시지는 '평균적인' 결과에 대해 너무 안주하지 말라는 경고입니다. 생사가 달린 의료 예측의 세계에서, 개별 모델이 처참하게 실패할 수 있다면 평균적인 성공률은 충분하지 않습니다. 저자들은 진정으로 신뢰할 수 있는 위험 모델, 특히 재료(예측 변수)가 적은 모델을 구축하려면 연구자들이 더 많은 데이터를 수집할 의지가 있어야 한다고 제안합니다. 그들은 평균적인 성공이 아닌 성공의 확률을 우선시하는 새로운 샘플 크기 계산법을 제안합니다.

이것이 이전보다 더 많은 환자를 모아야 한다는 것을 의미할 수도 있지만, 그 대가는 안정적이고 신뢰할 수 있는 모델입니다. 저자들이 언급했듯이, 모델이 작동한다는 것을 80% 확신하고 싶다면 단순히 평균을 목표로 하는 것이 아니라, 안전 마진을 목표로 해야 합니다. 그들의 연구는 정확히 그렇게 할 수 있는 수학적 도구를 제공하며, 의사가 예측 모델에 의존할 때 그것이 단순히 운 좋은 추측이 아니라 잘 검증된 레시피임을 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →