Impact of Missing Data Imputation on The Structure of Real-World Clinical Datasets: A Comparison of Median, K-Nearest Neighbours, and MICE Approaches
본 연구는 k-최근접 이웃(KNN) 대체법이 다양한 결측 수준에 걸쳐 실제 임상 데이터셋의 분포적 충실도와 다변량 구조적 무결성을 보존하는 데 있어 중앙값 대체 및 연쇄 방정식에 의한 다중 대체(MICE)보다 더 우수한 성능을 보임을 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
의학 연구의 세계에서 데이터는 발견을 위한 생명선과 같습니다. 의사와 과학자들은 질병을 이해하고 치료를 개선하기 위해 환자의 병력, 검사 결과, 치료 결과의 기록에 의존합니다. 그러나 실제 의료 기록은 결코 완벽하지 않습니다. 환자가 진료 예약을 놓치기도 하고, 기계가 고장 나기도 하며, 의사가 단순히 특정 측정값을 기록하는 것을 잊어버리기도 합니다. 결측치라고 불리는 이러한 공백은 문제를 일으킵니다. 만약 연구자가 구멍이 뚫린 숫자 목록을 분석하려고 시도한다면, 그 결과는 오해를 불러일으키거나 계산 자체가 불가능할 수 있습니다. 이를 해결하기 위해 연구자들은 '대치(imputation)'라고 불리는 과정을 통해 빈칸을 채우곤 합니다. 가장 흔하고 단순한 방법은 특정 측정값에 대해 실제로 가지고 있는 모든 숫자들을 살펴보고, 그 중간값을 찾아 모든 빈 자리에 동일한 숫자를 붙여넣는 것입니다. 이 방법은 실행하기 쉽지만, 알려진 결함이 있습니다. 바로 데이터의 자연스러운 다양성을 밋밋하게 만들어, 다양한 환자 집단을 실제보다 더 동일한 것처럼 보이게 한다는 점입니다. 더 정교한 접근 방식은 복잡한 컴퓨터 모델을 사용하여 환자에 대한 다른 정보와 어떻게 연관되는지를 바탕으로 누락된 숫자가 무엇일지 추측하는 것입니다. 과학계가 직면한 질문은 단순한 방법이 충분히 좋은 것인지, 아니면 데이터를 정직하게 유지하기 위해 복잡한 방법이 필수적인 것인지 하는 점입니다.
스페인 발렌시아의 연구팀은 실제 의료 기록의 공백을 채우는 세 가지 서로 다른 방법을 테스트함으로써 이 질문에 답하고자 했습니다. 그들은 이론을 테스트하기 위해 가짜 데이터를 만들지 않았습니다. 대신 두 개의 커다로운 실제 환자 정보 컬렉션을 사용했습니다. 첫 번째 그룹은 폐 이식을 받은 408명의 환자로 구성되었으며, 이 과정에서 의사들은 수술 전, 중, 후에 수십 가지의 측정값을 추적합니다. 두 번째 그룹은 심장마비를 겪은 1,700명의 환자를 포함하며, 이들의 활력 징후와 병력이 상세히 기록되어 있습니다. 두 그룹 모두 많은 숫자가 누락되어 있었습니다. 폐 이식 그룹에서는 일부 측정값이 적게는 0.2%에서 많게는 77.9%의 환자에게서 누락되었습니다. 심장마비 그룹에서는 누락된 데이터가 0.24%에서 63% 이상까지 나타났습니다. 연구진은 이러한 빈칸을 채우는 어떤 방법이 원래 데이터의 진정한 형태와 관계를 가장 잘 보존하는지 확인하고자 했습니다.
연구팀은 세 가지 구체적인 전략을 비교했습니다. 첫 번째는 표준적인 단순 접근법으로, 모든 누락된 숫자를 실제로 기록된 숫자들의 중앙값, 즉 중간값으로 대체하는 것이었습니다. 두 번째 방법은 'k-최근접 이웃(k-nearest neighbours)'이라 불리는 방식으로, 데이터베이스에서 결측치가 있는 환자와 가장 유사한 환자들을 찾아 그들의 값을 사용하여 추측을 수행합니다. 세 번째는 '다중 대치(multiple imputation)'라고 알려진 매우 복잡한 통계 기법으로, 여러 가지 정교한 모델을 실행하여 누락된 데이터의 가능한 여러 버전을 생성한 다음 이를 평균 내는 방식입니다. 연구진은 채워진 데이터가 원래의 완전한 데이터와 얼마나 밀접하게 일치하는지를 숫자의 분포가 동일하게 보이는지 확인하는 통계적 자를 사용하여 측정했습니다. 또한 나이가 혈압과 어떻게 연관되는지와 같은 서로 다른 변수 간의 관계가 그대로 유지되는지도 확인했습니다.
결과는 가장 복잡한 방법이 항상 최고일 것이라고 예상하는 많은 이들에게 놀라움을 주었습니다. 중간값을 사용하는 단순한 방법은 실제로 데이터를 왜곡하여 숫자의 다양성을 압축하고 데이터셋을 실제보다 덜 다양하게 보이게 만들었습니다. 그러나 복잡한 다단계 통계 모델은 이 특정 테스트에서 훨씬 더 좋지 않은 성과를 냈습니다. 이 모델은 가장 큰 오류를 도입했으며 다른 어떤 방법보다 변수 간의 관계를 더 많이 변화시켰습니다. 가장 좋은 성과를 낸 방법은 k-최근접 이웃 접근법이었습니다. 이 방법은 데이터의 자연스러운 확산을 보존하고 서로 다른 의료 측정치 간의 관계를 단순 중간값 방법이나 복잡한 모델보다 더 정확하게 유지했습니다. 폐 이식 그룹에서 복잡한 모델은 약 39%의 변수를 왜곡한 반면, k-최근접 이웃 방법은 약 11%만을 왜곡했습니다. 심장마비 그룹에서도 복잡한 모델은 39%의 변수를 왜곡했으나, k-최근접 이웃 방법은 11%만을 왜곡했습니다.
연구진은 누락된 데이터의 양이 증가함에 따라 모든 방법이 실수를 저지르지만, k-최근접 이웃 방법은 훨씬 더 느리게 실수를 범한다는 것을 발견했습니다. 변수의 누락 비율이 높을 때, 단순 중간값 방법과 복잡한 모델은 모두 데이터를 실제처럼 보이게 유지하는 데 어려움을 겪었지만, k-최근접 이웃 방법은 더 잘 버텨냈습니다. 이는 복잡한 모델이 모든 개별 변수에 대해 완벽한 수학적 규칙을 세우려고 노력하기 때문인데, 변수가 많고 학습할 환자가 충분하지 않을 때는 이것이 어려워집니다. 반면 k-최근접 이웃 방법은 단순히 가장 유사한 환자들을 찾아 그들의 패턴을 복사하므로, 데이터가 지저분하거나 불완전할 때도 잘 작동합니다.
이 연구가 복잡한 통계 모델이 쓸모없다는 것을 시사하는 것은 아닙니다. 그 모델은 다른 목적, 즉 가능한 답변의 범위를 제공하고 실제 숫자를 알지 못하는 데서 오는 불확실성을 설명하기 위해 설계되었으며, 이는 특정 유형의 심층 통계 분석에 매우 중요합니다. 그러나 환자 집단을 묘사하거나 변수 간의 관계를 탐색하기 위해 단순히 깨끗하고 완전한 데이터셋이 필요한 많은 연구자에게 복잡한 모델은 과할 수 있으며 오히려 역효과를 낼 수 있습니다. 이 연구 결과는 단일하고 신뢰할 수 있는 버전의 의료 데이터셋을 만드는 데 있어 k-최근접 이웃 방법이 강력한 균형을 제공한다는 점을 시사합니다. 이 방법은 여전히 널리 사용되는 단순 중간값 방법보다 훨씬 더 정확하며, 연구자에게 요구되는 기술적 결정이 적어 복잡한 모델보다 사용하기 쉽습니다.
이 연구는 의학 과학을 위한 실질적인 교훈을 강조합니다. 때로는 가장 정교한 도구가 작업에 가장 적합한 것은 아닐 수 있습니다. 환자의 프로필이 독특하고 데이터가 종종 불완전한 병원 기록의 무질서한 현실 속에서는, 유사한 환자를 살펴 빈칸을 채우는 방법이 경직된 수학 공식보다 데이터의 진정한 이야기를 더 잘 보존할 수 있습니다. 적절한 도구를 선택함으로써, 연구자들은 자신이 발견한 패턴이 누락된 숫자를 수정하려고 시도한 방식의 결과물이 아니라, 연구 중인 환자들의 현실을 반영하도록 보장할 수 있습니다. 이 연구는 불필요한 복잡함에 빠지지 않고 데이터를 정직하게 유지하고자 하는 과학자들에게 명확한 길을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.