Cohen's f or Mean Standardized Differences? Assessing Covariate Balance with Multivalued Treatments
이 논문은 다중 처치에 대한 공변량 균형을 평가하기 위해 코헨의 f(Cohen's f)와 표준화된 평균 차이(SMD)를 확장하는 Stata 명령어를 소개하며, 시뮬레이션을 통해 코헨의 f가 평균 절대 SMD만큼 효과적으로 추정 편향을 추적하는 동시에 현재 널리 쓰이고 있으나 덜 최적인 최대 SMD 접근법에 대한 이론적 근거를 갖춘 대안임을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 미스터리를 해결하려는 탐정이라고 상상해 보십시오. "새로운 약이 실제로 환자를 낫게 했는가, 아니면 원래부터 건강했던 것인가?"라는 미스터지입니다. 의학 연구의 세계에서 과학자들은 진실을 찾기 위해 서로 다른 집단들(예를 들어 약 A, 약 B, 또는 플라세보를 복용하는 사람들)을 비교합니다. 하지만 함정이 하나 있습니다. 결과를 비교하기 전에, 그들은 먼저 집단들이 공정한지 확인해야 합니다. 만약 "약 A" 집단은 젊고 건강한 운동선수들로 가득 차 있고, "플라세보" 집단은 감기에 걸린 노인들로 가득 차 있다면, 그 비교는 깨진 것입니다. 이것을 **공변량 균형(covariate balance)**이라고 부릅니다.
오랫동안 과학자들이 단 두 개의 집단을 비교할 때, 그들은 공정성을 확인할 수 있는 완벽한 도구인 **표준화된 평균 차이(Standardized Mean Difference, SMD)**를 사용해 왔습니다. 이것은 두 집단의 평균 연령이나 건강 점수가 얼마나 떨어져 있는지를 측정하는 "공정성 자"와 같습니다. 만약 숫자가 작다면(예: 0.1), 집단은 균형 잡힌 것이고, 크다면 균형이 깨진 것입니다. 하지만 비교해야 할 집단이 세 개 이상이 되면 어떻게 될까요? 갑자기 기존의 자가 작동하지 않게 됩니다. 단순히 A와 B 사이의 거리를 재고, B와 C 사이를 잰 뒤 그것으로 결론 내릴 수는 없습니다. 여러 집단을 한꺼번에 아우르는 하나의 "옴니버스(omnibus)" 점수, 즉 전체 방의 공정성을 알려주는 마스터 게이지가 필요합니다. 지금까지 연구자들은 이러한 쌍별(pairwise) 측정값들을 어떻게 결합할지 추측하거나, 원래 다른 종류의 수학 문제를 위해 설계된 **코헨의 f(Cohen's f)**라는 통계적 도구를 사용해 왔습니다. 이 논문은 아주 단순하고도 결정적인 질문을 던집니다. 세 개 이상의 치료법을 비교할 때, 어떤 도구가 최고의 "공정성 자"인가?
위대한 공정성 자의 대결
이 연구에서 에리얼 린든(Ariel Linden) 박사는 "최고의 다중 집단 공정성 자"라는 타이틀을 놓고 두 주요 후보를 테스트하기 위해 거대한 디지털 시뮬레이션 실험실을 구축했습니다. 한쪽에는 기본적으로 "모든 차이의 평균" 방식인 현상 유지(Status Quo) 모델이 있습니다. 빨강, 파랑, 초록 세 팀이 있다고 가정해 봅시다. 현상 유지 방식은 빨강과 파랑 사이의 격차, 파랑과 초록 사이의 격차, 그리고 빨강과 초록 사이의 격차를 각각 측정합니다. 그런 다음 그 격차들을 평균하거나, 혹은 가장 큰 격차를 보고합니다. 이는 마치 선생님이 학생들의 키를 비교할 때, 모든 학생 쌍을 살펴보고 "그래, 학생들 간의 평균 키 차이는 작구나"라고 말하거나, "음, 가장 큰 아이와 작은 아이는 차이가 크니 이 반은 불균형하군"이라고 말하는 것과 같습니다.
다른 한쪽에는 수십 년 동안 존재해 왔으며 주로 실험의 분산을 분석하는 데 사용되는 고전적인 통계 도구인 코헨의 f가 있습니다. 린든 박사는 이 도구를 다중 집단을 위한 "공정성 자"로 재용도화할 수 있다는 점을 깨달았습니다. 코헨의 f는 단순히 차이를 평균 내는 대신, 차이들의 "제곱평균제곱근(root-mean-square)"을 계산합니다. 이를 재미있는 비유로 설명하자면, 현상 유지 방식이 그룹 내 러너들의 평균 속도를 구하는 것이라면, 코헨의 f는 그룹의 총 에너지를 계산하는 것과 같습니다. 이는 앞서 나가거나 뒤처진 러너들에게 더 많은 주의를 기울이되, 각 집단의 인원수에 따라 그 무게를 조절합니다.
시뮬레이션 경주
어떤 자가 실제로 작동하는지 확인하기 위해, 린든 박사는 단순히 실제 데이터를 들여다본 것이 아니라 가상의 세계를 창조했습니다. 그는 다양한 특성(정규 분포를 따르거나, 왜곡되었거나, 예/아니오 형태의 특성 등)을 가진 수천 명의 가상 환자를 생성하고, 이들을 3, 4, 또는 6개의 서로 다른 치료 집단에 배정했습니다. 그런 다음 특정 집단이 의도적으로 더 아프거나 더 건강하게 만들도록 하여 "교란(confounding)"—즉, 불공정함이라는 멋진 단어—을 도입했습니다. 그는 두 가지 조건 하에서 이 집단들을 테스트했습니다. 하나는 무작위 추첨처럼 완벽하게 균형 잡힌 상태였고, 다른 하나는 조작된 게임처럼 왜곡된 상태였습니다.
그 후 그는 이 집단들을 "성향 점수 가중치 부여(propensity score weighting)" 과정에 통과시켰습니다. 이것을 과소 대표된 사람들에게는 더 많은 가중치를 주고, 과다 대표된 사람들에게는 적은 가중치를 주어 집단을 다시 균형 있게 만드는 디지털 저울이라고 상상해 보십시오. 목표는 다음과 같았습니다: 어떤 자(코헨의 f 또는 평균/최대 SMD)가 최종 치료 결과가 실제로 편향되었는지를 더 잘 예측하는가?
결과: 공동 1위, 그러나 반전이 있다
시뮬레이션 결과는 매우 흥amos했습니다. 린든 박사가 각 자가 실제 "편향"(최종 의학적 결론의 오류)을 얼마나 잘 예측하는지 확인했을 때, 코헨의 f와 평균 SMD는 공동 1위를 차지했습니다.
- 상관관계: 두 도구 모두 편향을 추적하는 데 매우 뛰어났습니다. 집단이 불균형하면 두 수치 모두 올라갔고, 집단이 균형 잡히면 둘 다 내려갔습니다. 모든 데이터를 함께 보았을 때, 자의 점수와 실제 오류 사이의 상관관계는 두 방식 모두 약 0.93이었습니다. "올바르게 가중치가 부여된" 집단만을 보았을 때도 두 방식 모두 약 0.79 수준을 유지했습니다.
- 패배자: "최대 SMD"(가장 나쁜 한 쌍의 집단만을 골라내고 나머지는 무시하는 방식)가 가장 약했습니다. 이 방식은 전체적인 편향을 예측하는 데 있어 가장 신뢰도가 낮았습니다. 이는 마치 한 명의 학생이 시험을 망친 것에만 신경 쓰고 나머지 학생들은 잘 봤다는 사실은 무시하는 선생님과 같습니다. 하나의 나쁜 쌍에 너무 민감하여 전체적인 그림을 놓치는 것입니다.
그렇다면 코헨의 f가 모든 것을 대체할 마법의 탄환이라는 뜻일까요? 꼭 그렇지는 않습니다. 이 논문은 코헨의 f가 정확도 측면에서 "더 낫다"는 생각은 배제합니다. 코헨의 f는 기존 방식만큼 잘 작동합니다. 하지만 이 논문은 **척도(scale)**에 관한 매우 중요한 발견을 해냈습니다.
"사과와 오렌지" 문제
여기 가장 결정적인 발견이 있습니다: 코헨의 f에서 나온 숫자를 SMD에서 나온 숫자와 직접 비교해서는 안 됩니다.
온도계 두 개가 있다고 상상해 보십시오. 하나는 섭씨를 측정하고, 다른 하나는 화씨를 측정합니다. 섭씨 온도계에 "20"이라고 적혀 있다면 따뜻한 날씨라는 것을 알 수 있습니다. 하지만 화씨 온도계에 "20"이라고 적혀 있다면 매우 추운 날씨입니다! 단순히 "20은 둘 다 똑같아"라고 말할 수는 없습니다.
이 논문은 수학적으로 코헨의 f와 평균 SMD가 저 온도계들과 같다는 것을 증명합니다.
- 만약 3개의 집단이 있다면, 코헨의 f는 평균 SMD 크기의 약 0.63배가 됩니다.
- 만약 6개의 집단이 있다면, 코코헨의 f는 평균 SMD 크기의 약 0.77배가 됩니다.
이는 만약 어떤 연구자가 SMD가 0.10인 것을 보고 "좋아, 이건 작고 수용 가능한 불균형이야"라고 생각하는 데 익숙하다면, 코헨의 f가 0.10인 것을 보고 똑같이 생각해서는 안 된다는 것을 의미합니다. 실제로 코헨의 f가 0.10이라면, 집단 수에 따라 SMD 0.10보다 훨씬 더 큰 불균형을 나타낼 수도 있습니다. 이 논문은 코헨의 f에 대해 기존의 "0.10 규칙"을 직접 적용하는 것을 명시적으로 경고합니다.
"집단 크기"의 함정
한 가지 반전이 더 있습니다. 코헨의 f에는 기존 방식에는 없는 내장된 기능이 있습니다: 바로 집단의 크기에 따라 가중치를 부여한다는 점입니다.
- 큰 집단: 만약 가장 큰 집단(예: 환자의 80%)이 약간 불균형하다면, 코헨의 f는 이를 크게 소리 높여 알릴 것입니다.
- 작은 집단: 만약 아주 작은 집단(예: 환자의 5%)이 극도로 불균형하더라도, 코헨의 f는 그 집단의 인원수가 적기 때문에 작게 속삭일 것입니다.
논문은 심부전 연구의 실제 사례로 이를 설명합니다. 가중치를 부여하기 전, 가장 큰 불균형은 거대한 "대조군"과 작은 "원격 모니터링" 그룹 사이에서 발생했습니다. 기존 방식(평균 SMD)은 이를 큰 문제(0.134)로 보았습니다. 코헨의 f 역시 이를 포착했지만, 대조군이 매우 컸기 때문에 숫자가 더 작게(0.065) 나타났습니다. 두 방식 모두 집단이 불균형하다는 점에는 동의했지만, 숫자는 달랐습니다.
저자는 이러한 가중치 부여가 "실질적인 선택(substantive choice)"이라고 주장합니다. 만약 당신이 전체 인구에 관심이 있다면, 코헨의 f는 중요한 집단(큰 집단)에 집중하기 때문에 훌륭합니다. 하지만 만약 당신이 아주 적은 사람만이 받는 희귀한 치료법에 관심이 있다면, 코헨의 f는 그 소수의 사람들이 불공평한 대우를 받고 있다는 사실을 숨길 수도 있습니다.
결론
그렇다면 연구자는 무엇을 해야 할까요?
- 당황하지 마십시오: 코헨의 f는 다중 집단 연구에서 균형을 확인하기 위한 타당하고 이론적으로 근거가 확실한 도구입니다. 코헨의 f는 기존 방식만큼이나 편향을 잘 추적합니다.
- 자(ruler)를 혼동하지 마십시오: 코헨의 f에 대해 기존의 "0.10" 기준치를 절대 적용하지 마십시오. 두 숫자의 척도는 다릅니다.
- 내부를 들여다보십시오: 논문은 만약 코헨의 f를 사용한다면, 반드시 숫자의 **상세 내역(breakdown)**을 보고해야 한다고 권고합니다. "수준별(per-level)" 점수(각 특정 집단이 어떤 상태인지)와 "쌍별(pairwise)" 점수(각 쌍의 관계가 어떠한지)를 모두 확인해야 합니다. 단 하나의 "코헨의 f" 숫자만 본다면, 문제가 생긴 특정 집단을 놓칠 수 있습니다.
결국, 이 논문은 코헨의 f가 여러 집단을 동시에 바라보는 수학적으로 우아한 방법을 제공하며, 탐정의 도구 상자에 추가된 강력한 새 도구라고 제안합니다. 하지만 어떤 좋은 도구와 마찬가지로, 사용 설명서가 따릅니다. 눈금을 읽는 법을 익히고, 사건이 해결되었다고 선언하기 전에 항상 세부 사항을 확인하십시오.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.