Do not log(x+1) transform: the bias and alternatives
이 논문은 널리 사용되는 log(x + 1) 변환이 특히 지수 분포를 따르는 데이터에 대해 상당한 편향과 오해의 소지가 있는 추론을 유발한다고 주장하며, 이를 일반화 선형 모델(GLM)과 같은 대안적인 수치적 방법으로 대체할 것을 권고한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
자연계에서 측정값은 종종 단순한 직선의 형태를 벗어나는 방식으로 행동합니다. 과학자들이 연못의 물고기 수를 세거나, 산림 캐노피의 높이를 측정하거나, 해양의 온도를 추적할 때, 데이터는 좀처럼 고르게 퍼지지 않습니다. 대신 작은 값은 흔하게 나타나고 큰 값은 드물게 나타나며, 이로 인해 비대칭적인 모양이 만들어져 표준적인 수학적 도구들이 패턴을 찾는 데 어려움을 겪게 됩니다. 이를 해결하기 위해 연구자들은 오랫동안 로그 변환(logarithmic transformation)이라는 수학적 기법에 의존해 왔습니다. 이 과정은 거대한 숫자는 압축하고 작은 숫자는 확장함으로써, 울퉁불퉁하고 불균형한 지형을 매끄럽고 평탄한 평원으로 바꾸어 관계를 명확하고 연구하기 쉽게 만듭니다. 그러나 이 기법은 데이터에 0이 포함될 때 커다란 벽에 부딪힙니다. 수학적 연산이 0을 처리할 수 없기 때문에, 과학자들은 전통적으로 모든 측정값에 아주 작은 임의의 숫자를 더하는 방식을 사용해 왔습니다. 수십 년 동안 가장 흔히 선택된 방법은 단순히 모든 값에 1을 더하는 것이었으며, 이는 log(x+1) 변환이라고 알려진 방식입니다. 이는 연구자들이 소중한 정보를 버리지 않고도 0의 빈도를 연구에 포함할 수 있게 해주는, 무해하고 실용적인 임시방편처럼 보였습니다.
포르투갈과 알가르브 대학교의 연구팀은 이제 이러한 오랜 습관이 근본적으로 결함이 있음을 보여주었습니다. 컴퓨터로 생성된 숫자와 실제 생태학적 데이터를 모두 사용하여 이 방법을 테스트함으로써, 데이터에 상수(constant)를 더하는 것이 단순히 0 문제를 해결하는 것에 그치지 않고, 진실을 능동적으로 왜곡한다는 것을 입증했습니다. 이 연구는 이러한 단순한 덧셈이 엄청난 편향을 도입하여 변수 간의 관계를 뒤틀고, 과학자들이 자연이 작동하는 방식에 대해 잘못된 결론을 내리게 만든다는 점을 밝혀냈습니다. 연구진은 이 왜곡이 사소한 오류가 아니라, 관계의 기울기를 변화시키고, 데이터의 실제 확산을 숨기며, 심지어 추세의 방향을 역전시킬 수도 있는 심각한 오류라는 것을 발견했습니다. 그들의 연구는 과학계가 즉시 이 특정 해결책의 사용을 중단하고, 데이터에 임의의 숫자를 더하는 데 의존하지 않는 더 견고한 방법을 찾아야 한다고 제안합니다.
자신의 주장을 증명하기 위해, 연구진은 먼저 두 변수 사이의 관계가 정확히 알려진 완벽한 인공 데이터셋을 만들었습니다. 그들은 한 변수가 다른 변수에 따라 지수적으로 성장하는 시나리오를 설계했는데, 이는 자연에서 흔히 나타나는 패턴이지만 실제 환경을 모사하기 위해 몇 개의 0 값을 포함했습니다. 이 완벽한 데이터에 표준적인 log(x+1) 변환을 적용했을 때, 결과 모델은 매우 부정확했습니다. 매끄럽고 예측 가능해야 했던 곡선은 굽어지고 깨져버렸습니다. 연구진은 숫자 '1'이 바로 그 원인임을 발견했습니다. 자연에서 흔히 발견되는 아주 작은 값들에 비해 1은 큰 숫자이기 때문에, 1을 더하는 행위는 실제 데이터를 완전히 압도해 버렸습니다. 매우 작은 측정값의 경우, 더해진 1이 지배적인 요인이 되어 미세한 차이들을 사라지게 만들었습니다. 더 큰 측정값의 경우에는 덧셈이 다른 효과를 내어, 수학적 모델이 교정할 수 없는 불일치를 만들어냈습니다. 연구진이 1 대신 훨씬 더 작은 숫자를 사용하더라도 문제는 지속되었습니다. 만약 너무 작은 숫자를 선택하면, 데이터의 0들이 나머지 데이터로부터 너무 멀리 떨어진 값으로 변환되어 새로운 종류의 왜곡을 일으키고 분석을 경로에서 벗어나게 만들었습니다.
연구팀은 그다음 인공 숫자를 넘어 해초의 개화와 포르투갈 하구의 수질에 관한 연구를 포함한 실제 생태학적 연구들을 조사했습니다. 해초 연구에서 연구자들은 상승하는 해양 온도가 어떻게 대규모의 꽃 피우기를 유발하는지 이해하려고 노력했습니다. 온도와 개화 사이의 관계는 명확하게 비선형적이었으며, 온도가 높아짐에 따라 더 빠르게 성장했습니다. 기존 연구자들이 이 데이터를 분석하기 위해 log(x+1) 방법을 사용했을 때, 결과 곡선은 반응의 실제 강도를 포착하는 데 실패했습니다. 그것은 정점(peak)을 평평하게 만들고 급격한 가속을 놓쳤습니다. 반면, 새 연구팀이 상수를 더하지 않는 다른 방법들을 사용하여 동일한 데이터를 재분석했을 때, 열과 개화 사이의 진실되고 날카로운 관계가 명확히 드러났습니다. 마찬가지로, 하구 연구에서 과학자들은 해초의 건강 상태를 결정하기 위해 지상부와 지하부 식물 바이오매스의 비율을 조사했습니다. 일부 식물은 성장하고 다른 식물은 줄어들고 있었기 때문에, 데이터에는 1보다 크거나 작은 값들이 모두 포함되어 있었습니다. log(x+1) 방식은 이러한 값들을 불균등하게 처리하여, 건강하게 자라는 식물은 압축하고 고전하는 식물은 과장함으로써 생태계 건강에 대한 왜곡된 시각을 초래했습니다. 연구진은 이러한 왜곡이 단순한 통계적 호기심이 아니라, 해초가 번성하고 있는지 아니면 죽어가고 있는지에 대한 해석을 바꾸어 놓는다는 것을 보여주었습니다.
연구팀은 또한 다른 일반적인 수학적 기법들이 이 문제를 해결할 수 있는지 테스트했습니다. 그들은 불균형한 데이터를 매끄럽게 만들기 위해 자주 사용되는 제곱근, 세제곱근 및 기타 복잡한 조정을 시도했습니다. 일부 대안들은 특정 상황에서 log(x+1) 방식보다 더 나은 성과를 보였지만, 데이터에 0이 포함되어 있고 지수적 패턴을 따를 때 문제를 완전히 해결할 수 있는 것은 없었습니다. 연구진은 데이터가 지수적인 방식으로 작동할 때, 숫자를 재구성하는 어떤 단순한 공식도 오류를 도입하지 않고는 표준 선형 모델에 맞출 수 없다는 것을 발견했습니다. 그러나 그들은 이것이 모든 변환이 실패할 운명이라는 의미는 아니라고 명시했습니다. 지수 모델을 엄격하게 따르지 않는 데이터셋의 경우, Box-Cox 변환과 같은 다른 방법들이 성공적일 수 있습니다. 이러한 특정 지수적 사례에서 논문은 최선의 해결책은 데이터를 억지로 직선에 맞추려 하지 않는 것이라고 결론짓습니다. 대신, 과학자들은 0을 직접 처리하고 임의의 숫자를 더할 필요 없이 지수적 성장을 다룰 수 있는 일반화 선형 모델(generalized linear models)과 같이 비선형 데이터에 특화된 통계 모델을 사용해야 합니다.
이 발견의 함의는 환경 과학 분야에서 매우 중요합니다. 환경 데이터에는 종의 부재나 검출되지 않는 오염 물질 등으로 인해 0이 포함되는 경우가 많기 때문입니다. 수년 동안 log(x+1) 변환은 이러한 0을 처리하기 위한 기본 도구로서 생물 다양성, 기후 변화, 오염에 관한 수많은 연구에서 사용되어 왔습니다. 연구진은 이러한 광범위한 사용이 관계의 강도를 과소 혹은 과대 평가하거나, 추세의 방향을 오해하게 만드는 등, 수많은 연구가 편향된 결과를 산출하도록 했을 가능성이 높다고 주장합니다. 이 편향은 미미한 것이 아니라, 연구의 결과를 바꿀 만큼 큽니다. 저자들은 log(x+1) 방식이 사용하기는 쉽지만, 타당한 과학적 해결책은 아니라고 강조합니다. 그들은 과학계가 이 관행을 버리고, 데이터의 진정한 본질을 존중하는 더 엄격한 방법들을 채택할 것을 촉구합니다. 그렇게 함으로써 연구자들은 자신들의 결론이 편리하지만 결함이 있는 지름길인 수학적 인공물이 아니라, 현실에 기반하고 있음을 보장할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.