Information Entropy of Biological Data: An Empirical Analysis
본 논문은 여섯 가지 생물학적 데이터 양상에 걸친 통합적인 경험적 분석을 통해 유한 표본 편향이 정보 이론적 추정치를 심각하게 왜곡함을 입증하며, 편향 수정 방법이 뚜렷한 생물학적 신호를 드러내고 엔트로피의 체계적 과소 추정과 정보량의 과대 추정을 바로잡는다는 점을 고려할 때, 추정자와 표본 크기를 명시하지 않고 엔트로피와 상호 정보를 보고하는 것은 방어 불가능하다고 주장한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
생물학을 단순히 세포와 화학 물질의 집합체가 아니라, 방대한 정보가 담긴 시끄러운 도서관이라고 상상해 보십시오. 아주 작은 박테리아부터 인간에 이르기까지 모든 생명체는 끊임없이 메시지를 읽고, 쓰고, 전송합니다. 이러한 메시지에 얼마나 많은 '놀라움'이나 '다양성'이 존재하는지 이해하기 위해, 과학자들은 **엔트로피(entropy)**라는 수학적 도구를 사용합니다. 엔트로피를 메시지가 얼마나 예측 불가능한지를 측정하는 척도라고 생각하십시오. 만약 DNA 가닥이 똑같은 글자가 계속 반복되는 긴 문자열이라면, 그것은 엔트로피가 낮습니다(지루하고 예측 가능합니다). 만약 그것이 다양한 글자들이 혼합된 혼란스러운 상태라면, 엔트로피가 높습니다(놀라움으로 가득 차 있습니다).
엔트로피와 밀접하게 연관된 개념은 두 대상이 서로에 대해 얼마나 많은 것을 알려주는지를 측정하는 **상호 정보량(mutual information)**입니다. 만약 당신이 바깥 날씨를 안다면, 그것이 무엇을 입어야 할지 알려줍니까? 그렇습니다. 그것이 상호 정보량입니다. 만약 특정 유전자 서열을 안다면, 그것이 어떤 단백질을 만드는지 알려줍니까? 또한 그렇습니다. 과학자들이 이 도구들을 사랑하는 이유는 이것들이 생명의 규칙을 해독하는 데 도움을 주기 때문입니다. 하지만 여기에는 함정이 있습니다. 완벽하고 무한한 양의 데이터가 없을 때 이 도구들을 사용하는 것은 매우 까다롭다는 점입니다. 현실 세계에서 우리는 제한된 수의 샘플만을 가지고 있습니다. 이는 마치 거대한 아이스크림 가게의 맛을 단 몇 스쿱의 시식만으로 추측하려는 것과 같습니다. 주의를 기울이지 않는다면, 당신의 추측이 크게 틀릴 수도 있습니다. 그것은 아이스크림이 이상해서가 아니라, 당신의 샘플이 너무 적었기 때문일 수 있습니다.
이것이 알렉산더 메밍(Alexander Memming)이 새로운 연구에서 다루는 퍼즐입니다. 이 논문은 간단하지만 매우 중요한 질문을 던집니다. 과학자들이 생물학적 데이터에서 '정보'를 측정할 때, 그들이 발견한 것 중 얼마만큼이 실제 생물학적 현상이고, 얼마만큼이 샘한 데이터로 인해 발생하는 수학적 착시인가?
저자는 이를 테스트하기 위해 여섯 가지 다른 유형의 생물학적 데이터(DNA 서열, 단백질 구조, 유전자 활성, 그리고 우리 장 속에 사는 박테리아 군집 등)를 살펴보았습니다. 그는 단순히 데이터를 관찰한 것이 아니라, 동일한 데이터셋에 대해 여섯 가지 서로 다른 수학적 '추정량(estimator, 엔트로피를 계산하는 방법)'을 사용하여 대규모 실험을 수행했습니다. 어떤 방법이 진실을 말하고 있는지 확인하기 위해, 그는 정답을 이미 알고 있는 가상의 컴퓨터 생성 데이터를 사용하여 먼저 테스트를 진행했습니다.
결과는 놀라웠습니다. 연구에 따르면 가장 흔히 쓰이는 '나이브한(naive)' 계산 방식(이를 '플러그인(plug-in)' 추정법이라 부릅니다)은 종종 거짓말을 합니다. 과학자들이 작은 데이터셋에 이 단순한 방법을 사용할 때, 이 방법은 DNA와 단백질에 존재하는 엔트로피(다양성)를 체계적으로 과소평가하여, 실제보다 더 예측 가능한 것처럼 보이게 만듭니다. 반대로, 상호 정보량은 과대평가하여, 서로 관련이 없는 유전자나 단백질이 마치 서로 소통하고 있는 것처럼 보이게 만듭니다.
예를 들어, DNA의 세계에서 이 연구는 유전 암호가 약 1.9 비트(최대 가능치인 2 비트 대비)의 엔트로피율을 가지며 실제로 매우 복잡하다는 것을 확인했습니다. 그러나 나이브한 방법은 이를 약간 덜 복잡한 것처럼 보이게 했습니다. 단백질의 세계에서 오류는 엄청났습니다. 단순한 방법은 아미노산의 다양성을 약 12% 정도 과소평가했습니다. 유전자 네트워크의 경우, 나이브한 방법은 너무 편향되어 있어서 유전자들이 실제로 독립적임에도 불구하고 마치 상호작용하는 것처럼 보이는 '유령 연결(ghost connections)'을 만들어냈습니다. 연구는 더 나은 편향 수정 방법들을 사용함으로써 과학자들이 실제 신호를 회복할 수 있음을 보여주었습니다. 예를 들어, 단백질 접힘을 예측할 때, 수정된 방법들을 사용하면 접촉 예측의 정확도가 가장 좋은 방법의 경우 25%에서 67%로 크게 향상되었습니다.
또한 논문은 단일 세포를 조사하였으며, 세포가 전문화됨에 따라(줄기세포에서 특정 조직 유형으로 분화함에 따라) 내부의 '노이즈' 또는 엔트로피가 감소한다는 것을 발견했습니다. 이는 전문화된 세포가 더 예측 가능하다는 것을 확인해 줍니다. 나아가, 연구진은 가장 발전된 AI 모델조차 제거할 수 없는 약 2.3 비트의 유전자당 엔트로피라는 '바닥(floor)'을 발견했습니다. 이는 유전자 발현 방식에 있어 근본적이고 줄일 수 없는 무작위성이 존재함을 시사합니다.
궁극적으로 이 연구는 해당 분야에 대한 현실적인 점검 역할을 합니다. 편향은 무작위적인 것이 아니라, 데이터의 양과 존재하는 가능성의 수 사이의 관계에 따라 예측 가능한 패턴을 따릅다는 것을 증명합니다. 저자는 어떤 방법이 사용되었고 데이터가 얼마나 가용했는지를 밝히지 않고 엔트로피 수치를 보고하는 것은 더 이상 용납될 수 없다고 주장합니다. 기상 예보를 믿기 위해 어떤 도구가 사용되었는지 알아야 하는 것처럼, 우리는 샘플의 한계에 대해 수학적으로 어떻게 교정되었는지 알지 못한다면 생물학적 결론에 대한 정보의 신뢰성을 믿어서는 안 됩니다. 이 연구는 새로운 생물학을 발명하는 것이 아니라, 우리가 발견하는 생물학이 단지 작은 샘플 크기로 인해 만들어진 신기루가 아니라 실제임을 보장하기 위한 필요한 교정(calibration)을 제공합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.