The standard genetic code's rank among randomized alternatives is not a property of the code
이 논문은 표준 유전 암호의 인지된 예외성이 내재적 속성이 아니라, 특정 돌연변이 스펙트럼과 비교에 사용된 요약 통계량에 따라 무작위 대안들 사이에서의 순위가 크게 변동한다는 점에서 통계적 인위물임을 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
생명은 네 개의 글자로 이루어진 언어로 쓰인 일련의 지침에 의존합니다. 모든 살아있는 세포에서, 코돈이라 불리는 세 글자 조합은 세포가 어떤 구성 요소를 단백질로 조립할지 알려주는 단어 역할을 합니다. 64개의 가능한 세 글자 조합이 존재하지만, 이들은 단 20가지의 서로 다른 구성 요소와 몇 개의 정지 신호만을 지정하면 됩니다. 자연은 이를 위해 표준 유전 암호라고 알려진 특정한 배열을 사용하며, 여기서는 대부분의 조합이 동일한 구성 요소를 가리킵니다. 수십 년 동안 과학자들은 이 배열이 특별한 것인지 궁금해해 왔습니다. 그들은 이 코드가 견고하게 설계되었다고 의심했습니다. 즉, 돌연변이가 단어의 한 글자를 바꾸더라도, 새로운 단어가 원래의 단어와 매우 유사하게 행동하는 구성 요소를 가리키도록 함으로써, 실수가 최종 단백질에 미치는 피해를 최소화한다는 것입니다.
이 아이디어를 테스트하기 위해, 연구자들은 전통적으로 표준 코드를 수천 개의 무작위 배열과 비교해 왔습니다. 그들은 다음과 같이 질문합니다. 만약 우리가 단어들을 무작위로 섞는다면, 표준 코드가 피해를 최소화하는 데 얼마나 자주 더 나은 성능을 보이는가? 35년 동안, 그 답은 하나의 인상적인 숫자로 제시되어 왔습니다. 모든 변화가 동일하게 발생한다고 가정하는 단순한 모델 아래에서, 표준 코드는 10,000개의 무작위 대안 중 9,998개보다 더 나은 것으로 나타났습니다. 과학자들이 더 현실적인 세부 사항, 즉 어떤 유형의 글자 변화는 다른 유형보다 더 자주 일어난다는 점을 추가했을 때, 표준 코드는 훨씬 더 독보적으로 보였으며 거의 모든 무작위 대안보다 우수해 보였습니다. 이는 코드가 진화에 의해 고정된, 거의 완벽한 해결책이라는 믿음으로 이어졌습니다.
그러나 독립 연구자인 루카스 지오바니 리베이로(Lucas Giovani Ribeiro)와 마르코스 안드레 시모니니(Marcos André Simonssini)의 새로운 연구는 이 단일한 숫자가 이야기의 일부만을 말해준다고 주장합니다. 그들은 유전 암호의 "독보적인" 지위가 코드 자체의 고정된 속성이 아니라, 변화하는 배경에 따라 측정되는 방식의 결과라고 주장합니다. 연구진은 수십 년간 사용된 이론적 모델에서 크게 벗어났습니다. 돌연변이가 발생하는 방식이 단일하고 균일하다고 가정하는 대신, 그들은 동물, 식물, 균류, 조류를 포함한 약 5,000종의 진핵생물에서 발견되는 실제 돌연변이 패턴을 살펴보았습니다. 각 계통은 자신만의 고유한 돌연변이 "스펙트럼"을 가지고 있으며, 이는 DNA에서 발생하는 구체적인 오류의 유형이 매우 다양함을 의미합니다.
연구팀은 각 종의 고유한 돌연변이 패턴을 해당 종의 테스트로 사용하여, 표준 유전 암호가 오류에 얼마나 잘 대처하는지 계산했습니다. 그들은 동일한 고정된 10,000개의 무작위 코드 세트를 모든 종에 대해 비교했습니다. 결과는 단일한 숫자가 아니라 넓은 분포였습니다. 약 22%의 종에 대해서는 표준 코드가 실제로 가장 좋은 배열이었으며, 어떤 무작위 대안도 이를 능가할 수 없었습니다. 그러나 다른 종들의 경우, 수백 개의 무작위 코드가 더 나은 성능을 보였습니다. 가장 극단적인 경우, 10,000개의 무작위 코드 중 341개가 표준 코드를 앞질렀습니다. 중앙값은 2였는데, 이는 35년 전의 유명한 숫자와 일치하지만, 연구진은 이 숫자가 2개 차수(orders of magnitude)에 걸쳐 펼쳐진 분포의 한 점일 뿐임을 보여줍니다.
이 연구는 이러한 결과를 해석하는 방식에 대한 놀라운 반전을 드러냅니다. 종의 돌연변이 패턴이 특정 유형의 흔한 오류 쪽으로 더 편향될수록, 표준 코드는 절대적인 측면에서 피해를 최소화하는 데 더 효과적이 됩니다. 그러나 동시에, 무작위 코드들의 성능 또한 더욱 다양해집니다. 무작위 코드들이 너무 넓게 퍼지기 때문에, 표준 코드는 덜 독특해 보이게 됩니다. 이는 마치 선수가 더 빨라지지만, 경기가 너무 혼란스러워져서 더 이상 독보적인 존재로 보이지 않는 것과 같습니다. 연구진은 돌연변이 편향이 증가함에 따라 표준 코드의 절대적인 이점은 커지지만, 대안들 사이에서의 순위는 떨어진다는 것을 발견했습니다. 즉, 높은 돌연변이 편향을 가진 계통은 코드로 인해 더 잘 보호되지만, 무작위 대안들의 혼돈과 비교했을 때 코드는 덜 "특별하게" 보인다는 뜻입니다.
이 논문은 또한 과학자들이 확인하기를 바랐던 두 가지 구체적인 아이디어에 이의를 제기합니다. 첫째, 그들은 CpG 사이트라고 알려진 특정 유형의 과돌연변이 DNA 서열이 이러한 차이의 주요 동력인지 테스트했습니다. 그들은 일반적인 돌연변이 편향을 고려했을 때, 이 특정 서열이 추가적인 보호 능력을 더하지 않는다는 것을 발견했습니다. 둘째, 그들은 만약 코드가 높은 돌연변이 편향에 최적화된다면 자연스럽게 표준 코드와 유사한 형태를 띠게 될지 확인하기 위해 시뮬레이션을 실행했습니다. 시뮬레이션 결과는 정반대였습니다. 강한 돌연변이 편향에 최적화된 코드들은 표준 코드와 유사해지지 않았습니다. 대신, 그들은 표준 코드와 덜 유사해졌습니다. 이는 표준 코드의 구조가 단순히 가장 흔한 유형의 돌연변이에 최적화된 결과라는 생각을 배제합니다.
연구진은 또한 돌연변이가 단백질 생성 과정을 조기에 종료시키는 "정지(stop)" 신호를 생성할 때 어떤 일이 일어나는지 살펴보았습니다. 그들은 표준 코드가 가능성의 단순한 횟수 측면에서는 이러한 오류를 방지하는 데 탁월하지만, 실제 종에서 이러한 오류가 얼마나 자주 발생하는지를 가중치를 두어 계산했을 때는 그만큼 놀랍지 않다는 것을 발견했습니다. 단순한 횟수와 가중치가 부여된 현실 사이의 이러한 괴리는 시스템의 여러 부분에서 나타나며, 이는 코드의 품질을 측정하는 방식이 우리가 얻는 답을 바꾼다는 것을 시사합니다.
궁극적으로, 이 연구는 유전 암호가 특별하지 않다고 말하는 것이 아닙니다. 그것의 특별함은 그것이 측정되는 맥락에 전적으로 달려 있다는 것입니다. 표준 코드는 견고하지만, 무작위 대안들 사이에서의 순위는 고정된 진리가 아닙니다. 그것은 연구되는 생물체의 돌연변이 패턴에 따라 변합니다. 이 분야를 수십 년간 정의해 온 유명한 숫자들은 틀린 것이 아니라 불완전한 것입니다. 그것들은 특정한 가정 하에서의 스냅샷을 나타냅니다. 그러한 가정들이 생물 전반의 무질서하고 다양한 현실로 대체될 때, 그림은 더 복잡해집니다. 코드는 좋은 해결책이지만, 그 위상은 코드 자체의 고정된 속성이 아니라, 코드와 그것이 직면하는 특정 오류 사이의 관계입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.