← 최신 논문
💻 bioinformatics

Additive-input encoding fails operator-level target-held-out prediction on current Perturb-seq screens

본 연구는 현재의 Perturb-seq 스크리닝에 사용되는 가산 입력 인코딩 모델(additive-input encoding models)이 새로운 홀드아웃 섭동 대상(held-out perturbation targets)으로 일반화하는 데 실패함을 입증하며, 이는 추론된 조절 연산자(regulatory operators)가 수학적 식별 가능성(mathematical identifiability)에도 불구하고 보지 못한 유전자에 대한 반응을 예측하는 데 검증되지 않았음을 드러낸다.

원저자: Fullmer, K., Kutzen, D., Terooatea, T. W.

게시일 2026-10-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Fullmer, K., Kutzen, D., Terooatea, T. W.

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

과학자들이 세포 내의 개별 유전자를 하나씩 끄고 그 결과가 어떻게 변하는지 동시에 관찰할 수 있는 세상을 상상해 보십시오. 이것이 바로 퍼터브-seq(Perturb-seq)이라 불리는 기술이 약속하는 미래입니다. 특정 유전자를 침묵시키는 분자 도구를 사용하고 그 후 세포의 전체적인 유전적 반응을 읽어냄으로써, 연구자들은 유전자들이 서로 어떻게 대화하는지에 대한 지도를 구축하고자 합니다. 궁극적인 목표는 생명의 숨겨진 규칙, 즉 하나의 실을 잡아당겼을 때 어떤 다른 실들이 팽팽해지고 어떤 것들이 느슨해지는지를 이해하는 것입니다. 수년 동안 이러한 거대한 실험을 해석하는 표준적인 방식은 세포의 반응이 단순히 부분들의 합이라고 가정하는 것이었습니다. 만약 유전자 A를 끄면 특정한 양의 변화가 더해지고, 유전자 B를 끄면 또 다른 특정한 양이 더해진다는 생각입니다. 만약 두 유전자를 모두 끈다면, 그 결과는 단지 이 두 변화를 더한 값이 되어야 한다는 것입니다. 이 "가산적(additive)" 관점은 수학적으로 깔끔하고 계산하기 쉬워, 과학자들이 세포 내부 배선의 마스터 제어 지도를 추론할 수 있게 해주기 때문에 매력적입니다.

하지만 브리검 영 대학교(Briggan Young University) 연구진의 새로운 연구는 이 단순한 가산 모델을 실제 생물학적 데이터에 적용했을 때 근본적으로 무너질 수 있음을 시사합니다. 카일러 풀머(Kyler Fullmer), 달튼 쿠첸(Dalton Kutzen), 토미 W. 테로테아(Tommy W. Terooatea)가 이끄는 연구팀은 지금까지 수행된 가장 크고 존경받는 유전자 침묵 실험 중 세 가지를 가져와, 가산 모델이 연구자들이 한 번도 본 적 없는 유전자에 어떤 일이 일어날지 실제로 예측할 수 있는지 테스트했습니다. 그들은 단순히 데이터를 살펴보는 데 그치지 않고, 모델이 일반화될 수 있는지 확인하기 위해 엄격한 테스트 환경을 구축했습니다. 그들은 명확한 질문을 던졌습니다. 만약 컴퓨터가 알려진 유전자 집합으로부터 게임의 규칙을 학습한다면, 한 번도 접해보지 못한 새로운 유전자에 대한 결과를 올바르게 추측할 수 있는가?

그 결과는 "아니오"라는 확고한 답변이었습니다. 연구진이 가산 모델을 사용하여 보지 못한 유전자의 행동을 예측하려 했을 때, 모델은 완전히 실패했습니다. 사실, 이 모델은 아무것도 변하지 않을 것이라고 단순히 추측하는 사람보다도 나은 성과를 내지 못했습니다. 이러한 실패가 단순히 데이터가 지저분해서 발생한 우연이거나 오류가 아님을 확실히 하기 위해, 연구팀은 완벽한 시뮬레이션을 만들었습니다. 그들은 이론이 주장하는 대로 규칙이 완벽하게 가산적인 가짜 데이터를 생성했습니다. 이 가짜 데이터에 모델을 실행했을 때, 모델은 숨겨진 규칙을 높은 정확도로 아름답게 복구해 냈습니다. 이는 그들의 테스트 방법이 타당하며 컴퓨터가 학습할 능력이 있다는 것을 증명했습니다. 따라서 문제는 수학이나 데이터의 노이즈가 아니라, 실제 세포가 단순한 합처럼 작동한다는 가정 자체에 있었습니다.

연구진은 세 가지 서로 다른 데이터 세트를 테스트했습니다. 두 개는 접시에서 배양된 인간 세포를 포함한 대규모 스크린이었고, 하나는 유전자 침묵의 다양한 용량을 테스트한 것이었습니다. 모든 경우에서, 유전자가 단순히 효과를 더한다고 가정하는 모델은 새로운 유전자의 결과를 예측할 수 없었습니다. 오차율이 너무 높아서 모델의 예측은 무작위 추측과 구별할 수 없는 수준이었습니다. 연구팀은 이러한 실패의 가능한 원인들을 검토했습니다. 문제의 원인이 연구하기 "쉬운" 유전자를 선택했기 때문인지 확인했으나, 유전자를 무작위로 선택하더라도 모델은 여전히 실패했습니다. 또한 문제가 연구된 유전자의 수나 유전자가 측정되는 특정 방식 때문인지 확인했으나, 실패는 이러한 요인들과 관계없이 지속되었습니다. 심지어 유전자 침묵의 강도에 대한 세부 사항을 제거하고 변화의 방향만을 살펴보았을 때도, 모델은 여전히 결과를 예측할 수 없었습니다.

희망의 빛을 보여주는 작은 예외가 하나 있었지만, 그것도 미미했습니다. 특정 세포 세트에서, 모델은 평균적인 결과를 예측하는 것보다 아주 약간 더 나은 성능으로 새로운 유전자의 결과를 예측할 수 있었습니다. 그러나 이 최선의 시나리오에서도 모델은 완벽하고 잘 작동하는 시스템이 제공했을 정보의 약 7%만을 복구했을 뿐이었습니다. 이는 실패의 바다 속에서 아주 작은 승리였습니다. 연구진은 또한 유전자의 정보를 인코딩하는 더 정교한 방법들, 즉 유전자가 세포의 자연스러운 상태에서 어떻게 연결되어 있는지 살펴보거나 머신러닝을 사용하여 데이터로부터 유전자의 "지문"을 학습하는 방법들을 테스트했습니다. 이러한 고급 방법들도 근본적인 문제를 극복할 수 없었습니다. 그들은 테스트된 세 가지 세포 유형 중 두 곳에서 새로운 유전자를 예측하는 데 실패했으며, 세 번째 유형에서는 약간의 개선을 이루었으나 이론이 약속한 수준에는 훨씬 미치지 못했습니다.

이 연구는 현재의 대규모 유전자 침묵 스크린을 해석하는 방식이 아마도 결함이 있을 가능성이 높다고 결론짓습니다. 유전자가 독립적인 스위치로서 단순히 효과를 더한다는 가정은 보지 못한 표적에 대해 테스트했을 때 성립하지 않습니다. 연구진은 왜 이런 일이 발생하는지에 대해 두 가지 주요 가능성을 제시합니다. 첫째, 유전자의 정체성을 수학적 입력값으로 변환하는 과정에서, 마치 복잡한 풍경을 단 하나의 흐릿한 사진으로만 설명하려는 것처럼 중요한 정보의 대부분을 버리고 있을 가능성이 있습니다. 둘째, 생물학적 실체는 유전자가 단순하고 선형적인 방식으로 작동하지 않을 수도 있습니다. 즉, 유전자의 효과가 포화 상태에 도달하거나 임계값에 부딪힐 수 있으며, 이는 유전자를 끈다고 해서 일정하고 예측 가능한 변화가 나타나는 것은 아님을 의미합니다.

이 작업은 유전자 침묵 스크린이 쓸모없다는 뜻은 아니지만, 우리가 지금까지 그것들로부터 구축한 지도들이 새로운 유전자를 표적으로 삼았을 때 어떤 일이 일어날지 예측하는 데 있어 신뢰할 만한 가이드가 아닐 수 있음을 의미합니다. 연구진은 다른 과학자들이 자신의 모델을 이러한 엄격한 기준에 따라 점검할 수 있도록 새로운 툴킷을 공개하여, 미래의 발견들이 견고한 토대 위에 세워질 수 있도록 했습니다. 교훈은 명확합니다. 생물학은 종종 우리의 가장 단순한 방정식보다 더 복잡하며, 우리가 그 복잡성을 포착할 방법을 찾을 때까지, 세포가 새로운 개입에 어떻게 반응할지에 대한 우리의 예측은 불확실한 상태로 남을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →