← 최신 논문
🧠 neurology

Evaluation of multiple sclerosis risk loci reveals that genomic oracles fail to generalise sequence effects across host contexts

이 연구는 딥러닝 유전체 오라클(deep-learning genomic oracles)이 서로 다른 숙주 맥락 간에 서열 효과를 일반화하는 데 실패하며, 이들의 조절 요소 활성에 대한 예측은 특정 유전체 위치에 크게 의존하고 서열 특징만으로는 신뢰성 있게 예측될 수 없음을 입증한다.

원저자: Selahattin Alperen Uysal

게시일 2026-09-21✓ Author reviewed ⓘ
📖 4 분 읽기☕ 가벼운 읽기

원저자: Selahattin Alperen Uysal

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간 게놈이라는 광활한 풍경 속에서, 특정 DNA 구간은 유전자의 스위치 역할을 하며 세포가 어떻게 기능할지를 조절하기 위해 유전자를 켜거나 끕니다. 과학자들은 이 스위치가 어디에서 작동하고 언제 활성화될지를 알려주는 정밀한 코드를 이해하기 위해 오랫동안 노력해 왔습니다. 최근 몇 년 동안, 이 언어를 해독하는 데 도움을 주는 강력한 컴퓨터 프로그램들이 등장했습니다. 흔히 "게놈 오라클(genomic oracles)"이라 불리는 이 프로그램들은 DNA 염기 서열을 보고 그것이 살아있는 세포 내에서 어떻게 행동할지, 즉 유전자 활동을 허용하기 위해 열릴 것인지 아니면 닫힌 상태로 유지될 것인지를 예측할 수 있습니다. 이러한 디지털 도구들은 실험실 실험에 비해 빠르고 저렴하기 때문에, 연구자들은 의도한 대로 정확히 작동하는 맞춤형 스위치를 만들기 위해 새로운 DNA 서열을 설계하는 데 점점 더 많이 활용하고 있습니다. 그 밑바탕에 깔린 희망은 만약 특정 컴퓨터 프로그램이 어떤 DNA 서열이 게놈의 한 부분에서 좋은 스위치라고 말한다면, 그 서열을 다른 위치로 옮기더라도 여전히 좋은 스위치로 남을 것이라는 믿음입니다.

새로운 한 연구는 동일한 DNA 서열이 게놈의 서로 다른 구역에 놓였을 때 이러한 디지털 예측이 유효한지를 테스트함으로써 이 근본적인 가설에 도전합니다. 연구진은 면역 체계가 신경계를 공격하는 질병인 다발성 경화증에 주목하여, 해당 질환의 발생 위험을 높이는 것으로 알려진 특정 유전 영역을 조사했습니다. 그들은 인공지능 모델을 사용하여 면역 세포 내에서 조절 스위치로서 기능할 수 있을 것처럼 보이는 수천 개의 후보 DNA 서열을 생성했습니다. 그런 다음 게놈 오라클을 사용하여 이 후보들의 점수를 매겼고, 컴퓨터가 가장 활발할 것이라고 예측한 것들을 선택했습니다. 연구팀은 엄격한 테스트를 수행했습니다. 그들은 선택된 동일한 서열들을 게놈 내의 24개 서로 다른 위치에 배치하여 컴퓨터의 예측이 일관되게 유지되는지 확인했습니다.

결과는 놀라울 정도로 일관성이 없었습니다. 컴퓨터 프로그램은 단일 위치 내에서는 서열의 순위를 잘 매길 수 있었지만, 서열이 이동했을 때는 그 예측이 일반화되는 데 실패했습니다. 특정 DNA 서열 변화의 효과는 서열 자체의 고정된 속성이 아니었습니다. 대신, 그 효과는 서열이 게놈의 어느 위치에 자리 잡고 있느냐에 전적으로 달려 있었습니다. 어떤 위치에서는 DNA 서열의 특정 편집이 서열을 더 활성화시킨 반면, 다른 위치에서는 똑같은 편집이 서열을 덜 활성화하거나 아무런 효과를 내지 못했습니다. 연구진은 서열의 행동이 주변 환경에 매우 의존적이라는 것을 발견했으며, 위치에 따른 변동 폭은 매우 컸고, 테스트된 부지의 거의 절반에서 효과의 방향이 역전되었습니다.

컴퓨터가 실제로 무엇을 "보고" 있었는지 이해하기 위해, 팀은 DNA 서열에 대한 직접적인 개입 실험을 수행했습니다. 그들은 컴퓨터의 선호도가 유전자를 조절하는 것으로 알려진 단백질의 특정 결합 부위의 존재 여부 때문인지, 혹은 이러한 부위의 밀도 때문인지를 테스트했습니다. 결과는 "아니오"였습니다. 이러한 결합 부위를 제거하거나 그 수를 변경해도 컴퓨터의 점수는 예측 가능한 방식으로 변하지 않았습니다. 대신, 진정한 핵심 요인은 두 개의 DNA 문자가 쌍을 이루는 CpG라고 불리는 특정 화학 구조의 내용이었습니다. 그러나 이 요인조차 단독으로 작용하지는 않았습니다. DNA 내의 이 구조를 늘리는 것이 어떤 게놈 위치에서는 점수를 높였지만, 다른 위치에서는 점수를 떨어뜨렸습니다. 효과의 방향은 편집 자체가 아니라 호스트 위치에 의해 결정되었습니다.

연구팀은 또한 두 번째의 독립적으로 학습된 컴퓨터 프로그램이 동일한 결과를 낼 수 있는지 테스트했습니다. 서로 다른 아키텍처와 데이터로 구축된 이 새로운 모델은 주요 발견을 확인해주었습니다. 즉, DNA 편집의 효과는 매우 불안정하며 게놈 위치에 따라 크게 달라진다는 것이었습니다. 그러나 두 프로그램은 어떤 위치에서 양(+) 또는 음(-)의 효과가 나타날지에 대해서는 의견이 일치하지 않았는데, 이는 불안정성이 실재하는 현상이긴 하지만, 모델이 위치를 해석하는 구체적인 방식은 각 모델마다 고유하다는 것을 시사합니다.

아마도 가장 결정적으로, 연구진은 컴퓨터가 선택한 서열이 실제 실험에서 실제로 더 잘 작동하는지를 확인했습니다. 그들은 컴퓨터의 점수를 수천 개의 DNA 요소가 포함된 대규모 실험실 분석법으로부터 측정된 실제 활성도와 비교했습니다. 컴퓨터의 선택 기준은 어떤 서열이 실제로 활발하게 작동하는지를 예측하는 데 실패했습니다. 사실, 컴퓨터가 최고의 성능을 낼 것이라고 평가한 서열들은 실험실에서 종종 정반대의 행동을 보였으며, 가장 특이적이고 활발한 요소들이 오라클로부터 가장 낮은 점수를 받았습니다. 이러한 불일치는 컴퓨터가 최적화하고자 하는 목표가 실제 DNA의 생물학적 활동을 반영하지 못하고 있음을 시사합니다.

연구진은 또한 DNA의 글자 패턴을 세는 방식에 기반한 훨씬 더 단순한 수학적 방법이 복잡한 딥러닝 인공지능 모델만큼이나 잘 작동한다는 것을 발견했습니다. 강력한 컴퓨터 없이도 몇 초 만에 맞춰질 수 있는 이 간단한 방법은 모든 테스트 항목에서 첨단 신경망과 대등한 성능을 보여주었습니다. 이 발견은 이러한 맥 context에서 DNA 서열의 필수적인 패턴을 포착하는 데 딥러닝 모델의 복잡성이 반드시 필요하지는 않음을 암시합니다.

궁극적으로, 본 연구는 게놈 오라클에 의해 학습되거나 측정된 서열 수준의 효과가 서열만의 속성이 아니라는 결론을 내립니다. 그것은 서열과 그 서열이 놓인 특정 게놈 맥락이 결합된 속성입니다. 이러한 위치 의존성은 주변 DNA의 단순하고 저렴한 특징들만으로는 예측할 수 없습니다. 새로운 유전 요소를 설계하는 과학자들에게 이는, 컴퓨터 시뮬레이션의 한 위치에서 설계되고 검증된 서열이 다른 곳으로 이동하거나 삽입되었을 때 어떻게 행동할지에 대해 아무런 보장을 해주지 못한다는 것을 의미합니다. 이 연구 결과는 이러한 강력한 디지털 도구들이 유용하기는 하지만, 여러 위치에서의 직접적인 실험적 검증 없이는 인간 게놈의 다양한 풍경 속에서 설계된 서열의 행동을 예측하는 데 아직 신뢰할 수 없다는 경고의 메시지를 전달합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →