← 최신 논문
💻 bioinformatics

A deep-learning-based score to evaluate multiple sequence alignments

이 논문은 널리 사용되는 합-쌍(sum-of-pairs) 점수가 가장 정확한 다중 서열 정렬을 식별하는 데 종종 실패한다는 것을 입증하며, 특히 모델 2라는 딥러닝 기반의 스코어링 프레임워크를 제안하여 하류의 계통 발생 재구성을 개선하기 위해 대안적 정렬들의 순위를 효과적으로 매깁니다.

원저자: Serok, N., Polonsky, K., Ashkenazy, H., Mayrose, I., Thorne, J. L., Pupko, T.

게시일 2026-02-05
📖 2 분 읽기☕ 가벼운 읽기

원저자: Serok, N., Polonsky, K., Ashkenazy, H., Mayrose, I., Thorne, J. L., Pupko, T.

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

여러 사람이 각기 조금씩 다른 버전의 이야기를 들려줄 때, 그 사람들을 일렬로 세우려고 노력한다고 상상해 보십시오. 생물학의 세계에서 이 "사람들"은 DNA 또는 단백질 서열이며, 그들의 "이야기"는 공유된 진화의 역사입니다. 과학자들은 이 과정을 **다중 서열 정렬(Multiple Sequence Alignment, MSA)**이라고 부릅니다. 이 줄 세우기를 제대로 하는 것은 매우 중요한데, 만약 이야기가 뒤섞인다면 과학자들이 생명체가 어떻게 진화했는지에 대해 내리는 그 어떤 결론도 틀리게 될 것이기 때문입니다.

오랫동안 과학자들은 어떤 줄 세우기가 가장 좋은지 결정하기 위해 특정한 경험칙을 사용해 왔습니다. 그들은 이를 "쌍의 합(Sum-of-Pairs, SP)" 점수라고 부릅니다. SP 점수를 생각할 때는, 마치 선생님이 학생들이 서로의 답이 얼마나 일치하는지만을 기준으로 그룹 프로젝트를 채점하는 것과 같습니다. 두 학생이 같은 위치에 같은 단어를 썼다면 점수를 얻습니다. 가장 많은 일치 점수를 얻은 줄 세우기가 승리합니다.

문제점
이 논문의 저자들은 이 채점 시스템의 결함을 발견했습니다. 단순히 일치하는 점수가 가장 높다고 해서(최고의 SP 점수를 가졌다고 해서), 그것이 반드시 가장 정확한 버전의 이야기를 담고 있다는 뜻은 아닙니다. 이는 마치 높은 점수를 받기 위해 정답을 완벽하게 암기했지만, 정작 이야기의 줄거리는 완전히 오해해 버린 학생과 같습니다. 많은 경우, SP 점수의 "승자"는 실제 정답인 버전과 비교했을 때 오히려 형편없는 정렬인 경우가 많았습니다.

해결책: 새로운 종류의 심판
이를 해결하기 위해 연구진은 더 똑똑한 심판 역할을 할 딥러닝 AI를 구축했습니다. 그들은 단순히 단순한 일치 여부만을 보는 것이 아니라, 줄 세우기 내의 전체적인 단서와 특징들의 집합을 살펴보았습니다. 그들은 문제를 해결하기 위해 두 가지 서로 다른 "모델(AI 심판)"을 만들었습니다:

  1. 모델 1 (개별 비평가): 이 모델은 단 하나의 정렬 상태를 보고, 그것이 진실로부터 얼마나 벗어나 있는지 추측합니다. 이는 마치 한 편의 이야기를 읽고 그것이 얼마나 정확한지 점수를 매기는 비평가와 같습니다. 이 모델은 기존의 SP 점수보다 정확도를 더 잘 예측했지만, 여러 선택지 중에서 최선의 것을 골라내는 데는 뛰어나지 않았습니다.

  2. 모델 2 (토너먼트 심판): 이 모델이 진정한 주인공입니다. 이 모델은 하나의 정렬을 고립시켜 판단하는 대신, 동일한 이야기를 가진 일련의 서로 다른 정렬들을 살펴보고 이들을 서로 비교하여 순위를 매깁니다. 이는 마치 스포츠 토너먼트의 심판이 각 팀의 통계만 보는 것이 아니라, 모든 팀을 비교하여 누가 실제로 승리했는지를 결정하는 것과 같습니다.

결과
연구진이 이 새로운 모델들을 테스트했을 때, 모델 2가 가장 정확한 정렬을 찾아내는 데 가장 뛰어나다는 것이 증명되었습니다. 모델 2는 기존의 SP 점수, 모델 1, 그리고 과학자들이 사용하는 여러 다른 유명한 컴퓨터 프로그램들을 모두 이겼습니다.

마지막으로, 연구진은 과학자들이 이 새로운 AI를 사용하여 최선의 줄 세우기를 선택할 때, 생명체들이 서로 어떻게 연관되어 있는지를 보여주는 "계통수(family trees)"가 훨씬 더 정확해진다는 것을 보여주었습니다. 본질적으로, 정렬을 채점하는 더 똑똑한 방법을 사용함으로써, 과학자들은 훨씬 더 큰 확신을 가지고 진화의 진정한 이야기를 들려줄 수 있게 된 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →