← 최신 논문
📄 molecular biology

An RNA Language Model trained on sequence alone reveals the structural logic of Internal Ribosome Entry Sites

저자들은 오직 서열 데이터만으로 학습되어 내부 리보솜 진입 부위(IRES) 구조 예측에서 기존 방식들을 크게 능가하며, 새로운 기능적 하위 클래스의 발견을 가능하게 하고 항바이러스 표적 식별을 가속화하는 RNA 언어 모델인 Albatross를 소개한다.

원저자: Sychla, A., Bongrand, P., Yang, G., Iyer, A., Rulison, J., Wesselhoeft, R. A., Bisaria, N., Rouskin, S.

게시일 2026-09-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sychla, A., Bongrand, P., Yang, G., Iyer, A., Rulison, J., Wesselhoeft, R. A., Bisaria, N., Rouskin, S.

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

바이러스는 변장의 명수이지만, 그들의 가장 중요한 비밀은 종종 유전 코드 안에 눈에 띄게 숨겨져 있습니다. 흔한 감기부터 치명적인 신경 질환까지 일으키는 피코르나바이러스(picornaviruses)를 포함한 많은 바이러스의 경우, 새로운 바이러스 입자를 만들기 위한 지침은 단순히 글자의 목록이 아닙니다. 그것들은 복잡한 3차원 형태로 접혀 있습니다. 이러한 형태는 스위치와 손잡이 역할을 하여, 바이러스가 세포의 단백질 제조 기계를 가로챌 수 있게 합니다. 이러한 형태 중 가장 중요한 것 중 하나는 내부 리보솜 진입 부위, 즉 IRES라고 불립니다. 특정 캡(cap)이 유전적 지침의 시작 부분에 있어야 읽기를 시작할 수 있는 인간 세포와 달리, 이 바이러스 IRES들은 직접적인 초대장처럼 작용하여 바이러스가 즉각적이고 독립적으로 단백질을 구축하기 시작할 수 있게 합니다. 이러한 IRES가 정확히 어떻게 접히는지 이해하는 것은 왜 어떤 바이러스가 특정 조직을 감염시키는지, 왜 어떤 바이러스는 심각한 질병을 일으키고 다른 것들은 그렇지 않은지, 그리고 어떻게 그들을 막기 위한 약물을 설계할 수 있는지를 파악하는 데 필수적입니다. 그러나 이러한 구조들은 파악하기가 매우 까다롭습니다. 그것들은 길고, 변동성이 매우 크며, 환경에 따라 형태가 변하기 때문에 전통적인 예측 방식은 느리고 종종 부정확합니다.

연구팀은 이제 비용이 많이 들고 시간이 오래 걸리는 실험의 필요성을 우회하여, 이러한 숨겨진 형태를 볼 수 있는 새로운 방법을 개발했습니다. 그들은 알바트로스(Albatross)라고 명명한 인공지능 시스템을 만들었으며, 이는 수천 개의 이러한 바이러스 요소들의 가공되지 않은 유전자 서열만을 학습하도록 훈련되었습니다. 이 시스템은 RNA가 어떻게 접히는지, 화학 법칙, 또는 안정성의 물리학에 대한 어떠한 정보도 받지 않았습니다. 그저 수백만 개의 서열을 입력받아 그 안의 패턴을 학습하도록 요청받았을 뿐입니다. 놀랍게도, 모델은 서열 내 글자들 사이의 통계적 관계를 인식함으로써 이러한 바이러스 요소들의 3차원 구조를 높은 정밀도로 예측하는 법을 배웠습니다. 연구진이 알바트로스를 96개의 서로 다른 전체 길이 바이러스 IRES 라이브러리와 대조했을 때, 모델의 예측은 기존의 최선책들보다 훨씬 더 정확했습니다. 다른 도구들이 실제 구조적 연결을 절반 미만으로 올바르게 식별한 반면, 알바트로스는 80퍼센트의 확률로 정확했습니다.

이 접근 방식의 힘은 모델이 실제로 무엇을 배웠느냐에 있습니다. 모델은 단순히 형태를 암기한 것이 아니라, 바이러스의 논리를 배웠습니다. 서열의 한 부분이 변화할 때 다른 부분의 예측에 어떤 영향을 미치는지 분석함으로써, 모델은 어떤 RNA 조각들이 기능하기 위해 서로 가까이 있어야 하는지를 식별했습니다. 이를 통해 연구진은 단순히 안정적인 형태와 바이러스가 작동하는 데 필수적인 형태를 구분할 수 있었습니다. 실제로, 모델은 기능적 구조를 포착하는 능력이 매우 뛰어나서, RNA의 어느 부분이 감염 과정을 시작하는 데 관여할 가능성이 가장 높은지를 예측할 수 있었습니다. 이 능력 덕분에 연구팀은 이전에 이 정도로 상세하게 연구된 적이 없는 방대한 다양성의 바이러스를 아우르는 75,000개 이상의 예측 구조로 구성된 거대한 지도를 구축할 수 있었습니다.

이 새로운 지도를 사용하여 연구진은 완전히 새로운 것을 발견했습니다. 그들은 확장된 줄기(extended stem)를 포함하는, 이 계열의 바이러스에서는 이전에 본 적 없는 특정 폴딩 패턴인 미지의 바이러스 구조 하위 그룹을 발견했습니다. 연구진은 실험실에서 이 발견을 테스트하여, 확장된 줄기가 실제로 존재하며 바이러스의 기능 수행 능력에 결정적인 역할을 한다는 것을 확인했습니다. 이 발견은 모델이 과학자들에게 이전에는 보이지 않았던 생물학적 진실을 밝혀낼 수 있음을 시사합니다. 나아가, 연구팀은 이 방법이 단 한 종류의 바이러스에 국한되지 않는다는 것을 보여주었습니다. 동일한 훈련 전략을 한타바이러스(hantaviruses)와 박테리아 센서의 유전 물질에 적용했을 때, 모델은 복잡하고 장거리적인 상호작용과 심지어 단일 RNA 분자가 환경에 따라 두 가지 다른 형태 사이를 전환하는 능력까지 성공적으로 식별해 냈습니다.

이 작업의 영향력은 단순히 바이러스를 매핑하는 것을 훨씬 넘어섭니다. 수십 년 동안 과학자들은 RNA가 매우 유연하고 이를 지배하는 규칙이 매우 복잡하기 때문에 그 구조를 예측하는 데 어려움을 겪어 왔습니다. 전통적인 방법들은 종종 가능한 모든 형태의 에너지를 계산하는 데 의존하는데, 이는 긴 서열에 대해서는 불가능한 과정이 됩니다. 다른 방법들은 많은 유사한 바이러스를 비교하여 패턴을 찾아내야 하는데, 이는 바이러스들이 너무 다를 경우 실패하게 됩니다. 알바트로스는 서열 데이터 자체로부터 직접 학습함으로써 이러한 문제들을 피해 갑니다. 연구진은 훈련 데이터와 모델의 크기를 키울수록 모델의 정확도가 향상된다는 것을 발견했으며, 이는 이 접근 방식이 더 많은 데이터와 함께 계속해서 발전할 수 있음을 시사합니다.

이 연구는 우리가 RNA 생물학에 접근하는 방식의 중대한 변화를 나타냅니다. 이 분자들을 물리 방정식으로 풀어야 할 정적인 퍼즐로 취급하는 대신, 연구진은 이들을 학습해야 할 하나의 언어로 취급했습니다. 결과는 바이러스의 진화적 역사가 인공지능이 해독할 수 있는 방식으로 그 서열 안에 인코딩되어 있다는 것을 보여줍니다. 이러한 바이러스 요소들의 구조적 논리를 밝혀냄으로써, 이 작업은 바이러스가 어떻게 작동하는지, 그리고 어떻게 그들을 저지할 수 있는지 이해하기 위한 강력한 새로운 도구를 제공합니다. 이러한 구조들을 대규모로 예측할 수 있는 능력은 과학자들이 이전에는 연구하기 너무 어려웠던 수천 개의 바이러스 서열의 기능적 잠재력을 탐구할 수 있게 함으로써, 바이러스학과 의학 분야의 새로운 발견을 위한 문을 열어주고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →