← 최신 논문
📄 bioengineering

RNASeek: A Cross-Phyla Generative Foundation Model for Multipurpose RNA Modeling and Reinforcement Learning-Based Design

RNASeek은 RNA 서열 표현, 기능 예측, 그리고 데 노보(de novo) 설계를 통합하기 위해 강화 학습을 활용하는 16억 개의 파라미터를 가진 생성형 파운데이션 모델로, 실험적으로 검증된 리보자임과 3' UTR을 향상된 성능으로 성공적으로 생성한다.

원저자: Chen, S., Fernandes, N., Li, W. V., Wang, L., Jia, Z., Xiang, J. S.

게시일 2026-09-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chen, S., Fernandes, N., Li, W. V., Wang, L., Jia, Z., Xiang, J. S.

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

모든 살아있는 세포 내부에서는 단어가 아닌 분자들을 통해 방대하고 복잡한 대화가 이루어집니다. 이 대화의 중심에는 RNA가 있습니다. RNA는 유전적 설계도로부터 지침을 전달하고 그 지침이 어떻게 실행될지를 결정하는, 메신저이자 조절자로서 역할을 하는 다재다능한 분자입니다. 수십 년 동안 과학자들은 RNA 가닥 내의 글자 배열이 문장의 배열이 의미를 결정하는 것과 마찬가지로, 그 형태와 기능을 결정한다는 점을 이해해 왔습니다. 그러나 새로운 글자 서열이 정확히 어떻게 행동할지 예측하는 것은 매우 힘든 과제였습니다. 그 규칙은 복잡하며, 손으로 직접 그려내기 어려운 장거리 상호작용과 미묘한 구조적 뉘앙스를 포함하고 있기 때문입니다. 이제 연구자들은 생명의 생물학적 문헌을 읽음으로써 이러한 규칙을 학습하는 새로운 도구를 개발했으며, 이를 통해 RNA가 어떻게 행동할지 예측할 뿐만 아니라 특정하고 원하는 특성을 가진 완전히 새로운 분자를 설계할 수 있게 되었습니다.

이 연구를 이끈 캘리포니아 대학교 리버사이드와 컬럼비아 대학교의 연구진은 RNASeek이라 불리는 거대한 컴퓨터 프로그램을 만들었습니다. 이 프로그램을 식물, 동물, 균류, 바이러스에 이르는 100여 종 이상의 생물체의 유전적 지침이 담긴 도서관의 모든 책을 읽은 학생이라고 생각하십시오. 단 하나의 특정 퍼즐만을 풀도록 설계된 기존의 도구들과 달리, RNASeek은 RNA의 일반적인 언어를 이해하도록 구축되었습니다. 이 프로그램은 약 1,500억 개의 유전 정보 데이터 세트를 학습하여, 서로 다른 유기체들이 RNA를 구성하는 방식의 패턴을 인식하는 법을 배웠습니다. 또한 이 프로그램은 자연어 지침을 읽는 법도 배웠는데, 이는 과학자가 "안정적인 RNA 서열을 생성하라" 또는 "스스로를 절단하는 분자를 설계하라"와 같이 원하는 바를 간단히 말하면 모델이 해결책을 생성하려고 시도할 수 있음을 의미합니다.

이 디지털 학생가 진정으로 언어를 배웠는지 테스트하기 위해, 연구진은 먼저 리보자임(ribozyme)의 행동을 예측하도록 요청했습니다. 리보자임은 스스로를 절단하거나 다른 분자를 절단할 수 있는 효소 역할을 하는 RNA 분자입니다. 연구진은 모델에 알려진 수천 개의 리보자임 서열과 측정된 절단 속도를 제공했습니다. RNASeek은 어떤 서열이 빠르게 절단되고 어떤 것이 느리게 절단되는지를 성공적으로 예측해 냈으며, 분자 구조 내 특정 루프의 유연성과 같이 속도에 기여하는 미묘한 특징들을 식별해 냈습니다. 이 모델은 이 작업에 특화되어 설계된 많은 전문 도구들과 대등하거나 혹은 그보다 더 뛰어난 성능을 보였으며, 이는 모델이 RNA 구조가 기능에 어떻게 관여하는지에 대한 근본적인 원리를 파악했음을 입증했습니다.

이러한 성공에 고무된 연구진은 모델을 한 단계 더 밀어붙여, 처음부터 새로운 RNA 서열을 설계하도록 했습니다. 그들은 RNA의 수명을 결정하는 데 도움을 주는 부분인 3' 비번역 부위(3' untranslated region)에서 발견되는 다른 유형의 RNA에 집중했습니다. RNA의 수명이 길수록 세포는 해당 RNA가 코딩하는 단백질을 더 많이 생산하게 되며, 이는 mRNA 백신과 같은 치료법에서 매우 중요합니다. 연구진은 강화 학습(reinforcement learning)이라는 기술을 사용했는데, 이는 컴퓨터 프로그램이 시행착오를 거치며 게임을 하는 방식입니다. 프로그램은 수천 개의 후보 서열을 생성했고, 모델의 별도 부분이 심판 역할을 하며 예측된 안정성을 바탕으로 점수를 매겼습니다. 그런 다음 프로그램은 더 나은 후보를 생성하기 위해 전략을 조정하며, 점차 매우 안정적인 서열을 만들어내는 법을 학습했습니다.

결과는 놀라웠습니다. RNASeek이 설계한 서열은 단순히 글자들의 무작위 조합이 아니었습니다. 그것들은 RNA를 안정시키는 데 도움이 되는 것으로 알려진 아데닌과 우라실의 풍부함과 같은 특정 패턴을 포함하고 있었습니다. 연구진이 이 컴퓨터 생성 설계들을 실험실 환경에서 테스트했을 때, 새로운 서열들이 매우 뛰어난 성능을 보인다는 것을 발견했습니다. 설계된 분자 중 일부는 자연계에서 발견된 최상의 서열이나 다른 인공지능 도구에 의해 만들어진 것들보다 심지어 더 안정적이었습니다. 결정적으로, 연구진이 동일한 성분은 유지한 채 글자의 순서만 뒤섞어 서열을 섞었을 때, 그 안정성은 사라졌습니다. 이는 성공의 원인이 단순히 화학적 조성 때문이 아니라 글자의 특정 배열에서 온 것임을 확인시켜 주었으며, 모델이 언어의 진정한 구문(syntax)을 학습했음을 증명했습니다.

이 연구는 또한 모델이 복잡한 지시를 따를 수 있음을 보여주었습니다. 과학자들은 프로그램에 클로닝을 위한 특정 모티프를 포함하거나 문제가 될 수 있는 특정 패턴을 제외한 안정적인 RNA 서열을 생성하라고 요청할 수 있었습니다. 모델은 안정성을 최적화하면서도 이러한 제약 조건을 성공적으로 준수했습니다. 자연어 명령을 따르고 기능적인 생물학적 부품을 만들어내는 이러한 능력은 생명을 공학적으로 설계하는 새로운 방식을 시사합니다. 느리고 비용이 많이 드는 실험실에서의 시행착오 반복에 의존하는 대신, 이제 과학자들은 RNA가 어떻게 행동할지 예측하고 정밀한 요구 사항을 충족하는 새로운 분자를 설계하기 위해 통합된 시스템을 사용할 수 있습니다. 이 연구는 단일한 대규모 모델이 생물학적 데이터를 이해하는 것과 새로운 기능적 생물학적 도구를 만드는 것 사이의 간극을 메울 수 있음을 확립하며, 더 효율적인 치료제 및 연구 도구 설계를 향한 문을 열어주고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →