← 최신 논문
🧬 biology

mRNA Design and Optimization with Deep Knowledge-Infused Approach

이 논문은 메커니즘 정렬 손실(mechanism-aligned losses)을 통합하여 절대적인 서열 충실도, 현저히 향상된 생물학적 지표, 그리고 높은 처리량을 달려냄으로써 mRNA 최적화의 '불가능한 삼각형'을 해결하고, mRNA 설계를 블랙박스 과정에서 예측 가능하고 설명 가능한 공학적 문제로 변모시키는 지식 주입형 트랜스포머 모델인 RNop를 소개한다.

원저자: Zheng Gong, Ziyi Jiang, Weihao Gao, Yuanyuan Wang, Zhining Cai, Deng Zhuo, Lan Ma

게시일 2026-09-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zheng Gong, Ziyi Jiang, Weihao Gao, Yuanyuan Wang, Zhining Cai, Deng Zhuo, Lan Ma

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

메신저 RNA, 즉 mRNA는 세포의 지시 설명서입니다. 이는 DNA로부터 단백질 제조 공장으로 유전적 청사진을 전달하여, 세포가 어떤 단백질을 얼마만큼의 양으로 만들어야 하는지 정확하게 알려줍니다. 수십 년 동안 과학자들은 의료용으로 이러한 지시 사항을 재작성하기 위해 고군분투해 왔습니다. 연구자들이 백신이나 치료제를 만들기 위해 mRNA를 설계할 때, 그들은 어려운 균형 잡기에 직면합니다. 세포가 더 많은 단백질을 생산하도록 서열을 미세하게 조정해야 하지만, 실제 만들어지는 단백질 자체를 변경해서는 안 됩니다. 그렇지 않으면 치료가 실패하기 때문입니다. 또한 이들은 한 번에 수천 개의 서열을 동시에 설계할 수 있을 만큼 빠르게 이 작업을 수행해야 합니다. 지금까지 기존의 도구들은 과학자들에게 목표 사이의 선택을 강요했습니다. 즉, 단백질이 정확하게 유지되도록 보장하거나, 혹은 속도와 양을 최적화하거나 둘 중 하나를 할 수는 있었지만, 두 가지 모두를 달성하는 경우는 드물었습니다.

이제 한 연구팀이 이 교착 상태를 깨뜨리는 새로운 접근 방식을 개발했습니다. 컴퓨터 모델이 단순히 패턴을 추측하는 것이 아니라 특정 생물학적 규칙을 따르도록 가르침으로써, 그들은 완벽한 정확도, 높은 속도, 그리고 개선된 단백질 생산량을 갖춘 mRNA 서열을 최적화할 수 있는 시스템을 만들었습니다. RNop라고 불리는 이 방법은 설계 과정을 신비로운 추측 게임이 아니라, 모든 변화가 알려진 생물학적 원칙에 의해 유도되는 통제된 공학적 과업으로 취급합니다. 그 결과, 이 도구는 최종 단백질이 의도한 대로 정확하게 유지됨을 보장하면서도, 이전 방식보다 훨씬 더 효과적인 mRNA 서열을 생성할 수 있습니다.

mRNA 설계의 핵심 과제는 흔 often '불가능한 삼각형'으로 묘사됩니다. 첫 번째 꼭짓점은 충실도(fidelity)로, 새로운 서열이 원래의 것과 정확히 동일한 단백질을 생성해야 한다는 요구 조건입니다. 두 번째는 mRNA를 더 안정적으로 만들거나 세포가 읽기 쉽게 만드는 등 여러 생물학적 목표를 동시에 최적화할 수 있는 능력입니다. 세 번째는 속도, 즉 방대한 양의 서열을 빠르게 처리해야 할 필요성입니다. 전통적인 컴퓨터 알고리즘은 단백질이 정확함을 보장할 수는 있었지만, 대규모 사용에는 너무 느렸습니다. 최신 인공지능 모델들은 빠르고 여러 목표를 최적화할 수 있었지만, 종종 단백질을 변화시키는 의도치 않은 작은 실수를 저질러 설계를 무용지물로 만들곤 했습니다. 이러한 모델들은 방대한 데이터를 통해 학습하되 근본적인 규칙은 이해하지 못하는 '블랙박스'처럼 작동했기에, 오류를 제어하거나 왜 특정 선택을 했는지 설명하는 것이 불가능했습니다.

연구진은 학습 방식을 바꿈으로써 이 문제를 해결했습니다. 모델이 데이터로부터 규칙을 스스로 추측하게 두는 대신, 처벌과 보상 시스템을 통해 생물학적 규칙을 명시적으로 가르쳤습니다. 그들은 유전 코드와 그 결과로 나타나는 단백질 사이의 관계를 이해하는 모델을 구축했습니다. 만약 모델이 단백질을 변화시키는 제안을 하면, 시스템은 즉시 그 제안에 벌점을 부여하여 모델이 단백질을 동일하게 유지하는 다른 경로를 찾도록 강제합니다. 이를 통해 최종 출력물이 항상 원래의 단백질 서열에 충실하도록 보장합니다. 동시에, 모델은 세포의 기구가 선호하는 유전 코드를 선택하거나 서열을 더 안정적으로 배치하는 등 유익한 변화를 일으키면 보상을 받습니다.

이러한 접근 방식 덕분에 연구팀은 600만 개 이상의 유전 서열을 바탕으로 시스템을 훈련할 수 있었습니다. 컴퓨터 시뮬레이션 테스트에서, 이 새로운 모델은 원래 단백질과 완벽하게 일치하는 서열을 오류 없이 지속적으로 생성했습니다. 동시에, 이 최적화된 서열들은 세포가 이를 얼마나 잘 읽을지를 예측하는 생물학적 지표에서 상당한 개선을 보여주었습니다. 모델은 다양한 길이의 서열을 처리할 수 있었고 박테리아부터 인간에 이르기까지 다양한 종에 걸쳐 작동하며, 단순히 특정 사례를 암기한 것이 아니라 일반적인 생물학적 규칙을 학습했음을 증명했습니다. 하나의 설계를 처리하는 데 몇 시간이 걸리거나 긴 서열 처리에 어려움을 겪었던 기존 방식과 달리, 이 새로운 시스템은 초당 수십 개의 최적화된 서열을 생성할 수 있어 고처리량 산업 응용 분야에 적합합니다.

실제 환경에서 이 결과를 확인하기 위해 연구진은 살아있는 세포 내에서 최적화된 서열을 테스트했습니다. 그들은 실험실 접시 안의 인간 세포를 사용하여 새로운 지시 사항으로부터 얼마나 많은 단백질이 생성되는지 관찰했습니다. 결과는 놀라웠습니다. 이 시스템이 설계한 서열은 상업적 기준으로 이미 매우 최적화되었다고 간주되는 서열보다 최대 2.28배 더 많은 단백질을 생성했습니다. 한 특정 테스트에서 경쟁사의 방식은 메시지의 구조를 너무 많이 변경하여 단백질을 거의 생성하지 못하며 완전히 실패했습니다. 새로운 시스템은 필요한 모든 요소를 균형 있게 조절함으로써 메시지가 읽기 쉽고 안정적으로 유지되도록 하여 이러한 실패를 피했습니다. 이는 컴퓨터의 예측이 실제 생물학적 성공으로 직접 연결됨을 입증했습니다.

이 시스템의 힘은 투명성에 있습니다. 규칙이 모델에 내장되어 있기 때문에 과학자들은 서로 다른 목표의 중요도를 조정할 수 있습니다. 만약 단백질이 변하지 않도록 매우 엄격하게 유지하고 싶다면 규칙을 강화할 수 있습니다. 만약 새로운 가능성을 탐색하기 위해 약간의 유연성을 허용하고 싶다면 규칙을 완화할 수 있습니다. 이러한 제어력은 설계 과정을 신비로운 시행착오의 과정에서 예측 가능한 공학적 규율로 변화시킵니다. 연구진은 모델에 명확하고 해석 가능한 지식을 주입함으로써, 이전에는 서로 양립할 수 없다고 여겨졌던 결과들을 달성할 수 있음을 보여주었습니다.

이 연구는 과학자들이 생물학적 설계를 접근하는 방식의 변화를 의미합니다. 이는 자연에서 단순히 패턴을 찾는 데 인공지능에 의존하는 방식에서 벗어나, 알려진 과학적 원리를 엄격하게 적용하는 데 AI를 사용하는 방향으로 나아가는 것입니다. 이 시스템은 유연하게 설계되어, 과학자들이 새로운 생물학적 규칙을 발견할 때마다 전체 시스템을 처음부터 다시 구축할 필요 없이 모델에 추가할 수 있습니다. 이는 새로운 백신부터 산업적 단백질 생산에 이르기까지 더 넓은 범위의 응용 분야를 위한 mRNA를 설계할 수 있는 문을 열어줍니다. 충실도, 최적화, 속도라는 '불가능한 삼각형'을 해결함으로써, 연구진은 생명의 지시 사항을 설계하는 것을 더 정밀하고 강력하게 만드는 새로운 도구를 제공했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →