← 최신 논문
🧬 biology

Monroe: A Molecular Foundation Model for In-Context Probabilistic Inference

이 논문은 향상된 입체화학적 표현과 새로운 학습 목적 함수를 사용하여 8,100만 개의 분자로 학습된 확장 가능한 분자 파운데이션 모델인 Monroe를 소개하며, 이는 사전 데이터 적합 모델(TabPFN)을 활용하여 인컨텍스트 확률 추론을 수행함으로써 바이오어세이 활성 예측에서 최첨단 성능을 달축하고, 이러한 다운스트림 적응 전략이 MiniMol 및 CheMeleon과 같은 기존 모델들도 유의미하게 개선함을 입증한다.

원저자: Blazej Banaszewski, Andrew W. Fitzgibbon

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Blazej Banaszewski, Andrew W. Fitzgibbon

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

새로운 의약품을 발견하기 위한 경주에서, 과학자들은 고질적인 병목 현상에 직면해 있습니다. 그것은 바로 특정 분자가 질병을 치료할 수 있는지 알기 위한 가장 신뢰할 수 있는 방법이 실험실에서 직접 그 분자를 만들고 테스트하는 것이라는 점입니다. 이 과정은 느리고 비용이 많이 들며, 이러한 실험을 수행할 수 있는 전문 시설의 수에 의해 제한됩니다. 이 때문에 컴퓨터 프로그램을 훈련시키는 데 사용할 수 있는 데이터는 종종 부족합니다. 이를 극 overcome 하기 위해, 연구자들은 아이가 특정 개나 고양이를 보기 전에 동물을 인식하는 법을 배우는 방식과 유사한 전략을 사용했습니다. 그들은 방대한 화학 구조 라이브러리와 그들의 기본적인 물리적 특성을 바탕으로 거대한 컴퓨터 모델을 훈련시켜, 소프트웨어가 분자가 어떻게 행동하는지에 대한 일반적인 감각을 익히도록 했습니다. 일단 이 토대가 구축되면, 모델은 특정 화합물이 바이러스와 결합할지 여부와 같은 구체적인 생물학적 결과를 예측하도록 적응될 수 있으며, 이는 해당 특정 작업에 대한 실험 결과가 단 몇 가지뿐인 경우에도 가능합니다. '분자 파운데이션 모델(molecular foundation model)'로 알려진 이 접근 방식은 무한한 가능한 화학 물질의 세계와 실제 세계의 약물 테스트라는 제한된 데이터 사이의 간극을 메우는 것을 목표로 합니다.

연구팀은 이 분야에서 중요한 진전을 의미하는 'Monroe'라는 새로운 모델을 선보였습니다. 이 이름은 계산 화학의 선구자인 엘리자베스 먼로 보그스(Elizabeth Monroe Boggs)를 기리는 것이지만, 모델 자체는 분자의 복잡한 언어를 이해하도록 설계된 현대적인 머신 러닝 시스템입니다. 연구진은 8,100만 개 이상의 분자를 포함하는 거대한 데이터셋으로 Monroe를 훈련시켰는데, 이는 이전의 시도들보다 훨씬 더 큰 규모입니다. 이 데이터셋에는 원자의 에너지와 구조를 설명하는 상세한 양자 화학 계산뿐만 아니라, 분자가 생명체와 어떻게 상호작용하는지를 측정하는 수천 개의 생물학적 분석(assays) 데이터가 포함되었습니다. 이 방대한 정보에 모델을 노출시킴으로써, 연구진은 모델이 단순히 특정 사례를 암기하는 것이 아니라 다양한 유형의 문제에 적용되는 일반적인 화학 법칙을 학습할 수 있도록 했습니다.

Monroe의 가장 결정적인 혁신 중 하나는 분자의 3차원 형태, 특히 그들의 '손잡이 방향성(handedness)'을 처리하는 방식입니다. 많은 분자는 서로 거울에 비친 모습처럼 왼쪽과 오른쪽 손과 같이 두 가지 형태로 존재합니다. 이러한 거울 쌍들은 동일한 원자들이 동일한 순서로 연결되어 있지만, 인체 내에서는 완전히 다르게 행동할 수 있습니다. 하나는 약이 될 수 있는 반면, 그 거울상은 독성이 될 수도 있습니다. 표준 컴퓨터 모델은 두 형태에 대해 동일하게 보이는 수학적 기술에 의존하기 때문에 이들을 구별하는 데 어려움을 겪는 경우가 많습니다. Monroe는 분자의 내부 지도에 이러한 거울상 차이를 나타내는 '깃발' 역할을 하는 추가적인 연결을 명시적으로 추가함으로써 이 문제를 해결합니다. 이를 통해 모델은 두 형태를 높은 정확도로 구별할 수 있으며, 이는 약물이 실제 생물학적 시스템에서 어떻게 작용할지 예측하는 데 필수적인 능력입니다.

연구진은 또한 모델이 훈련 데이터로부터 학습하는 방식을 개선했습니다. 모든 학습 과제를 똑같이 중요하게 취급하는 대신, Monroe는 자동으로 초점을 조정하는 스마트 가중치 시스템을 사용합니다. 모델은 데이터가 명확하고 신뢰할 수 있는 과제에는 더 많은 주의를 기울이고, 노이즈가 많거나 불확실한 과제에는 주의를 덜 기울입니다. 나아가, 모델은 불완전한 데이터를 정화하도록 훈련받습니다. 현실 세계에서 컴퓨터 시뮬레이션에 사용되는 분자의 3D 형태는 종-종 거친 근사치인 경우가 많습니다. Monroe는 이러한 거친 형태를 받아 더 정확하고 안정적인 형태로 정제하도록 학습되며, 이 과정은 모델이 분자 안정성을 지배하는 근본적인 물리 법칙을 이해하는 데 도움을 줍니다. 이러한 '노이즈 제거(denoise)' 능력은 실제 응용 분야에 대한 모델의 예측력을 강화합니다.

다른 선도적인 모델들과 비교했을 때, Monroe는 '활성 절벽(activity cliffs)'이라고 알려진 가장 까다로운 시나리오에서 탁월한 성능을 입증했습니다. 활성 절벽은 두 분자가 구조적으로는 거의 동일하지만 생물학적 효과는 극적으로 다른 경우를 말합니다. 이러한 급격한 차이를 예측하는 것은 인공지능에게 매우 어려운 일로 알려져 있지만, Monroe는 이 테스트에서 경쟁 모델들을 능가했습니다. 연구진은 또한 모델을 새로운 작업에 적응시키는 그들의 방법이 매우 효과적이라는 것을 발견했습니다. 모델 전체를 매번 다시 훈련시키는 대신, 그들은 인간이 단 몇 가지 사례를 본 후 새로운 규칙을 배울 수 있는 것과 유사하게, 단 한 단계 만에 적은 양의 예시로부터 학습할 수 있는 기술을 사용했습니다. 이 접근 방식은 Monroe에 적용되었을 뿐만 아니라 기존의 다른 두 모델을 개선하는 데도 사용되었으며, 강력하고 일반적인 전략임이 증명되었습니다.

이 연구는 대규모 사전 훈련과 함께, 분자의 손잡이 방향성 처리 및 스마트 데이터 가중치와 같은 특정 구조적 개선을 결합하는 것이 더 견고한 도구를 만든다는 결론을 내립니다. 이 모델이 분자 예측의 모든 문제를 해결하는 것은 아니며, 활성 절벽의 과제가 여전히 어렵기는 하지만, Monroe는 무엇이 가능한지에 대한 새로운 기준을 세웁니다. 이는 컴퓨터에게 화학적 구조와 행동에 대한 더 깊고 미묘한 이해를 가르침으로써, 과학자들이 잠재적인 의약품의 방대한 영역을 탐색하는 데 더 잘 갖춰진 도구를 구축할 수 있음을 보여주며, 이는 화학적 아이디어에서 생명을 구하는 치료제로 가는 여정을 가속화할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →