Mol-JEPA: A multimodal Joint Embedding Predictive Architecture for Molecules
Mol-JEPA는 화학적으로 유효하지 않은 증강 및 모달리티 붕괴와 같은 한계를 극복하기 위해 다양한 신약 개발 데이터에 걸쳐 모달리티 마스킹을 채택함으로써 분자 세계 모델을 학습하고, 잠재 공간 예측을 통해 강건한 표현을 생성하는 확장 가능한 멀티모달 프레임워크이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
새로운 의약품을 찾는 과정은 느리고 비용이 많이 들며 종종 좌절을 안겨주는 여정입니다. 과학자들은 질병을 멈추기 위해 신체의 특정 표적에 결합할 수 있는 아주 작은 분자들을 찾아내야 하지만, 이 동일한 분자들은 혈류를 통과하는 여정에서 살아남아야 하고, 간에 의해 파괴되지 않아야 하며, 건강한 세포를 독성으로부터 보호해야 합니다. 수십 년 동안 연구자들은 분자의 이미지를(보통 텍스트 형태의 문자열이나 연결된 원자의 도식으로 표현됨) 컴퓨터에게 보여줌으로써 이러한 결과를 예측하도록 가르치려 노력해 왔습니다. 그러나 분자는 진공 상태에 존재하지 않습니다. 분자의 행동은 그것을 둘러싼 복잡하고 살아있는 시스템과 어떻게 상호작용하느냐에 전적으로 달려 있습니다. 분자의 형태만을 보는 모델은 지형은 보여주지만 날씨, 교통, 그리고 지역 법규는 무시하는 지도와 같습니다. 그 지도는 도로가 어디로 이어지는지는 알려줄 수 있지만, 실제로 자동차가 그 길을 달릴 수 있는지까지는 알려주지 못합니다.
이를 해결하기 위해 연구진은 Mol-JEPA라고 불리는 새로운 종류의 인공지능을 개발했습니다. Mol-JEPA는 분자의 형태를 미세하게 변형시켜 미래를 추측하는 방식(화학에서는 아주 작은 변화가 거대한 행동 변화를 일으킬 수 있기 때문에 종종 터무니없는 결과를 초래함) 대신, 분자를 여러 각도에서 동시에 관찰함으로써 학습합니다. 한 사람을 이해할 때 얼굴만 보는 것이 아니라, 목소리를 듣고, 움직임을 관찰하며, 의료 기록을 읽고, 다양한 음식을 먹었을 때 어떻게 반응하는지를 관찰하는 것을 상상해 보십시오. Mol-JEPA는 화학 물질에 대해 정확히 이와 같은 작업을 수행합니다. 이 시스템은 원자 구조, 단백질과의 결합 방식, 세포에 미치는 영향, 물리적 특성을 포함하여 약 500만 개의 분자에 대한 방대한 양의 정보를 수집합니다. 그런 다음 시스템은 이 정보 중 한 조각을 숨기고 나머지 정보를 바탕으로 그것이 무엇인지 맞히는 예측 게임을 연습합니다. 이렇게 누락된 조각들을 반복적으로 채워 넣음으로써, 컴퓨터는 단순히 정적인 형태를 암기하는 것이 아니라 실제 세상에서 분자가 어떻게 행동하는지에 대한 깊고 통합적인 이해를 학습하게 됩니다.
연구진은 공공 데이터베이스와 새로운 계산법에서 얻은 방대한 데이터 모음을 사용하여 이 모델을 구축했습니다. 그들은 표준적인 화학적 측정값과 원자가 어떻게 움직이고 상호작용하는지에 대한 고급 시뮬레이션, 그리고 약물이 살아있는 세포에 어떤 영향을 미치는지 측정하는 실험 데이터를 결합했습니다. 결과적으로 그들은 각각 최대 14가지 유형의 정보로 설명되는 거의 500만 개의 고유 화합물을 포함하는 데이터 세트를 만들었습니다. 이 설명 중 일부는 이미 화학적 패턴을 인식하도록 학습된 기존 컴퓨터 모델에서 왔으며, 다른 일부는 양자 물리학을 사용하여 처음부터 계산되었습니다. 연구진은 이 AI가 '세계 모델(world model)', 즉 화학적 우주의 규칙을 이해하는 시스템 역할을 하도록 훈련시켰습니다. 훈련 과정에서 컴퓨터는 분자의 구조와 세포 효과 등을 살펴본 뒤, 특정 단백질에 대한 결합 강도를 예측하거나 그 반대의 과정을 수행하도록 요청받았습니다. 만약 컴퓨터가 예측에 실패하면, 스스로의 내부 이해도가 맞을 때까지 내부 메커니즘을 조정했습니다. 이 과정을 통해 모델은 명시적으로 규칙을 전달받지 않고도 분자의 형태와 생물학적 행동 사이의 숨겨진 연결 고리를 학습할 수 있었습니다.
연구진이 이 새로운 모델을 다른 선도적인 인공지능 시스템들과 비교 테스트했을 때, 결과는 놀라웠습니다. 이 모델은 다양한 어려운 과제에서 경쟁 모델들보다 뛰어난 성능을 보였으며, 특히 데이터가 부족한 상황에서 두드러졌습니다. 신약 개발의 실제 현장에서 과학자들은 매우 적은 양의 실험 데이터만을 바탕으로 결정을 내려야 하는 경우가 많은데, 바로 이 지점에서 새로운 모델이 빛을 발했습니다. 이 모델은 이전에 본 적 없는 분자에 대해서도 지식을 일반화할 수 있었으며, 테스트 대상 분자가 훈련 중에 학습한 것과 화학적으로 매우 다르더라도 높은 정확도를 유지했습니다. 연구진은 모델의 성공이 다양한 유형의 정보를 모두 활용하는 능력에서 비롯되었다는 것을 발견했습니다. 분자의 상세한 3D 구조나 세포 효과와 같은 특정 유형의 데이터를 제거했을 때 모델의 성능 변화가 미미했는데, 이는 학습된 표현 속에 정보가 여러 양상(modality)에 걸쳐 중복되어 인코딩되어 있음을 시사합니다. 시스템은 단순히 데이터를 암기한 것이 아니라, 서로 다른 화학적 특성 사이의 관계를 추론하는 법을 배웠던 것입니다.
가장 중요한 발견 중 หนึ่ง은 모델이 모든 개별 과제에서 완벽할 필요는 없다는 점이었습니다. 대신, 모델은 여러 가지 문제에 적응할 수 있는 유연한 분자 표현법을 학습했습니다. 연구진은 약물이 체내에 얼마나 잘 흡수될지 또는 얼마나 독성이 있을지를 예측하는 것을 포함하여 몇 가지 도전적인 벤치마크를 통해 모델을 테스트했습니다. 거의 모든 경우에서 새 모델은 기존의 최선 방법들을 능가했습니다. 특히 이 모델은 '분포 외(out-of-distribution)' 문제, 즉 새로운 분자가 훈련 데이터와 화학적으로 매우 다를 때 그 행동을 예측하기 어려워하는 문제를 처리하는 데 탁월했습니다. 광범한 생물학적 및 물리적 맥락으로부터 학습함으로써, 모델은 새로운 화합물에 대해서도 신뢰할 수 있는 추측을 할 수 있는 견고한 이해력을 구축했습니다. 이는 향-신약 개발의 미래가 단순히 더 많은 데이터를 암기하는 더 큰 모델을 만드는 것이 아니라, 다양한 정보원을 통합하여 의약품이 작동하는 복잡한 현실을 이해할 수 있는 더 똑똑한 모델을 만드는 데 있음을 시사합니다.
또한 이 연구는 모든 유형의 정보가 똑같이 중요한 것은 아니지만, 시스템이 그 모든 정보를 갖추었을 때 이득을 얻는다는 점을 밝혀냈습니다. 연구진은 분자의 연결성과 구조를 나타내는 그래프 양상(graph modality)이 다운스트림 성능에 있어 가장 결정적인 정보라는 것을 발견했으나, 화학적 지문(fingerprints)과 분자가 세포와 상호작용하는 데이터 또한 필수적이라는 점도 확인했습니다. 흥ًا히도, 모델은 데이터가 누락되거나 희소한 상황에서도 효과적으로 학습할 수 있었는데, 이는 과학 연구에서 흔히 발생하는 문제입니다. 이러한 회복 탄력성은 이 접근 방식이 데이터가 불완전하거나 얻기 어려운 재료 과학이나 생물학 같은 다른 분야에도 적용될 수 있음을 시사합니다. 연구진은 이 모델이 강력하긴 하지만 마법 같은 해결책은 아니라고 언급했습니다. 즉, 학습할 데이터를 신중하게 선택해야 하며, 모델이 한 번도 본 적 없는 완전히 이질적인 분자에 대한 결과를 예측하는 데에는 한계가 있다는 것입니다. 그러나 이 접근 방식의 성공은 단순한 패턴 매칭을 넘어 생명의 복잡성을 반영하는 더 깊고 맥락적인 추론을 통해 화학 세계를 진정으로 이해할 수 있는 인공지능을 만드는 데 있어 중요한 진전을 의미합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.