← 최신 논문
📄 medicine

UniLingo3DMol: a unified 3D molecular language model for de novo and fragment-based drug design

이 논문은 새로운 표현 방식과 다단계 학습 전략을 통해 데 노보(de novo) 및 단편 기반 약물 설계를 통합하여, 우수한 성능과 빠른 추론을 달 수 있고 생체 내 효능를 가진 강력한 CBL-B 억제제를 성공적으로 식별해낸 통합 3D 분자 언어 모델인 UniLingo3DMol을 소개한다.

원저자: Han Wang, Guanglong Sun, Bowen Zhang, Yang Wang, Bin Xi, Wenbiao Zhou, Minjian Yang, Chuanyu Liu, Yuyang Ge, Fan Fan, Wei Feng, Yanhao Zhu, Yang Xiao, Xiaojian Xu, Yuji Wang, Daohua Jiang, Huting Wang
게시일 2026-08-18
📖 5 분 읽기🧠 심층 분석

원저자: Han Wang, Guanglong Sun, Bowen Zhang, Yang Wang, Bin Xi, Wenbiao Zhou, Minjian Yang, Chuanyu Liu, Yuyang Ge, Fan Fan, Wei Feng, Yanhao Zhu, Yang Xiao, Xiaojian Xu, Yuji Wang, Daohua Jiang, Huting Wang, Zhenming Liu, Bo Huang

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 약물을 찾는 과정은 거대한 과업이며, 종종 끊임없이 형태가 변하는 건더기 속에서 특정 바늘을 찾는 것에 비유되곤 합니다. 수십 년 동안 과학자들은 이러한 바늘을 설계하기 위해 두 가지 주요 전략에 의존해 왔습니다. 한 가지 접근 방식은 이미 효과가 입증된 분자의 화학적 형태를 살펴보고, 이를 약간씩 수정하여 더 나은 결과가 나오는지 확인하는 것입니다. 다른 접근 방식은 질병 표적 자체의 3차원 형태(마치 자물쇠와 같은)를 보고, 그 움푹 파인 곳에 완벽하게 들어맞는 열쇠를 설계하는 것입니다. 두 방법 모두 유용하지만, 전통적으로 이들은 서로 분리되어 있었습니다. 인공지능은 두 방식 모두에 도움을 주기 시작했지만, 대부분의 컴퓨터 프로그램은 전문화되어 있습니다. 즉, 기존의 화학 물질을 미세하게 조정하는 데 뛰어나거나, 특정 자물쇠에 맞는 새로운 형태를 설계하는 데는 뛰어나지만, 두 가지를 동시에 수행하는 경우는 드뭅니다. 이러한 분리는 연구자들이 도구와 사고방식을 전환하도록 강요하며, 이는 발견 과정을 늦추고 컴퓨터가 약물과 질병 표적이 어떻게 상호작용하는지에 대한 전체적인 그림을 학습하는 것을 방해합니다.

한 연구팀은 이제 이러한 간극을 메우는 'UniLingo3DMol'이라는 새로운 인공지능 시스템을 선보였습니다. 이 시스템은 약물 설계의 서로 다른 단계마다 별도의 도구를 사용하는 대신, 분자를 3차원으로 기술하는 하나의 통합된 언어를 사용합니다. 이 시스템은 완전히 새로운 약물 후보를 처음부터 생성할 수도 있고, 알려진 약물의 특정 부분을 가져와 그 주변에 새로운 분자를 구축할 수도 있으며, 이 모든 과정에서 질병 표적의 복잡한 3차원 형태를 염두에 둡니다. 연구진은 이 시스템을 100개 이상의 다양한 생물학적 표적에 대해 테스트했으며, 기존의 컴퓨터 모델보다 더 잘 맞고 정확하게 표적에 결합하는 약물 유사 분자를 생성할 수 있음을 발견했습니다. 이 시스템이 실제로 작동함을 증명하기 위해, 연구팀은 면역 체계를 조절하는 데 관여하는 단백질인 CBL-B에 대한 새로운 억제제를 설계하는 데 이 시스템을 사용했습니다. 그 결과물인 화합물은 실험실 테스트에서 강력한 활성을 보였으며, 기존의 면역 항암 항체와 결ิน했을 때 생쥐의 종양을 76% 감소시키는 데 성공했습니다.

이 연구의 핵심 혁신은 컴퓨터가 분자를 '보는' 방식에 있습니다. 전통적인 방식은 분자를 원자와 결합의 평면적인 목록으로 기술하는 경우가 많은데, 이는 컴퓨터가 해당 분자가 단백질에 들어맞을 때 3차원 공간에서 어떤 모습일지 이해하는 것을 어렵게 만듭니다. 새로운 시스템은 이중 시퀀스(dual-sequence) 접근 방식을 사용합니다. 이 방식은 분자를 고리 구조나 측쇄와 같이 의미 있는 덩어리로 나누고, 그다음 포인터를 사용하여 이 덩어리들이 서로 어떻게 연결되는지 기술합니다. 이를 통해 컴퓨터는 분자의 구조를 깨뜨리지 않으면서도 덩어리의 순서를 재배열할 수 있는데, 이는 마치 카드의 문양을 유지하면서 카드 덱을 섞는 것과 같습니다. 이러한 유연성은 매우 중요한데, 시스템이 두 가지 매우 다른 유형의 데이터로부터 동시에 학습할 수 있게 해주기 때문입니다. 즉, 가능한 모든 분자의 방대한 화학적 공간과, 이미 단백질에 결합하는 것으로 알려진 분자들의 고해 resolution 구조를 동시에 학습할 수 있습니다.

시스템을 교육하기 위해 연구진은 수백만 개의 단백질-리간드 복합체를 포함하는 'RComplex'라는 거대한 데이터베이스를 구축했습니다. 연구진은 이 데이터를 X선 결정학에 의해 직접 결정된 가장 확실한 구조부터 컴퓨터 도킹에 의해 예측된 덜 확실한 구조에 이르기까지 세 가지 신뢰도 수준으로 분류했습니다. 학습 과정은 세 단계로 진행되었습니다. 첫째, 시스템은 800만 개의 가상 분자 라이브러리를 사용하여 화학의 기본 규칙과 원자들이 공간에서 어떻게 배열되는지를 배웠습니다. 둘째, 데이터베이스의 덜 확실하지만 풍부한 데이터를 사용하여 이러한 분자들이 단백질 포켓과 어떻게 상호작용하는지를 배웠습니다. 마지막으로, 오직 최고 품질의 실험적 구조만을 사용하여 이해도를 정교화했습니다. 이러한 단계별 접근 방식은 시스템이 단백질 결합이라는 복잡한 방언을 익히기 전에 화학의 근본적인 언어를 먼저 배우도록 보장했습니다.

연구진은 102개의 단백질 표적에 대한 표준 세트를 사용하여 이 시스템을 6개의 선도적인 인공지능 모델과 비교 평가했습니다. 새로운 시스템은 이들 모두를 능가했습니다. 이 시스템은 실제 약물처럼 보이는 분자들을 더 높은 비율로 생성했는데, 이는 분자들이 크기, 복잡성, 화학적 특성의 적절한 균형을 갖추고 있음을 의미합니다. 더 중요한 것은, 생성된 3차원 형태가 단백질 표적에 더 정밀하게 들어맞았다는 점입니다. 연구진이 생성된 분자들이 알려진 활성 약물의 결합 패턴을 재현할 수 있는지 확인했을 때, 새 시스템은 70% 이상의 사례에서 성공을 거두었으며, 이는 기존 모델들의 성공률인 35% 미만보다 크게 향상된 수치입니다. 또한 훨씬 빠르게 작동하여, 다른 모델들이 동일한 작업을 수행하는 데 13분에서 3시간 이상 걸리는 동안, 이 시스템은 약 30초 만에 500개의 유효한 분자를 생성했습니다.

이것이 단순한 컴퓨터상의 연습이 아님을 입증하기 위해, 연구팀은 특정 과제, 즉 CBL-B 억제제를 설계하는 데 이 시스템을 적용했습니다. CBL-B 단백질은 면역 체계에 브레이크 역할을 하기 때문에 암 면역 요법에서 매력적인 표적입니다. 이 단백질을 끄면 신체가 암과 더 효과적으로 싸울 수 있습니다. 연구팀은 CBL-B 단백질에 결합된 알려진 억제제에서 시작하여, 원래 약물의 두 가지 특정 부분은 유지하되 나머지 부분을 변경하여 더 나은 적합성을 찾는 새로운 분자를 생성하도록 시스템에 요청했습니다. 시스템은 수십만 개의 후보를 생성했고, 이들은 몇 개의 유망한 리드로 필터링되었습니다. 이 중 하나인 Cmpd. 7이라 명명된 화합물이 합성 및 테스트되었습니다. 이 화합물은 실험실에서 강력한 활성을 보였으며, 결정 구조 분석을 통해 컴퓨터가 예측한 대로 단백히에 결합함이 확인되었습니다.

이러한 성공을 바탕으로, 연구진은 시스템을 다시 사용하여 해당 화합물을 더욱 최적화했습니다. 그들은 Cmpd. 7에서 잘 작동하는 부분들을 유지하면서, 단백질과의 상호작용을 개선하기 위해 나머지 부분을 재설계하도록 요청했습니다. 이 생성 단계는 새로운 리드인 Cmpd. 20을 만들어냈습니다. 생쥐의 종양 모델에 테스트했을 때, Cmpd. 20은 단독으로는 어느 정도의 활성을 보였으나, 표준 PD-1 항체와 결합했을 때 종양 성장을 76% 감소시켰습니다. 또한 이 화합물은 약물 상호작용을 자주 일으키는 특정 간 효소에 대한 억제력이 낮아 초기 테스트에서 양호한 안전 프로필을 보여주었습니다. 컴퓨터 생성부터 최종 동물 실험에 이르는 전체 과정은 통합된 접근 방식이 어떻게 디지털 아이디어에서 잠재적 의약품으로 가는 경로를 간소화할 수 있는지를 보여주었습니다.

이 연구는 현재 기술의 한계도 탐구했습니다. 시스템이 매우 효과적이긴 하지만, 실제 인체 내에서 움직이는 유연한 단백질을 정적인 이미지에 의존하고 있다는 점이 한계로 지적되었습니다. 연구진은 향가 버전에서 단백질의 움직임을 통합하여 설계를 더욱 견고하게 만들 수 있다고 언급했습니다. 또한, 외부 데이터베이스에서 특정 화학적 파편(fragment)을 실시간으로 검색할 수 있도록 개선한다면, 처음부터 다시 학습할 필요 없이 새로운 과학적 발견에 적응할 수 있을 것이라고 제안했습니다. 이러한 잠로한 업그레이드들은 인공지능이 새로운 데이터가 가용해짐에 따라 끊임없이 학습하고 설계를 정교화하는, 지속적인 파트너로서 작용하는 미래를 향하고 있습니다.

UniLingo3DMol의 성공은 약물 설계의 미래가 특정 작업에 특화된 도구가 아니라, 전체 과정을 다룰 수 있는 통합된 시스템에 달려 있음을 시사합니다. 인공지능에게 분자의 화학과 표적의 기하학적 구조를 모두 아우르는 언어를 가르침으로써, 연구진은 복잡한 약물 발견의 지형을 그 어느 때보다 효율적으로 탐색할 수 있는 도구를 만들어냈습니다. 고품질의 3차원 약물 후보를 몇 초 만에 생성하고 이를 살아있는 유기체에서 검증할 수 있는 능력은 인류 건강을 위한 인공지능 적용에 있어 중요한 진전을 의미합니다. 이 연구는 컴퓨터 모델이 약물 설계에 대한 인간 전문가의 총체적인 사고 방식을 모방하도록 설계되었을 때, 이론적으로 타당할 뿐만 아니라 실제로도 효과적인 결과를 낼 수 있음을 입증합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →