← 최신 논문
🤖 AI

MolBioKG: Grounding Out-of-Graph Molecules in Biomedical Knowledge Graphs via Multi-Resolution Structural Anchoring

MolBioKG는 다해상도 구조적 앵커링(multi-resolution structural anchoring)과 적응형 LLM 기반 트래버설(adaptive LLM-driven traversal)을 통해 그래프 외부에 존재하는 SMILES 문자열을 대규모 지식 그래프에 접지(grounding)시키는 2계층 시스템을 도입함으로써, 생물 의학적 신약 개발 과정에서 미등록 분자의 콜드 스타트 문제를 해결하고 태스크별 학습 없이도 추론 정확도와 타겟 재현율을 유의미하게 향상시킨다.

원저자: Yiming Zhang, Hikaru Shindo, Shuan Chen, Kaushalya Madhawa, Jun Jin Choong, Yuna Oikawa, Takashi Fujiwara, Keisuke Ozawa

게시일 2026-08-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yiming Zhang, Hikaru Shindo, Shuan Chen, Kaushalya Madhawa, Jun Jin Choong, Yuna Oikawa, Takashi Fujiwara, Keisuke Ozawa

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 살아있는 도서관을 상상해 보세요. 이곳의 모든 책은 생물학적 지식의 한 조각입니다. 특정 약물이 어떻게 질병과 싸우는지, 단백질이 유전자와 어떻게 상호작용하는지, 혹은 왜 특정 화학 구조가 부작용을 일으키는지와 같은 것들 말이죠. 과학자들은 이를 "생물의학 지식 그래프(Biomedical Knowledge Graph)"라고 부릅니다. 이것은 컴퓨터가 새로운 질병 치료법을 찾아낼 수 있도록 돕는, 사실들이 서로 얽혀 있는 거대한 연결망과 같습니다. 하지만 여기에는 함정이 있습니다. 이 도서관에는 이미 체크인되어 목록에 등록된 분자들에 대한 책들만 존재한다는 점입니다. 만약 오늘날 한 과학자가 이전에 본 적 없는 완전히 새로운 분자를 발명한다면, 이 도서히에는 그에 대한 기록이 없습니다. 그것은 시스템 속의 "유령"이 됩니다. 컴퓨터는 그 유령의 이야기를 읽을 수 없는데, 왜냐하면 그 유령에게는 아직 도서관 회원 카드가 없기 때문입니다. 이는 매우 큰 문제입니다. 왜냐-냐면 새로운 약물들이 발명되는 속도가 사서들이 선반을 업데이트하는 속도보다 빠르기 때문입니다. 만약 우리가 이 새로운, 등록되지 않은 분자들을 기존의 지식 네트워크에 연결하지 못한다면, 우리는 생명을 구하는 치료제나 위험한 부작용을 놓칠 수도 있습니다. 문제는 바로 이것입니다. 어떻게 하면 공식적인 소개 없이 낯선 이방인을 전문가들이 가득한 방에 입성시킬 수 있을까요?

이것이 바로 MolBioKG라는 논문이 해결하고자 하는 문제입니다. 도쿄 대학교와 SB Intuitions의 연구진으로 구성된 저자들은 숙련된 번역가이자 탐정 역할을 하는 영리한 2단계 시스템을 구축했습니다. 새로운 분자가 도서관 카드를 받을 때까지 기다리는 대신, MolBioKG는 그 분자의 "DNA", 즉 화학적 구조를 살펴보고 카드를 가진 친척들을 찾아냅니다.

새로운 분자를 독특한 의상을 입고 파티장에 들어선 사람이라고 생각해 보세요. 비록 당신이 그를 만난 적은 없더라도, 그가 유명 배우와 같은 스타일의 모자를 쓰고 있거나, 록 스타와 같은 신발을 신고 있거나, 과학자와 유사한 가방을 들고 있다는 것을 알아챌 수 있습니다. MolBioKG는 분자를 네 가지 다른 "의상" 또는 관점으로 분해함으로써 이 작업을 수행합니다: 주요 골격(scaffold), 작은 구성 요소(fragments), 화학적 액세서리(functional-groups), 그리고 전체적인 지문(fingerprint)입니다. 그런 다음 시스템은 이러한 특징들을 공유하는 기존의 분자들을 검색합니다.

일단 이 "친척"들을 찾으면, 시스템은 단순히 추측만 하는 것이 아니라 그들의 연결 고리를 추적합니다. 만약 새로운 분자가 파킨슨병을 치료하는 약물과 닮았다면, 시스템은 그것이 파킨션병을 치료할 수도 있다고 제안하지만, 왜 그런 추측을 했는지에 대한 명확한 근거의 흔적을 남깁니다. 논문은 이 시스템을 세 가지 방식으로 테스트했습니다:

  1. "숨겨진 연결 고리" 테스트: 그들은 도서관에 알려진 연결 고리들을 숨긴 뒤, MolBioKG가 그것들을 다시 찾아낼 수 있는지 물었습니다. 시스템은 특히 광범위한 가능한 치료법들을 찾아내는 데 있어 이전의 최고 시스템들보다 더 뛰어난 성과를 보였습니다.
  2. "복잡한 퍼즐" 테스트: 그들은 시스템에 "이 특정 단백질을 표적으로 하는 약물들이 어떤 질병을 치료하는가?"와 같은 까다롭고 다단계적인 질문에 답하도록 요청했습니다. 여기서 그들은 마치 미스터리를 해결하는 탐정처럼 어떤 단서를 따라갈지 결정할 수 있는 Adapt-KG라는 스마트 AI 에이전트를 사용했습니다. 이 접근 방식은 복잡한 퍼즐을 해결하는 시스템의 정확도를 58.5%에서 87.6%로 끌어올렸습니다.
  3. "완전히 새로운 약물" 테스트: 이것이 진정한 '콜드 스타트(cold-start)' 도전 과제였습니다. 그들은 도서관이 알지 못했던 2011년 이후 승인된 199개의 약물을 가져와 MolBioKG에게 그 용도를 맞히도록 했습니다. 다중 관점의 탐정 작업을 사용하여, 시스템은 아무런 도움 없이 추측했을 때보다 새로운 표적을 정확히 식별하는 능력을 두 배로 높였습니다.

논문은 분자를 바라보는 방법이 단 하나에만 의존해서는 안 된다고 주장합니다. 때로는 주요 골격이 핵심이 되기도 하고, 때로는 아주 작은 파편이나 특정 화학 그룹이 전체 이야기를 들려주기도 합니다. 이 모든 관점을 하나로 융합함으로써, MolBioKG는 새로운, 미지의 분자로부터 방대한 알려진 의학적 사실들로 이어지는 "추적 가능한" 경로를 만들어냅니다. 이 시스템은 단순히 답을 내놓는 것이 아니라 증거를 보여줌으로써, 모든 예측이 실제 존재하는 생물학적 데이터에 근거하도록 보장합니다. 저자들은 이 방법이 고립되고 알려지지 않은 화학 구조를 새로운 치료를 위한 연결되고 추적 가능한 후보로 변모시키는, 미래의 신약 개발을 위한 강력한 도구라고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →