← 최신 논문
🤖 machine learning

Conditional GraphGANFed: Optimizing Graph-Structured Molecule Generation in Federated Generative Adversarial Networks

이 논문은 연합 학습 환경에서 QED 및 LogP와 같은 사용자 정의 지표를 동시에 최적화하면서 고품질의 화학적으로 유효한 분자 생성을 유도하기 위해 비평가 네트워크(critic network)를 통합한 GraphGANFed의 새로운 확장판인 cGraphGANFed를 소개하며, 이를 통해 다중 지표 최적화와 단일 목표 강화 모두에서 기존 모델보다 우수한 성능을 보여준다.

원저자: Daniel Manu, Abee Alazzwi

게시일 2026-08-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Daniel Manu, Abee Alazzwi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 의약품을 찾는 과정은 종종 끊임없이 모양이 변하는 건더기 더미 속에서 특정한 바늘 하나를 찾는 것처럼 느껴집니다. 과학자들은 질병을 치료하기 위해 인체와 상호작용할 수 있는 완전히 새로운 분자 구조(원자들의 미세한 배열)를 만들어내야 합니다. 문제는 가능한 분자의 공간이 너무나 방대하고 복잡하여, 무작위적인 확률로 유용한 것을 찾아내는 것이 거의 불가능하다는 점입니다. 전통적인 방식은 잠재적 후보군인 거대한 라이브러리를 생성한 뒤 이를 필터링하는 과정을 포함하지만, 이 과정은 느릴 뿐만 아니라 기존 라이브러리에 존재하는 부분들의 조합으로 제한되는 경우가 많습니다. 이를 가속화하기 위해 연구자들은 인공지능, 구체적으로는 생성적 적대 신경망(generative adversarial network)이라 불리는 유형의 컴퓨터 프로그램에 주목했습니다. 이 프로그램들은 마치 두 명의 경쟁하는 예술가처럼 작동합니다. 한 명은 진짜처럼 보이는 가짜 분자를 만들려고 노력하고, 다른 한 명은 그 가짜를 찾아내려고 노력합니다. 시간이 흐르면서 창조자는 자신의 직무에 매우 능숙해져서 완전히 새로운 유효한 분자들을 만들어내게 됩니다. 하지만 여기에는 함정이 있습니다. 이러한 프로그램들은 화학적으로 올바른 분자를 만들 수는 있지만, 인간에게 안전하거나 물에 잘 녹는 것과 같은 특정 목표에 최적화된 분자를 만드는 데는 어려움을 겪습니다. 더욱이, 이러한 프로그램을 훈련하는 데 필요한 데이터는 엄격한 개인정보 보호법으로 인해 종종 민간 제약사 데이터베이스에 잠겨 있어, 연구자들이 지식을 모으고 더 나은 모델을 함께 훈련하는 것을 어렵게 만듭니다.

한 연구팀은 이러한 맞춤화와 개인정보 보호라는 두 가지 문제를 해결하기 위해 'conditional GraphGANFed'라고 불리는 새로운 시스템을 개발했습니다. 이들의 접근 방식은 그래프 기반 학습과 연합 학습(federated learning)이라는 개인정보 보호 기술을 결합한 이전 방법론을 기반으로 합니다. 이 설정에서는 여러 제약 회사가 실제 화학 데이터를 전혀 공유하지 않고도 공유된 인공지능 모델을 훈련할 수 있습니다. 각 회사는 자신의 로컬 서버에 데이터를 유지하고, 로컬에서 모델을 훈련시킨 뒤, 학습된 패턴만을 중앙 조정자에게 보냅니다. 이 연구의 새로운 혁신은 일반적인 두 부분 구성에 세 번째 구성 요소인 '비평가(critic)'를 추가한 것입니다. 기존 시스템에는 분자를 만드는 생성자(generator)와 그것이 진짜처럼 보이는지를 판단하는 판별자(discriminator)가 있었지만, 새로운 비평가는 사용자가 정의한 특정 목표를 기준으로 분자를 평가하는 전문적인 심판 역할을 합니다. 만약 연구자가 약물일 가능성이 높은 분자를 원한다면, 비평가는 생성된 분자에 대해 해당 품질에 대한 점수를 매기고 이 점수를 생성자에게 다시 전달하여 생성자가 더 나은 후보를 만들도록 유도합니다.

연구진은 세 가지 서로 다른 분자 데이터 세트를 사용하여 광범한 컴퓨터 시뮬레이션을 통해 이 새로운 시스템을 테스트했습니다. 그들은 참여하는 컴퓨터들 사이에 데이터가 고르게 분포되어 있거나, 혹은 실세계의 연합 학습에서 흔히 발생하는 문제인 불균등하게 분포된 상황에서 시스템이 학습해야 하는 시나리오를 설정했습니다. 한 세트의 테스트에서, 시스템은 일곱 가지 표준 분자 품질 척도를 동시에 최적화하도록 요청받았습니다. 결과는 새로운 비평가가 포함된 시스템이 이전 버전을 크게 능가했다는 것을 보여주었습니다. 이 시스템은 더 화학적으로 유효하며, 약물이 체내에서 이동하는 핵심 요소인 지방에 대한 용해성(물 대비 지방에 녹는 성질) 측면에서 더 나은 특성을 가진 분자들을 생성했습니다. 이전 시스템도 유효한 분자를 만들어낼 수는 있었지만, 새로운 시스템은 이를 더 신뢰성 있게 수행했을 뿐만 아니라 전반적인 약물 유사성(drug-likeness)에서도 약간의 우위를 점했습니다. 또 다른 테스트 세트에서 연구진은 단 하나의 목표, 즉 약물 유사성 점수를 극대화하는 데 집중했습니다. 여기서 개선 효과는 더욱 극적이었습니다. 새로운 시스템은 이전 방법이 생성한 분자보다 이 특정 목표를 달atem하는 데 있어 10% 이상 더 뛰어난 분자들을 생성했습니다.

새로운 시스템은 더 나은 분자를 만드는 것을 넘어, 더 안정적이고 탄력적이라는 것을 입증했습니다. 인공지능에서 흔히 발생하는 문제는 '모드 붕괴(mode collapse)'로, 생성자가 새로운 가능성을 탐색하는 대신 판별자를 속이는 요령을 터득하여 동일한 몇 가지 반복적인 분자만을 계속해서 생산하는 현상입니다. 연구진은 특히 데이터가 제한적이거나 불균등하게 분포되어 있을 때 이전 시스템이 이 문제에 취약하다는 것을 발견했습니다. 비평가 네트워크가 추가된 새로운 시스템은 이러한 붕괴에 훨씬 더 효과적으로 저항하며, 다양하고 독특한 분자 구조를 지속적으로 생성했습니다. 또한 이 연구는 각 참여자가 보유한 데이터가 균일하지 않은 상황에서도 이 시스템이 잘 작동한다는 것을 확인했는데, 이는 다른 개인정보 보호 모델들이 실패하곤 하는 상황입니다. 비평가 네트워크를 연합 학습 과정에 통합함으로써, 연구진은 개별 기업이 보유한 데이터의 프라이버시를 침해하지 않으면서도 협력적인 신약 개발이 가능한 프레임워크를 구축했습니다. 시뮬레이션 결과는 이 접근 방식이 제약 연구자들이 방대한 화학적 공간을 더 효율적으로 탐색하고, 화학적으로 견고할 뿐만 아니라 새로운 신약 개발의 특정 요구에 맞춘 새로운 후보 물질들을 생성하는 데 도움이 될 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →