← 최신 논문
🤖 machine learning

Amortized Molecular Optimization via Group Relative Policy Optimization

본 논문은 다양한 구조적 제약과 시작 구조에 걸친 학습을 안정화하기 위해 그룹 상대적 정책 최적화를 활용함으로써 추론 시 오라클 호출 없이 효율적인 단일 통과 분자 최적화를 달성하는 감가상각 그래프 트랜스포머 모델인 AMORTIX를 소개합니다.

원저자: Muhammad bin Javaid, Hasham Hussain, Ashima Khanna, Berke Kisin, Jonathan Pirnay, Alexander Mitsos, Dominik G. Grimm, Martin Grohe

게시일 2026-05-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Muhammad bin Javaid, Hasham Hussain, Ashima Khanna, Berke Kisin, Jonathan Pirnay, Alexander Mitsos, Dominik G. Grimm, Martin Grohe

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

마스터 셰프가 완벽한 새로운 요리를 만들어내려 한다고 상상해 보세요. 당신은 최종 레시피에 반드시 포함되어야 하는 특정의 비양보 가능한 기본 재료 (특정 종류의 파스타나 독특한 향신료 블렌드 등) 를 보유하고 있습니다. 당신의 목표는 다른 재료들을 추가하여 맛을 놀라울 정도로 좋게 만드는 것이지만, 모든 단일 조합을 실제로 요리하고 맛보며 테스트해야 합니다.

신약 개발 세계에서는 이 '맛보기' 작업을 오라클 (Oracle) 이라는 컴퓨터 프로그램이 수행합니다. 이를 실행하는 것은 매우 비용이 많이 들고 느립니다.

구식 방법: '시행착오' 셰프 (인스턴스 최적화)

현재 대부분의 과학자들은 인스턴스 최적화 (Instance Optimization) 라는 방법을 사용합니다. 이는 개선하고자 하는 각기 다른 기본 재료 하나하나마다 새로운 셰프 팀을 고용하는 것과 같습니다.

  1. 그들은 처음부터 시작합니다.
  2. 수천 가지 변형을 요리합니다.
  3. 가장 좋은 것을 찾기 위해 모두를 맛봅니다 (비싼 오라클을 호출합니다).
  4. 승자를 찾으면 전체 팀을 해고합니다.
  5. 만약 1,000 개의 서로 다른 기본 재료가 있다면, 1,000 개의 서로 다른 팀을 고용하고 1,000 개의 별도이며 비싼 맛보기 세션을 지불해야 합니다.

이 방법은 작동하지만, 많은 서로 다른 시작점이 있다면 느리고 천문학적인 비용이 듭니다.

새로운 방법: '수퍼-러너' 셰프 (감가상각 최적화)

이 논문은 감가상각 최적화 (Amortized Optimization) 라고 불리는 새로운 접근법인 AMORTIX를 소개합니다. 이는 잠시 동안 '요리 학교 (훈련)'에 가는 한 명의 천재 셰프를 고용하는 것으로 생각하세요.

  1. 훈련: 셰프는 수천 개의 예를 연구하며 "기본 재료가 매콤하면 단맛을 더한다"거나 "기본 재료가 무거우면 가벼운 것을 더한다"는 것과 같은 일반적인 규칙을 배웁니다.
  2. 성과: 셰프가 훈련을 마치면, 당신은 그에게 어떤 새로운 기본 재료라도 건네줄 수 있으며, 그는 단 1 초 만에 완벽한 요리를 즉시 설계할 수 있습니다. 그들은 다시 수천 가지 옵션을 요리하고 맛볼 필요가 없습니다. 단지 배운 것을 사용할 뿐입니다.
  3. 이익: 비용은 훈련 중에 선불로 지불됩니다. 그 이후로 새로운 레시피를 만드는 것은 거의 무료이며 즉각적입니다.

큰 문제: '쉬운 대 어려운' 퍼즐

저자들은 이전의 '수퍼-러너' 셰프들과 관련된 주요 걸림돌을 발견했습니다.

  • 일부 기본 재료는 개선하기 쉬운 것들입니다 (맛없는 수프에 소금을 넣는 것처럼). 거의 어떤 변화든 더 좋게 만듭니다.
  • 일부 기본 재료는 어려운 것들입니다 (돌을 맛있게 만들려고 시도하는 것처럼). 최고의 변화조차도 그들을 약간만 더 좋게 만듭니다.

만약 셰프를 모든 요리를 함께 비교하며 훈련시킨다면, 쉽게 높은 점수를 받는 '쉬운' 요리들이 '어려운' 요리들을 압도합니다. 셰프는 "글쎄, 훌륭한 수프를 만들었으니 내가 잘하고 있군!"이라고 생각하며 돌을 개선하지 못했다는 사실을 무시합니다. 학습 신호는 난이도가 극도로 다양하기 때문에 혼란을 겪게 됩니다.

해결책: 그룹 상대적 정책 최적화 (GRPO)

AMORTIX 는 그룹 상대적 정책 최적화 (Group Relative Policy Optimization) 라는 교묘한 트릭으로 이를 해결합니다.

셰프의 '쉬운 수프'와 '어려운 돌'을 직접 비교하는 대신, 시스템은 이들을 별도의 그룹에 배치합니다:

  • 그룹 A (쉬운 기본 재료): 셰프는 쉬운 수프의 10 가지 변형을 만듭니다. 시스템은 이들을 서로 간에만 비교합니다. "이 10 가지 수프 중 어떤 것이 가장 좋은가?"
  • 그룹 B (어려운 기본 재료): 셰프는 돌의 10 가지 변형을 만듭니다. 시스템은 이들을 서로 간에만 비교합니다. "이 10 가지 돌 중 어떤 것이 가장 덜 끔찍한가?"

동일한 '난이도 그룹' 내의 동료들에 대해 셰프를 평가함으로써, 시스템은 혼란을 겪지 않고 쉬운 작업과 어려운 작업 모두에 대한 올바른 교훈을 배웁니다.

그들이 증명한 것은 무엇인가?

저자들은 세 가지 주요 시나리오에서 AMORTIX 를 테스트했습니다:

  1. 표준 테스트 (PMO 벤치마크): 그들은 다른 최상위 방법들과 '최고의 분자를 찾아라'라는 표준 게임을 플레이했습니다. AMORTIX 는 가장 빠르고 효율적이었으며, '수퍼-러너' 방법들 중 1 위, 전체적으로는 2 위를 차지했습니다.
  2. '새로운 재료' 테스트 (스캐폴드 장식): 그들은 시스템이 이전에 본 적 없는 완전히 새로운 기본 구조들을 제공했습니다. AMORTIX 는 이를 즉시 성공적으로 개선하여, 각 새로운 기본 재료마다 수천 번 다시 요리해야 했던 다른 방법들을 능가했습니다.
  3. '퓨-샷' 테스트 (전구체 설계): 그들은 약물을 체내에서 활성화되는 '전구체 (prodrug)'로 변환하는 방법을 보여주는 단 네 가지 예시만 시스템에게 보여주었습니다. 시스템은 규칙을 학습하고 이전에 본 적 없는 52 개의 완전히 다른 약물에 이를 성공적으로 적용하여 유효하고 작동하는 설계를 즉시 생성했습니다.

결론

AMORTIX 는 새로운 문제마다 처음부터 시작하는 대신 많은 예제를 한꺼번에 연구하여 약물을 설계하는 법을 배우는 새로운 AI 도구입니다. 이는 쉬운 화학 구조와 어려운 화학 구조 모두를 처리할 수 있도록 하는 스마트한 그룹화 트릭을 사용하여, 과학자들이 새로운 약물 아이디어 하나하나마다 수천 번의 컴퓨터 시뮬레이션을 실행하는 높은 비용을 치르지 않고도 최적화된 약물 후보를 즉시 생성할 수 있게 합니다.

참고: 해당 논문은 명시적으로 AI 가 이러한 분자들을 설계하지만, 현재는 2 차원 화학 구조 (평면 도면) 만으로 작동하며 실제 물리적 약물 결합에 중요한 3 차원 형태나 입체화학은 아직 고려하지 않는다고 밝히고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →