← 최신 논문
🧬 biology

Pushing Biomolecular Utility-Diversity Frontiers with Supergroup Relative Policy Optimization

본 논문은 후보 슈퍼그룹으로부터 집합 수준의 다양성 보상을 구성하여 생체분자 생성 작업에서 유용성과 다양성을 효과적으로 분리하고 동시에 최적화함으로써 다양한 분자 및 단백질 설계 벤치마크에서 유용성-다양성 파레토 프론티어를 확장하는 유연한 프레임워크인 슈퍼그룹 상대 정책 최적화 (SGRPO) 를 소개합니다.

원저자: Xinwu Ye, He Cao, Hao Li, Bin Feng, Zijing Liu, Xiangru Tang, Yu Li, Shenghua Gao

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xinwu Ye, He Cao, Hao Li, Bin Feng, Zijing Liu, Xiangru Tang, Yu Li, Shenghua Gao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

마스터 셰프가 새로운 요리를 발명한다고 상상해 보세요. 당신은 두 가지 주요 목표를 가지고 있습니다:

  1. 맛 (유틸리티): 요리는 맛있어야 하며 특정 기준 (예: "저칼로리", "매운맛", 또는 "글루텐 프리") 을 충족해야 합니다.
  2. 다양성 (다양성): 당신은 똑같은 매운 파스타 100 가지를 만들고 싶지 않습니다. 대신 여러 가지 다른 독특한 옵션이 있는 메뉴를 원합니다.

문제:
약물 개발을 위한 AI 생성 분자나 생물학을 위한 단백질 분야에서 현재의 AI 셰프들은 하나의 완벽한 요리를 만드는 데는 탁월합니다. 하지만 "맛있는" 요리를 100 가지 만들어 달라고 요청하면, 그들은 종종 고착됩니다. 그들은 같은 파스타 요리의 100 가지 약간 다른 버전을 만들 수 있습니다. 그들은 "완벽한 맛"에 너무 집중하기 때문에 다양성을 잃습니다.

기존 방법들은 AI 에게 "이전에 만든 것을 다시 만들지 마라"고 말함으로써 이를 해결하려 합니다. 하지만 이는 셰프에게 "어제 소금을 썼으니 오늘 소금을 쓰지 마라"고 말하는 것과 같습니다. 이는 간접적인 해결책으로, 때로는 음식 맛이 이상해지거나 셰프가 먹을 수 없는 잡동사니를 만들게 할 수 있습니다.

해결책: SGRPO (수퍼그룹 상대적 정책 최적화)
이 논문은 SGRPO라는 새로운 학습 방법을 소개합니다. 이를 "그룹 미각 테스트" 전략으로 생각하세요.

각 요리를 하나씩 평가하는 대신, SGRPO 는 AI 의 시도들을 그룹 (예: 100 가지 요리의 "수퍼그룹") 으로 조직합니다.

이것이 우리 주방 비유를 사용하여 단계별로 어떻게 작동하는지 살펴봅시다:

  1. 그룹 챌린지: AI 는 특정 요청 (예: "매운 저칼로리 식사를 만들어라") 을 위해 100 가지 요리의 한 배치를 만들도록 요청받습니다.
  2. 그룹 점수: 시스템은 전체 배치를 살펴보고 "이 100 가지 요리는 서로 얼마나 다른가?"라고 묻습니다.
    • 배치가 100 가지 독특한 레시피 (샐러드, 커리, 수프, 타코 등) 를 포함하면, 그룹은 높은 다양성 점수를 받습니다.
    • 배치가 같은 파스타의 100 가지 버전을 포함하면, 그룹은 낮은 다양성 점수를 받습니다.
  3. 비교: AI 는 이러한 배치를 여러 번 만듭니다. 그리고 비교합니다. "배치 A 는 매우 다양했다; 배치 B 는 지루했다."
  4. "Leave-One-Out" 트릭 (비밀 소스): 이것이 영리한 부분입니다. 시스템은 전체 그룹을 보상할 뿐만 아니라, 어떤 특정 요리가 그룹을 다양하게 만들었는지 파악합니다.
    • 시스템은 묻습니다: "이 특정 타코를 그룹에서 제거하면 그룹이 여전히 다양할까?"
    • 타코를 제거하면 그룹이 지루해지면, 그 타코는 독창성으로 인해 엄청난 보너스를 받습니다.
    • 타코를 제거해도 큰 변화가 없다면 (10 개의 다른 타코가 있기 때문에), 그 타코는 더 작은 보너스를 받습니다.
  5. 보상: AI 는 최고의 점수를 얻으려면 맛있으면서도 그룹의 다양성에 진정으로 기여하는 독특한 요리를 만들어야 한다는 것을 학습합니다.

왜 이것이 더 나은가요?

  • "에코 챔버"의 종말: 기존 방법들은 종종 AI 가 단순히 다르기 위해 다르게 만들도록 강요하여 나쁜 결과를 초래했습니다. SGRPO 는 유용한 다양성을 보상합니다.
  • "파레토 프론티어": 수학 용어로, 이 논문은 SGRPO 가 "프론티어"를 바깥쪽으로 밀어낸다고 주장합니다. X 축을 "맛"으로, Y 축을 "다양성"으로 하는 그래프를 상상해 보세요.
    • 기존 AI 는 높은 맛과 낮은 다양성, 또는 높은 다양성과 낮은 맛을 얻을 수 있었습니다.
    • SGRPO 는 AI 가 동시에 높은 맛과 높은 다양성을 얻을 수 있게 합니다. 이는 가능한 옵션의 메뉴를 확장합니다.

어디서 이를 테스트했나요?
저자들은 이 "그룹 미각 테스트"를 세 가지 실제 요리 챌린지에서 테스트했습니다:

  1. 새로운 작은 분자 발명 (약물을 위한 새로운 화학 구조를 처음부터 창조하는 것).
  2. 특정 주머니에 맞는 분자 설계 (단백질 결합 부위와 같은 특정 잠금 장치에 맞는 열쇠를 설계하는 것).
  3. 새로운 단백질 설계 (새로운 생물학적 서열을 창조하는 것).

결과:
세 가지 경우 모두에서 SGRPO 는 이전 방법들보다 더 넓은 범위의 고품질 옵션을 생산했습니다. 이는 단순히 AI 를 "무작위"로 만든 것이 아니라, 특정 기능에 대한 필요성과 창의적 다양성에 대한 필요성 사이를 더 똑똑하게 균형을 잡도록 만들었습니다.

한 마디로:
SGRPO 는 AI 가 자신을 복제하는 것을 멈추도록 가르치는 학습 방법입니다. 각 시도를 고립적으로 평가하는 대신, 시도들의 그룹을 평가하여 모든 단일 항목이 혼합물에 새롭고 가치 있는 무언가를 추가하는 배치를 만드는 AI 를 보상합니다. 이는 더 넓고 유용한 과학적 발견의 선택지로 이어집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →