← 최신 논문
🤖 machine learning

Routing by Reaching: Composition of Pre-trained GFlowNets for Multi-Objective Generation

본 논문은 재학습 없이 다중 목적 생성 작업을 효율적으로 처리하기 위해 추론 시점에 사전 학습된 GFlowNet들을 합성하는 프레임워크를 제안하며, 이는 선형 스칼라화에 대한 정확한 복구와 비선형 연산자에 대한 유계 근사를 제공하는 동시에 공동 학습된 베이스라인과 대등한 성능을 달성한다.

원저자: Seokwon Yoon, Youngbin Choi, Seunghyuk Cho, Seungbeom Lee, MoonJeong Park, Dongwoo Kim

게시일 2026-07-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Seokwon Yoon, Youngbin Choi, Seunghyuk Cho, Seungbeom Lee, MoonJeong Park, Dongwoo Kim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 완벽하고 새로운 요리를 발명하려는 숙련된 셰프라고 상상해 보십시오. 당신에게는 식재료 목록이 있지만, 동시에 지켜야 할 규칙들도 있습니다. 요리는 매콤해야 하지만 너무 맵지는 않아야 합니다. 달콤해야 하지만 너무 달아서 질려서는 안 됩니다. 또한 만드는 비용은 저렴해야 하지만, 여전히 고급스러워 보여야 합니다. 인공지능의 세계에서 과학자들은 '생성 흐름 네트워크(Generative Flow Networks, 또는 GFlowNets)'라고 불리는 특별한 도구를 사용하여 이와 같은 셰프 역할을 수행하게 합니다. 이들은 요리를 하는 대신, 의약품을 위한 분자나 복잡한 그래프와 같은 새로운 것들을 '요리해 냅니다'. 이 도구들은 단순히 하나의 '최선의' 답만을 찾는 것이 아니라, 다양한 취향에 맞는 여러 가지 요리를 제공하기 위해 가능성 있는 다양한 주방 전체를 탐색한다는 점에서 매우 뛰어납니다.

하지만 현실 세계는 복잡합니다. 보통 당신은 단 한 가지만을 원하는 것이 아닙니다. 마치 분자가 강하면서도 안전하도록 만드는 것처럼, 여러 가지를 동시에 조절하고 싶어 합니다. 기존의 방식은 매번 규칙의 조합마다 새로운 셰프를 고용하는 것과 같았습니다. 만약 레시피를 '매콤하고 저렴한 것'에서 '달콤하고 안전한 것'으로 바꾸고 싶다면, 기존의 셰프를 해고하고 처음부터 다시 훈련된 완전히 새로운 셰프를 데려와야 했습니다. 이는 느리고, 비용이 많이 들며, 낭비적입니다. 과학자들이 던져온 큰 질문은 이것입니다. "이미 자신만의 특정 요리에 전문가인 셰프 팀을 데려와서, 그들을 새로 훈련시키지 않고도 즉각적으로 협력하여 새로운 복합적인 풍미를 만들어낼 수 있을까?"

이 논문은 '도달에 의한 라우팅(Routing by Reaching)'이라는 영리한 새로운 방법론을 통해 그 질문에 "예"라고 답합니다. 저자들은 사전 훈련된 AI 셰프(GFlowNets) 그룹을 가져와서 그들의 지침을 실시간으로 혼합하여 새로운 다목적 레시피를 만들어내는 스마트한 지휘자 역할을 하는 프레임워크를 제안합니다. 목표의 새로운 조합마다 새로운 모델을 훈련하는 대신, 이 시스템은 각 기존 모델이 특정 단계에 도달할 확률이 얼마나 되는지를 살펴보고, 이를 가중치로 사용하여 그들의 결정을 혼합합니다.

연구진은 단순한 조합, 예를 들어 서로 다른 목표에 가중치를 두어 합산하는 방식(선형 스칼라화라고 불리는 과정)에 대해서는, 이 혼합 방식이 수학적으로 완벽하다는 것을 발견했습니다. 즉, 처음부터 새로운 모델을 훈련했을 때 얻게 될 결과의 분포와 정확히 일치하는 분포를 만들어냅니다. 더 복잡한 비선형 조합(예를 들어 "A여야 하지만 B는 아니어야 한다"와 같은 논리를 사용하는 경우)의 경우, 이 방법이 모든 사례에서 수학적으로 완벽한 것은 아니지만, 저자들은 시뮬레이션을 통해 이 방법이 실제로 해결책을 찾고자 하는 핵심 영역인 '고품질, 고보상' 영역에서 믿기 힘들 정도로 정확하다는 것을 보여주었습니다.

이를 테스트하기 위해 연구팀은 두 가지 서로 다른 단계에서 실험을 진행했습니다. 첫째, AI가 보상 구역을 얼마나 잘 항해하는지 정확히 볼 수 있는 2D 그리드 게임(마치 비디오 게임 지도와 같은)을 사용했습니다. 여기서 그들의 방법은 목표를 섞을 때 기존의 접근 방식보다 훨씬 더 정확했으며, 특히 목표가 늘어날수록 그 차이가 두드러졌습니다. 그다음으로 연구팀은 실제 세계로 이동하여 신약 개발을 위한 새로운 분자를 생성했습니다. 그들은 미리 만들어진 조각(fragment)들을 끼워 맞추는 방식과 원자 단위로 구축하는 방식, 두 가지 유형의 분자 구축을 테스트했습니다. 이러한 실제 환경 테스트에서 그들의 방법은 매번 새로운 목표를 위해 대규모 재훈련이 필요한 모델들의 성능과 대등하거나 심지어 능가했습니다. 특히 인상적인 점은, "높은 결합 친화력을 갖되 독성은 낮아야 한다"와 같은 '논리적' 규칙을 사용할 때, 그들의 방법이 매 단계마다 무거운 계산을 수행해야 했던 기존의 최선책보다 약 30배에서 65배 더 빠르게 답을 생성했다는 것입니다.

이 논문은 이 접근 방식이 사전 훈련된 AI 모델을 재사용 가능한 구성 요소로 바꾼다는 점을 시사합니다. 음악가가 악기를 다시 녹음하지 않고도 기존의 녹음된 트랙들을 섞어 새로운 노래를 만드는 것처럼, 이 방법은 과학자들이 새로운 AI 행동을 즉석에서 작곡할 수 있게 해줍니다. 이 방법이 모든 문제를 해결하는 마법의 탄환은 아니지만(기저 모델이 잘 훈련되어 있고 목표가 너무 모순적이지 않을 때 가장 잘 작동합니다), 지속적인 재훈련이라는 막대한 비용 없이 복잡한 과학적 문제를 탐구할 수 있는 유연하고 빠르며 매우 정확한 방법을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →