← 최신 논문
🤖 machine learning

PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents

PACEvolve++ 는 학습 가능한 어드바이저와 프런티어 모델을 사용하여 전략적 가설 선택과 구현을 분리하는 진화적 탐색 에이전트를 위한 강화학습 프레임워크를 도입하여, 다양한 공학 및 과학 과제에서 더 빠른 수렴과 안정적인 테스트 시간 학습을 달성하기 위해 위상 적응형 학습 전략을 활용합니다.

원저자: Minghao Yan, Bo Peng, Benjamin Coleman, Ziqi Chen, Zhouhang Xie, Shuo Chen, Zhankui He, Noveen Sachdeva, Weili Wang, Ed H. Chi, Shivaram Venkataraman, Wang-Cheng Kang, Derek Zhiyuan Cheng, Beidou Wang

게시일 2026-05-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Minghao Yan, Bo Peng, Benjamin Coleman, Ziqi Chen, Zhouhang Xie, Shuo Chen, Zhankui He, Noveen Sachdeva, Weili Wang, Ed H. Chi, Shivaram Venkataraman, Wang-Cheng Kang, Derek Zhiyuan Cheng, Beidou Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새롭고 매우 효율적인 기계를 발명하려고 한다고 상상해 보세요. 여러분에게는 약간 혼란스럽지만 천재적인 아이디어 생성기(작은 AI)와 매우 숙련된 마스터 빌더(강력한 AI)가 있습니다.

이 발명 과정을 자동화하려는 대부분의 이전 시도에서는 동일한 AI 가 두 가지 업무, 즉 아이디어를 내고 기계를 만드는 일을 모두 수행하도록 강요받았습니다. 기계가 작동하지 않으면, 아이디어가 나쁜 것인지, 아니면 빌더가 실수를 저지른 것인지 AI 가 구분할 수 없었습니다. 이는 건설 팀이 잘못된 벽돌을 사용했을 때 누수된 지붕의 책임을 건축가에게 돌리는 것과 같습니다.

**PACEvolve++**는 역할을 분리하고 작업하는 동안 '아이디어 생성기'가 더 똑똑해질 수 있도록 가르침으로써 이 문제를 해결하는 새로운 시스템입니다. 작동 원리는 다음과 같이 간단히 설명할 수 있습니다:

1. 두 팀 전략

하나의 AI 가 모든 일을 하는 대신, PACEvolve++ 는 두 명의 인원으로 구성된 팀을 사용합니다:

  • 고문 (전략가): 이는 작고 학습 가능한 AI 입니다. 이의 유일한 임무는 현재 가장 좋은 기계를 살펴보고, 새로운 아이디어를 구상하며, 어떤 아이디어가 참신한지 추측한 다음, 다음에 시도할 최상의 아이디어를 선택하는 것입니다. 이는 무엇을 시도할지 학습합니다.
  • 프런티어 모델 (빌더): 이는 이미 코딩에 매우 능숙한 방대하고 강력한 AI 입니다. 고문이 선택한 아이디어를 받아 실제 작동하는 코드로 변환합니다. 이는 어떻게 구축할지에 대한 중압을 담당합니다.

이러한 분리를 통해 시스템은 코드가 완벽한지 여부를 걱정하지 않고도 고문이 전략을 더 잘 세우도록 훈련할 수 있습니다. 코드가 실패하면 그것은 전략의 문제가 아니라 구축의 문제입니다.

2. "단계 적응형" 코치

가장 큰 도전은 완벽한 해결책에 가까워질수록 '게임'이 변한다는 점입니다. 논문은 탐색의 진행 정도에 따라 고문을 다르게 코칭해야 한다고 주장합니다.

  • 1 단계: 광범위한 탐색 (초반 게임)

    • 상황: 이제 막 시작했습니다. 아이디어는 제각각입니다. 어떤 것은 미친 듯하고, 어떤 것은 지루하며, 어떤 것은 천재적입니다.
    • 코칭: 시스템은 고문에게 말합니다: "전체 아이디어 그룹을 살펴보세요. 평균보다 일반적으로 더 좋은 아이디어는 무엇인가요? 새로운 방향을 찾아보세요!"
    • 유추: 새로운 캠프터를 찾는 스카우트를 상상해 보세요. 시작 단계에서는 넓은 그물을 던져 다양한 계곡과 언덕을 살펴봅니다. 코치는 아직 절대적으로 최선은 아니더라도 어떤 유망한 지역을 찾았다는 이유로 보상을 줍니다.
  • 2 단계: 미세 조정 (후반 게임)

    • 상황: 훌륭한 장소를 찾았지만, 이제 높이를 몇 인치 줄이거나 전망을 개선하는 것만 시도하고 있습니다. 아이디어 간의 차이는 미미합니다.
    • 코칭: 시스템은 규칙을 바꿉니다. "어떤 아이디어가 평균보다 나은가?"라고 묻는 것을 멈추고, "이 특정 아이디어가 실제로 '최대 가능' 기록을 앞당겼는가?"라고 묻기 시작합니다.
    • 유추: 이제 스카우트가 찾은 최고의 언덕에 서 있습니다. 코치는 '좋은' 언덕에는 더 이상 관심을 두지 않고, 스카우트가 현재 챔피언보다 엄격하게 더 나은 장소를 찾았는지 여부만 신경 씁니다. 새로운 장소가 그저 '괜찮은' 수준이라면 보상을 받지 못합니다. 이는 시스템이 작고 의미 없는 차이로 혼란을 겪는 것을 방지합니다.

3. 왜 이것이 중요한가

과거에 솔루션을 진화시키려던 AI 시스템은 처음부터 끝까지 동일한 '코칭' 방법을 사용하려고 시도하다가 종종 막히거나 충돌했습니다.

  • 너무 늦게 '초반 게임' 규칙을 사용하면, AI 는 작은 차이로 혼란을 겪고 미쳐버립니다 (불안정성).
  • 너무 일찍 '후반 게임' 규칙을 사용하면, AI 는 탐색을 포기하고 동일한 안전한 아이디어만 반복합니다 (막힘).

**PACEvolve++**는 탐색이 진행됨에 따라 코칭 스타일을 자동으로 전환합니다. 광범위한 탐색을 장려하는 것으로 시작하여, 실제로 기록을 깨는 미세한 개선 사항에만 보상을 주는 방식으로 원활하게 전환합니다.

결과

저자들은 이 시스템을 세 가지 어려운 실제 엔지니어링 작업에서 테스트했습니다:

  1. 컴퓨터 작업 부하 균형: 서로 다른 컴퓨터 칩이 작업을 고르게 공유하도록 보장합니다.
  2. 추천 시스템: 앱이 사용자에게 다음 비디오나 제품을 제안하는 방식을 개선합니다.
  3. 단백질 설계: 단백질 구조의 변화가 기능에 어떤 영향을 미치는지 예측합니다.

세 가지 경우 모두에서 PACEvolve++ 는 이전 방법들보다 더 빠른 속도로 더 나은 솔루션을 찾았습니다. 단순히 좋은 답을 찾은 것이 아니라, 시스템이 중간에 충돌하거나 혼란을 겪지 않고 최고의 답을 더 빠르게 찾았습니다.

간단히 말해: PACEvolve++ 는 AI 가 발명하는 방법을 가르치는 더 지적인 방법입니다. 이는 전략가와 빌더 간에 업무를 분담하며, 상황이 요구하는 순간에 정확히 '탐색하라'는 가르침에서 '세부 사항을 완벽하게 하라'는 가르침으로 전환합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →