← 최신 논문
🤖 AI

Harnessing Agentic Evolution

본 논문은 메타에이전트가 축적된 컨텍스트에 기반하여 진화 절차 자체를 편집하는 상호작용 환경으로 에이전트 진화를 다루는 메타 편집 프레임워크인 AEvo 를 소개함으로써, 경직된 접근법과 유연한 접근법을 통합하여 장시간 검색 및 최적화 작업에서 최첨단 성능을 달성합니다.

원저자: Jiayi Zhang, Yongfeng Gu, Jianhao Ruan, Maojia Song, Yiran Peng, Zhiguang Han, Jinyu Xiang, Zhitao Wang, Caiyin Yang, Yixi Ouyang, Bang Liu, Chenglin Wu, Yuyu Luo

게시일 2026-05-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiayi Zhang, Yongfeng Gu, Jianhao Ruan, Maojia Song, Yiran Peng, Zhiguang Han, Jinyu Xiang, Zhitao Wang, Caiyin Yang, Yixi Ouyang, Bang Liu, Chenglin Wu, Yuyu Luo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 어려운 퍼즐을 풀려고 상상해 보세요. 예를 들어, 원을 정사각형 안에 완벽하게 채우는 방법을 찾거나, 놀라울 정도로 빠르게 실행되는 컴퓨터 프로그램을 작성하는 것과 같습니다. 이때 당신을 도와줄 똑똑한 조수 (AI 에이전트) 가 있다고 가정해 봅시다.

구식 방법: 두 가지 결함 있는 접근법

이 논문이 나오기 전까지, 사람들은 이러한 문제들을 반복적으로 해결하기 위해 AI 를 활용하는 두 가지 주요 방식을 사용했습니다:

  1. 경직된 로봇: AI 에게 엄격하고 변경 불가능한 규칙책을 줍니다. "이것을 시도해 보고, 점수를 확인한 뒤, 나쁘면 저것을 시도해라."라고 지시합니다. 이는 신뢰할 수 있지만, 규칙책이 루프에 갇히면 로봇은 영원히 같은 쓸모없는 행동을 계속 반복합니다. 로봇은 실수로부터 배우어 작동 방식을 변경할 수 없습니다.
  2. 자유로운 천재: AI 에게 일반적인 목표를 부여하고 나머지는 스스로 알아내게 합니다. 매우 유연하고 창의적입니다. 하지만 수천 가지 시도를 하다 보면 혼란에 빠집니다. 무엇이 작동했는지 잊어버리거나, 나쁜 생각에 산만해지거나, 이미 끝났다고 생각하여 너무 일찍 포기할 수 있습니다. 자유는 너무 많고 구조는 부족합니다.

두 방법 모두 방대한 양의 데이터 (실패한 시도, 성공 사례, 메모 등) 를 수집합니다. 하지만 그 모든 데이터를 검토하여 "이봐, 우리가 이 일을 하는 방식이 망가졌어. 규칙을 바꿔보자"라고 말할 수 있는 방법이 부족합니다.

신식 방법: AEVO (에이전트 진화)

저자들은 AEVO(Agentic Evolution) 를 소개합니다. 그들은 전체 문제 해결 과정을 AI 에게 할당된 '작업'이 아니라, '메타 에이전트 (코치)'가 플레이하는 비디오 게임 레벨로 간주합니다.

간단한 비유를 통해 작동 원리를 설명해 보겠습니다:

  • 플레이어 (진화 에이전트): 퍼즐을 풀려고 노력하는 AI 입니다. 후보 (해결책) 를 생성하고, 평가를 받은 뒤 다시 시도합니다.
  • 게임 보드 (환경): 실패한 시도, 점수, 메모, 현재 상태 등 게임의 모든 역사가 여기에 저장됩니다. 점수판과 리플레이 테이프가 합쳐진 것과 같습니다.
  • 코치 (메타 에이전트): 이것이 AEVO 의 특수한 AI 입니다. 코치는 퍼즐을 직접 풀려고 하는 대신 플레이어를 관찰합니다.
    • 반전: 코치는 단순히 "더 열심히 노력해"라고 말하지 않습니다. 대신 규칙책을 편집하거나 플레이어의 훈련 매뉴얼을 변경합니다.
    • 플레이어가 퍼즐의 잘못된 부분을 보고 있어 계속 실패한다면, 코치는 플레이어가 다른 곳을 보도록 지시하는 내용을 규칙책에 다시 씁니다.
    • 플레이어가 시간을 낭비한다면, 코치는 작동하는 것에 집중하도록 전략을 변경합니다.

'하네스': 안전망

이 논문은 '하네스 (harnessed)'된 설계를 강조합니다. 플레이어를 야생의 말이라고 상상해 보세요. 하네스는 마구간과 고삐입니다.

  • 플레이어가 점수를 속이거나 조작하지 못하도록 '심판 (평가자)'을 보호합니다.
  • 코치가 전체적인 그림을 볼 수 있도록 모든 시도에 대한 완벽하고 체계적인 기록을 유지합니다.
  • 코치가 규칙을 변경할 때, 그 변경 사항이 안전하고 명확하게 적용되도록 보장합니다.

시도했을 때 어떤 일이 일어났을까요?

연구자들은 이 시스템을 세 가지 유형의 도전 과제에서 테스트했습니다:

  1. 표준 논리 퍼즐: (ARC-AGI-2 와 같은 것)
  2. 터미널 작업: (명령 줄에서 컴퓨터 코드를 수정하는 것과 같은 것)
  3. 개방형 최적화: (컴퓨터 프로그램을 가능한 한 빠르게 실행되게 만드는 것과 같은 것)

결과:

  • 더 높은 점수: AEVO 는 다른 다섯 가지 최상위 방법을 능가했습니다. 표준 논리 테스트에서 기존 최상위 방법 대비 성능이 26% 향상되었습니다.
  • 더 빠른 최적화: 개방형 작업에서 동일한 시간과 비용 (컴퓨팅 파워) 이 주어졌을 때, 다른 방법들보다 더 나은 해결책을 찾았습니다.
  • 정체국 돌파: 다른 방법들이 갇혀서 (더 이상 개선할 수 없는 '정체국'에 도달하여) 멈췄을 때, AEVO 의 코치는 개입하여 현재 전략이 실패하고 있음을 깨닫고 벽을 뚫기 위해 전략을 다시 작성했습니다.

요약

AEVO 를 단순히 일을 시키기 위해 직원을 고용하는 것이 아니라, 직원을 관찰하고 게임 테이프를 검토한 뒤 직원을 더 잘 만들도록 직무 설명서를 다시 쓰는 코치를 고용하는 시스템으로 생각하세요. 이는 시행착오라는 messy 한 과정을, 답변뿐만 아니라 탐색 방법 자체가 더 똑똑해지도록 하는 구조화된 학습 루프로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →