← 최신 논문
🤖 machine learning

APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents

본 논문은 모델 가중치 업데이트 없이 메모리와 반성을 통해 우월한 전략을 발견할 수 있도록 자가 진화 LLM 에이전트에서 탐구 붕괴를 극복하기 위해 전략 지도와 포크 발견 메커니즘을 활용하는 자율 정책 탐구 프레임워크인 APEX 를 제안합니다.

원저자: Yibo Li, Jiashuo Yang, Zhi Zheng, Zhiyuan Hu, Yuan Sui, Shizun Wang, Yufei He, Bryan Hooi

게시일 2026-05-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yibo Li, Jiashuo Yang, Zhi Zheng, Zhiyuan Hu, Yuan Sui, Shizun Wang, Yufei He, Bryan Hooi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

APEX 논문에 대한 설명을 일상적인 비유와 함께 간단한 개념으로 나누어 정리합니다.

문제: "편안한 영역"의 함정

복잡한 비디오 게임 (예: 명령어를 입력하여 세상을 탐험하는 텍스트 어드벤처) 을 플레이하고 있다고 상상해 보세요. 당신은 똑똑한 AI 어시스턴트의 도움을 받고 있습니다.

처음에는 AI 가 문을 열고, 물건을 주우며, NPC 와 대화하는 등 다양한 시도를 합니다. 하지만 시간이 지나면 그럭저럭 점수를 주는 경로를 발견합니다. 그리고는 편안해집니다. *"이 특정 복도를 따라가서 이 열쇠 하나만 주우면 매번 점수를 얻을 수 있구나."*라고 깨닫는 것입니다.

그래서 더 이상 새로운 시도를 멈춥니다. 같은 안전한 루틴을 반복하며 함정에 빠지게 됩니다.

  • 문제점: AI 는 평균적으로 잘 수행하고 있지만, 시도해 본 적 없는 문 뒤에 숨겨져 있어 두 배의 점수를 주는 "비밀 보물방"을 찾아보는 것을 멈췄습니다.
  • 논문의 용어: 이를 **탐색 붕괴 (Exploration Collapse)**라고 합니다. 에이전트가 더 이상 탐색하지 않고 이미 알고 있는 것만 활용하여 더 나은 전략을 놓치게 되는 현상입니다.

해결책: APEX ("탐험가의 지도")

저자들은 APEX(자율 정책 탐색, Autonomous Policy Exploration) 라는 시스템을 제안합니다. AI 가 그냥 방황하거나 과거의 실수를 암기하도록 두는 대신, APEX 는 AI 에게 전략 지도를 제공합니다.

이 지도를 건물의 그림이 아니라 규칙으로 연결된 목표 체크리스트로 생각하세요.

  • 마일스톤: "열쇠 찾기"나 "상자 잠금 해제"와 같은 구체적인 목표들입니다.
  • 의존성: 이 지도는 "열쇠를 찾기 전까지는 상자의 잠금을 해제할 수 없다"는 사실을 알고 있습니다.

이 지도는 AI 의 공유된 뇌 역할을 하며, 정확히 무엇을 시도했고 무엇을 아직 시도하지 않았는지 추적합니다.

APEX 의 작동 원리: 두 엔진 시스템

APEX 는 AI 가 갇히지 않도록 두 가지 주요 메커니즘을 사용하여 가이드탐정처럼 함께 작동합니다.

1. 탐정: "분기 발견 (Fork Discovery)"

박물관을 걷고 있다고 상상해 보세요. 문이 살짝 열려 있는 것을 보지만, 앞의 그림에 집중하고 있어 그냥 지나칩니다.

  • 발생 상황: AI 는 문을 보지만 열지 않습니다.
  • 분기 발견의 역할: 게임이 끝난 후 "탐정"이 리플레이를 살펴봅니다. *"잠깐, 우리는 저 문을 보았잖아! 문을 열 기회는 있었지만 결코 열지 않았어. '문 열기'를 새로운 목표로 체크리스트에 추가하자."*라고 말합니다.
  • 결과: 지도가 확장됩니다. AI 가 무시했던 방향을 적극적으로 찾아내어 계획에 추가함으로써, AI 가 숨겨진 기회를 놓치지 않도록 보장합니다.

2. 가이드: "정책 선택 (Policy Selection)"

이제 지도에 목표 목록이 생겼으니, AI 는 다음에 어떤 목표를 처리할지 결정해야 합니다.

  • 문제점: AI 가 가장 많은 점수를 주는 것으로 알고 있는 목표만 선택한다면, 새로운 위험한 목표는 결코 시도하지 않을 것입니다.
  • 정책 선택의 역할: 이는 안전과 모험을 균형 있게 조절하는 똑똑한 가이드처럼 작동합니다. **톰슨 샘플링 (Thompson Sampling)**이라는 수학적 트릭을 사용하여 결정합니다. *"우리는 '열쇠' 목표를 10 번 시도했고 효과가 있었어. 하지만 '문' 목표는 단 한 번만 시도했어. 아직 그것이 금광인지 아닌지 모르니, 다시 문을 열어보자!"*라고 말합니다.
  • 결과: AI 는 지도의 "미탐험" 지역을 방문하도록 강제되어 함정에 빠지지 않도록 보장합니다.

개선의 사이클

몇 게임마다 시스템은 지도를 업데이트하기 위해 휴식을 취합니다.

  1. 정제: 오류를 수정합니다. (예: "우리는 문을 열기 위해 검이 필요하다고 생각했지만, 사실은 열쇠만 필요했습니다.")
  2. 전파: 통계를 업데이트합니다. (예: "'열쇠 찾기' 목표는 큰 보물로 이어지기 때문에 실제로 매우 중요합니다.")
  3. 발견: 탐정이 지도에 추가할 새로운 문을 찾습니다.

작동 이유 (결과)

연구자들은 이 시스템을 두 가지 유형의 "게임"에서 테스트했습니다.

  1. 텍스트 어드벤처 (Jericho): 명령어를 입력하는 복잡한 스토리.
  2. 웹 상호작용 (WebArena): 물건을 사거나 정보를 찾기 위해 웹사이트를 탐색하는 현실적인 작업.

발견 사항:

  • 기존 방법 (Reflexion 등): 이러한 에이전트들은 편안한 영역에 갇혔습니다. 그럭저럭 평균 점수는 얻었지만 절대적인 최선의 해결책을 거의 찾지 못했습니다.
  • APEX: 시도해 보지 않은 것을 명시적으로 추적하기 때문에, 지속적으로 더 나은 전략을 발견했습니다. 단순히 평균 점수가 높아진 것을 넘어, 다른 사람들이 놓친 "비밀 보물"을 찾아냈습니다.

요약 비유

출근길에 가장 좋은 경로를 찾으려 한다고 상상해 보세요.

  • 기존 방식: 보통 빠르기 때문에 매일 같은 길로 갑니다. 새로운 단축길이 생겼는지 확인해 본 적이 없습니다.
  • APEX 방식: 당신은 노트 (전략 지도) 를 가지고 있습니다.
    • 분기 발견은 지도를 보며 "어제 새로운 길을 보았지만 지나쳤어. 내일 시도해 보려고 적어두자."라고 말하는 것입니다.
    • 정책 선택은 "주요 도로를 20 번 탔어. 오늘 새로운 도로를 시도해서 더 빠른지 확인해 보자."라고 결정하는 것입니다.

시도한 것과 시도하지 않은 것을 구조화된 목록으로 유지함으로써, APEX 는 AI 가 게으름을 피우지 않게 하고 문제를 해결하는 더 나은 방법을 계속 발견하도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →