← 최신 논문
💬 NLP

Empirical-MCTS: Continuous Agent Evolution via Dual-Experience Monte Carlo Tree Search

Empirical-MCTS는 로컬 탐색과 글로벌 메모리 시스템을 통합하여 대규모 언어 모델의 추론 능력을 향상시키는 이중 루프 프레임워크를 도입하며, 쌍체 경험 진화 메타 프롬프팅(Pairwise-Experience-Evolutionary Meta-Prompting)과 메모리 최적화 에이전트를 활용하여 적응형 메타 프롬프트를 지속적으로 진화시키고 문제 전반에 걸쳐 통찰을 증류함으로써, 복잡한 추론 벤치마크에서 상태 비저장(stateless) MCTS 전략을 크게 능가합니다.

원저자: Hao Lu, Haoyuan Huang, Yulin Zhou, Chen Li, Ningxin Zhu

게시일 2026-02-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hao Lu, Haoyuan Huang, Yulin Zhou, Chen Li, Ningxin Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 어려운 퍼즐, 예를 들어 복잡한 수학 문제나 논리 퀴즈를 풀려고 노력하고 있다고 상상해 보십시오.

과거의 방식: "건망증" 천재
현재 대부분의 고급 AI 모델은 매 퍼즐을 풀 때마다 완전한 건망증을 앓는 똑똑한 천재처럼 행동합니다. 그들은 문제를 해결하기 위해 100가지 다른 방법을 시도하고, 작동하는 단 하나의 방법을 찾아내어 축하할 수도 있습니다. 하지만 다음 퍼즐로 넘어가는 순간, 방금 배운 모든 것을 잊어버립니다. 그들은 방금 배운 기술이 지난번에 어떻게 작동했는지 "기억"하지 못하며, 마치 이전에 퍼즐을 본 적이 없는 것처럼 새로운 문제를 처음부터 다시 다룹니다. 특정 요령이 왜 효과가 있었는지 기억하지 못하기 때문에, 그것을 다시 발견하는 데 시간을 허비합니다.

새로운 방식: Empirical-MCTS (지혜를 수집하는 탐정)
이 논문은 Empirical-MCTS라는 새로운 시스템을 소개합니다. 이 AI를 건망증 환자가 아니라, 계속해서 커지는 체계적인 사건 파일을 관리하는 탐정이라고 생각하십시오. 이 탐정은 단서 하나를 풀거나 실수를 할 때마다 단순히 종이를 버리지 않습니다. 대신, 무엇이 효과적이었는지 분석하고, 그것을 기록하여 영구적인 "지혜 도서관(Wisdom Library)"에 추가합니다.

이 시스템은 두 가지 주요 "루프" 또는 습관을 사용하여 작동합니다.

1. 로컬 루프: "토론 클럽" (PE-EMP)

AI의 내부에서, 특정 문제를 해결하려고 노력하는 동안, AI는 단순히 추측만 하지 않습니다. 대신 토론 클럽처럼 행동합니다.

  • 그것은 두 가지 서로 다른 가능한 답(Candidate A와 Candidate B라고 부릅시다)을 생성합니다.
  • 그것은 이 둘을 "토론"에 부치며, AI 스스로가 심판 역할을 합니다.
  • 단순히 승자를 뽑는 대신, 심판은 이렇게 묻습니다: "왜 A가 이겼는가? B가 놓친 어떤 구체적인 규칙을 A는 따랐는가?"
  • 이 토론을 바탕으로, AI는 실시간으로 자신의 "지침서(meta-prompt)"를 다시 작성합니다. 이것은 마치 학생이 "아, 최종 답을 쓰기 전에 수학 계산을 먼저 확인해야겠구나"라고 깨닫고, 다음 단계를 위해 즉시 자신의 학습 가이드를 업데이트하는 것과 같습니다.

2. 글로벌 루프: "사서" (메모리 최적화)

"토론 클럽"이 현재 문제에 매달려 있는 동안, 별도의 "사서" 에이전트가 지켜보고 있습니다.

  • 만약 토론 클럽이 아주 훌륭한 새로운 요령을 발견하거나 피해야 할 흔한 실수를 찾아낸다면, 사서는 단순히 원문 텍스트를 저장하는 데 그치지 않습니다.
  • 사서는 스마트한 편집자처럼 행동합니다. 사서는 공간을 절약하기 위해 새로운 규칙을 추가하거나, 유사한 두 규칙을 하나로 병합하거나, 약간 틀린 기존 규칙을 수정하거나, 더 이상 유용하지 않은 규칙을 삭제할 수 있습니다.
  • 이를 통해 AI가 문제를 풀 때마다 점점 더 똑똑하고 정교해지는 "살아있는" 지혜의 도서관이 만들어집니다.

결과: "공부" 없이 똑똑해지기

보통 AI를 더 똑똑하게 만들려면 "학습(training)"을 시켜야 하는데, 이는 인간에게 몇 달 동안 학교에 가서 모든 것을 다시 배우도록 강요하는 것과 같습니다. 이는 비용이 많이 들고 느립니다.

Empirical-MCTS는 다릅니다. 이것은 AI의 뇌(가중치)를 바꾸지 않습니다. 대신 AI의 **컨텍스트(context)**를 바꿉니다.

  • 이것은 표준 AI 모델(똑똑하지만 경험이 적은 학생과 같은)을 가져옵니다.
  • 그리고 그 학생에게 자신의 과거 성공과 실패가 담긴 끊임없이 업데이트되는 "치트 시트(요약 노트)"를 줍니다.
  • 이 치트 시트 덕분에, 학생은 비록 근본적인 뇌는 변하지 않았음에도 불구하고, 이전보다 훨씬 더 뛰어난 성과로 매우 어려운 문제들(고급 수학 경시 대회나 추상적 추론 과제 등)을 해결할 수 있습니다.

논문의 발견 사항

저자들은 이 방식을 사용 가능한 가장 어려운 논리 및 수학 테스트(AIME 수학 경시 대회 및 추상적 추론 과제 등)에 적용했습니다.

  • 건망증 AI (표준 방식)는 가장 어려운 문제에서 자주 막히거나 포기했습니다.
  • 지혜 수집형 AI (Empirical-MCTS)는 현저히 더 많은 문제를 해결했습니다.
  • 비용 효율성: 그들은 이 방법을 더 작고 저렴한 AI 모델에 사용했을 때, 훨씬 더 크고 비싼 모델들을 능가한다는 것을 발견했습니다. 이것은 완벽하게 공유된 플레이북을 가진 작은 팀이, 과거의 경기 기억이 전혀 없는 거대한 팀을 이기는 것과 같습니다.

요약하자면: 이 논문은 만약 AI가 자신의 추론 패턴을 "기억"하고 진행하면서 자신의 지침을 스스로 업데이트하도록 가르친다면, 재학습 없이도 문제 해결의 명수가 될 수 있음을 보여줍니다. 이것은 "상태가 없는(stateless)" 탐색을 지속적인 학습의 여정으로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →