CoEvo-Mem: Co-Evolving Retrieval Policy and Memory Bank for LLM Agents
CoEvo-Mem은 검색 정책과 메모리 뱅크의 진화를 교대 업데이트와 궤적 조건부 피드백을 통해 동시에 최적화함으로써, 장기 LLM 에이전트의 메모리 접근과 정제 사이의 근본적인 상호 의존성을 해결하여 다양한 벤치마크에서 최첨단 성능을 달성하는 폐쇄 루프 프레임워크이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 똑똑하지만 잘 까먹는 로봇에게 복잡한 비디오 게임을 가르치고 있다고 상상해 보세요. 이 로봇은 거대한 뇌(대규모 언어 모델)를 가지고 있어 말하고 생각할 줄 알지만, 한 번에 담을 수 있는 정보량(작업 기억)은 아주 적습니다. 마치 퍼즐 조각 중 마지막 세 개만 보면서 문제를 풀어야 하는 것과 같습니다. 긴 시간 동안 게임을 잘 해내려면 과거의 경험을 찾아볼 수 있는 도서관이 필요합니다. 여기서 **검색 증강 생성(Retrieval-Augmented Generation, RAG)**이 등장합니다. 이것은 로봇이 사서에게 "헤이, 전에 이런 퍼즐을 본 적이 있나요?"라고 묻는 것과 같습니다.
하지만 이 로봇이 완벽하게 작동하려면 두 가지가 필요합니다. 첫째, 현재의 질문에 맞는 적절한 옛 노트를 찾아내는 데 능숙한 사서(검색 정책)가 필요합니다. 둘째, 어떤 노트가 정말 유용한지 결정하고 게임이 어려워짐에 따라 그 노트들을 업데이트하고 정리하는 데 능숙한 기록관(메모리 뱅크)이 필요합니다. 오랫동안 과학자들은 사서를 더 똑똑하게 만들면서 기록관은 고정된 상태로 두거나, 기록관을 더 좋게 만들면서 사서는 그대로 두는 방식을 시도해 왔습니다. 하지만 만약 사서가 노트를 찾는 법을 알기 위해 노트가 어떻게 구성되어 있는지 알아야 하고, 기록관은 더 잘 정리하기 위해 사서가 무엇을 찾고 있는지 알아야 한다면 어떨까요? 그들은 서로를 위해 함께 학습해야 합니다.
이것이 바로 CoEvo-Mem이라는 논문이 탐구하는 내용입니다. 저자들은 "사서"와 "기록관"이 함께 진화하며, 서로의 일을 더 잘하도록 끊임없이 가르치는 시스템을 제안합니다. 그들은 코딩, 과학 문제 해결부터 컴퓨터 운영 체제 제어에 이르기까지 일곱 가지 유형의 도전적인 과제들을 통해 이 아이디어를 테스트했습니다. 결과는 이 두 부분이 동기화되어 학습할 때, 로봇이 분리되어 학습할 때보다 훨씬 더 길고 복 복잡한 문제를 해결하는 데 유의미하게 더 나아진다는 것을 보여줍니다.
문제점: 끊어진 피드백 루프
당신이 거대한 역사 시험을 위해 공부하고 있다고 상상해 보세요. 당신에게는 플래시 카드 뭉치(당신의 기억)와 학습 가이드(당신의 검색 정책)가 있습니다. 만약 학습 가이드가 형편없다면, 당신은 복습할 잘못된 카드를 고르게 될 것입니다. 하지만 만약 플래시 카드가 엉망이고 무질서하다면, 아무리 좋은 학습 가이드라도 적절한 카드를 찾기 어려울 것입니다.
AI 에이전트의 세계에서도 기존 방식들은 문제의 한쪽 면을 해결하면서 다른 쪽 면은 무시하곤 합니다. 어떤 방법은 AI가 기억을 요청하는 방식(검색)을 개선하려 하고, 다른 방법은 AI가 기억을 저장하고 정리하는 방식(진화)을 개선하려 합니다. 이 논문의 저자들은 이러한 분리가 실수라고 주장합니다. 그들은 무시되었던 "근본적인 피드백 루프"를 지적합니다:
- 검색은 무엇이 사용될지를 결정합니다: 만약 AI가 잘못된 기억을 선택한다면, 그 기억은 과제에 도움을 주거나 해를 끼치는 데 있어 아무런 "공로(credit)"를 인정받지 못합니다.
- 메모리 업데이트는 미래를 바꿉니다: 만약 AI가 일어난 일에 기반하여 메모리를 업데이트한다면, 메모리가 조직되는 방식이 바뀌며, 이는 다음번에 그 메모리를 찾기 더 어렵거나 쉽게 만듭니다.
만약 메모리를 변화시키지 않고 검색 방식만 고치거나, 반대로 검색 방식은 그대로 둔 채 메모리만 개선한다면, 둘이 함께 발전할 기회를 놓치게 됩니다. 이것은 마치 현의 두께가 계속 변하는 기타를 조율하는 것과 같습니다; 두 가지를 동시에 조절하지 않으면 완벽한 소리를 낼 수 없습니다.
해결책: CoEvo-Mem
저자들은 CoEvo-Mem(공진화 메모리)이라는 프레임워크를 구축했습니다. 이것은 두 파트너 사이의 춤과 같습니다: 라우터(사서)와 메모리 뱅크(기록관).
이 춤이 작동하는 방식은 다음과 같습니다:
1. 얼어붙은 뇌와 똑똑한 라우터
AI의 메인 "뇌"(대규모 언어 모델)는 얼어붙은 상태로 유지됩니다—즉, 새로운 것을 배우지 않습니다. 대신, 시스템은 도움을 요청하는 방식을 결정하기 위해 작고 가벼운 "라우터"를 사용합니다.
- 질문이 들어오면, 얼어붙은 뇌는 질문을 재작성하는 몇 가지 방법(어떤 것은 의미에 집중하고, 어떤 것은 특정 키워드에 집중함)을 제안합니다.
- 그다음 라우터는 게임의 결과에 따라 이 제안들을 미세하게 조정하는 법을 배웁니다. 이는 마치 코치가 게임 결과를 바탕으로 "다음에는 이런 방식으로 물어보렴"이라고 속삭이는 것과 같습니다.
2. 살아있는 지도로서의 메모리 뱅크
메모리는 단순한 노트 목록이 아니라 **관계형 그래프(Relational Graph)**입니다. 모든 메모리가 도시이고, 도시 사이의 도로가 그들의 관계를 보여주는 지도라고 상상해 보세요.
- **밀집된 도로(Dense roads)**는 의미가 같은 메모리들을 연결합니다(의미론적).
- **희소한 도로(Sparse roads)**는 특정 단어나 이름을 공유하는 메모리들을 연결합니다(어휘적).
- **시간의 도로(Time roads)**는 순차적으로 일어난 메모리들을 연결합니다(시간적).
AI가 과제를 해결할 때, 단순히 정답만 저장하는 것이 아닙니다. 그것은 방문한 도시들의 "가치"를 업데이트합니다. 만약 어떤 메모리가 AI가 승리하는 데 도움이 되었다면, 그 도시는 더 높은 점수를 받습니다. 만약 도움이 되었지만 조금뿐이었다면, 점수가 약간 올라갑니다. 결정적으로, 이 공로는 해당 메모리에만 머물지 않고 도로를 따라 이웃 도시들로 전달되어, 전체 동네를 더 똑똑하게 만듭니다.
3. 교차하는 춤 (비법)
"왜 라우터와 메모리를 동시에 업데이트하지 않나요?"라고 물을 수 있습니다. 저자들은 이것이 혼란을 야기한다는 것을 발견했습니다. 만약 둘 다 동시에 변한다면, 자전거를 배우는 동안 자전거의 모양도 계속 변하는 것과 같습니다. 시스템은 혼란에 빠지고 불안정해집니다.
대신, CoEved-Mem은 **교차 스케줄(alternating schedule)**을 사용합니다:
- 단계 1: 메모리 뱅크가 얼어붙습니다(고정됩니다). 라우터는 이 고정된 지도를 사용하여 최선의 메모리를 찾는 연습을 합니다.
- 단계 2: 라우터가 얼어붙습니다(고정됩니다). 메모리 뱅크는 라우터가 방금 찾아낸 것에 기반하여 자신의 조직과 가치를 업데이트합니다.
- 이 과정을 번갈아 수행합니다. 이를 통해 각 파트너는 다른 파트너가 동시에 변함으로 인한 혼란 없이, 상대방의 현재 상태로부터 배울 수 있습니다.
연구 결과
팀은 일곱 가지 매우 다른 도전 과제들에 대해 CoEvo-Mem을 테스트했습니다:
- 운영 체제 상호작용: 작업을 수행하기 위해 컴퓨터를 제어함.
- 코드 생성: 작동하는 컴퓨터 프로그램을 작성함.
- 멀티모달 추론: 텍스트와 이미지가 결합된 퍼즐을 해결함.
- 과학적 질문: 물리학, 화학, 생물학에 관한 어려운 질문에 답함.
- 함수 호출(Function Calling): AI가 도구와 API를 올바르게 사용하도록 가르침.
- 장기 대화: 긴 채팅에서 세부 사항을 기억함.
모든 테스트에서 CoEvo-Mem은 기존의 가장 우수한 방법들보다 더 뛰어난 성능을 보였습니다.
- GPQA Diamond(어려운 과학 질문)에서, 기존의 가장 강력한 베이스라인보다 7.50 퍼센트 포인트 향상된 점수를 기록했습니다.
- LiveCodeBench(코딩)에서, 3.81 퍼센트 포인트 향상되었습니다.
- **장기 대화 기억(LoLoMo)**에서, 다음으로 좋은 방법보다 거의 5점 차이로 앞선 81.71의 점수에 도달했습니다.
저자들은 또한 시스템의 특정 부분을 제거했을 때 어떤 일이 일어나는지 보여주는 "절제 실험(ablation studies)"을 실시하여 왜 이것이 작동하는지 증명했습니다.
- 쿼리 재작성(query rewriting)(질문을 던지는 방식을 바꾸는 부분)을 제거했을 때, 성능이 크게 떨어졌습니다.
- 메모리 진화(memory evolution)(그래프와 가치를 업데이트하는 부분)를 제거했을 때도, 특히 코딩이나 과학 같은 복잡한 과제에서 성능이 하락했습니다.
- 만약 (교차 방식 대신) 라우터와 메모리를 동시에 업데이트하려고 시도했을 때, 시스템은 교차 방식보다 성능이 더 낮았습니다.
핵심 요약
이 논문은 AI 에이전트가 진정으로 장기적인 과제를 마스터하기 위해서는, 단순히 더 나은 검색 엔진이나 더 나은 데이터베이스를 만드는 것만으로는 부족하다고 시사합니다. 우리는 검색 엔진과 데이터베이스가 서로에게 적응하도록 만드는 시스템을 구축해야 합니다. "사서"와 "기록관"이 한쪽이 멈춰 있는 동안 번갈아 가며 학습하게 함으로써, CoEvo-Mem은 AI 에이전트가 더 잘 기억하고, 더 명확하게 생각하며, 더 어려운 문제를 해결할 수 있도록 돕는 안정적이고 개선되는 루프를 만들어냅니다.
저자들은 이 결과가 이 일곱 가지 벤치마크에서 강력하다는 점을 분명히 하며, 이것이 공진화를 위한 특정한 프레임워크임을 명시합니다. 그들은 이것이 AI의 모든 문제를 해결한다고 주장하는 것이 아니라, 검색과 메모리를 이렇게 연결하는 방식이 에이전트가 시간이 지남에 따라 학습하고 적응하는 데 있어 강력한 진전임을 보여준다는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.