← 최신 논문
🤖 AI

Memory as Action: Autonomous Context Curation for Long-Horizon Agentic Tasks

본 논문은 장기적 에이전트 작업을 위한 효율적이고 적응적인 컨텍스트 큐레이션을 가능하게 하고, 훨씬 더 큰 모델의 정확도를 달성하면서 컨텍스트 길이를 크게 단축하기 위해 강화 학습을 통해 최적화되는 학습 가능한 정책 행동으로 작업 기억 관리를 취급하는 메모리 - 액션 (MemAct) 프레임워크를 소개합니다.

원저자: Yuxiang Zhang, Jiangming Shu, Ye Ma, Xueyuan Lin, Shangxi Wu, Jitao Sang

게시일 2026-05-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuxiang Zhang, Jiangming Shu, Ye Ma, Xueyuan Lin, Shangxi Wu, Jitao Sang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 다단계 퍼즐을 푸는 상황을 상상해 보세요. 복잡한 여행 계획을 세우거나 방대한 소프트웨어 프로그램을 디버깅하는 것과 같습니다. 여러분은 거대한 화이트보드 (컴퓨터의 메모리) 를 가지고 있으며, 그곳에 모든 생각, 검색 결과, 그리고 발견한 단서들을 적어둡니다.

문제:
작업이 길어질수록 화이트보드는 지저분해집니다. 여러분은 모든 것을 적기 시작합니다. "날씨를 검색했다", "기차 시간을 확인했다", "도시의 역사에 대해 읽었다", "날씨를 다시 검색했다" 등. 결국 보드는 중요한 단서를 더 이상 찾을 수 없을 정도로 낙서로 가득 차게 됩니다. 여러분은 자신의 메모 속에서 "중간에 길을 잃게" 됩니다.

현재의 AI 어시스턴트들도 똑같은 일을 합니다. 그들은 페이지 하단에 메모를 계속 추가할 뿐, 절대 지우지 않아서 페이지가 너무 지저분해져서 효과적으로 읽을 수 없게 될 때까지 그렇게 합니다.

해결책: "행동으로서의 기억" (MemAct)
이 논문은 AI 가 사고하는 새로운 방식을 소개합니다. 단순히 수동적으로 메모를 적는 대신, AI 는 자신의 기억에 행동하도록 가르쳐집니다. 마치 AI 에게 가위와 형광펜을 쥐여주는 것과 같습니다.

저자들은 이 프레임워크를 MemAct라고 부릅니다. 간단한 용어로 설명하면 다음과 같습니다:

1. "편집" 버튼

옛 방식에서는 AI 가 그냥 계속 이야기할 뿐이었습니다. MemAct 에서는 AI 가 **Prune & Write (가지치기 및 작성)**라는 특별한 도구를 갖습니다.

  • Prune (가위): AI 는 자신의 기록을 살펴보고 "더 이상 그 10 개의 오래된 검색 결과가 필요 없다. 그 부분의 답은 이미 알고 있다"라고 결정합니다. 그리고 그들을 잘라냅니다.
  • Write (형광펜): 잘라내기 전에, AI 는 그 오래된 메모들에서 배운 내용을 짧고 깔끔하게 요약하여 적습니다.
  • 결과: 지저분하고 긴 기록은 깔끔하고 짧은 요약으로 대체됩니다. AI 는 의미는 유지하지만 지저분함은 잃습니다.

2. "스마트한" 결정

어느 시점에 잘라낼지 아는 것이 까다로운 부분입니다. 너무 일찍 잘라내면 중요한 사실을 잃게 되고, 너무 늦게 잘라내면 보드가 너무 지저분해집니다.

  • 옛 방법: 인간 프로그래머가 "5 분마다 가장 오래된 메모를 삭제하라"와 같은 규칙을 설정합니다. 이는 경직되어 있으며 종종 잘못된 것들을 삭제합니다.
  • MemAct 방법: AI 는 스스로 결정하는 법을 배웁니다. 마치 수학 문제의 첫 부분을 해결했을 때 다음 부분을 위한 공간을 확보하기 위해 초안 작업을 지울 수 있다는 것을 배우는 학생과 같습니다. AI 는 시행착오 (강화 학습) 를 통해 이 전략을 배웁니다.

3. "기차 선로" 도전 (DCPO)

큰 기술적 장애물이 있었습니다. 기차가 선로를 따라 앞으로 나아가는 상황을 상상해 보세요. 만약 AI 가 뒤쪽 선로 조각을 갑자기 삭제한다면, 기차 (AI 의 사고 과정) 는 추락할 수 있습니다. 왜냐하면 선로는 추가만 되고 제거되지 않는다는 가정을 바탕으로 구축되었기 때문입니다.

저자들은 **DCPO (Dynamic Context Policy Optimization, 동적 컨텍스트 정책 최적화)**라는 교묘한 해결책을 고안해냈습니다.

  • 비유: 영화를 촬영한다고 상상해 보세요. 배우가 대사를 잊어버리고 감독이 "컷! 그 장면을 다시 찍자"라고 말한다면, 여러분은 실수를 덮어쓰며 촬영을 계속하지 않습니다. 대신 뒤로 돌아가 장면을 다시 촬영하고, 새롭고 올바른 영상을 영화 필름에 접합합니다.
  • 해결책: DCPO 는 AI 의 학습에 대해 이렇게 작동합니다. AI 가 기억을 편집할 때, 시스템은 논리적으로 "되감기"를 하여 학습 데이터를 깔끔하고 분리된 세그먼트로 재구성합니다. 이를 통해 AI 는 자신의 변경 사항에 혼란을 느끼지 않고 기억을 편집하는 법을 배울 수 있습니다.

결과: 더 작고, 더 빠르고, 더 똑똑해짐
이 논문은 140 억 파라미터 규모의 AI 모델 (크기는 크지만 가장 큰 것은 아님) 로 이를 테스트했습니다.

  • 비교: 그들은 거대한 기억을 가지고 있지만 정리하는 법을 모르는 "거대"한 AI 모델 (2,350 억 파라미터) 과 비교했습니다.
  • 결과: 더 작은 MemAct AI 는 거대 모델과 똑같은 성능을 발휘했지만, 메모리 공간을 51% 적게 사용했습니다.
  • 이점: "화이트보드"를 깔끔하게 유지했기 때문에 더 빨랐고, 관련 없는 정보에 혼란을 받지 않았습니다. 이는 초점을 예리하게 유지하기 위해 필요한 것만 제거하는 "외과 의학적" 편집자가 되는 법을 배운 것입니다.

요약
이 논문은 AI 에게 자신의 단기 기억을 능동적으로 관리하도록 가르침으로써—무엇을 유지할지, 무엇을 요약할지, 무엇을 삭제할지 결정하도록 함으로써—복잡하고 장기적인 문제를 훨씬 더 효율적으로 해결할 수 있다고 주장합니다. 이는 기억 관리를 수동적인 저장 문제에서 능동적이고 학습된 기술로 전환시켜, 더 작은 모델들이 자신의 등급 이상으로 활약할 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →