← 최신 논문
💻 computer science

MESA:Task-Adaptive Multi-Structure Evidence Selection for Long-Horizon Agent Memory

MESA는 고정된 컨텍스트 방식의 노이즈를 피하는 동시에 다양한 증거의 구성을 가능하게 함으로써, AMA-Bench에서 성능과 효율성을 크게 향상시키고 장기적 목표를 수행하는 에이전트를 위해 쿼리별로 상호 보완적인 메모리 구조의 부분 집합을 동적으로 선택하고 융합하는 태스크 적응형 프레임워크입니다.

원저자: Beidi Zhao, Yaoqi Chen, Yuru Feng, Menghao Li, Qianxi Zhang, Baotong Lu, Jianan Lu, Zhirui Wang, Xinjiang Wang, Shusen Xu, Zengzhong Li, Xiaoxiao Li, Qi Chen

게시일 2026-08-12
📖 5 분 읽기🧠 심층 분석

원저자: Beidi Zhao, Yaoqi Chen, Yuru Feng, Menghao Li, Qianxi Zhang, Baotong Lu, Jianan Lu, Zhirui Wang, Xinjiang Wang, Shusen Xu, Zengzhong Li, Xiaoxiao Li, Qi Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 며칠에 걸쳐 일어난 미스터리를 풀기 위해 노력하는 탐정이라고 상상해 보십시오. 당신에게는 당신이 했던 모든 행동, 보았던 것, 생각했던 것, 그리고 말했던 모든 것이 적힌 방대한 노리북이 있습니다. 어떤 페이지는 그날의 짧은 요약이고, 어떤 페이지는 당신이 내디딘 발걸음 하나하나를 기록한 가감 없는 목록이며, 또 다른 페이지는 당신이 누구와 대화했는지 보여주는 지도이고, 다른 페이지는 당신이 검색했던 키워드 목록입니다. 만약 "나는 언제 열쇠를 잃어버렸나?"와 같은 단순한 질문에 답하기 위해 이 노트 전체를 읽으려 한다면, 당신의 뇌는 너무 많은 정보에 압도될 것입니다. 하지만 특정 페이지 하나만 읽는다면, 다른 섹션에 숨겨진 결정적인 단서를 놓칠 수도 있습니다. 이것이 바로 현대의 "AI 에이전트(AI agents)"—디지털 비서처럼 행동하는 컴퓨터 프로그램—가 직면한 과제입니다. 이들은 복잡한 문제를 해결하기 위해 긴 사건의 연쇄를 기억해야 하지만, 종종 자신의 기억 속에서 길을 잃곤 합니다. 과학자들은 이 기억들을 조직하는 가장 좋은 방법이 무엇인지 알아내기 위해 노력해 왔습니다. AI가 모든 것을 읽어야 할까요? 아니면 단 한 가지 유형의 노트만 골라야 할까요? 아니면 더 똑똑한 방법이 있을까요?

이 논문은 이 AI 탐정들을 위한 초스마트 사서 역할을 하는 MESA(Multi-structure Evidence Selection for long-horizon Agent)라는 영리하고 새로운 시스템을 소개합니다. MESA는 AI에게 전체 노트를 강제로 읽게 하거나 아무 데서나 단 하나의 페이지를 무작정 고르게 하는 대신, 각 특정 질문에 딱 맞는 조합의 노트를 선택하는 법을 배웁니다. 이것은 마치 요리사가 단순히 눈에 보이는 첫 번째 양념통을 집어 들거나 양념 선반의 모든 것을 냄비에 쏟아붓는 것이 아니라, 요리의 맛을 보고 소금이 조금 필요하고 후추 한 꼬집이 필요하다는 것을 깨달은 뒤 정확히 그 두 개의 통만을 집어 드는 것과 같습니다. 연구진은 이 시스템을 AMA-Bench라는 벤치마크로 테스트했습니다. AMA-Bench는 AI가 장기간 동안 얼마나 잘 기억하고 추론할 수 있는지를 측정하는 거대한 테스트와 같습니다. 연구 결과, MESA는 이전 방식들보다 훨씬 더 뛰어난 성능을 보였습니다. 실제로 MESA는 기존의 가장 우수한 시스템보다 정답을 8.5% 더 자주 맞혔으며, 동시에 메모에서 읽어들이는 단어(또는 "토큰")의 양은 41% 더 적게 사용했습니다. 이는 단순히 모든 것을 읽는 것이 아니라, 다양한 유형의 기억 뷰(view)를 선택적으로 혼합하는 것이 장기적인 퍼즐을 푸는 핵심임을 시사합니다.

문제점: 너무 많은 소음, 부족한 신호

당신이 50단계 전의 일을 기억해야 하는 퍼즐을 풀어야 하는 비디오 게임을 하고 있다고 상상해 보십시오. 당신의 캐릭터는 돌아다니고, 몬스터와 싸우고, NPC와 대화하고, 아이템을 수집해 왔습니다. 만약 게임에 "왜 문이 잠겼지?"라고 묻는다면, 그 답은 40단계 전의 아주 작은 디테일, 예를 들어 당신이 떨어뜨린 특정 열쇠에 숨겨져 있을 수도 있습니다.

AI의 세계에서 이러한 "단계"를 **궤적(trajectories)**이라고 부릅니다. 이것들은 행동, 관찰, 생각이 얽힌 길고 복잡한 연쇄입니다. 문제는 이러한 연쇄가 수백 단계에 달할 수 있다는 점입니다. 만약 이 전체 체인을 AI에게 입력하면 비용이 많이 들고 혼란스러워집니다. 만약 이를 요약하려고 시도한다면, 중요한 작은 디테일을 놓칠 수도 있습니다.

과학자들은 지저식한 방을 여러 개의 통에 정리하듯, 기억을 다양한 "구조(structures)" 또는 형식으로 조직하여 이 문제를 해결하려 노력해 왔습니다.

  • 요약(Summaries): 그날의 "핵심"은 전달하지만 세부 사항은 건너뛰는 일기 항목과 같습니다.
  • 시간적 저장소(Temporal Stores): 사건을 엄격한 순서대로 유지하는 타임라인이나 달력과 같습니다.
  • 지식 그래프(Knowledge Graphs): 사람과 사물 사이의 연결 관계를 보여주며 그들이 어떻게 연관되어 있는지 나타내는 웹(web)과 같습니다.
  • 벡터 데이터베이스(Vector Databases): 단어가 다르더라도 "느낌"이나 의미를 바탕으로 정보를 찾아내는 검색 엔진과 같습니다.
  • 원시 흔적(Raw Traces): 모든 움직임을 보여주는 보안 카메라 녹화 영상과 같지만, 노이즈가 많고 훑어보기 어렵습니다.

큰 질문은 이것이었습니다: AI는 어떤 통을 열어야 하는가?

기존 방식들: 너무 많거나, 너무 적거나

MESA가 나오기 전, AI가 이를 처리하기 위해 사용했던 두 가지 주요 방식이 있었습니다:

  1. "모두 읽기" 접근법: AI가 모든 통을 한꺼번에 열고 모든 노트를 뇌 속으로 쏟아붓는 방식입니다. 이것은 아침 식사로 무엇을 먹었는지 알아내기 위해 자신의 일기, 달력, 지도, 그리고 보안 영상까지 모두 동시에 읽으려는 것과 같습니다. 정보가 너무 많아서 중요한 단서가 소음에 묻혀버립니다.
  2. "하나만 고르기" 접근법: AI가 단 하나의 통이 가장 좋을 것이라고 추측하고 오직 그것만 읽는 방식입니다. 이것은 아침 식사로 무엇을 먹었는지 알아내기 위해 오직 달력만 보기로 결정하는 것과 같습니다. 당신은 일기에 그 내용을 적어두었을 수도 있는데 말입니다.

연구진은 이 두 극단적인 방식 모두 효과적이지 않다는 것을 발견했습니다. 때로는 타임라인이 필요하고, 때로는 지도가 필요하며, 종종은 두 가지 모두가 필요합니다. 하지만 "최적의 조합"은 질문에 따라 달라집니다. "무엇이 먼저 일어났는가"에 대한 질문은 타임라인을 필요로 하고, "누가 누구와 대화했는가"에 대한 질문은 지도를 필요로 합니다.

해결책: 적응형 사서, MESA

MESA는 역동적인 사서가 되는 법을 배우는 시스템입니다. MESA는 단순히 하나의 통을 고르거나 모든 통을 여는 것이 아닙니다. 대신 질문을 보고 이렇게 판단합니다. "아, 이 질문은 타임라인이 조금 필요하고 지도도 조금 필요하지만, 원시 영상은 건너뛰어도 되겠군."

작동 방식은 다음과 같습니다:

  1. 도서관: 먼저, AI는 자신의 이력으로부터 다섯 가지 다른 유형의 메모 구조(요약, 타임라인, 지도, 검색, 원시 영상)를 구축합니다. 이들은 모두 사전에 생성되며 변하지 않습니다.
  2. 선택기(Selector): 질문이 들어오면, MESA가 학습시킨 특수한 "선택기" 부분이 어떤 구조를 사용할지 결정합니다. 이것은 질문을 보고 적절한 도구를 고르는 스마트한 비서와 같습니다.
  3. 학습: 까다로운 부분은 선택기를 가르치는 것입니다. 시스템에는 모든 질문에 대해 어떤 통을 골라야 하는지 정확히 알려주는 선생님이 없습니다. 대신, 시스템은 최종 결과로부터 학습합니다. "AI가 정답을 맞혔는가?" 만약 답이 틀렸다면, 시스템은 선택 전략을 미세하게 조정합니다. MESA는 새로운 조합을 시도하는 것(탐색, exploration)과 기존에 잘 작동하던 것을 고수하는 것(활용, exploitation) 사이의 균열을 맞추기 위해 **UCB (Upper Confidence Bound)**라는 영리한 수학적 기법을 사용합니다.

연구 결과

연구진은 복잡하고 긴 작업들로 가득 찬 데이터셋인 AMA-Bench에서 MESA를 테스트했습니다. 그들은 MESA를 기존의 가장 우수한 방법들과 비교했습니다.

  • 더 높은 정확도: MESA는 **65.1%**의 확률로 정답을 맞혔으며, 이는 이전의 최고 시스템(AMA-Agent)보다 8.5% 높은 수치입니다.
  • 더 똑똑한 효율성: MESA는 더 정확해졌음에도 불구하고, 메모에서 사용하는 단어(토큰)의 양은 오히려 41% 적게 사용했습니다. 이는 MESA가 단순히 더 많이 읽은 것이 아니라, 더 읽었다는 것을 의미합니다.
  • 단일 승자는 없다: 이 연구는 "하나의 크기로 통일된" 메모 구조는 존재하지 않는다는 점을 확인해 주었습니다. 최적의 메모 유형 조합은 특정 작업과 특정 질문에 따라 달라집니다.

이것이 왜 중요한가

이 논문은 AI 메모의 미래가 더 큰 도서관을 만들거나 단 한 가지 유형의 노트를 선택하는 것에 있지 않음을 시사합니다. 그것은 바로 유연성에 있습니다. 인간 탐정이 날짜를 확인하기 위해 달력을, 장소를 확인하기 위해 지도를, 감정을 확인하기 위해 일기를 확인해야 한다는 것을 알 듯, AI 또한 문제를 해결하기 위해 서로 다른 메모 뷰를 혼합하고 매칭하는 법을 알아야 합니다.

MESA는 AI에게 선택적이고 적응적인 능력을 가르침으로써, AI의 사고 방식이나 메모 저장 방식을 변경하지 않고도 더 똑똑하고 효율적으로 만들 수 있음을 보여줍니다. 이는 AI가 단순히 많은 데이터를 가진 것을 넘어, 가장 중요한 순간에 정확히 어떤 데이터를 찾아야 하는지 알게 하는 단계입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →