← 최신 논문
💬 NLP

LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues

본 논문은 451 개의 선별된 질문과 광범위한 히스토리 궤적을 통해 전문 웹 환경을 위한 장기 에이전트 메모리를 평가하도록 설계된 종합 벤치마크인 LongMemEval-V2 를 소개하며, 파일 기반 코딩 에이전트 접근법 (AgentRunbook-C) 이 정확도 측면에서 RAG 베이스라인을 크게 능가함을 입증하는 동시에 성능과 지연 시간 간의 지속적인 트레이드오프를 부각시킵니다.

원저자: Di Wu, Zixiang Ji, Asmi Kawatkar, Bryan Kwan, Jia-Chen Gu, Nanyun Peng, Kai-Wei Chang

게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Di Wu, Zixiang Ji, Asmi Kawatkar, Bryan Kwan, Jia-Chen Gu, Nanyun Peng, Kai-Wei Chang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 비서를 고용하여 매우 구체적이고 복잡한 사무실을 관리하게 한다고 상상해 보세요. 첫날, 그들은 파일 캐비닛의 이상한 버튼, 프린터로 가는 비밀 단축키, 또는 오전 9 시 전에 라떼를 만들려고 시도할 때마다 커피 머신이 고장 난다는 사실에 대해 아무것도 모릅니다.

LongMemEval-V2는 AI 비서가 "신입사원"이기를 멈추고 수년 동안 그 특정 사무실에서 일해 온 경험 많은 동료처럼 행동하기 시작하는지 확인하도록 설계된 테스트입니다.

다음은 간단한 비유를 사용하여 이 논문의 핵심 아이디어를 정리한 것입니다:

1. 문제: AI 의 "망각"

오늘날 대부분의 AI 비서는 단기 기억력을 가진 사람들처럼 행동합니다. 잠시 동안 당신과 대화할 수는 있지만, "3 일 전에 로그인하려고 시도했을 때 본 그 이상한 오류 메시지를 기억해?"라고 물으면 보통 잊어버립니다.

현재 AI 기억력 테스트는 대부분 "어제 사용자가 뭐라고 했나요?" 또는 "이 긴 책을 요약할 수 있나요?"와 같은 간단한 질문을 던집니다. 하지만 현실 세계에서는 AI 에이전트 (버튼을 클릭하고 양식을 채우는 봇) 가 훨씬 더 복잡한 것들을 기억해야 합니다:

  • 정적 상태: "이 특정 양식에서 '제출' 버튼은 어디에 있나요?"
  • 동적 상태: "여기서 '저장'을 클릭하면 페이지가 파란색으로 변할까요, 아니면 빨간색으로 변할까요?"
  • 워크플로우: "중복 문제를 해결하는 5 단계는 무엇인가요?"
  • 함정: "아, 이 목록에서 '첼시'를 검색하려고 하면 실수로 다른 사람들도 포함됩니다. 그 함정을 알아야 해요."
  • 전제 인식: "잠깐, 이 질문은 우리가 '영업' 부서에 있다고 가정하고 있지만, 실제로는 '인사' 부서에 있습니다. 그 가정은 틀렸어요."

2. 해결책: AI 기억력을 위한 새로운 "체육관"

연구진들은 **LongMemEval-V2(LME-V2)**라는 새로운 훈련장을 구축했습니다.

  • "건초더미": 1 억 페이지 분량의 메모 (토큰이라고 함) 가 있는 도서관을 상상해 보세요. 이 메모들은 맞춤형 웹사이트에서 작업을 해결하려는 AI 봇의 역사입니다.
  • "바늘": 그 1 억 페이지 안에 451 개의 까다로운 질문에 대한 구체적인 답변이 숨겨져 있습니다.
  • 도전 과제: AI 는 거대한 도서관을 읽어가며 작은 바늘 (정답) 을 찾아 설명해야 하며, 소음에 휩쓸리지 않아야 합니다.

3. 테스트된 두 가지 "기억 시스템"

이 논문은 인간이 메모를 정리하는 방식과 비교하여 AI 가 기억하는 것을 돕기 위한 두 가지 다른 방법을 테스트했습니다.

방법 A: "인덱스 카드" 시스템 (AgentRunbook-R)

이는 모든 페이지를 읽고 인덱스 카드에 요약을 작성한 후 서랍에 넣는 사서와 같습니다.

  • 작동 방식: 역사를 세 가지 유형의 카드로 나눕니다:
    1. 원본 메모: 시각적 세부 사항 (스크린샷 및 텍스트) 만 포함.
    2. 이벤트 카드: "내가 X 를 클릭했을 때 Y 가 발생했습니다."
    3. 전략 메모: "이 시스템이 작동하는 일반적인 규칙은 여기 있습니다."
  • 결과: 빠르고 효율적이지만, 요약에 의존하기 때문에 미세한 세부 사항을 놓치는 경우가 있습니다.

방법 B: "도구를 가진 탐정" (AgentRunbook-C)

이는 요약만 읽는 것이 아니라 파일 보관실로 들어가 실제 폴더를 열고 문서 자체를 검사하는 탐정을 고용하는 것과 같습니다.

  • 작동 방식: 요약 대신 원본 역사를 파일로 저장합니다. 질문이 들어오면 "코딩 에이전트 (도구 사용법을 아는 스마트 봇)"를 사용하여 다음을 수행합니다:
    1. "매니페스트 (파일의 지도)"를 확인합니다.
    2. 헬퍼 스크립트를 사용하여 특정 폴더를 검색합니다.
    3. 증거를 찾기 위해 필요한 정확한 파일을 엽니다.
  • 결과: 이 방법이 우승했습니다. 잠재적으로 결함이 있는 요약에 의존하기보다는 원본 데이터를 깊이 파고들어 정확한 증거를 찾을 수 있었기 때문에 최고 점수 (72.5% 정확도) 를 받았습니다.

4. 트레이드오프: 속도 대 정확도

이 논문은 고전적인 트레이드오프를 발견했습니다:

  • 인덱스 카드 시스템은 빠릅니다 (질문당 약 26 초) 하지만 정확도는 낮습니다.
  • 탐정 시스템은 더 느립니다 (약 110~140 초) 하지만 훨씬 더 정확합니다.
  • 흥미롭게도, "탐정"은 특별한 지시 없이 표준 상용 코딩 에이전트를 사용하는 것보다 여전히 32% 더 빠릅니다. 이는 탐정에게 좋은 지도와 올바른 도구를 제공하면 훨씬 더 효율적이 된다는 것을 증명합니다.

5. 주요 시사점

이 논문은 AI 가 전문 환경에서 진정한 "경험 많은 동료"가 되기 위해서는 방대한 양의 엉망진창인 역사를 처리하고 구체적이고 상세한 증거를 찾을 수 있는 기억 시스템이 필요하다고 결론 내립니다.

"탐정" 접근 방식 (AgentRunbook-C) 은 기억을 파일 관리 문제로 취급하는 것, 즉 에이전트가 적극적으로 파일을 검색하고 검사하는 것이 이를 해결하는 강력한 방법임을 보여주었습니다. 이는 AI 를 일반적인 지식에 기반한 "추측"에서 구체적인 누적 경험에 기반한 "알기"로 이동시킵니다.

간단히 말해: 이 논문은 AI 가 특정 직무에서 과거의 실수와 성공으로부터 배울 수 있는지 확인하기 위한 거대한 테스트를 구축했습니다. 그들은 AI 에게 일어난 일을 요약하라고 요청하는 것보다, AI 에게 자신의 역사 파일을 파헤칠 수 있는 "탐정" 도구를 제공하는 것이 더 효과적임을 발견했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →