← 최신 논문
💬 NLP

Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents

이 논문은 모델의 규모와 관계없이 대화 길이가 길어짐에 따라 사실 갱신(fact-supersession) 작업의 성능이 현저히 저하되는 LL로 기반 에이전트의 뚜렷한 '메모리 업데이트 격차(memory-update gap)'를 식별하며, 이러한 격차가 새로 도입된 Supersede라는 훈련 환경에서의 강화 학습을 통해 효과적으로 좁혀질 수 있음을 입증한다.

원저자: Vedant Patel

게시일 2026-06-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Vedant Patel

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 매우 똑똑한 비서와 대화하고 있다고 상상해 보세요. 하지만 한 가지 제약 조건이 있습니다. 그 비서는 당신이 말한 모든 것을 기억하기 위해 반드시 사용해야 하는 아주 작은 수첩을 가지고 있습니다. 비서는 전체 대화 기록을 다시 훑어볼 수 없으며, 오직 그 작은 수첩에 적힌 내용만을 읽을 수 있습니다.

이 논문은 그 비서가 수첩의 정보를 업데이트하려고 할 때 발생하는 특정 문제에 대해 다룹니다.

문제점: "오래된 메모"의 함정

당신가 비서에게 "저는 디트로이트에 살아요"라고 말한다고 가정해 봅시다. 당신은 그것을 적어둡니다. 일주일 후, 당신은 비서에게 "사실, 저 교외로 이사했어요"라고 말합니다.

만약 비서가 전체 대화 기록을 활용할 수 있다면, 두 메시지를 모두 보고 당신이 교외에 산다는 것을 알게 될 것입니다. 하지만 만약 비서가 그 작은 수첩에 의존하고 있다면, "디트로이"를 지우고 "교외"라고 명확하게 새로 써야 한다는 사실을 놓칠 수 있습니다. 대신, 기존의 메모를 그대로 유지하거나 대화의 노이즈 때문에 혼란을 느껴, 당신이 여전히 디트로이트에 살고 있다고 실수로 말할 수도 있습니다.

저자들은 이를 **"Supersession(대체/계승)"**이라고 부릅니다. 이는 "아, 이 오래된 사실은 이제 틀렸구나. 이제 새로운 것을 사용해야 해"라고 깨닫는 능력을 의미합니다.

무엇을 테스트했는가

연구진은 이것이 단순히 비서가 "멍청해서" 발생하는 문제인지, 아니면 구체적으로 그 작은 수첩을 관리하는 과정에서 발생하는 문제인지를 확인하고 싶었습니다. 그들은 세 가지 주요 실험을 진행했습니다.

  1. "더 똑똑한 두뇌" 테스트: 훨씬 더 똑똑하고 강력한 AI 모델(예: 고등학생에서 박사 학위 소지자로 업그레이드하는 것)을 사용하는 실험을 했습니다.

    • 결과: 초강력 모델조차 작은 수첩을 사용해야 할 때는 실패했습니다. 그 모델은 전체 대화를 완벽하게 읽을 수 있었지만, 일단 자신의 메모에 의존하도록 강제되자 여전히 실수를 저질렀습니다. 결론: 두뇌를 키우는 것은 수첩 문제를 해결하지 못합니다.
  2. "더 큰 수첩" 테스트: 원래의 수첩이 너무 작아서 발생하는 문제인지 확인하기 위해, 비서에게 훨씬 더 큰 수첩(24배 더 큰 크기)을 주었습니다.

    • 결과: 놀랍게도 더 큰 수첩을 주는 것은 전혀 도움이 되지 않았습니다. 정확도는 동일하게 유지되었습니다. 문제는 메모의 크기가 아니라, 메모를 업데이트하는 과정이었습니다. 비서는 메모 공간이 아무리 많아지더라도 상관없이 계속해서 잘못된 옛날 사실을 적어 내려갔습니다. 결론: 수첩을 크게 만드는 것 역시 문제를 해결하지 못합니다.
  3. "훈련" 테스트: 더 큰 두뇌와 더 큰 수첩이 효과가 없었기에, 연구진은 다른 방법을 시도했습니다. 바로 비서에게 메모를 관리하는 법을 가르치는 것이었습니다. 그들은 비서가 현재 버전의 사실을 올바르게 사용했을 때만 "보상"을 주고, 오래된 사실을 사용했을 때는 "벌칙"을 주는 특별한 훈련 게임을 만들었습니다.

    • 결과: 이것이 통했습니다! 연구진은 작은 오픈 소스 모델을 가져와 이 게임을 통해 훈련시켰습니다. 훈련 후, 모델이 실제 대화에서 업데이트된 사실을 사용하는 능력은 거의 두 배 가까이 향상되었습니다.

핵심 요점

이 논문은 AI 에이전트가 변화하는 사실을 따라잡지 못하는 이유가 그들이 충분히 똑똑하지 않거나 메모가 부족해서가 아니라고 주장합니다. 그것은 그들이 "메모를 업데이트하는" 구체적인 기술을 훈련받지 못했기 때문입니다.

이것은 사서에 비유할 수 있습니다. 당신이 사서에게 더 큰 도서관(더 많은 메모)을 주거나 더 똑똑한 사서(더 큰 모델)를 붙여줄 수는 있지만, 만약 그 사서에게 "새로운 카드가 도착하면 항상 예전 카드를 버려라"라는 구체적인 규칙을 가르치지 않는다면, 사서는 계속해서 당신에게 잘못된 책을 안내할 것입니다.

저자들은 AI 에이전트가 자신의 "정신적 메모"를 최신 상태로 유지하도록 훈련시키는 전용 체육관 역할을 하는 새로운 도구(Supersede)를 공개했습니다. 그들은 더 큰 모델이나 더 큰 메모가 문제를 해결하지 못하는 반면, 약간의 표적 훈련이 에이전트가 최신 상태를 유지하는 능력을 크게 향상시킬 수 있음을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →