← 최신 논문
💬 NLP

Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents

본 논문은 메모리가 탑재된 LLM 에이전트가 독립적인 작업들 사이에서 시간이 지남에 따라 안전 위험을 축적한다는 점을 입증하기 위해 '시간적 기억 오염' 개념을 제시함으로써, 단일 상태 평가에서 종단적 안전 평가로의 전환이 필요함을 보여준다.

원저자: Ahmad Al-Tawaha, Shangding Gu, Peizhi Niu, Ruoxi Jia, Ming Jin

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ahmad Al-Tawaha, Shangding Gu, Peizhi Niu, Ruoxi Jia, Ming Jin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"더 많이 기억할수록 더 큰 위험"이라는 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 풀어보겠습니다.

핵심 아이디어: "좋은 기억력"의 함정

매우 똑똑한 개인 비서를 고용하여 일상 업무를 도와달라고 상상해 보세요. 당신은 그에게 "다음에 더 잘 도와줄 수 있도록 내가 하는 모든 말을 기억해 두세요"라고 말합니다.

보통 우리는 좋은 기억력을 안전 장치라고 생각합니다. 비서가 사용자의 선호도를 기억하면 더 도움이 되기 때문입니다. 하지만 이 논문은 AI 에이전트의 경우 너무 많이 기억하는 것이 오히려 시간이 지남에 따라 안전성을 떨어뜨릴 수 있다고 주장합니다.

연구자들은 **"시간적 기억 오염 (Temporal Memory Contamination)"**이라는 새로운 유형의 실수를 발견했습니다. 해커에 의해 AI 가 속이는 것이 아니라, AI 가 스스로 쌓아 올린 메모 더미에 혼란을 겪는 것입니다. AI 가 해롭지 않은 일상 업무에서 점점 더 많은 기억을 축적할수록, 서로 다른 것들을 섞어 놓다가 나중에 실수로 비밀을 누설하거나 나쁜 결정을 내리게 됩니다.


두 가지 주요 등장인물

이를 증명하기 위해 연구자들은 두 가지 다른 유형의 AI 비서를 테스트했습니다.

  1. 사무실 비서: 의사의 진료소나 대학을 위한 디지털 비서라고 생각하세요. 이메일, 일정, 메모 등을 처리합니다.
  2. "클로 (Claw)" 에이전트: 컴퓨터 내부에서 일하는 로봇 노동자라고 생각하세요. 파일을 열고, 코드를 실행하며, 소프트웨어 설정을 관리할 수 있습니다.

실험: "타임머신" 테스트

대부분의 안전 테스트는 다음과 같은 질문을 던집니다: "이 AI 는 하나의 특정 까다로운 질문에 대처할 수 있는가?" (예: "비밀번호를 말하지 마세요!")

연구자들은 다른 질문을 던졌습니다: "AI 가 수개월 동안 일하며 수천 가지의 평범한 것들을 기억한 후에는 어떤 일이 일어날까?"

그들은 **"트리거 - 프로브 (Trigger-Probe) 프로토콜"**이라고 부르는 교묘한 설정을 사용했습니다.

  • 스트림: AI 가 이메일과 업무를 쌓아 올리며 정상적으로 일하도록 잠시 방치했습니다.
  • 스냅샷: 100 개의 작업 후, 500 개 후, 1,000 개 후처럼 AI 의 기억을 서로 다른 시점에서 얼려 두었습니다 (마치 뇌의 사진을 찍는 것과 같습니다).
  • 프로브: 이 서로 다른 스냅샷들에 대해 AI 에게 동일한 안전한 질문을 던졌습니다.

비유: 책장에 책을 계속 추가하는 사서라고 상상해 보세요.

  • 1 일 차: "정원 가꾸기 책이 어디 있나요?"라고 물으면 사서는 쉽게 찾아냅니다.
  • 100 일 차: 책장이 거대해졌습니다. 같은 질문을 하면 사서는 책을 한 권 집어 들지만, 책장이 너무 혼잡해서 다른 섹션에 있는 유독 식물에 관한 책을 실수로 집어 당신에게 건네줍니다.
  • 1,000 일 차: 책장은 산처럼 쌓였습니다. 다시 질문하면 사서는 책의 양에 압도되어 다시 잘못된 책을 집어 들지만, 이번에도 독극물을 요청한 것은 아닙니다.

무엇이 잘못되었을까? (기억이 망가진 세 가지 방식)

논문은 AI 의 기억이 실수를 일으킨 세 가지 주요 방식을 발견했습니다.

  1. 교차 컨텍스트 유출 (The "Wrong File" Mix-up):

    • 비유: 비서에게 환자 A를 위한 메모를 작성해 달라고 요청합니다. 하지만 비서가 지난주 환자 B의 병력을 기억하고 있기 때문에, 실수로 환자 A 를 위한 메모에 환자 B 의 개인 정보를 붙여 넣습니다.
    • 결과: AI 가 악의가 있어서가 아니라 기억에서 잘못된 "파일"을 검색했기 때문에 개인 정보가 유출됩니다.
  2. 구식 정보 (The "Outdated Map"):

    • 비유: "우체국의 주소는 어디인가요?"라고 물으면 비서는 2020 년 주소 기억합니다. 현재 대화에서 주소가 바뀌었다고 방금 알려줬음에도, 오래된 기억이 너무 강력해서 새로운 지시를 덮어씌웁니다.
    • 결과: AI 는 오래된 사실에 집착하기 때문에 잘못된 답변을 합니다.
  3. 요약 결합 (The "Frankenstein" Fact):

    • 비유: 비서가 두 개의 별도 메모를 읽습니다. "직원 A 는 1 만 5 천 달러를 받는다"와 "직원 B 는 2 만 5 천 달러를 받는다". 나중에 이를 요약하려다 "직원들은 1 만 5 천 달러에서 2 만 5 천 달러 사이를 받는다"고 말합니다. 그 후 직원 C가 자신이 얼마를 받는지 물으면, AI 는 자신 있게 "당신은 2 만 달러를 받습니다"라고 말합니다.
    • 결과: AI 는 두 가지 기억을 단순히 섞어 현실에 존재하지 않는 구체적인 숫자를 만들어냅니다.

"클로 (Claw)" 에이전트의 놀라운 사실

연구자들은 컴퓨터 내부에서 일하는 "클로" 에이전트들도 테스트했습니다. AI 가 지루하고 안전한 코딩 작업만 수행하더라도, 기억의 sheer 이 그 자체로 위험을 만든다는 사실을 발견했습니다.

  • 주의 희석: AI 의 기억이 수천 줄의 코드와 설정 파일로 채워질수록 "산만해집니다." 거대한 메모 더미를 뒤지는 데 너무 바빠 안전 경고에 주의를 기울이지 않게 됩니다.
  • 정상화: AI 가 평범한 코딩 작업을 하다가 메모에서 500 번이나 비밀번호와 민감한 키를 보면, "아, 비밀번호를 보여주는 것은 정상적인 일이구나"라고 생각하기 시작합니다. 그리고는 더 이상 이를 비밀로 취급하지 않게 됩니다.

좋은 소식: 초기에 잡아낼 수 있습니다

논문은 또한 해결책을 제시합니다. 그들은 **"검색 시간 모니터 (Retrieval-Time Monitor)"**를 구축했습니다.

  • 비유: 사서가 책을 건네주기 전에 사서의 손을 점검하는 경비원이라고 상상해 보세요.
  • 작동 원리: AI 는 답변하기 전에 정보를 "찾아봐야" 합니다. 모니터는 확인합니다: "잠깐, AI 가 기억에서 방금 꺼낸 정보가 이 특정 사용자에게 보여도 안전한가?"
  • 결과: 이 모니터는 AI 가 답변을 입력하기 전에 이러한 실수들을 매우 잘 잡아냅니다. "잘못된 파일"이나 "구식 지도"를 식별하여 AI 가 실수를 저지르는 것을 막을 수 있습니다.

결론

이 논문은 안전은 스냅샷이 아니라 영화다라고 결론 내립니다.

오늘 AI 가 안전한지 확인하는 것만으로는 부족합니다. AI 가 나이를 먹고 더 많이 기억해 가면서 어떻게 행동하는지 지켜봐야 합니다. AI 가 더 많이 기억할수록, 단순히 기억이 너무 혼잡하고 지저분해지기 때문에 실수로 비밀을 누설하거나 실수를 할 가능성이 더 커집니다. AI 를 안전하게 유지하려면 "지금"의 위험뿐만 아니라 "장기적"인 위험을 이해하는 시스템을 설계해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →