← 최신 논문
🤖 machine learning

MemLeak: Diagnosing Information Leaks in Multimodal Agent Memory

이 논문은 멀티모달 AI 에이전트가 텍스트 삭제 후에도 보존된 이미지로부터 사실을 여전히 복구할 수 있기 때문에 진정으로 정보를 '망각'하는 데 종종 실패한다는 점을 입증하기 위해, 정보 기원 그래프(Information Provenance Graph) 분류 체계와 벤치마크인 MemLeak을 소개하며, 이러한 유출을 완화하기 위해 콘텐츠 인지적 의미론적 삭제가 필요함을 보여준다.

원저자: Kuan Wang, Chao Zhang

게시일 2026-06-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kuan Wang, Chao Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 디지털 기억을 당신이 말한 모든 것을 저장해 두는 거대하고 지저분한 다락방이라고 상상해 보세요. 여기에는 텍_트 노트 상자, 사진 앨범, 그리고 AI가 당신의 사진에서 포착한 '분위기'나 인상을 보관하는 숨겨진 서랍까지 있습니다.

**"MEMLEAK"**라는 논문은 당신이 AI에게 "내가 스쿠버 다이빙을 좋아한다는 사실을 잊어줘"라고 말했을 때 어떤 일이 벌어지는지를 조사합니다.

삭제의 환상

옛날에는 컴퓨터에 파일을 삭제하라고 요청하면, 단순히 폴로더에서 파일을 꺼내 쓰레기통에 던져버렸습니다. 이 논문은 현대의 AI 에이전트도 텍스트에 대해서는 똑같이 행동한다는 것을 발견했습니다. 즉, "나는 스쿠버 다이빙을 좋아한다"라는 노트를 삭제하고 "완료되었습니다!"라고 말하는 것이죠.

하지만 여기에 '누출(Leak)'이 있습니다: AI는 다락방 전체를 청소하지 않았습니다.

특정 노트는 사라졌을지라도, AI는 여전히 당신의 사진 앨범을 가지고 있습니다. 그리고 여기서 기술이 들어갑니다. AI는 단순히 사진을 읽는 것이 아니라, 사진을 "봅니다." AI는 당신에게 열대 해변 사진 한 장, 다이브 워치 사진 한 장, 그리고 산호초 사진 한 장이 있다는 것을 알아차립니다. 이 사진들 중 그 어떤 것도 "스쿠버 다이빙"이라고 태그되어 있지 않더라도, AI는 점들을 연결합니다. 서로 관련 없어 보이는 사진들의 모임을 보고서 이렇게 말하는 것입니다. "아, 이 사람은 분명히 스쿠버 다이빙을 좋아하는구나."

논문은 이를 **메모리 리크(Memory Leak, 기억 누출)**라고 부릅니다. 수도꼭지를 잠근 후에도 물이 뚝뚝 떨어지는 배관 누수처럼, 당신이 정보를 잊으라고 요청한 후에도 정보가 AI의 기억에서 흘러나오는 현상입니다.

"정보 프로비넌스 그래프" (다락방의 지도)

이런 일이 왜 발생하는지 이해하기 위해, 저자들은 **정보 프로비넌스 그래프(Information Provenance Graph, IPG)**라는 지도를 만들었습니다. 이것은 정보 조각이 숨을 수 있는 모든 장소를 보여주는 다락방의 설계도와 같습니다:

  1. 주소 지정 가능한 노트 (The Addressable Note): 쉽게 찾아서 삭제할 수 있는 텍스트 파일입니다.
  2. 연결된 노트 (The Linked Note): 특정 텍스트에 명시적으로 태그된 사진입니다. 만약 스마트한 시스템이라면 텍스트를 삭제할 때 이 사진도 함께 삭제해야 합니다.
  3. 지속되는 유령 (The Persistent Ghost): 이것이 무서운 부분입니다. 이것은 특정 대상에 태그되지 않은 채 사진 속에 숨겨진 "분위기"나 미세한 단서들입니다. 마치 빛 속을 떠다니는 먼지 입자와 같습니다. 이를 쉽게 지목하여 "삭제해 줘"라고 말할 수는 없지만, 그것들은 여전히 그곳에 존재하며 AI가 당신의 비밀을 추측하는 데 사용되기를 기다리고 있습니다.

실험: 누출은 얼마나 심각한가?

연구진은 정보가 얼마나 누출되는지 정확히 측정하기 위해 MEMLEK이라는 테스트를 구축했습니다. 그들은 300개의 가짜 사용자 프로필을 생성하고 사실과 사진을 담은 뒤, AI에게 특정 사항을 잊으라고 요청했습니다.

결과는 다음과 같았습니다:

  • "블라인드" 테스트: 만약 AI에게 당신의 옛날 사진이나 노트를 전혀 보여주지 않고 사실을 추측하게 한다면, AI는 100% 확률로 틀립니다. (AI는 마법처럼 당신의 비밀을 알지 못합니다.)
  • 텍스트 누출: 텍ست 노트를 삭제했지만 다른 텍텍스트 노트(예: "나는 해변 근처에 산다")를 남겨두었을 경우, AI는 남은 노트들을 읽는 것만으로 삭제된 사실을 **18.3%**의 확률로 맞출 수 있었습니다.
  • 사진 누출: 텍스트 노트와 그에 직접 태그된 사진들을 삭제했지만, 나머지 사진 앨범을 남겨두었을 경우, AI는 여전히 삭제된 사실을 **12.0%**의 확률로 맞출 수 있었습니다.
    • 충격적인 부분: 이 사례 중 거의 절반은 AI가 오직 사진 때문에 그 사실을 알아냈다는 것입니다. 만약 텍스트만 보았다면, 당신은 삭제가 성공했다고 생각했을 것입니다. 사진이 바로 "보이지 않는" 누출구였습니다.

해결할 수 있을까?

논문은 이 누출을 막기 위한 몇 가지 방법을 테스트합니다:

  1. 태그된 모든 것 삭제: AI가 텍스트와 그 사실에 명시적으로 태그된 모든 사진을 함께 삭제하면, 특정 사진을 남겨두었을 때의 48%였던 누출률이 12%로 떨어집니다. 이는 "연결된" 노트 문제는 해결하지만 "유령" 문제는 해결하지 못합니다.
  2. "스마트 스위퍼" (의미론적 삭제): 연구진은 명백한 것들을 삭제한 후, 두 번째 AI가 남은 사진들을 스캔하여 여전히 삭제된 사실을 암시하는지 확인하는 새로운 방법을 시도했습니다. 예를 들어, "스쿠버 다이빙을 잊어달라"고 했는데 "열대 해변" 사진이 남아 있다면, 스마트 스위퍼는 그 해변 사진도 삭제합니다.
    • 결과: 이 방법은 누출을 **2.0%**까지 줄였습니다. 훨씬 나아졌지만 완벽하지는 않습니다. 어떤 "유령"들은 스마트 스위퍼조차 잡아낼 수 없을 만큼 너무 미묘합니다.

결론

이 논문은 텍스트 항목 하나를 삭제하는 것만으로는 충분하지 않다고 결론짓습니다.

당신이 멀티모달 AI(보고 읽는 AI)에게 무언가를 잊으라고 말한다면, AI는 텍스트는 삭제할 수 있지만, 남겨진 다른 사진과 노트 속의 "단서"들을 통해 그 비밀을 재구성할 수 있습니다. 저자들은 현재의 시스템들이 바닥은 쓸어내지만 카펫 아래의 먼지는 남겨두는 청소부와 같다고 주장합니다. 진정으로 "잊기" 위해서는, 시스템이 단순히 지목된 상자 하나만을 보는 것이 아니라 다락방 전체를 감사(audit)해야 합니다.

이 논문이 주장하지 않는 것:

  • 이것이 오늘날의 모든 AI 시스템에서 발생한다고 말하지 않습니다 (특정 시스템인 Mem0와 Letta를 테스트했습니다).
  • 누출을 100% 제거하는 마법 같은 해결책을 제시하지 않습니다.
  • 이를 의료 진단이나 법적 재판에 사용하는 것에 대해 논하지 않습니다. 이는 순수하게 현재의 메모리 시스템이 정보를 삭제하는 데 어떻게 실패하는지를 측정하는 연구입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →