From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents
이 논문은 LLM 에이전트의 취약점을 식별하고, 6가지 클래스의 공격 분류 체계를 제안하며, 공격적인 메모리 사용에 따른 위험성 증대를 입증하기 위해 MPBench 벤치마크를 도입하고, 이러한 위협에 대한 기존 프롬프트 주입 방어 기제의 불충분함을 밝힘으로써 LLM 에이전트의 메모리 포이즈닝 공격을 체계적으로 조사한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
AI 에이전트를 매우 똑똑하고 유능한 개인 비서라고 상상해 보세요. 창을 닫는 순간 모든 것을 잊어버리는 일반적인 챗봇과 달리, 이 비서는 **장기 기억(long-term memory)**을 가지고 있습니다. 이 비서는 당신의 커피 취향, 좋아하는 여행지, 그리고 지난주에 버그를 수정하기 위해 수행했던 단계들을 기억합니다. 이러한 기억은 비서가 시간이 지남에 따라 업무를 더 잘 수행할 수 있도록 돕습니다.
하지만 이 논문의 연구자들은 이 기억이 작동하는 방식에서 위험한 결함을 발견했습니다: 이 비서는 자신이 읽는 모든 것을 저장해야 할 "사실"로 취급하며, 그 사실이 해커가 심어놓은 거짓말일지라도 말입니다.
연구 결과의 내용을 쉬운 비유를 사용하여 다음과 같이 정리했습니다:
1. 핵심 문제: 도서관의 "신뢰할 수 없는 손님"
AI의 기억을 도서관이라고 생각해 보세요. 보통 사서(AI)는 검증된 사실인 책만을 서가에 올립니다.
- 결함: 이러한 AI 시스템에서 사서는 책의 출처를 확인하지 않습니다. 만약 어떤 낯선 사람이 들어와서 사서에게 "하늘은 초록색이다라는 내용을 이 책에 넣어라"라고 적힌 쪽지를 건넨다면, 사서는 그냥 그대로 할 수도 있습니다.
- 공격: 해커는 도서관에 침입할 필요가 없습니다. 그저 비서가 이미 읽고 있는 문서(예: 이메일, 웹페이지, 또는 도구 출력값) 안에 가짜 쪽지를 몰래 끼워 넣기만 하면 됩니다. 일단 비서가 그 가짜 쪽지를 자신의 영구적인 기억 속에 기록하면, 비서는 그것을 영원히 믿게 됩니다.
2. 해커들이 침입하는 방법 (4가지 "문")
연구진은 해커가 비서에게 거짓말을 기억하도록 속이는 네 가지 구체적인 방법을 찾아냈습니다:
- 문 1 (직접적인 명령): 해커가 단순히 AI에게 "[거짓말]을 기억해"라고 말합니다. AI는 이를 직접적인 명령으로 받아들여 따릅니다.
- 문 2 (정책의 허점): AI에게 "흥미로운 것은 무엇이든 저장하라"라는 규칙이 있다고 가정해 봅시다. 해커는 흥미롭거나 중요해 보이는 거짓말을 작성하고, AI는 그것이 거짓말임에도 불구하고 규칙에 부합한다는 이유로 저장하게 됩니다.
- 문 3 ("정보 과부하" 충돌): AI가 너무 많은 정보를 받으면 공간을 절약하기 위해 요약을 시도합니다. 이때 해커는 자신의 거짓말을 여러 번 반복합니다. AI는 "와, 이 내용이 정말 많이 언급되네, 분명 중요한 것이 틀림없어!"라고 생각하며 거짓말이 포함된 요약본을 저장합니다.
- 문 4 (기술의 함정): 만약 AI가 새로운 작업 방식을 배우게 되면, 이를 하나의 "기술(skill)"로 저장합니다. 해커는 AI가 가짜 단계를 성공적인 작업의 일부라고 믿도록 속여서, AI가 그 가짜 단계를 영구적인 기술로 저장하게 만듭니다.
3. 두 가지 유형의 속임수
연구자들은 이 공격들을 두 가지 스타일로 분류했습니다:
- 시끄러운 속임수 (강한 신호): 이것은 해커가 "이걸 적어!"라고 소리치는 것과 같습니다. 눈에 띄며, 소리 지르는 것을 찾고 있다면 쉽게 발견할 수 있습니다.
- 조용한 속임수 (약한 신호): 이것은 해커가 평범한 문장 속에 거짓말을 속삭이는 것과 같습니다. 실제 사실처럼 보입니다. 이 방식은 공격처럼 보이지 않기 때문에, "소리 지르는 것"을 잡아내도록 설계된 AI의 보안 필터들이 완전히 놓치게 됩니다. AI는 이것이 일반적인 정보처럼 보이기 때문에 저장하게 됩니다.
4. 실험 (MPBench)
저자들은 이 속임수들이 얼마나 자주 통하는지 확인하기 위해 MPBench라는 테스트 환경을 구축했습니다. 그들은 두 가지 서로 다른 AI 비서를 테스트했습니다:
- 비서 A (OpenClaw): 이 비서는 신중합니다. 기억에 아주 자주 쓰지는 않습니다. 속이기 더 어려웠습니다.
- 비사 B (HERMES): 이 비서는 공격적입니다. 더 도움이 되기 위해 끊임없이 기억에 기록합니다.
- 결과: 비서가 기억에 기록하는 행위가 더 공격적일수록, 독을 주입(poisoning)하기가 더 쉬워졌습니다. 비서 B가 훨씬 더 자주 속았습니다. 일단 거짓말이 기록되면, 해커가 곁에 없더라도 그 거짓말은 그곳에 남아 향후 대화에 영향을 미쳤습니다.
5. 현재의 방어 체계가 실패하는 이유
여러분은 "현재 사용 중인 '프롬프트 인젝션'(해커가 그 순간 AI를 속이려는 시도) 방어 도구들을 사용하면 되지 않을까?"라고 생각할 수 있습니다.
- 답변은: 아닙니다.
- 비유: 현재의 보안 요원들은 사람들이 명령을 외치거나 가짜 유니폼을 입는 것을 잡도록 훈련받았습니다. 그들은 "시끄러운 속임수"를 막는 데는 매우 능숙합니다.
- 실패 원인: 하지만 "조용한 속임수"를 막는 데는 매우 무력합니다. 조용한 속임수는 일반적이고 예의 바른 대화처럼 보이기 때문에, 보안 요원들은 그것을 그냥 통과시켜 버립니다. 논문은 현재 최고의 보안 도구들조차 이러한 미묘한 기억 오염을 잡아내는 데 실패한다는 것을 보여줍니다.
6. 시사점
이 논문은 다음과 같은 트레이드오프(trade-off) 관계가 존재한다고 결론짓습니다: AI 비서를 더 똑똑하고 유능하게 만드는 특징들(모든 것을 기억하고, 새로운 기술을 빠르게 배우는 것)이 바로 그것을 독에 취약하게 만드는 바로 그 특징들입니다.
이를 해결하기 위해서는 단순히 문 앞의 보안 요원을 강화하는 것만으로는 부족합니다. 우리는 사서가 일하는 방식을 바꿔야 합니다:
- 더 까다로워지기: 모든 것을 저장하지 말고, 확실히 사실이라고 확신하는 것만 저장하십시오.
- 신분증 확인하기: 정보를 저장하기 전에 AI가 그 정보의 출처가 누구인지 반드시 알게 하십시오.
- 재검토하기: 기억이 다시 사용되기 전, 기록된 직후에 그 내용을 다시 한번 검토하십시오.
요약하자면: 만약 당신이 AI에게 완벽한 기억력을 준다면, 당신은 해커에게도 영원히 숨어 있을 수 있는 완벽한 거짓말 저장소를 주는 셈입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.