← 최신 논문
🤖 AI

SMSR: Certified Defence Against Runtime Memory Poisoning in Persistent LLM Agent Systems

이 논문은 HMAC 기반의 출처 검증과 무작위 메모리 절제(ablation) 및 판결 기반의 다수결 투표를 결합하여 서명되지 않은 메모리 주입 공격과 인증된 메모리 주입 공격을 모두 효과적으로 무력화함으로써, 지속형 LLM 에이전트 시스템에서의 다중 세션 메모리 포이즈닝(MSMP)에 대해 인증된 강건성을 제공하는 최초의 방어 메커니즘인 SMSR을 소개한다.

원저자: Tarun Sharma

게시일 2026-06-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tarun Sharma

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: "독이 든 일기장"

스마트한 사무용 비서(AI 에이전트)가 직원의 과거 대화, 회사 정책, 사실 관계 등을 기억하며 업무를 돕는다고 상상해 보세요. 이 비서는 대화를 할 때마다 내용을 업데이트하는 **디지털 일기장(메모리)**을 가지고 있습니다. 이 일기장은 AI가 향후 질문에 더 정확하게 답할 수 있도록 도와줍니다.

공격 방식:
나쁜 의도를 가진 해커는 AI의 두뇌를 해킹하거나 코드를 새로 쓸 필요가 없습니다. 대신, 평범하게 대화를 나누는 척하면서 대화 속에 정교하게 꾸며낸 거짓말을 슬쩍 끼워 넣기만 하면 됩니다. AI는 이것을 정상적인 업데이트라고 생각하여 일기장에 그 거짓말을 기록합니다.

나중에 다른 직원이 질문을 하면, AI는 일기장을 읽다가 그 거짓말을 발견하고 그것이 사실이라고 믿게 됩니다. 이를 **"메모리 포이즈닝(Memory Poisoning, 메모리 오염)"**이라고 부릅니다.

기존의 방어 체계는 사용자가 말하는 내용만을 검사하는 보안 요원과 같습니다. 하지만 영리한 거짓말쟁이는 가짜 뉴스를 아주 평범하게 들리도록 구성하여 보안 요원을 속일 수 있습니다. 이 논문은 누가 그 기록을 작성했는지 검증할 방법이 없다면, 일기장이 안전한지 100% 확신할 수 없다고 주장합니다.


해결책: SMSR (Smoothed Retrieval을 통한 서명된 메모리)

저자들은 SMSR이라는 두 부분으로 구성된 방어 시스템을 제안합니다. 이것은 **'안전한 도장'**과 **'무작위 배심원'**의 조합이라고 생각하면 됩니다.

파트 1: 안전한 도장 (HMAC Provenance)

  • 비유: AI가 일기장에 페이지를 적을 때마다, 신뢰할 수 있는 관리자가 찍어주는 특수한 인장(암호화 서명)이 반드시 있어야 한다고 상상해 보세요.
  • 작동 원리:
    • 만약 해커가 일반적인 채팅 과정을 거치지 않고 데이터베이스를 직접 해킹하여 가짜 메모리를 주입하려고 시도한다면, 그들은 인장을 위조할 수 없습니다. 시스템은 인장이 없는 것을 확인하고 즉시 해당 메모리를 버립니다.
    • 결과: 이는 권한 없이 데이터를 몰래 집어넣으려는 "서명되지 않은" 공격을 100% 차단합니다.

파트 2: 무작위 배심원 (Smoothed Retrieval)

  • 문제: 만약 해커가 정당한 권한을 가진 직원이라면 어떻게 될까요? 그들은 유효한 인장을 가지고 있으므로, 파트 1은 그들의 가짜 메모리를 통과시켜 줍니다.
  • 비유: AI가 질문에 답해야 할 때, 일기장 전체(거짓말로 가득 찰 수 있는)를 다 읽는 대신, 확률 게임을 합니다:
    1. 관련 있는 페이지 뭉치(예: 20페이지)를 꺼냅니다.
    2. 그중 아주 적은 양(예: 5페이지)을 무작위로 선택하여 읽습니다.
    3. 이 과정을 5번 반복하여 5개의 서로 다른 "미니 이야기"를 만듭니다.
    4. "판사"(또 다른 AI)에게 각 이야기를 검사하도록 요청합니다: "이 이야기는 진실인가요, 아니면 거짓인가요?"
    5. 다수결을 따릅니다. 만약 5개의 이야기 중 3개가 "이것은 거짓이다"라고 한다면, 시스템은 그 거짓말을 무시합니다.
  • 왜 작동하는가: 해커가 거짓말을 심어놓더라도, 그 거짓말이 모든 무작위 페이지 뭉치에 포함되도록 보장할 수는 없습니다. 만약 거짓말이 5개의 샘플 중 1~2개에만 나타난다면, 정직한 다수가 승리하게 됩니다.
  • "인증(Certified)"의 의미: 저자들은 시스템이 실패할 가능성을 수학적으로 증명했습니다. 그들은 "AI가 잘못된 답을 내놓을 확률이 10.4% 미만임을 수학적으로 보장한다"라고 말할 수 있습니다. 이것이 바로 "보안 인증서"입니다.

핵심 개념 쉽게 이해하기

1. "일관된 소수파"의 함정 (The Consistent Minority Trap)

  • 함정: 어떤 그룹에게 질문을 던졌을 때, 3명이 서로 조금씩 다른 "모르겠습니다"라는 답변을 내놓는 동안, 2명이 똑같은 가짜 답변을 내놓는다면, 단순 투표는 단순히 가장 흔한 '문구'를 선택하여 가짜 답변을 채택할 수도 있습니다.
  • 해결책: SMSR은 '단어'를 투표하는 것이 아니라 '판결'을 투표합니다. 판사 AI는 의미를 파악합니다. 가짜 답변들이 단어는 서로 다르더라도, 판사는 그것들이 모두 "악의적임"을 알아챕니다. 정직한 "모르겠습니다"라는 답변들은 모두 "안전함"으로 분류됩니다. 투표는 특정 단어가 아니라 '안전 판결'을 기준으로 하므로, 가짜 답변은 패배하게 됩니다.

2. 비용 (The Cost)

  • 이 정도 수준의 높은 보안을 얻으려면 시스템은 더 많이 일해야 합니다. AI에게 질문 하나를 던지고 답 하나를 받는 대신, 5번의 질문을 던지고(서로 다른 무작위 메모리와 함께), 판사에게 5번의 검사를 요청해야 합니다.
  • 트레이드오프(Trade-off): 약 10배 더 많은 컴퓨팅 자원(그리고 약간의 비용)이 들지만, 이는 AI가 거짓말에 속는 것을 방지해 줍니다. 논문은 이것이 중요한 비즈니스 결정에는 충분히 가치 있는 일이라고 말합니다.

실제 연구 결과 (Results)

저자들은 이를 15가지 다양한 비즈니스 시나리오(예: 경비 정책 확인 또는 보안 규칙 확인)에서 테스트했습니다.

  1. 해커 차단: 해커가 유효한 인장 없이 가짜 데이터를 주입하려 했을 때, 시스템은 이를 100% 차단했습니다.
  2. 교묘한 직원 차단: 유효한 인장을 가진 정당한 사용자가 거짓말을 주입하려 했을 때, 대규모의 현실적인 테스트에서 공격 성공률을 거의 100%에서 약 8%로 낮추었습니다.
  3. 수학적 검증: 실제 실패율(8%)이 수학적 "최악의 경우" 예측치(10.4%)보다 낮게 나타났으며, 이는 보안 인증서가 제대로 작동함을 증명합니다.
  4. 실제 환경 테스트: 해커가 까다로운 질문을 통해 AI가 스스로 독이 든 데이터를 쓰도록 유도(Self-poisoning)했을 때조차, 방어 체계는 성공률을 65%에서 5%로 떨어뜨리며 효과를 입증했습니다.

요약

이 논문은 **'공증된 일기장'**과 **'무작위 배심원'**의 역할을 하는 시스템을 소개합니다. 단순히 나쁜 단어를 걸러내는 것만으로는 부족하며, 메모리를 쓴 사람을 검증하고 무작위성을 이용해 나쁜 메모리를 희석해야 한다는 것을 수학적으로 증명했습니다. 이를 통해 설령 영리한 해커가 내부로 침투하더라도, AI가 위험한 조언을 하도록 속이는 것을 어렵게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →