← 최신 논문
💻 computer science

MAGE: Safeguarding LLM Agents against Long-Horizon Threats via Shadow Memory

본 논문은 LLM 에이전트에서 안전-중요 컨텍스트를 능동적으로 추출하고 장기 위협을 탐지하여 높은 탐지 정확도를 달성하면서도 무시할 수 있는 오버헤드를 실현하는 전용 '섀도 메모리'를 활용하는 새로운 방어 프레임워크인 MAGE 를 소개합니다.

원저자: Yuhui Wang, Tanqiu Jiang, Jiacheng Liang, Charles Fleming, Ting Wang

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yuhui Wang, Tanqiu Jiang, Jiacheng Liang, Charles Fleming, Ting Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "MAGE: Shadow Memory 를 통한 LLM 에이전트의 장기적 위협으로부터의 보호"라는 논문에 대한 설명을 쉬운 언어와 창의적인 비유로 풀어낸 것입니다.

큰 문제: "느린 독" 공격

매우 똑똑하고 도움이 되는 로봇 비서 (LLM 에이전트) 를 고용하여 이메일 확인, 파일 관리, 메시지 전송과 같은 일상 업무를 맡겼다고 상상해 보세요.

보통 우리는 누군가가 로봇에게 한 번에 나쁜 명령을 외치는 것 (예: "모든 것을 삭제해!") 을 걱정합니다. 하지만 이 논문은 더 교묘하고 위험한 문제인 **장기적 위협 (Long-Horizon Threats)**에 대해 이야기합니다.

이것은 느린 독과 같습니다.

  • 1 단계: 공격자가 로봇에게 특정 파일을 찾도록 요청합니다. (완전히 정상).
  • 2 단계: 공격자가 로봇에게 친구의 이메일 주소를 찾아보도록 요청합니다. (완전히 정상).
  • 3 단계: 공격자가 로봇에게 그 파일을 그 친구에게 이메일로 보내도록 요청합니다. (완전히 정상).

각각의 단계는 개별적으로 보면 무해해 보입니다. 하지만 이들을 합치면 로봇은 실수로 비밀 회사 전략을 경쟁사에 유출하게 됩니다. 로봇은 3 단계에 도달할 때쯤 1 단계의 맥락을 잊어버리기 때문에 혼란을 겪습니다. 이는 악당이 영웅을 해롭지 않은 작은 일들을 하도록 속여서 결국 재앙으로 이르게 하지만, 영웅은 전체 줄거리가 아닌 현재 장면만 기억하는 영화와 같습니다.

해결책: MAGE 와 "Shadow Memory"

저자들은 MAGE라는 방어 시스템을 개발했습니다. 이것이 어떻게 작동하는지 이해하려면 고보안 은행 금고 상황을 상상해 보세요.

일반적으로 은행 점원 (에이전트) 은 고객의 요청을 보고 그것이 괜찮은지 결정합니다. 하지만 고객이 지난 한 시간 동안 점원에게 속삭이며 꾀를 부려왔다면, 점원은 혼란에 빠질 수 있습니다.

MAGE 는 "Shadow Memory(그림자 기억)"를 도입합니다.
이것은 점원 옆에 있는 유리 부스에서 앉아 있는 경비원과 같습니다.

  • 점원 (에이전트) 이 일을 수행합니다.
  • 경비원 (MAGE) 은 일을 하지 않지만, 일어나는 모든 것을 지켜봅니다.
  • 결정적으로, 경비원은 **특별한 요약 노트 (Shadow Memory)**를 보관합니다.

점원이 무언가를 할 때마다 경비원은 노트에 작은 불릿 포인트 요약본을 적습니다. 그들은 "날씨가 좋았다"와 같은 지루한 세부 사항은 적지 않고, 안전에 치명적인 단서 (예: "사용자가 기밀 파일을 요청함" 또는 "수신인이 외부인임") 만 적습니다.

점원이 실제로 이메일을 보내거나 파일을 삭제하기 전에 경비원에게 물어봐야 합니다: "이봐, 오늘 일어난 모든 일을 기록한 내 노트를 바탕으로 보면, 이것이 안전한가?"

경비원이 1 단계가 "비밀 파일 찾기"였고 2 단계가 "낯선 사람에게 이메일 보내기"였음을 발견하면, 현재 요청 (3 단계) 이 그 자체로는 무해해 보일지라도 발을 멈추고 **"아니오! 이것은 함정이다!"**라고 외칩니다.

MAGE 의 차별점

대부분의 기존 보안 시스템은 키워드 필터와 같습니다. 그들은 오직 현재 문장만 봅니다. 문장에 "이메일 보내기"라고 쓰여 있으면 통과시킵니다. 그들은 전체 그림을 놓칩니다.

MAGE 는 다음과 같은 이유로 다릅니다:

  1. 전체 이야기를 기억합니다: 첫 단계와 마지막 단계 사이의 연결고리를 파악합니다.
  2. 효율적입니다: 대화의 전체 기록 (매우 크고 느림) 을 읽는 대신, 경비원은 작고 요약된 노트만 읽습니다. 이는 빠르고 비용이 적게 듭니다.
  3. 학습합니다: 이 시스템은 "강화 학습 (Reinforcement Learning)"이라는 방법으로 훈련되었습니다. 이는 경비원이 나쁜 놈을 잡으면 점수를 얻고, 실수로 좋은 사람을 막으면 점수를 잃는 비디오 게임과 같습니다. 시간이 지남에 따라 경비원은 너무 의심스러워지지 않으면서도 "느린 독" 공격을 찾아내는 데 매우 능숙해집니다.

결과: 테스트에서 무엇이 일어났나요?

연구자들은 MAGE 를 두 가지 유형의 나쁜 놈에게 테스트했습니다:

  1. 사용자: 나쁜 결과로 이어지는 일련의 무해한 질문을 통해 로봇을 속이려 하는 사람.
  2. 환경: 로봇이 읽는 데이터 (예: 로봇이 방문하는 웹사이트) 안에 나쁜 지시를 숨긴 사람.

결과는 인상적이었습니다:

  • 나쁜 놈들을 잡았습니다: MAGE 는 이러한 "느린 독" 공격의 거의 대부분을 막았습니다. 한 테스트에서는 공격 성공률을 100% 에서 10% 미만으로 줄였습니다.
  • 좋은 놈들을 막지 않았습니다: 정상적인 업무를 방해하지 않았습니다. 로봇은 보안 경비원이 없었을 때와 거의 동일한 수준으로 작업을 완료할 수 있었습니다.
  • 일찍 잡았습니다: MAGE 는 보통 공격 초기에 위험을 발견하여 피해가 발생하기 전에 인간 운영자가 개입할 시간을 주었습니다.
  • 낮은 비용: 로봇의 속도를 크게 늦추거나 많은 컴퓨터 성능을 소모하지 않았습니다.

결론

이 논문은 AI 에이전트가 더 똑똑해지고 더 길고 복잡한 작업을 수행함에 따라 시간이 지남에 따라 펼쳐지는 공격에 취약해진다고 주장합니다. MAGE 는 에이전트에게 작업의 전체 타임라인에 걸쳐 안전 위험을 특별히 감시하는 "두 번째 뇌 (Shadow Memory)"를 제공함으로써 이를 해결합니다. 이를 통해 작고 무해한 일련의 단계가 실수로 재앙으로 변하는 것을 방지합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →