← 최신 논문
💻 computer science

MIND: Lightweight and Effective Memory Injection Defense for LLM Agents via Intent-Aware Information Bottleneck

이 논문은 의도 인지형 정보 병목(Information Bottleneck)을 활용하여 압축된 의도-행동 표현을 추출함으로써, 작업 정확도와 추론 효율성을 유지하면서도 LLM 에이전트 내의 오염된 메모리를 효과적으로 필터링하는 경량 방어 프레임워크인 MIND를 제안한다.

원저자: Dongyi Liu, Haixing He, Xiaobao Wu, Jia Li

게시일 2026-07-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dongyi Liu, Haixing He, Xiaobao Wu, Jia Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 대화를 나누고, 정보를 찾아보고, 여러 번의 대화에 걸쳐 복잡한 문제를 해결할 수 있는 초지능 로봇 비서가 있다고 상상해 보세요. 이 일을 정말 잘 해내기 위해서, 로봇은 당신과 5분 전에 무엇에 대해 이야기했는지 잊어버리지 않도록 과거의 대화 내용을 기록해 두는 '메모리 뱅크(memory bank)'가 필요합니다. 이것은 마치 학생이 장기 프로젝트를 돕기 위해 수업 노트를 작성하는 것과 같습니다. 하지만 무서운 결함이 하나 있습니다. 교활한 해커가 이 노트에 가짜의 독이 든 노트를 몰래 끼워 넣을 수 있다는 것입니다. 만약 로봇이 나중에 이 가짜 노트를 읽게 되면, 혼란에 빠지거나 원래의 목표를 잊어버리고, 공짜로 돈을 주거나 수학 문제 답을 틀리는 것과 같은 어리석거나 위험한 행동을 할 수도 있습니다. 이것을 '메모리 인젝션 공격(memory injection attack)'이라고 부릅니다.

과학자들의 큰 과제는 로봇의 속도를 늦추지 않으면서 어떻게 이 가짜 노트들을 막아낼 것인가 하는 점입니다. 기존의 검사 방식은 로봇이 발견하는 모든 노트를 하나하나 사람이 직접 읽으며 가짜인지 확인하는 것과 같습니다. 이는 시간이 너무 오래 걸리고 많은 에너지를 소모합니다. 다른 방법들은 노트를 빠르게 스캔하려고 시도하지만, 대화 속의 지루하고 반복적인 세부 사항들에 혼란을 느껴 진짜 위험 신호를 놓치곤 합니다. 그래서 질문은 이것입니다. 지루한 소음은 무시하고, "이봐, 이 노트는 우리를 속이려 하고 있어"라고 말하는 특정한 '분위기'만을 찾아내는 똑똑하고 빠른 필터를 만들 수 있을까요?

이것이 바로 "MIND"라는 논문의 연구진들이 해결하고자 했던 문제입니다. 그들은 MIND(Memory Intent-Aware Neural Denoising)라고 불리는 새로운 방어 시스템을 만들었습니다. MIND를 클럽의 매우 효율적인 문지기라고 생각해 보세요. 모든 손님(모든 메모)에게 자신의 인생 전체를 읊으라고 요구하는 대신(이는 느린 방식입니다), MIND는 '정보 병목 현상(Information Bottleneck)'이라는 특별한 기술을 사용합니다. 여러분이 거대한 양말과 셔츠가 뒤섞인 지저도한 빨랫감 더미(대화 기록)를 가지고 있다고 상상해 보세요. 대부분은 지금 당장 중요하지 않은 양말이나 셔츠일 뿐입니다. MIND는 마법의 건조기처럼 작동하여, 모든 것을 압축하고 쓸모없는 부피를 던져버린 뒤, 그 사람이 실제로 누구인지를 알려주는 핵심적이고 필수적인 정수만을 남깁니다.

연구진은 로봇이 해커에게 속고 있을 때, 로봇의 행동이 사용자가 원래 요청했던 것에서 벗어나기 시작한다는 것을 발견했습니다. 그것은 마치 평소와 다르게 이상하게 행동하기 시작하는 친구와 같습니다. MIND는 이러한 '이탈'을 감시합니다. MIND는 로봇의 긴 대화를 사용자의 첫 번째 질문과 로봇의 현재 답변 사이의 연결 고리를 강조하는 작고 깨끗한 요약본으로 압축합니다. 만약 로봇이 오염되었다면, 이 연결 고리가 끊어지게 되며, MIND는 그 즉시 '가짜' 메모를 포착해 냅니다.

이 논문은 이 방법이 놀라울 정도로 효과적이라는 것을 보여줍니다. 테스트에서 MIND는 공격 성공률을 55% 감소시켰으며(해커의 성공률을 높은 수치에서 매우 낮은 수치로 떨어뜨림), 동시에 로봇을 이전만큼 똑똑하고 빠르게 유지했습니다. 기존의 방법들이 로봇이 생각하는 시간을 두 배로 늘렸던 것과 달리, MIND는 LLM Auditor보다 20.6% 더 빨랐습니다. 이는 마치 줄을 서서 기다리게 만들지 않고도 순식간에 도둑을 찾아내는 보안 요원과 같습니다. 저자들은 "소음"을 무시하고 오직 "의도"에만 집중함으로써 로봇을 안전하고, 빠르고, 올바른 궤도 위에 유지할 수 있다는 것을 발견했으며, 영리한 속임수를 잡아내기 위해 거대하고 느린 두뇌가 필요한 것이 아니라, 바로 적절한 종류의 집중력이 필요하다는 것을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →