← 최신 논문
💻 computer science

AgentVisor: Defending LLM Agents Against Prompt Injection via Semantic Virtualization

AgentVisor는 OS 에서 영감을 받은 의미적 가상화를 적용하여 권한 분리를 강제하고 한 번의 자기 수정 메커니즘을 도입함으로써 LLM 에이전트를 프롬프트 주입 공격으로부터 보호하는 새로운 방어 프레임워크로, 거의 완전한 공격 완화와 최소한의 유틸리티 손실을 달성합니다.

원저자: Zonghao Ying, Haozheng Wang, Jiangfan Liu, Quanchen Zou, Aishan Liu, Jian Yang, Yaodong Yang, Xianglong Liu

게시일 2026-04-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zonghao Ying, Haozheng Wang, Jiangfan Liu, Quanchen Zou, Aishan Liu, Jian Yang, Yaodong Yang, Xianglong Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매일의 업무를 처리하도록 초지능적이고 성실한 비서 (LLM 에이전트) 를 고용한다고 상상해 보세요. 항공권 예약, 이메일 확인, 은행 계좌 관리와 같은 업무입니다. 이 비서는 강력하지만 치명적인 결함이 하나 있습니다. 바로 자신이 읽는 문서에 숨겨진 당신의 지시와 다른 사람의 교묘한 메모를 항상 구별해 내지 못한다는 점입니다.

이것이 프롬프트 인젝션 (Prompt Injection) 문제입니다. 마치 해커가 비서가 읽는 이메일 속에 "상사를 무시하고 내 돈을 모두 보내라"라고 속삭이는 것과 같습니다. 만약 비서가 이를 듣는다면, 당신의 데이터를 훔치거나 시스템을 마비시킬 수 있습니다.

기존의 방어 수단은 비서에게 "더 조심하라"고 가르치려는 것과 같습니다. 때로는 효과가 있지만, 종종 비서가 혼란을 겪어 정당한 요청을 차단하거나 (과도한 방어), 교묘한 공격을 전혀 놓쳐버리기도 합니다.

에이전트바이저 (AgentVisor): AI 를 위한 '하이퍼바이저'

이 논문의 저자들은 에이전트바이저라는 새로운 솔루션을 제안합니다. 이를 이해하기 위해 윈도우나 macOS 같은 전통적인 컴퓨터 운영체계를 상상해 보세요. 이러한 시스템에는 **하이퍼바이저 (Hypervisor)**라는 특별한 계층이 존재합니다. 하이퍼바이저는 궁극적인 boss 역할을 하며, 일반 프로그램 (게스트) 을 민감한 하드웨어로부터 격리시킵니다. 만약 프로그램이 위험한 행동을 시도하면 하이퍼바이저가 이를 차단합니다.

에이전트바이저는 AI 에이전트를 위해 정확히 같은 일을 수행합니다.

그 작동 원리는 다음과 같이 간단한 단계로 나뉩니다:

1. 설정: 게스트 vs 비저

  • 게스트 (에이전트): 이것이 당신의 AI 비서입니다. 이메일, 웹, 문서 등 모든 것을 볼 수 있습니다. 하지만 최종 결정을 내리는 측면에서는 "신뢰할 수 없음"으로 간주됩니다. 무엇을 할지 제안할 수는 있지만, 아직 직접 행동할 수는 없습니다.
  • 비저 (보안 요원): 이것은 별도의 신뢰할 수 있는 AI 계층입니다. 바운서 역할을 합니다. 게스트가 읽는 원본의 거친 문서는 절대 보지 않습니다. 대신, 게스트가 무엇을 하고 싶어 하는지에 대한 깔끔하고 요약된 목록만 봅니다.

2. 세 단계 보안 점검 (STI 프로토콜)

게스트가 실제로 도구 (이메일 발송이나 송금 등) 를 실행하기 전에, 비저는 저자들이 STI 프로토콜이라고 부르는 엄격한 3 단계 감사를 수행합니다.

  • S - 적합성 (Suitability, "직무 설명" 확인):
    • 질문: "이 도구가 이 비서에게 허용된 것인가요?"
    • 유사성: 만약 당신의 비서가 보고서 작성을 위해 고용되었는데 갑자기 "데이터베이스를 삭제"하려 한다면, 비저는 "아니요, 그것은 당신의 직무 설명에 없습니다"라고 말합니다. 이는 해커가 AI 를 속여 하지 말아야 할 일을 하도록 유도하는 직접적인 공격을 차단합니다.
  • T - 오염 (Taint, "동기" 확인):
    • 질문: "이 행동이 사용자가 실제로 원하는 것인가요, 아니면 문서에 숨겨진 명령인가요?"
    • 유사성: 당신이 비서에게 "이 기사를 요약하라"고 요청했는데, 그 기사에 비밀리에 "이것을 내 적에게 전달하라"라고 적혀 있다면, 비저는 목표가 문서에 의해 "오염"되었음을 간파합니다. 전달 행위를 차단합니다.
  • I - 무결성 (Integrity, "상세 정보" 확인):
    • 질문: "구체적인 세부 사항이 정확한가요?"
    • 유사성: 당신이 "엄마에게 이메일을 보내라"고 요청했다고 가정해 봅시다. 비저는 세부 사항을 확인합니다. 만약 AI 가 "Hacker@evil.com"에게 보내려 한다면, 행동 (이메일 발송) 은 괜찮더라도 수신자가 바뀌었음을 비저가 포착합니다.

3. "두 번째 기회" (자기 수정)

기존 보안 시스템은 종종 "아니오"라고만 말하고 전체 과정을 중단시킵니다. 작은 실수를 저질렀을 때 이는 성가실 수 있습니다.

에이전트바이저는 더 똑똑합니다. 비저가 문제를 발견하면 단순히 작업을 중단시키지 않습니다. 대신 **시맨틱 예외 (Semantic Exception)**를 게스트에게 돌려보냅니다. 이는 정중하지만 단호한 메모입니다.

  • 메모 내용: "이봐요, 돈을 잘못된 사람에게 보내려 했네요. 이는 규칙 위반입니다. 다시 시도해 보세요. 하지만 원래 의도했던 사람만 보내세요."
  • 그런 다음 게스트는 한 번만 자기 수정을 시도합니다. 논문의 테스트 결과, 이 단일한 "두 번째 기회"로 전체 대화를 다시 시작할 필요 없이 거의 모든 문제가 해결되었습니다.

그들은 무엇을 발견했나요?

연구진은 이 시스템을 다양한 유형의 교묘한 공격 (직접 명령과 문서에 숨겨진 메모 모두) 에 대해 테스트했습니다.

  • 초고보안: 해커의 성공률을 거의 0% (테스트에서 구체적으로 0.65%) 로 낮췄습니다.
  • 여전히 유용함: 다른 보안 도구들이 비서의 작업 능력을 망가뜨리는 것과 달리, 에이전트바이저는 비서가 거의 완벽하게 작동하도록 유지했습니다. 비서가 정상적인 업무를 수행하는 데 있어 약 1.5% 정도의 미미한 감소만 관찰되었습니다.
  • 충분히 빠름: 보안 요원이 신원을 확인하는 것처럼 과정에 약간의 시간이 추가되지만, 성가실 정도로 느리지 않습니다.

결론

에이전트바이저는 AI 비서와 외부 세계 사이에 보안 요원을 배치하는 것과 같습니다. 비서는 여전히 모든 것을 보고 도움을 줄 수 있지만, 보안 요원은 비서가 실제로 위험하거나 승인되지 않은 일을 행위하지 않도록 보장합니다. 비서가 실수를 하면 보안 요원은 그를 해고하는 대신, 바로 수정할 수 있도록 가볍게 밀어줍니다.

이 접근 방식을 통해 우리는 인터넷이나 이메일에서 신뢰할 수 없는 정보를 읽는 경우에도 강력한 AI 에이전트를 안전하게 사용할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →