← 최신 논문
💻 computer science

Capability-Mediated Perimeters for Secure AI Agent Tool Execution: Conditional Non-Escalation Invariants and Empirical Evaluation Against Indirect Prompt Injection

이 논문은 LLM 에이전트를 신뢰할 수 없는 주체로 취급하고 외부 참조 모니터를 통해 조건부 비에스컬레이션 불변성을 강제함으로써, 간접 프롬프트 주입 및 데이터 유출 위협에 대한 실증적 평가에서 제로의 오탐률과 함께 완벽에 가까운 공격 탐지율을 달성하는 결정론 우선 보안 아키텍처인 Mastyf Guard를 소개한다.

원저자: Rudraneel Das

게시일 2026-09-02✓ Author reviewed
📖 6 분 읽기🧠 심층 분석

원저자: Rudraneel Das

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 컴퓨팅의 세계에서, 시스템을 안전하게 유지해 온 근본적인 규칙은 기계가 무엇을 할지 지시하는 명령(instructions)과 기계가 처리하는 데이터(data)를 분리하여 유지하는 것이었습니다. 이러한 분리는 사용자가 의도치 않게 혹은 악의적으로 컴퓨터가 따르지 않기로 되어 있는 명령을 실행하도록 속이는 것을 방지합니다. 그러나 자율 인공지능 에이전트의 부상은 이 경계를 모호하게 만들었습니다. 데이터베이스를 관리하거나 스마트 기기를 제어하는 것과 같은 복잡한 작업을 수행하도록 설계된 이 에이전트들은 종-종 인터넷으로부터 오는 지시 사항과 신뢰할 수 없는 데이터를 한 번에, 하나의 텍스트 스트림으로 읽습니다. 컴퓨터는 데이터와 지시 사항을 동일한 혼합물로 취급하기 때문에, 영리한 공격자는 겉보기에 무해한 이메일이나 웹페이지 안에 숨겨진 명령을 숨길 수 있습니다. 에이전트가 이 콘텐츠를 읽을 때, 에이전트는 자신도 모르게 숨겨진 명령에 복종하여 파일을 삭제하거나 비밀번호를 훔치는 등의 행동을 수행할 수 있습니다. '간접 프롬프트 주입(indirect prompt injection)'이라고 알려진 이 취약점은 에이전트를 자신이 받으려 하지 않았던 명령을 따르는 '혼란스러운 대리인(confused deputy)'으로 만듭니다.

Mastyf AI 연구소의 연구원들은 이러한 에이전트를 보호하기 위한 새로운 방법을 제안하며, 인공지능 자체가 안전의 최종 판단자가 될 수 있다는 생각에서 벗어났습니다. AI가 가능한 모든 속임수를 인식할 수 있는지에 의존하는 대신, 연구팀은 어떤 행동이 취해지기 전에 엄격한 문지기 역할을 하는 보안 시스템을 구축했습니다. 그들은 이 시스템을 Mastyf Guard라고 부릅니다. 이 시스템은 단순하지만 강력한 원칙에 따라 작동합니다. 즉, AI는 생각하고 추론할 수는 있지만, 스스로 행동할 수 있는 권한은 박탈된다는 것입니다. AI가 이메일을 보내거나 서버에 접속하는 것과 같이 도구(tool)를 사용할 것을 제안할 때마다, 별도의 독립적인 보안 모니터가 그 요청을 확인합니다. 이 모니터는 AI의 의도를 추측하려 하지 않습니다. 대신, 클럽 입구에서 명단을 확인하는 보안 요원처럼 디지털 권한 목록을 확인합니다. 만약 요청된 행동이 해당 세션에 대해 명시적으로 허용되지 않은 것이라면, AI의 추론이 아무리 설득력이 있더라도 그 요청은 즉시 차단됩니다.

연구원들은 이 접근 방식을 5만 개의 시나리오로 구성된 방대한 컬렉션을 대상으로 테스트했습니다. 이 중 절반은 에이전트를 속이기 위해 설계된 현실적인 공격이었고, 나머지 절반은 개발자가 수행하는 정상적이고 안전한 작업이었습니다. 결과에 따르면, 이 시스템은 대다수의 공격을 거의 즉각적으로 차단할 수 있었습니다. 가장 빠른 경우, 보안 확인은 단 0.005초밖에 걸리지 않았는데, 이는 인간이 느끼지 못할 정도로 빠른 속도입니다. 이 시스템은 공격의 99.33%를 성공적으로 식별하고 차단했으며, 이는 이러한 미묘한 속임수를 절반 이상 놓치는 기존의 안전 도구들에 비해 상당한 개선입니다. 결정적으로, 이 시스템은 값비싸고 고성능인 컴퓨터 칩을 필요로 하지 않고, 단 1.1GB의 메모리 점유율로 표준 컴퓨터 프로세서에서 효율적으로 실행되었습니다. 이는 이 보호 기능이 특수 하드웨어 없이도 일상적인 사무 환경에 배포될 수 있음을 의미합니다.

이것이 어떻게 작동하는지 이해하기 위해, AI 에이전트를 건물 전체의 마스터 키를 가진, 매우 유능하지만 주의력이 산만한 직원이라고 상상해 보십시오. 만약 낯선 사람이 직원의 귀에 가짜 지시를 속삭인다면, 직원은 그 마스터 키를 사용하여 열어서는 안 될 문을 열 수도 있습니다. Mastyf Guard 시스템은 직원의 주머니에서 마스터 키를 완전히 제거합니다. 대신, 직원은 문을 열고 싶을 때마다 보안 요원에게 허가를 구해야 합니다. 보안 요원은 직원의 이야기를 듣거나 어조를 해석하려 하지 않습니다. 보안 요원은 단순히 직원이 그 순간에 열 수 있도록 허용된 문의 목록을 확인합니다. 요청이 목록에 없다면 문은 잠긴 상태로 유지됩니다. 이 접근 방식은 AI가 잘못된 것을 요청하도록 속이더라도, 시스템이 권한이 없기 때문에 그 일을 수행할 수 없도록 함으로써 '혼란스러운 대리인' 문제를 해결합니다.

연구원들은 또한 더 미묘한 문제, 즉 AI가 도구를 사용할 권한은 있지만 해를 끼치기 위해 요청의 세부 사항을 변경하려고 할 때 발생하는 문제에 대해서도 다루었습니다. 예를 들어, AI는 이메일을 보낼 권한이 있지만, 공격자는 AI를 속여 다른 주소로 이메일을 보내거나 다른 제목으로 보내도록 할 수 있습니다. 이를 처리하기 위해 연구팀은 꼼꼼한 교정가 역할을 하는 두 번째 방어 계층을 추가했습니다. 이 계층은 요청의 구체적인 세부 사항을 원래의 권한과 대조하여 확인합니다. 만약 AI가 허용되지 않은 계좌로 돈을 보내려고 하거나 건드려서는 안 될 파일에 접근하려고 하면, 시스템이 그 변경 사항을 잡아냅니다. 3,000개의 복잡한 비즈니스 시나리오를 포함한 테스트에서, 이 엄격한 권한 확인과 세부적인 교정의 결합은 97.5%의 공격을 잡아냈으며, 2,000개의 양호한 기업 운영에 대해 0.19%의 통계적 상한선을 가진 0%의 오탐률을 유지했습니다. 시스템은 매우 정밀하여 2,000건의 정상적인 비즈니스 운영 중에 단 하나의 가짜 경보도 울리지 않았습니다.

연구의 중요한 발견 중 하나는 효과적인 데 있어 시스템이 초지능형 AI일 필요가 없다는 점입니다. 연구원들은 작고 전문화된 컴퓨터 프로그램이 마이크로초 단위로 대부분의 보안 확인을 처리할 수 있으며, 요청이 모호하거나 의심스러운 경우에만 더 크고 복잡한 AI 모델을 호출할 수 있다는 것을 발견했습니다. 이러한 하이브리드 접근 방식은 시스템을 빠르고 저렴하게 유지합니다. 일상적인 비즈니스 트래픽에서 복잡한 AI 모델은 전혀 필요하지 않았으며, 덕분에 시스템은 빠른 단순 확인의 속도로 작동할 수 있었습니다. 시스템이 까다로운 요청을 조사하기 위해 더 큰 모델을 호출해야 했을 때는 약 18밀리초가 소요되었는데, 이는 여전히 대부분의 실시간 애플리케이션에 충분히 빠른 속도입니다. 이 설계는 보안이 속도나 사용성을 희생시키지 않도록 보장하며, 기업들이 일상 업무를 늦추지 않고도 강력한 AI 에이전트를 사용할 수 있게 합니다.

또한 연구팀은 승인된 도구들의 체인을 통해 시스템 외부로 데이터가 유출되는 것을 방지하는 방법을 탐구했습니다. 공격자가 금지된 도구를 사용하도록 AI를 강제할 수는 없더라도, 허용된 도구 사이에서 정보를 이동시켜 정보를 몰래 빼내는 방식을 시도할 수 있습니다. 표준적인 권한 확인만으로는, 공격자가 허용된 도구 간에 정보를 이동시킴으로써 상당 부분의 테스트 케이스에서 데이터를 유출할 수 있다는 것을 연구원들은 발견했습니다. 이를 막기 위해 연구원들은 현금의 움직임을 추적하여 돈이 사라지지 않도록 보장하는 은행의 방식과 유사하게 정보의 흐름을 추적하는 시스템을 구현했습니다. 이 시스템은 비밀번호나 금융 기록과 같은 민감한 데이터를 표시하고, 이 데이터가 명시적으로 수신이 허가된 목적지로만 이동할 수 있도록 보장합니다. 이 특정 추적 방법을 사용하여 데이터를 훔치려는 1,000건 이상의 시도가 포함된 테스트에서, 시스템은 모든 시도를 차단하여 민감한 정보가 승인되지 않은 위치로 이동할 수 없도록 했습니다.

시스템이 놀라운 성공을 보여주었지만, 연구원들은 그 한계에 대해서도 주의 깊게 언급했습니다. 보안 보증은 보안 모니터 자체가 신뢰할 수 있는 컴퓨터에서 실행되고 있으며 해킹되지 않았다는 가정에 의존합니다. 만약 모니터가 침해되면 전체 시스템은 실패합니다. 또한, 이 시스템은 도구를 승인되지 않은 방식으로 사용하려는 공격을 막는 데는 탁-월하지만, 시스템을 혼란스럽게 하기 위해 설계된 복잡한 다단계 기동을 포함한 모든 종류의 속임수를 잡아내는 데는 완벽하지 않습니다. 연구원들은 시스템이 우회되는 소수의 사례를 확인했으며, 대부분은 매우 구체적인 금융 속임수나 도메인 이름 위장과 관련되어 있었습니다. 그들은 이미 이러한 격차를 해결하기 위한 업데이트를 제 제안했습니다. 그들은 자신들의 작업을 '프리 프로덕션 아키텍처(pre-production architecture)'라고 설명하는데, 이는 실제 환경에서 테스트할 준비가 되었으나 상업적 제품으로 간주되기 전까지 독립적인 전문가에 의한 추가 검증이 필요함을 의미합니다.

이 연구의 영향은 단순히 AI를 더 안전하게 만드는 것을 넘어, 우리가 지능형 시스템을 구축하는 방식에 대한 생각을 바꿉니다. AI를 스스로를 감시할 수 있는 신뢰할 수 있는 파트너가 아니라, 지속적인 감독이 필요한 잠재적으로 신뢰할 수 없는 구성 요소로 취급함으로써, 연구원들은 훨씬 더 깨뜨리기 어려운 프레임워크를 만들었습니다. 이러한 관점의 전환은 실수에 따른 비용이 매우 높은 병원, 은행, 정부 기관과 같은 민감한 환경에서 강력하고 자율적인 에이전트를 사용할 수 있게 합니다. 이 시스템은 높은 보안이 속도를 희생하거나 값비싼 하드웨어를 요구하지 않는다는 것을 증명하며, 이는 인공지능의 미래를 위한 실질적인 솔루션이 됩니다. 이러한 에이전트들이 우리 일상생활에서 점점 더 흔해짐에 따라, 사고하는 것과 행동하는 것을 분리하고, 어떤 행동이 허용되는지에 대한 엄격한 규칙을 집행하는 능력은 우리의 디지털 세계를 안전하게 유지하는 데 필수적일 것입니다.

연구원들은 자신의 도구와 데이터를 대중에게 공개하여 다른 과학자들이 자신들의 연구를 테스트하고 개선할 수 있도록 했습니다. 그들은 보안 모니터와 훈련된 AI 모델의 코드를 공개하여, 글로벌 커뮤니티가 약점을 찾아내고 개선 사항을 제안할 수 있도록 초대했습니다. 이러한 개방성은 과학적 과정의 핵심적인 부분이며, 시스템이 단순한 이론적 아이디어가 아니라 검토되고 정교해질 수 있는 실질적인 도구임을 보장합니다. 연구는 엄격하고 결정론적인 규칙과 스마트하고 유연한 체크를 결격하여 자율 에이전트를 위한 안전한 환경을 구축할 수 있다는 결론을 내립니다. 앞으로의 길은 이러한 시스템을 실제 환경에서 계속 테스트하고, 새로운 유형의 속임수를 잡아내기 위해 규칙을 정교화하며, 위협이 진화함에 따라 기술이 견고함을 유지하도록 하는 것을 포함합니다. 이 작업은 자율형 AI의 약속을 모두를 위한 안전하고 신뢰할 수 있는 현실로 만드는 데 있어 중요한 단계입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →