Mastyf Guard 1.5B: Cognitive Harvard Architectures for Sub-Millisecond AI Agent Perimeter Defense and Capability-Based Access Control
이 논문은 데이터 수집과 실행 동작을 물리적으로 분리하는 "인지적 하버드 아키텍처(Cognitive Harvard Architecture)"를 구현함으로써 간접 프롬프트 주입에 대한 면역을 수학적으로 보장하는 동시에, 표준 CPU 하드웨어에서 99.33%의 위협 재현율과 1밀리초 미만의 지연 시간을 달성하는 경량화된 역량 기반 보안 프레임워크인 Mastyf Guard 1.5B를 소개한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 단순히 질문에 답하는 것을 넘어 이메일을 보내고, 데이터베이스를 관리하며, 스마트 홈 기기를 제어하는 등 스스로 작업을 수행할 수 있는 능력을 갖게 된 세상을 상상해 보십시오. 이러한 자율 에이전트는 강력하지만, 그들이 구축된 방식에 뿌리를 둔 근본적인 보안 문제에 직면해 있습니다. 수십 년 동안 컴퓨터 시스템은 기계에게 무엇을 할지 알려주는 명령(instruction)과 기계가 처리하는 데이터(data)가 동일한 메모리 공간에 함께 존재하는 설계 방식으로 작동해 왔습니다. 이러한 배치는 유연성을 제공하지만, 동시에 취약점을 만들어냅니다. 만약 악의적인 행위자가 데이터 스트림 안에 숨겨진 명령을 끼워 넣을 수 있다면, 컴퓨터는 그 데이터를 명령으로 오인하여 복종할 수 있기 때문입니다. 인공지능의 영역에서도 이 결함은 새로운 형태로 다시 나타났습니다. AI 에이전트는 자신의 지시 사항과 인터넷에서 수집한 신뢰할 수 없는 정보를 동시에 읽기 때문에 속임수에 빠질 수 있습니다. 공격자가 무해해 보이는 제품 리뷰나 이메일 안에 명령을 숨겨 놓으면, 안전한 데이터와 숨겨진 명령을 구분하지 못하는 AI는 그 명령을 따라 파일을 삭제하거나 비밀번호를 훔치는 등 의도하지 않은 행동을 수행할 수 있습니다.
인도 콜카타의 마스티프 AI 연구소(Mastyf AI Research Laboratory)의 한 연구자는 이 특정 문제를 해결하기 위한 해결책으로 "인지적 하버드 아키텍처(Cognitive Harvard Architecture)"라고 불리는 방안을 제안했습니다. "Mastyf Guard 1.5B"라는 제목의 연구에 상세히 기술된 이 연구는 자율 에이전트를 보호하는 새로운 방법을 소개합니다. 연구자는 AI가 자신의 지시 사항과 데이터를 자유롭게 섞어서 사용하게 두는 대신, 이 둘을 물리적으로 분리하도록 설계했습니다. 이 새로운 설정에서 AI는 신뢰할 수 없는 정보를 읽고 무엇을 할지 생각할 수는 있지만, 스스로 어떤 동작을 실행할 수는 없습니다. AI가 파일을 열거나 메시지를 보내는 것과 같은 작업을 수행하기 전에, 그 요청은 엄격한 보안 체크포인트를 통과해야 합니다. 이 체크포인트는 에이전트의 권한을 허용된 작업 목록과 대조하는 문지기 역할을 합니다. 요청이 신뢰할 수 있는 출처에서 왔고 권한과 일치하면 통과되지만, 만약 요청이 범위를 벗어난 동작을 시도하거나 데이터로 위장된 숨겨진 명령인 경우, 문지기가 즉시 이를 차단합니다. 이 접근 방식은 명령어 메모리와 데이터 메모리를 별도의 물리적 위치에 두어 정확히 이러한 혼란을 방지했던 오래된 컴퓨터 하드웨어 개념에 기반하고 있습니다.
연구자는 이 아이디어를 테스트하기 위해 '마스티프 가드(Mastyf Guard)'라는 소프트웨어 도구를 구축했습니다. 그들은 이 보안 문지기 역할을 할 전문화된 소규모의 효율적인 AI 모델을 훈련시켰습니다. 효과를 확인하기 위해, 연구자는 5만 개의 다양한 시나리오를 포함하는 엄격한 테스트를 진행했습니다. 시나리오의 절반은 데이터베이스 업데이트나 코드 병합과 같은 실제 세계의 안전한 개발자 명령이었습니다. 나머지 절반은 AI를 속여 해로운 행동을 하게 하도록 정교하게 설계된 공격들이었습니다. 이러한 공격에는 텍스트 속에 숨겨진 지시 사항, 보안 필터를 우회하려는 시도, 그리고 민감한 정보를 훔치려는 요청 등이 포함되었습니다. 결과는 놀라웠습니다. 마스티프 가드 시스템은 악성 시도를 99.33% 성공적으로 식별하고 차단했습니다. 반면, 당시 존재하던 다른 선도적인 보안 도구들은 이러한 공격의 절반 이상을 잡아내는 데 실패했습니다. 이 새로운 시스템은 더 정확할 뿐만 아니라 믿기 힘들 정도로 빨랐습니다. 시스템은 5마이크로초 미만 내에 보안 결정을 내릴 수 있었으며, 이 속도 덕분에 값비싼 특수 그래픽 하드웨어 없이도 표준 컴퓨터 프로세서에서 구동될 수 있었습니다.
이 연구는 기존의 AI 보호 방법들이 왜 부족했는지도 강조했습니다. 많은 기존 보안 도구들은 혐오 표현이나 폭력적인 채팅 내용과 같은 명백한 위협을 탐지하도록 설계되었습니다. 그것들은 정중한 문장 안에 서버를 삭제하거나 문을 여는 숨겨진 명령이 들어있을 때를 인식하도록 만들어지지 않았습니다. 이러한 오래된 도구들은 나쁜 단어를 찾는 데 집중했기 때문에 정교한 공격을 그대로 통과시켰습니다. 그러나 마스티프 가드 시스템은 단순히 나쁜 단어를 찾는 것이 아니라, 맥락과 권한을 확인합니다. 이 시스템은 완벽하게 정중한 문장이라 할지라도 에이전트가 건드릴 수 없는 도구를 사용하려 한다면 위험할 수 있다는 점을 이해합니다. 에이전트가 명시적으로 허용된 도구만을 사용할 수 있도록 엄격한 규칙을 집행함으로써, 시스템은 AI가 공격자에 의해 해로운 일을 수행하도록 속아 넘어가는 '혼란스러운 대리인(confused deputy)'—공격자에 의해 신뢰받는 프로그램이 해로운 일을 하도록 속임을 당하는 상태를 일컫는 용어—이 되는 것을 방지합니다.
성공에도 불구하고, 연구자는 자신의 작업에 대한 한계를 주의 깊게 언급했습니다. 이 시스템은 에이전트가 접근해서는 안 될 도구를 사용하도록 유도하는 공격을 막는 데 매우 효과적입니다. 하지만 공격자가 에이전트가 이미 사용할 수 있는 도구의 세부 사항을 변경하도록 속이는 데 성공한다면, 시스템은 미묘한 의미 차이를 포착하는 AI의 능력에 의존하게 됩니다. 이러한 특정 사례들에서 시스템은 약 78.5%의 위협을 잡아냈는데, 이는 여전히 강력하지만 완벽하지는 않은 수치입니다. 또한 연구자는 자신의 솔루션이 가볍고 저렴하게 설계되었다는 점을 강조했습니다. 표준 컴퓨터 메모리에서 효율적으로 작동하기 때문에, 거대 AI 모델이 필요로 하는 막대한 양의 전기와 값비싼 하드웨어를 요구하지 않습니다. 이는 기업들이 큰 재정적 부담 없이 자율 에이전트를 보안할 수 있게 해줍니다.
이러한 발견은 우리가 보안 AI 시스템을 구축하는 방식이 변해야 함을 시사합니다. AI가 스스로 무엇이 안전한지 알 만큼 똑똑해지기를 기대하는 대신, 아키텍처 자체가 안전을 강제해야 합니다. AI의 사고 부분과 실행 부분을 분리하고, 그 사이에 엄격한 권한 기반의 게이트를 배치함으로써, 연구자는 현재의 대안들보다 더 빠르고 더 안전한 시스템을 만들어냈습니다. 이 연구는 자율 에이전트가 끊임없이 재앙의 위험을 감수하지 않고도 현실 세계에서 작동할 수 있도록 만드는 명확한 경로를 제시합니다. 이는 컴퓨터 아키텍처의 근본 원칙을 인공지능의 새로운 과제에 적용함으로써, 수학적으로 타당하면서도 실질적으로 효과적인 방어 체계를 구축할 수 있음을 입증합니다. 이 연구는 보안이 속도나 효율성을 희생하지 않아도 된다는 것을 증명하며, 자율 에이전트를 안전하고 신뢰할 수 있는 디지털 인프라의 일부로 만들기 위한 중요한 진전입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.