← 최신 논문
💻 computer science

Agent Guard: Kernel-Enforced Damage Boundaries for AI Agents via Human-Authorized Contracts

본 논문은 eBPF 기반 LSM을 사용하여 권한이 없는 파일 및 네트워크 접근을 결정론적으로 차단하고 프로세스 계층 전반에 걸쳐 엄격한 "no-egress" 상태를 전파함으로써, 기존 베이스라인보다 현저히 낮은 오버헤드를 달ach성하며 AI 에이전트를 위한 인간 승인 손상 경계(human-authorized damage boundaries)를 강제하는 리눅스 레퍼런스 모니터인 Agent Guard를 제시한다.

원저자: Dongxu Cui, Zhichao Gu, Ping Zheng, Wenshuai Xi, Simeng Han, Yong Liao

게시일 2026-09-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Dongxu Cui, Zhichao Gu, Ping Zheng, Wenshuai Xi, Simeng Han, Yong Liao

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 디지털 환경에서 인공지능은 단순한 텍스트 생성기를 넘어 복잡한 작업을 계획하고, 프로그램을 실행하며, 컴퓨터의 파일 및 네트워크와 상호작용할 수 있는 능동적인 작업자로 진화했습니다. 그러나 이러한 새로운 자율성은 특정한 종류의 위험을 동반합니다. 만약 AI가 실수를 하거나, 악의적인 프롬프트에 속거나, 혹은 단순히 위험한 명령을 환각(hallucination)하여 생성한다면, AI는 자신이 도와야 할 바로 그 시스템에 손상을 입히는 명령을 실행할 수 있습니다. 전통적인 보안 조치들은 도구의 이름을 확인하고 입장을 허가하는 클럽 문 앞의 보안 요원처럼 작동하지만, 그 도구가 셸(shell)을 열거나, 자식 프로세스를 생성하거나, 나중에 다른 프로그램에 의해 읽힐 파일을 작성하는 상황까지 추적하는 데는 어려움을 겪습니다. 일단 AI가 초기 검사를 통과하면, 그 동작은 운영 체제 전체로 파급될 수 있으며, 이로 인해 보안 팀은 실행된 부분 중 어느 부분이 승인된 것이고 어느 부분이 해를 끼친 것인지 구분할 수 없게 됩니다.

이를 해결하기 위해 연구자들은 컴퓨터의 핵심부인 커널(kernel) 내부에서 지속적으로 눈을 떼지 않고 감시하는 '에이전트 가드(Agent Guard)'라는 시스템을 개발했습니다. 이 시스템은 AI가 규칙을 따를 것이라고 믿거나 AI가 무엇을 허용해야 할지 제안하도록 의존하는 대신, AI가 실행되기 전에 인간이 경계(boundary)를 확인하도록 요구합니다. 인간은 AI의 행동에 대한 특정 규칙 세트를 승인하며, 그러면 컴퓨터의 운영 체제는 절대적인 확실성을 가지고 이 규칙들을 집행합니다. 만약 AI가 승인된 범위를 벗어난 행동을 시도하면, 시스템은 피해가 발생하기 훨씬 전인 즉시 이를 차단합니다. 이 접근 방식은 AI가 저지를 수 있는 모든 가능한 실수를 예측하려는 데 초점을 맞추는 대신, 인간이 안전하다고 결정한 특정 자산 주위에 견고하고 깨지지 않는 울타리를 치는 데 집중합니다.

연구진은 인간의 승인과 AI의 실행 사이에 위치하는 특별한 게이트를 만들어 이 시스템을 구축했습니다. AI가 코드를 실행하기 전에, 인간은 제안된 계획을 검토하고 AI가 접근할 수 있는 정확한 파일과 네트워크 연결을 확인해야 합니다. 이 확인은 단순한 제안이 아닙니다. 이는 컴퓨터의 운영 체제가 확정 짓는 공식적인 계약입니다. 시스템은 이 계약을 AI가 수행하려는 특정 작업에 결합합니다. 만약 AI가 이 계약을 위반하는 명령을 실행하려고 하면, 운영 체제는 즉시 요청을 거부합니다. 결정적으로, 이 시스템은 초기 명령만을 체크하는 것이 아니라 전체 사건의 사슬을 지켜봅니다. 만약 AI가 파일을 작성하고 그 파일을 나중에 다른 프로그램이 읽는다면, 그 제한 사항은 파일과 함께 이동합니다. 만약 AI가 네트워크 연결을 연다면, 시스템은 계약에서 금지한 경우라면 연결이 제한이 완전히 적용되기 전에 설정되었더라도 데이터가 컴퓨터 외부로 나갈 수 없도록 보장합니다.

이러한 수준의 제어를 달성하기 위해 연구진은 시스템이 운영 체제의 내부 훅(hook)에 직접 연결될 수 있게 하는 기술을 사용했습니다. 그들은 모든 프로세스, 파일, 통신 채널에 특정 상태를 태깅하는 데이터 플레인(data plane)을 만들었습니다. 프로세스가 제한된 파일을 읽으면, 그 제한 사항을 상속받습니다. 프로세스가 파이프(pipe)나 소켓(socket)에 데이터를 쓰면, 그 제한 사항은 반대편으로 전달됩니다. 이러한 전파는 단조적(monotonic)입니다. 즉, 한 번 적용된 제한은 AI가 단순히 프로그램을 재시작하거나 파일 이름을 변경한다고 해서 제거될 수 없습니다. 시스템은 '금지' 상태가 프로세스의 네트워크를 통해 마치 지워지지 않는 얼룩처럼 퍼져나가도록 하여, AI가 중간 단계를 거쳐 규칙을 우회하는 방식으로 자신의 행동을 세탁하는 것을 방지합니다.

연구팀은 이 시스템이 설계된 대로 피해를 실제로 막을 수 있는지 확인하기 위해 엄격하게 테스트를 진행했습니다. 그들은 AI가 접근해서는 안 될 파일에 접근하거나, 제한된 후 데이터를 네트워크로 보내거나, 다른 프로그램에 제한을 전달하는 등의 사례를 포함하여 19가지 시나리오에 걸친 수백 건의 공식 보안 테스트를 실행했습니다. 570개의 테스트 기록 모두에서 시스템은 의도한 대로 정확하게 작동했습니다. 시스템은 승인되지 않은 행동을 성공적으로 거부했고, 다양한 유형의 파일과 통신 채널에 걸쳐 제한 사항을 올바르게 전파했으며, 합의된 경계 밖에서 어떠한 부수 효과도 발생하지 않음을 보장했습니다. 이 시스템은 AI의 판단이나 정책 제안에 의존하지 않고도 엄격한 인간 승인 기반의 피해 경계(damage boundary)를 유지할 수 있음을 증명했습니다.

단순히 작동 여부를 증명하는 것을 넘어, 연구진은 이 추가적인 보안 계층이 컴퓨터의 속도를 얼마나 늦추는지 측정했습니다. 그들은 이 시스템을 유사한 보안 도구인 '액트플레인(ActPlane)'과 비교했습니다. 파일 읽기 및 쓰기 작업이 포함된 테스트에서, 이 새로운 시스템은 보안 조치가 전혀 없는 컴퓨터와 비교했을 때 약 12%의 지연 시간만을 추가했습니다. 반면, 기존 시스템은 작업에 따라 33%에서 61% 사이의 속도 저하를 일으켰습니다. 이러한 상당한 차이는 새로운 접근 방식이 더 안전할 뿐만 아니라 훨씬 효율적이며, 속도가 중요한 실제 환경에서 실용적이라는 점을 시사합니다. 연구진은 규칙을 확인하고 데이터의 흐름을 추적하는 비용이 이전 세대의 도구들이 가진 무거운 오버헤드에 비해 매우 미미하다는 것을 발견했습니다.

또한 이 연구는 시스템이 수행하지 '않는' 일이 무엇인지도 강조했는데, 이는 시스템이 하는 일만큼이나 중요합니다. 이 시스템은 AI 안전의 모든 문제를 해결한다고 주장하거나, 인간의 초기 결정이 완벽할 것이라고 보장하지 않습니다. 시스템은 단지 인간이 결정한 것이 규칙이라면, 컴퓨터가 그 규칙을 실패 없이 따르도록 보장할 뿐입니다. 이는 선언되지 않은 자산을 보호하지 못하며, 인간이 명시적으로 위험한 행동을 승인했을 경우 AI가 피해를 입히는 것을 막지도 못합니다. 이 시스템은 집행을 위한 도구이지, 인간의 판단을 대체하는 것이 아닙니다. 시스템은 "안전한 AI"라는 복잡하고 종종 모호한 개념을, 사람이 정의하고 기계가 집행하는 구체적이고 기술적인 현실로 바꿉니다.

결론적으로, 이 연구는 엄격하면서도 효율적인 인공지능 안전망을 만드는 것이 가능하다는 것을 보여줍니다. 행동을 제안하는 AI의 역할과 이를 승인하는 인간의 역할을 분리하고, 운영 체제를 사용하여 그 승인을 집행함으로써, 연구진은 피해가 제한되고 예측 가능한 모델을 만들어냈습니다. 이 시스템은 AI가 착하게 행동하기를 기대하는 것이 아니라, 운영 체제가 AI가 나쁘게 행동하는 것을 방지하는 것에 의존합니다. 에이전트(agent)를 신뢰하는 것에서 계약(contract)을 집행하는 것으로의 이러한 전환은, 자율 컴퓨팅의 미래를 어떻게 보안할 것인가에 대한 근본적인 변화를 나타내며, 설령 AI가 실수를 하더라도 그 결과가 인간이 세운 벽 안에 갇히도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →