Bounded Agents: Delegation Security for Multi-Agent AI Systems
이 논문은 동적이고 상태 인지적인 권한 부여 검사를 강제함으로써 프롬프트 인젝션 공격, 무단 위임, 금지된 동작 조합의 위험을 방지하여, 낮은 지연 시간을 유지하면서도 데이터 유출 및 조작을 제로에 가깝게 줄이는 LLM 기반 멀티 에이전트 시스템의 보안 아키텍처인 에이전틱 프린시플 체인(Agentic Principal Chain, APC)을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 디지털 작업 환경에서 새로운 형태의 노동자가 등장했다: 바로 소프트웨어 에이전트다. 이들은 대규모 언어 모델(LLM)을 기반으로 문서를 읽고, 이메일을 보내며, 시스템 간에 데이터를 이동시키고, 심지어 다른 프로그램을 호출하여 업무를 수행할 수 있는 프로그램들이다. 이들은 인간 직원을 대신하여 행동하며, 지시를 받아 이를 일련의 실행 단계로 전환한다. 그 약속된 효율성은 엄청나지만, 그 위험 또한 그만큼 높다. 만약 인간 직원이 속아서 비밀 파일을 잘못된 사람에게 보낸다면, 그 피해는 해당 개인의 판단력 범위 내로 국한된다. 하지만 소프트웨어 에이젝트가 속게 된다면, 그것은 자신이 접근할 수 있는 모든 시스템에 걸쳐 완벽한 속도로 실수를 실행할 수 있다. 보안 전문가들의 핵심 과제는 단순히 이 에이전트들이 속지 않도록 더 똑똑하게 만드는 것이 아니라, 설령 속더라도 그 피해를 입히는 것이 물리적으로 불가능하도록 시스템을 구축하는 것이다.
이것이 독립 연구자 자비에르 무루아가(Xabier Muruaga)의 새로운 연구가 다루는 중심 문제이며, 그는 에이전트의 '두뇌'를 더 견고하게 만드는 것이 아니라 에이전트가 할 수 있는 일의 '규칙'을 강화함으로써 이러한 디지털 노동자들을 보호하는 방법을 제안한다. 이 연구는 소프트웨어 에이전트가 조작당할 위험이 인공지능 모델 자체의 문제가 아니라, 주로 권한 아키텍처(permission architecture)의 문제라고 주장한다. 설령 에이전트가 속임수에 완벽하게 방어할 수 있다고 해도, 무해한 행동들을 결합하여 위험한 결과를 만들어낼 수 있는 너무 많은 자유가 주어진다면 여전히 해를 끼칠 수 있다. 예를 들어, 에이전트가 기밀 문서를 읽을 권한과 이메일을 보낼 권한을 각각 가지고 있다고 가정해보자. 개별적으로 두 행동은 모두 안전하다. 하지만 에이전트가 속아서 문서를 읽은 직후 외부 주소로 이메일을 보내게 된다면, 이 결합은 단독으로는 허용되지 않았던 데이터 유출을 초라하게 만든다.
이를 해결하기 위해 무루아는 '에이전틱 프린시펄 체인(Agentic Principal Chain)'이라 불리는 시스템을 개발했다. 명령의 사슬을 상상해 보라. 인간 상사가 매니저에게 업무를 위임하고, 매니저는 그 업무의 일부를 주니어 어시스턴트에게 전달한다. 전통적인 보안 시스템에서는 상사가 권한을 부여하면 그 권한이 변하지 않고 사슬을 타고 내려간다. 이 경우 주니어 어시스턴트는 상사와 동일한 광범위한 권한을 갖게 되어, 어시스턴트가 침해되었을 때 큰 위험을 초래할 수 있다. 에이전틱 프린시펄 체인은 단계가 내려갈 때마다 권한이 더 작고 구체적으로 변하도록 보장함으로써 이를 변화시킨다. 이는 에이전트의 사고 과정 외부에 위치한 엄격한 문지기 역할을 한다. 에이전트가 어떤 행동을 수행하기 전에, 이 문지기는 에이전트가 특정 행위를 할 권한이 있는지뿐만 아니라, 동일한 세션 동안 에이전트가 과거에 무엇을 했는지도 확인한다.
이 시스템은 '세션 상태(session state)', 즉 에이전트가 취한 모든 행동의 실행 기록을 추적하는 방식으로 작동한다. 만약 에이전트가 파일을 읽을 권한과 이메일을 보낼 권한을 모두 가지고 있다면, 시스템은 이력을 살펴본다. 만약 에이전트가 방금 비밀 파일을 읽었다면, 시스템은 이메일 발송이 일반적으로 허용되는 동작이라 할지라도 다음 이메일 발송 시도를 차단할 것이다. 이는 에이전트가 두 가지 안전한 행동을 결합하여 위험한 상황을 만드는 것을 방지한다. 연구진은 이를 '구성 폐쇄성(composition closure)'이라고 부른다. 이는 개별 단계는 허용되더라도 특정 행동의 조합은 금지된다는 규칙이다. 또한 이 시스템은 단일 에이전트의 '폭발 반경(blast radius)'을 제한한다. 만약 하위 에이전트가 침해되더라도, 그가 입힐 수 있는 피해는 그를 생성한 에이전트보다 엄격하게 작아진 권한에 의해 수학적으로 제한된다. 이는 시스템의 한 부분에서 발생한 침해가 조직 전체를 파괴하는 방향으로 확산되는 것을 방지한다.
연구진은 이 접근 방식이 실제로 작동하는지 테스트하기 위해 작동하는 버전의 시스템을 구축하고 일련의 엄격한 시험을 거쳤다. 그들은 확립된 보안 벤치마크를 사용하여 수천 건의 시뮬레이션 공격을 통해 테스트를 진행했다. 데이터 탈취를 목적으로 설계된 1,000개 이상의 시나리오가 포함된 한 세트의 테스트에서, 시스템은 모든 시도를 차단했다. 또 다른 테스트 세트에서는 인공지능 모델 자체가 완전히 장악되어 공격자의 통제하에 있는 상황을 시뮬레이션했음에도 불구하고, 시스템은 여전히 공격을 막아냈다. 모델이 탈취한 데이터를 보내려고 시도했을 때, 문지기는 해당 행동의 조합이 세션 규칙을 위반했기 때문에 요청을 거부했다. 또한 시스템은 에이전트가 원래의 과업과 관련 없는 방식으로 파일을 파괴하거나 데이터를 조작하는 것을 성공적으로 방지하여, 그러한 공격의 성공률을 90% 이상에서 단 12%로 낮추었다.
연구진은 이 추가적인 보안 계층이 에이전트의 속도를 얼마나 늦추는지도 측정했다. 결과에 따르면 이 시스템은 매우 빨라서 의사 결정에 걸리는 시간을 0.25밀리초 미만으로 늘릴 뿐이었다. 이는 보안 검사가 거의 즉각적으로 이루어져 사용자에게 눈에 띄는 지연을 주지 않음을 의미한다. 그러나 연구진은 트레이드오프(trade-off)가 존재한다는 점도 발견했다. 어떤 경우에는 엄격한 규칙이 에이전트가 정당한 과업을 완료하는 것을 방해하기도 했는데, 이는 시스템이 행동의 조합에 대해 너무 신중했기 때문이다. 테스트 결과, 가장 엄격한 규칙을 적용했을 때 정당한 과업의 성공률이 약 8.6 퍼센트 포인트 하락했다. 이는 시스템이 공격을 막는 데는 매우 효과적이지만, 정상적인 업무를 방해하지 않도록 세심한 조정(tuning)이 필요함을 시사한다.
연구진은 자신들의 시스템이 무엇을 하고 무엇을 하지 못하는지를 명확히 정의했다. 그들은 규칙이 올바르게 설정된다면 에이전트가 금지된 행동의 조합을 수행하는 것이 불가능함을 수학적으로 증명했다. 또한 과업이 명령 사슬을 따라 전달될 때 잠재적 피해가 커질 수 없다는 점도 증명했다. 그러나 그들은 이 시스템이 모든 문제를 해결할 수는 없다고 언급했다. 예를 들어, 에이전트가 파일을 삭제할 권한이 있는 경우처럼 단일 행동 자체가 이미 규칙에 의해 허용되어 있다면, 그 행동이 해로운 결과를 초래하는 것을 막을 수 없다. 또한 에이전트가 허용된 범위 내에서 잘못된 선택을 하도록 유도되는 것도 막을 수 없다. 이러한 문제는 인공지능에 대한 더 나은 훈련이나 다루는 데이터에 대한 더 상세한 검토와 같은 다른 해결책을 필요로 한다.
궁극적으로 이 논문은 인공지능을 보안하는 방식에 대한 사고의 전환을 제시한다. 깨지지 않는 '정신(mind)'을 구축하려는 노력 대신, 깨지지 않는 '우리(cage)'를 구축하는 데 초점을 맞춘다. 행동의 조합에 대한 엄칙한 규칙을 강제하고 과업이 위임될 때 권한이 축소되도록 함으로써, 이 시스템은 에이전트의 판단력이 실패하더라도 버틸 수 있는 안전망을 구축한다. 이 연구는 적절한 아키텍처 제어가 있다면, 단 한 번의 혼란이 대재앙으로 이어질까 두려워하지 않고도 이러한 강력한 디지털 노동자들이 복잡한 환경에서 작동할 수 있음을 보여준다. 이 연구의 결론은 안전한 인공지능으로 가는 길이 단순히 더 똑똑한 모델을 만드는 것뿐만 아니라, 모델이 '예'라고 말할 때조차 '아니오'라고 말할 줄 아는 더 똑똑한 시스템을 만드는 데 있다는 것을 시사한다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.