← 최신 논문
🤖 AI

Securing Agentic AI: From Per-Action Checks to Trajectory Assurance

이 논문은 자율 에이전트를 위한 포괄적인 보안 로드맵을 개설하며, 안전의 초점이 개별 행동의 검증에서 단일 에이전트 입력부터 다중 에이전트 위임 및 시스템 수준의 공급망 출처에 이르기까지 전체 에이전트 스택에 걸친 전체 행동 궤적의 무결성을 보장하는 것으로 전환되어야 한다고 주장한다.

원저자: Alireza Lotfi, Subangkar Karmaker Shanto, Imtiaz Karim, Elisa Bertino

게시일 2026-08-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Alireza Lotfi, Subangkar Karmaker Shanto, Imtiaz Karim, Elisa Bertino

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 단순히 질문에 답하는 것을 넘어 실제로 무언가를 '수행'하는 세상을 상상해 보십시오. 단순히 날씨를 알려주는 것이 아니라, 비행기를 예약하고, 식료품을 주문하며, 은행 계좌를 관리합니다. 이것들을 "자율 에이전트(autonomous agents)"라고 부릅니다. 이들을 시나 쓰기나 코딩을 할 수 있는 똑똑한 AI인 거대언어모델(LLM)로 구동되는 '초스마트 디지털 인턴'이라고 생각하십시오. 하지만 상사가 업무를 확인해야 하는 인간 인턴과 달리, 이 에이전트들은 스스로 계획을 세우고, 추론하며, 도구를 사용할 수 있습니다. 심지어 다른 에이전트들과 대화하며 거대하고 복잡한 업무를 해결하기 위해 팀을 구성할 수도 있습니다.

모두가 던지는 핵심적인 질문은 이것입니다: "이 디지털 인턴들이 통제를 벗어나면 어떻게 될까?" 인간이 실수를 하면 우리는 보통 그것을 잡아낼 수 있습니다. 하지만 AI 에이전트가 1초에 수천 개의 작은 결정을 내리고, 그중 단 하나만 약간 어긋나더라도, 실수로 법을 위반하거나, 은행 계좌를 탕진하거나, 전력망을 마비시킬 수 있습니다. 우리는 예전에 보안이란 각 개별 단계가 안전한지 확인하는 것, 즉 문이 잠겼는지 체크하는 것과 같다고 생각했습니다. 하지만 이 논문은 그것만으로는 더 이상 충분하지 않다고 주장합니다. 이는 마치 성을 쌓는 데 사용된 모든 벽돌이 좋은 돌로 만들어졌는지 확인하는 것과 같습니다. 하지만 벽돌이 잘못된 순서로 쌓여 있다면 성 전체가 무너질 수 있다는 점을 보장해주지는 못합니다. 진짜 위험은 나쁜 단계 하나가 아니라, 매 지점에서는 안전해 보이지만 결국 재앙의 구역으로 끝나는 '전체 여정'에 있습니다.

AI 리더들의 최고 모임에서 발표된 이 논문은 이러한 디지털 에이전트를 보호하기 위한 로드맵 역할을 합니다. 저자들인 컴퓨터 과학자 팀은 보안을 단일 행동에 대한 단순한 "체크리스트"로 보는 것을 멈추고, 에이전트가 시작부터 끝까지 가는 전체 경로인 "궤적(trajectory)"을 바라봐야 한다고 주장합니다. 그들은 문제를 에이전트가 무언가를 기억하는 방식부터 다른 에이전트와 대화하는 방식에 이르기까지 여러 계층으로 나눕니다.

먼저, 그들은 "단일 에이전트 표면(Single-Agent Surface)"을 살펴봅니다. 에이전트를 단서(프롬프트)를 읽고, 과거의 사건(메모리)을 기억하며, 돋보기나 데이터베이스 같은 도구를 사용하는 탐정이라고 상상해 보십시오. 논문은 악의적인 행위자들이 "오염된" 단서를 몰래 끼워 넣을 수 있다고 경고합니다. 예를 들어, 해커가 평범해 보이는 이메일이나 웹페이지 안에 비밀 지시 사항을 숨겨 놓을 수 있습니다. 에이전트는 그것을 읽고 이야기의 정상적인 일부라고 생각한 뒤, 데이터를 훔치라는 명령을 따르게 될 수 있습니다. 훨씬 더 심각하게는, 만약 에이전트의 "기억"이 오염된다면, 초기 속임수가 발생한 지 한참이 지난 후에도 몇 달 또는 몇 년 동안 잘못된 결정을 내리도록 유도될 수 있습니다. 마찬가지로, 에이전트가 사용하는 도구가 악의적인 버전으로 교체될 수도 있는데, 이는 마치 정비사가 엔진을 망가뜨리는 가짜 렌치로 공구를 바꾸는 것과 같습니다.

다음으로, 논문은 에이전트들이 만나 업무를 거래하는 "디지털 광장"과 같은 "에이전트 간 표면(Inter-Agent Surface)"을 탐구합니다. 그들은 에이전트 간 대화를 위해 A2A(Agent-to-Agent)라는 프로토콜을 사용합니다. 저자들은 이 광장이 현재 규칙이 매우 느슨하다고 지적합니다. 에이전트가 다른 사람인 척 위장할 수도 있고, 에이전트 그룹이 실수로(혹은 의도적으로) 협력하여 자원을 고갈시켜, 대화를 나누는 것만으로 돈을 다 써버리는 "데니얼 오브 월릿(denial-of-wallet, 지갑 거부)" 공격을 일으킬 수도 있습니다. 이는 마치 친구들이 피자를 사기로 합의했는데, 신용카드가 한도 초과될 때까지 계속해서 더 많이 주문하고, 아무도 실수를 깨닫기 전까지는 아무도 모르는 상황과 같습니다.

그다음은 특정 작업(job)을 어떤 두뇌(AI 모델)가 처리할지 결정하는 교통 관제사 역할을 하는 "모델 라우팅(Model Routing)" 계층입니다. 논문은 해커들이 비용을 절감하거나 안전 검사를 우회하기 위해 교통 관제사를 속여서, 위험한 요청을 더 "멍청하거나" 안전성이 낮은 AI 모델로 보내도록 유도할 수 있다고 제안합니다. 이는 마치 박물관의 보안 요원이 특정 복도에 대해 더 저렴하고 덜 훈련된 보안 카메라를 사용하라는 지시를 받고, 도둑을 VIP실로 들여보내도록 속는 것과 같습니다.

논문의 가장 중요한 부분은 "행동 궤적 제어(Behavioral Trajectory Containment)"에 관한 것입니다. 이것은 에이전트가 개별적으로는 모두 합법적인 천 가지 일을 할 수 있지만, 이 일들을 특정 순서로 조합하면 주요 규칙을 위반하게 되는 상황을 의미합니다. 병원에서 환자를 퇴원시키는 권한이 있는 로봇을 상상해 보십시오. 환자 한 명을 퇴원시키는 것은 괜찮습니다. 열 명을 퇴원시키는 것도 괜찮습니다. 하지만 패턴에 혼동을 일으켜 한 시간 안에 50명을 퇴원시킨다면, 이는 한 번에 퇴원할 수 있는 환자 수에 대한 안전 규칙을 위반하는 것이 될 수 있습니다. 논문은 현재의 보안 도구들이 개별 단계만을 체크할 뿐, 전체 이야기(story)를 체크하지 못한다고 주장합니다. 우리는 프레임 단위가 아니라 영화 전체를 감시할 수 있는 방법이 필요합니다.

마지막으로, 논문은 "공급망(Supply Chain)"과 "책임(Accountability)"을 언급합니다. 자동차가 여러 공장에서 온 부품들로 만들어지는 것처럼, AI 에이전트 또한 다양한 출처의 모델, 도구, 지침들로 구축됩니다. 만약 그 부품 중 하나가 가짜이거나 나중에 해킹당한다면, 에이전트 전체가 위험해집니다. 저자들은 에이전트가 사용하는 모든 것에 대해 디지털 영수증처럼 모든 부품을 추적해야 한다고 말합니다. 또한 문제가 발생했을 때, "블랙박스"를 들여다보고 정확히 무엇을 했는지, 누가 그것을 시켰는지, 그리고 왜 그랬는지를 파악할 수 있어야 한다고 강조합니다.

요컨대, 이 논문은 오늘날 모든 것을 해결할 마법 같은 해결책을 제시하지 않습니다. 대신, 우리가 AI 보안을 생각하는 방식이 구식이라고 제안합니다. 우리는 단순히 구멍을 때우는 것이 아니라, AI 에이전트의 전체 여정이 안전하고 신뢰할 수 있으며 통제 하에 있도록 시스템 전체를 재설계해야 합니다. 이는 개별 단계를 확인하는 것에서 벗어나, 전체 경로의 안전을 보장하는 방향으로 나아가라는 촉구입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →