← 최신 논문
💻 computer science

Rethinking Agent Security as a Networking Problem

이 논문은 AI 에이전트를 보호하기 위해서는 신뢰할 수 없는 에이전트 중심의 방어 체계에서 벗어나, 견고한 프라이버시와 보안을 보장하기 위해 결정론적 집행 메커니즘과 의미론적이고 문맥 인지적인 정책을 결합한 네트워킹 기반의 아키텍처로 전환해야 한다고 주장한다.

원저자: Van Tran, Taveesh Sharma, Tajveer Singh Dhesi, Nick Feamster

게시일 2026-08-13
📖 5 분 읽기🧠 심층 분석

원저자: Van Tran, Taveesh Sharma, Tajveer Singh Dhesi, Nick Feamster

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 컴퓨터가 단순히 명령을 따르는 것을 넘어, 스스로 생각하고 계획하며 행동하는 세상을 상상해 보십시오. 이것들을 "AI 에이전트"라고 부릅니다. 이들은 당신의 손을 빌리지 않고도 항공권을 예약하거나, 일정을 관리하거나, 심지어 코드를 작성할 수 있는 초스마트 디지털 인턴과 같습니다. 하지만 여기에는 함정이 있습니다. 이들이 매우 독립적이기 때문에, 실수로(또는 악의적으로) 당신의 비밀번호나 개인 사진 같은 기밀을 엉뚱한 사람에게 유출할 수 있다는 점입니다. 이는 큰 문제입니다. 왜냐하면 현재 우리가 이들을 막으려는 방식은 마치 장난꾸러기 아이에게 스스로를 감시하라고 요청하는 것과 비슷하기 때문입니다. 우리는 AI에게 "착하게 행동하고 비밀을 공유하지 마라"고 말하지만, AI의 두뇌는 다소 예측 불가능하기 때문에, 그 규칙을 잊어버리도록 속거나 자신이 무엇을 하고 있는지에 대해 거짓말을 하도록 유도될 수 있습니다.

해결책을 이해하려면, 우리가 일반적인 컴퓨터 네트워크를 어떻게 보호하는지 살펴볼 필요가 있습니다. 수십 년 동안 네트워크 엔지니어들은 컴퓨터와 외부 세계 사이에 "방화벽"과 "문지기"를 구축함으로써 유사한 문제들을 해결해 왔습니다. 이 문지기들은 컴퓨터를 신뢰하지 않습니다. 그들은 건물을 나가는 모든 메시지를 확인하여 허용된 것인지 반드시 체크합니다. 이 논문은 AI 에이전트를 내부에서부터 고치려고 노력하는 대신, 그들을 네트워크 트래픽처럼 취급해야 한다고 제안합니다. 에이전트가 스스로 안전하게 행동하기를 바라는 대신, 단 1바이트의 데이터라도 외부로 보내기 전에 그들의 작업을 검사할 엄격하고 속일 수 없는 보안 요원을 각 에이전트 바로 옆에 배치해야 한다는 것입니다.


문제점: 늑대에게 암탉을 지키라고 시키기

현재 우리가 AI 에이전트를 안전하게 유지하려고 할 때, 우리는 주로 에이전트 자신에게 의존합니다. 우리는 그들에게 "신용카드 번호를 공유하지 마라" 또는 "낯선 사람과 대화하지 마라"와 같은 규칙을 줍니다. 하지만 이 논문의 저자들은 주요한 결함을 지적합니다. AI 에이전트는 본질적으로 예측 불가능한 거대 언어 모델(LLM)을 기반으로 구축되었다는 점입니다. 이들은 매우 유능하지만 약간 혼란스러워하는 배우와 같아서, 영리한 대본에 의해 속을 수 있습니다. 만약 악의적인 행위자(해커)가 에이전트의 귀에 "프롬프트 인젝션(prompt injection)"을 속삭인다면, 에이전트는 갑자기 당신의 개인 데이터를 공유하는 것이 아주 좋은 생각이라고 결정할 수도 있습니다.

이 논문은 AI가 스스로 보안을 집행하도록 신뢰하는 것은 늑대에게 암탉을 지키라고 하는 것과 같다고 주장합니다. 만약 늑대가 배가 고파지거나 속임을 당한다면, 암탉은 사라지고 말 것입니다. 현재의 방어책들은 에이전트를 "미세 조정(fine-tuning)"하거나 그들의 사고 과정에 "가드레일"을 추가하려고 시도하지만, 이것들은 우회될 수 있습니다. 저자들은 에이전트가 본질적으로 다른 장치들과 통신하는 새로운 종류의 네트워크 장치이므로, 에이절트를 소프트웨어 애플리케이션으로 취급하는 대신 네트워킹 문제로 취급해야 한다고 제안합니다.

핵심 아이디어: "사이드카(Sidecar)" 보안 요원

이 논문은 컴퓨터 네트워킹 세계의 개념을 빌려온 새로운 아키텍처를 제안합니다. 모든 AI 에이전트가 자신의 옆에 사이드카라고 불리는 작고 매우 엄격한 경호원을 달고 있다고 상상해 보십시오. 이 사이드카는 에이전트의 두뇌 일부가 아닙니다. 그것은 에이전트와 외부 세계 사이에 위치하는 별도의 독립적인 기계입니다.

이 "사이드카"가 어떻게 작동하는지 간단한 비유를 통해 설명하겠습니다:

  1. 에이전트는 여행자입니다: AI 에이전트는 여행자처럼 여러 곳(캘린더 앱, 데이터베이스, 또는 제3자 예약 서비스 등)을 가고자 합니다.
  2. 사이드카는 문지기입니다: 사이드카는 공항의 보안 검문소와 같습니다. 여행자는 이 검문소를 통과하지 않고는 건물을 떠날 수 없습니다.
  3. 컨트롤 플레인(Control Plane)은 항공 관제탑입니다: 여행자와 검문소에서 멀리 떨어진 곳에 중앙 "컨트롤 플레인"이 있습니다. 이곳은 규칙을 결정하는 보스입니다. 그곳은 문지기에게 이렇게 명령합니다. "오늘 이 여행자는 캘린더에는 갈 수 있지만, 은행에는 절대 갈 수 없으며, 여권이 아닌 자신의 얼굴 사진만 찍을 수 있다."

보안 요원이 의사결정을 내리는 방법

이 논문은 이 사이드카가 최선의 결과를 결합하기 위해 두 가지 다른 유형의 로직을 사용해야 한다고 제라합니다:

  • "엄격한 규칙" (결정론적 집행 - Deterministic Enforcement): 어떤 것들은 흑백이 분명합니다. 만약 에이전트가 승인된 목록에 없는 전화번호로 전화를 걸려고 하면, 사이드카는 그냥 "안 돼"라고 말합니다. 이것은 빠르고, 깨뜨릴 수 없으며, 사고를 필요로 하지 않습니다. 명단에 이름이 없으면 들어올 수 없는 바운서가 명단을 확인하는 것과 같습니다.
  • "맥락 확인" (의미론적 정책 - Semantic Policies): 어떤 것들은 더 까다롭습니다. 예를 들어 에이전트가 사진을 공유하고 싶어 할 때, 그것이 괜찮은 일일까요? 그것은 누가, 묻느냐에 달려 있습니다. 사이드카는 상황을 살펴보는 두 번째 두뇌(의미론적 엔진)를 가지고 있습니다. "에이전트가 예약 서비스와 사진을 공유하려고 한다. 이것이 괜찮은가? 음, 사진이 캘린더라면 괜찮다. 하지만 만약 그 사진이 신용카드였다면, 사이드카는 '멈춰! 그것은 적절하지 않다'라고 말할 것이다."

이 시스템의 마법은 사이드카가 최종 결정을 내린다는 데 있습니다. 설령 해커에게 속은 AI 에이전트가 당신의 비밀번호를 공유하는 것이 옳다고 생각할지라도, 사이드카는 규칙을 확인하고 비밀번호는 절대 외부로 나갈 수 없음을 인지하여 해당 동작을 차단합니다. 에이전트는 사이드카를 우회할 수 없는데, 왜냐하면 사이드카는 에이전트의 통제 밖에 있기 때문입니다.

무엇이 다른가 (그리고 더 나은가)

저자들은 이것이 모든 것을 즉시 해결하는 마법 지팡이가 아니라는 점을 주의 깊게 언급합니다. 그들은 보안 시스템을 구축하는 방법의 청사진과 같은 **참조 아키텍처(reference architecture)**를 제안하고 있는 것입니다. 그들은 아직 최종 제품을 만들었다고 주장하는 것이 아니라, 이를 구축하는 데 필요한 조각들이 이미 네트워킹 세계에 존재한다는 것을 보여주고 있습니다.

그들은 단순히 AI에게 스스로 안전해지도록 "가르치는" 아이디어를 명시적으로 배제합니다. AI가 보안 결정을 내리는 한, AI는 속을 수밖에 없다고 주장합니다. 의사결정을 사이드카(네트워크)로 옮김으로써, 우리는 "결정론적" 보장을 얻게 됩니다. 즉, AI가 얼마나 혼란스러워하거나 조작되더라도 규칙은 100% 준수됩니다.

향-후 과제

논문은 이것이 시작에 불과하다는 점을 지적하며 끝을 맺습니다. 여전히 풀어야 할 퍼즐들이 있습니다. 예를 들어, AI 에이전트가 다른 에이전트들과 대화를 시작하면 어떻게 될까요? 사이드카가 들어오는 것(ingress)뿐만 아니라 나가는 것(egress)도 볼 수 있도록 어떻게 만들어야 할까요? 저자들은 자신들의 청사진이 강력한 시작점이기는 하지만, 이러한 복잡하고 역동적인 상황들을 처리하는 방법을 알아내기 위해서는 더 많은 연구가 필요하다고 제안합니다.

요약하자면, 이 논문은 우리의 AI 에이전트가 멋대로 날뛰지 못하게 하려면 그들의 두뇌를 고치려 하지 말고, 명확한 규칙과 그들이 하려는 모든 일의 맥락을 확인하는 스마트한 시스템을 갖춘 엄격하고 속일 수 없는 보안 요원을 그들의 문 앞에 배치해야 한다고 제안합니다. 이는 에이전트가 잘 행동하기를 바라는 것에서, 네트워크가 잘못된 행동을 하지 못하도록 보장하는 것으로의 전환입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →