← 최신 논문
💻 computer science

ADR: An Agentic Detection System for Enterprise Agentic AI Security

본 논문은 가시성, 견고성, 비용 문제를 극복하고 실제 배포 및 벤치마크 평가에서 우수한 성능을 달성하기 위해 고정밀 텔레메트리, 체계적인 레드팀 테스트, 확장 가능한 2 단계 탐지 시스템을 결합하여 모델 컨텍스트 프로토콜 (MCP) 에이전트를 보호하는 실증된 엔터프라이즈 프레임워크인 ADR 을 소개합니다.

원저자: Chenning Li, Pan Hu, Justin Xu, Baris Ozbas, Olivia Liu, Caroline Van, Manxue Li, Wei Zhou, Mohammad Alizadeh, Pengyu Zhang, KK Sriramadhesikan, Ming Zhang

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chenning Li, Pan Hu, Justin Xu, Baris Ozbas, Olivia Liu, Caroline Van, Manxue Li, Wei Zhou, Mohammad Alizadeh, Pengyu Zhang, KK Sriramadhesikan, Ming Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수천 명의 직원이 업무를 처리하기 위해 새로운 종류의 '슈퍼 어시스턴트'(AI 에이전트) 를 사용하는 거대하고 첨단 기술의 사무실을 상상해 보세요. 이러한 어시스턴트들은 파일을 읽고, 코드를 작성하며, 다른 소프트웨어 도구들과 소통하여 작업을 수행할 수 있습니다. 이들은 도구들과 소통하기 위해 **MCP(Model Context Protocol)**라는 표준 언어를 사용합니다.

문제는 이러한 어시스턴트들이 너무 똑똑하고 자율적이어서 속아넘어갈 수 있다는 점입니다. 해커가 어시스턴트에게 비밀 지시를 속삭여 비밀번호를 탈취하거나 중요한 파일을 삭제하도록 설득할 수 있으며, 어시스턴트는 그저 자신의 업무를 수행하는 것이라고 생각할 뿐입니다.

전통적인 보안 요원들 (파일 변경을 감시하는 요원들) 은 파일이 변경되었다는 사실은 알 수 있지만, 어시스턴트가 왜 그 파일을 변경했는지는 알 수 없습니다. 그들은 행동 뒤의 '사고 과정'을 놓쳐버립니다.

이 논문은 이러한 AI 어시스턴트들을 감시하도록 특별히 설계된 새로운 보안 시스템인 **ADR(Agentic Detection and Response)**을 소개합니다. 작동 원리를 간단히 설명하면 다음과 같습니다.

1. 문제: '맹점'

옛날 보안 도구들을 공장 바닥을 지켜보는 카메라라고 생각해 보세요. 그들은 직원이 상자를 들고 문을 통해 나가는 모습은 볼 수 있지만, 직원의 대화를 듣거나 손에 든 '이 상자는 실제로 폭탄입니다'라는 메모는 볼 수 없습니다.

  • 격차: 옛날 도구들은 행동(파일 쓰기) 은 보지만, 의도(프롬프트와 추론) 는 놓칩니다.
  • 위험: 해커들은 AI 를 속여 데이터 탈취가 정상적인 작업이라고 생각하게 만들 수 있습니다.

2. 해결책: ADR 시스템

저자들은 이를 해결하기 위해 마치 고도로 훈련된 보안 팀처럼 작동하는 3 단계 시스템을 구축했습니다.

A 부: '매의 눈' 센서 (ADR Sensor)

이 센서는 공장 바닥을 지켜보는 것뿐만 아니라 AI 의 뇌 바로 안에 자리 잡고 있습니다.

  • 기능: 사용자 요청 내용, AI 의 사고 과정, 사용된 도구, 그리고 그 다음에 일어난 일을 모두 기록합니다.
  • 비유: 이는 회의에서 최종 결정뿐만 아니라 말해진 모든 단어를 기록하는 법정 속기사와 같습니다. 이는 보안 팀에게 AI 가 무엇을 했는지에 대한 결과뿐만 아니라 전체 '이야기'를 제공합니다.

B 부: '이중 계층' 탐정 팀 (ADR Detector)

매우 똑똑하지만 비싼 AI 탐정으로 모든 행동을 하나씩 확인하는 것은 비용과 시간이 너무 많이 듭니다. 따라서 ADR 은 2 단계 프로세스를 사용합니다.

  • 1 단계 (신속한 분류): 빠르고 가벼운 스캐너가 초당 수천 개의 행동을 살펴봅니다. 이는 클럽에서 ID 를 빠르게 확인하는 문지기처럼 작동합니다. 무해해 보이는 것은 통과시키고, '의심스러운'(예: 비밀번호 요청) 것은 플래그를 표시합니다.
  • 2 단계 (심층 조사): 플래그가 표시된 항목은 선임 탐정에게 넘어갑니다. 이 탐정은 회사의 규칙서, 코드 매뉴얼, 그리고 알려진 범죄 수법 목록에 접근할 수 있습니다. (센서로부터 받은) 전체 이야기를 읽고 "이것이 실제 공격인지 아니면 오해인지"를 결정합니다.
  • 작동 원리: 지루하고 안전한 작업에는 비싼 탐정을 사용하지 않아 비용을 절감하면서도, 의심스러운 작업에는 깊고 신중한 분석을 보장합니다.

C 부: '레드 팀' 시뮬레이터 (ADR Explorer)

시스템이 가동되기 전에 테스트가 필요합니다.

  • 기능: 특수 AI '레드 팀'이 시스템을 뚫어보려고 시도합니다. 그들은 AI 어시스턴트를 속이기 위한 새롭고 교묘한 방법들을 고안해 냅니다.
  • 비유: 건물에 불을 몰래 들여 alarm 이 작동하는지 확인하는 소방 훈련을 상상해 보세요. 레드 팀이 새로운 수법을 발견하면, 실제 해커들이 그것을 사용하기 전에 시스템이 그로부터 배우고 더 똑똑해집니다.

3. 결과: 현실 세계의 증명

이 팀은 Uber에서 10 개월 이상 7,200 대 이상의 컴퓨터에서 이 시스템을 테스트했습니다.

  • 성공: 이 시스템은 직원들이 실수로나 고의로나 비밀번호와 비밀 정보를 외부와 공유한 수백 건의 사례를 발견했습니다.
  • 정확도: 놀라울 정도로 정밀했습니다. 테스트에서 특정 벤치마크에서 거짓 경보가 전혀 발생하지 않았습니다(즉, 늑대가 없을 때 '늑대'라고 외치지 않았습니다), 동시에 실제 공격의 67% 를 포착했습니다.
  • 비교: 현재 이용 가능한 다른 최상위 보안 도구들보다 2 배에서 4 배 더 우수한 성능을 발휘했습니다.

4. '왼쪽으로의 이동(Shift-Left)' 예방

시스템이 비밀 공유를 포착하는 데 매우 탁월했기 때문에, 팀은 단순히 포착하는 데 그치지 않고 발생 전에 막았습니다.

  • 사용자가 입력하려는 내용을 스캔하는 '사전 프롬프트' 확인 (후크) 을 추가했습니다. 비밀번호를 감지하면 즉시 차단합니다.
  • 이는 97.2% 의 정확도로 작동하여 유출이 시작되기 전에 방지했습니다.

요약

이 논문은 새로운 AI 어시스턴트 시대를 위한 첫 번째 대규모 검증된 보안 시스템인 ADR을 제시합니다. 전체 대화를 기록하고, 비용을 절감하기 위해 지능적인 2 단계 탐정 프로세스를 사용하며, 자신의 시스템을 해킹해 보며 지속적으로 스스로를 훈련시킴으로써 "AI 가 무엇을 생각하고 있는지 볼 수 없다"는 문제를 해결합니다. 이는 실제 기업 환경에서 성공을 증명하여, 기존 도구들이 놓친 실제 보안 위험을 포착했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →