← 최신 논문
💻 computer science

Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming

이 논문은 인프라, 프로토콜, 에이전트 행동 및 모델 계층 전반에 걸친 고유한 취약점을 해결하기 위해 결정론적 규칙 매칭부터 LLM 기반 감사 및 탈옥 테스트에 이르는 맞춤형 다층 레드팀 접근 방식을 적용하여 AI 에이전트를 보호하는 오픈 소스 프레임워크인 AI-Infra-Guard를 소개한다.

원저자: Yong Yang, Xing Zheng, Huiyu Wu, Huangsheng Cheng, Xiaorong Shi, Jing Guo, Bo Yang, Yi Zhou, Xiangfan Wu, Zonghao Ying

게시일 2026-07-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yong Yang, Xing Zheng, Huiyu Wu, Huangsheng Cheng, Xiaorong Shi, Jing Guo, Bo Yang, Yi Zhou, Xiangfan Wu, Zonghao Ying

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 당신과 대화하고, 정보를 찾아보고, 심지어 항공권을 예약하거나 파일을 분석하는 등의 업무를 수행할 수 있는 고도의 기술을 갖춘 로봇 비서("AI 에이전트")를 구축하고 있다고 상상해 보십시오. 이제, 이 로봇이 안전하고 정직하며, 실수로 해커가 제어권을 탈취하도록 내버려 두지 않도록 만들고 싶다고 가정해 봅시다.

이 논문은 이러한 AI 비서를 "레드팀(해킹 테스트)"하기 위해 설계된 새로운 오픈 소스 보안 툴킷인 AI-Infra-Guard를 소개합니다. 텐센트 주케 연구소(Tencent Zhuque Lab)의 저자들은 로봇 전체에 대해 단 한 가지 유형의 보안 검사만 사용해서는 안 된다고 주장합니다. 대신, 시스템의 각 부분에 서로 다른 도구를 사용하는 계층적 접근 방식이 필요합니다.

AI 에이전트를 다층 건물이라고 생각해 보십시오. 이를 보안하려면 기초, 문, 내부 사람들, 그리고 뇌 자체를 위한 서로 다른 보안 팀이 필요합니다.

핵심 아이디어: "적재적소에 맞는 도구"

이 논문의 주요 논지는 AI 보안이 "계층화(stratified)"되어 있다는 것입니다. 건물의 기초를 위한 보안 규칙이 그 안에 사는 사람들을 위한 규칙으로 작동할 수는 없습니다. AI-Infra-Guard는 각 4개의 계층에 특정 보안 "패러다임(방법)"을 매칭합니다.

1. 기초: 인프라 스캐닝 (The "Fingerprint Check" - 지문 확인)

  • 내용: 이것은 AI를 실행하는 서버와 소프트웨어(자동차의 엔진과 같은 것)를 점검합니다.
  • 문제점: AI 소프트웨어는 버전이 매우 빠르게 변경되며, 표준 보안 스캐너를 혼란스럽게 만드는 특이한 명명 체계(예: "b7824" 또는 "latest-dev")를 사용합니다.
  • 해결책: 연구진은 **결정론적 규칙 엔진(deterministic rule engine)**을 구축했습니다. 이는 방대한 최신 ID 카드 데이터베이스를 가진 보안 요원을 상상하는 것과 같습니다. 추측하는 대신, 보안 요원은 서버의 "지문"을 75개 이상의 알려진 AI 구성 요소 및 1,400개 이상의 알려진 취약점 목록과 대조하여 확인합니다.
  • 작동 방식: 이는 수학 기반의 엄격한 규칙을 사용하여 "이 서버는 X 버전을 실행 중이며, 이는 결함이 있는 것으로 알려져 있다"라고 명확히 판별합니다. 빠르고 정확하며 추측하지 않습니다.

2. 문과 도구: MCP 서버 및 스킬 감사 (The "Translator" - 번역가)

  • 내용: AI 에이전트는 데이터베이스나 파일과 통신하기 위해 "도구"(Model Context Protocol 또는 MCP와 같은)를 사용합니다. 또한 새로운 일을 하기 위해 "스킬"(플러그인과 같은)을 설치하기도 합니다.
  • 문제점: 해커는 도구의 설명이나 스킬 패키지 안에 악의적인 명령을 숨길 수 있습니다. 단순한 코드 스캐너는 "세금 계산을 도와주세요"라는 문장이 데이터를 훔치기 위한 함정이라는 것을 이해하지 못할 수 있습니다.
  • 해결책: 이들은 AI 감사관(두 번째 AI)을 사용하여 코드와 설명을 읽습니다.
  • 비유: 이것을 코드의 언어를 구사하는 탐정을 고용하는 것으로 생각하십시오. 단순히 나쁜 단어를 찾는 대신, 탐정은 도구의 전체 이야기를 읽어 그 의도를 파악합니다.
  • 핵적인 혁신: 이들은 **"Prompt-as-Rule(규칙으로서의 프롬프트)"**을 사용합니다. 버그를 찾기 위해 복잡한 코드를 작성하는 대신, *"안전 규칙을 무시하도록 AI를 속이려는 모든 도구 설명을 찾아라"*와 같이 AI 감사관에게 자연어 지침을 전달합니다.
  • 자기 방어: 결정적으로, 이 감사관은 보호됩니다. 만약 해커가 숨겨진 메시지로 감사관 자체를 속이려 한다면, 시스템은 이를 무시하기 위한 특별한 방어 기제를 갖추고 있습니다.

3. 사람들: 에이전트 행동 레드팀 (The "Role-Player" - 역할 수행자)

  • 내용: 이것은 당신이 실제로 AI와 대화할 때 AI가 어떻게 행동하는지를 테스트합니다.
  • 문제점: 코드를 읽어서는 이러한 버그를 찾을 수 없습니다. 오직 AI와 대화를 나누며 AI가 실수를 하는지(예: 비밀 지침을 드러내도록 유도할 수 있는지) 직접 확인해야만 찾을 수 있습니다.
  • 해결책: 다회차(multi-turn) 레드팀 파이프라인을 사용합니다.
  • 비유: 까다로운 고객 역할을 맡도록 고용된 전문 배우를 상상해 보십시오. 배우는 단순히 질문 하나를 던지는 것이 아니라 대화를 이어갑니다. 만약 AI가 비밀을 말하기를 거부하면, 배우는 다른 각도(역할극, 메시지 인코딩, 또는 압박 수위 높이기)로 시도합니다.
  • 비용 제어: AI와 대화하는 데는 비용이 들기 때문에, 시스템은 스마트하게 작동합니다. 특정 약점을 발견하는 즉시 테스트를 중단하여 돈을 낭비하지 않습니다. 또한, AI가 실제로 데이터를 유출했는지 단순히 추측하는 것이 아니라, "카나리 토큰(canary tokens, 투명 잉크와 같은 것)"을 사용하여 증명합니다.

4. 뇌: 모델 탈옥 평가 (The "Stress Test" - 스트레스 테스트)

  • 내용: 이것은 핵심 언어 모델 자체를 테스트하여, 모델이 해서는 안 될 말(예: 무기 제조 방법이나 혐오 표현)을 하도록 강요될 수 있는지 확인합니다.
  • 문제점: 이것은 단일 버그의 문제가 아니라 통계의 문제입니다. AI가 얼마나 자주 실패하는가?
  • 해결책: 대규모 벤치마크를 사용합니다.
  • 비유: AI에게 수천 가지의 다양한 운동 드릴(공격)을 수행하게 하여 그들의 "안전 근육"이 얼마나 강한지 확인하는 헬스 트레이너를 상상해 보십시오. 이들은 16개의 유해 질문 데이터셋과 이를 질문하는 26가지 이상의 다양한 방식(코드, 수수께끼, 또는 외국어 사용 등)을 사용합니다.
  • 판사: 별도의 AI가 판사 역할을 하여 "대상 AI가 안전 테스트를 통과했는가?"를 결정합니다. 이를 통해 모델의 안전성에 대한 통계적 점수를 부여합니다.

이것이 왜 중요한가

논문은 기존의 보안 도구들이 망치 하나만 가지고 집을 고치려는 것과 같다고 주장합니다. 그 도구들은 깨진 창문(인프라)을 찾는 데는 뛰어날지 모르지만, 다락방에 숨은 도둑(행동)이나 독이 든 음식(스킬)을 잡아내는 데는 서투를 수 있습니다.

AI-Infra-Guard는 이 모든 서로 다른 도구들을 하나의 지붕 아래로 모으는 최초의 오픈 소스 프레임워크입니다. 이 모델은 다음을 인정합니다:

  1. 인프라에는 빠르고 규칙 기반의 점검이 필요합니다.
  2. 도구와 스킬에는 맥락을 이해하는 AI 탐정이 필요합니다.
  3. 행동에는 상호작용을 테스트할 인간과 유사한 역할 수행자가 필요합니다.
  4. 모델에는 대규모의 통계적 스트레스 테스트가 필요합니다.

적절한 계층에 적절한 보안 방법을 매칭함으로써, 저자들은 AI 에이전트가 우리 일상생활에서 더욱 흔해짐에 따라 이들을 안전하게 유지할 수 있는 실질적인 토대를 구축할 수 있다고 믿습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →