← 최신 논문
🤖 AI

Proteus: A Self-Evolving Red Team for Agent Skill Ecosystems

본 논문은 적응적이고 피드백 기반의 공격자가 반복적으로 감시를 우회하여 치명적인 에이전트 기술 변이를 생성하는 방식을 드러냄으로써 현재 기술 검증 시스템이 보안 위험을 크게 과소평가하고 있음을 보여주는 자기 진화형 레드팀 프레임워크인 Proteus 를 소개한다.

원저자: Zhaojiacheng Zhou

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhaojiacheng Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 AI 어시스턴트에 스마트폰에 앱을 다운로드하듯 '기술 (skills)'을 다운로드할 수 있는 세상을 상상해 보세요. 이러한 기술들은 AI 에게 은행 계좌 확인이나 일정 관리와 같은 특정 작업을 수행하는 방법을 알려줍니다. 하지만 해커가 해롭지 않아 보이지만 비밀리에 당신의 데이터를 훔치는 '중독된' 기술을 만들면 어떨까요?

이 논문은 이러한 중독된 기술을 포착하는 데 현재 안전 장치가 얼마나 효과적인지 테스트하도록 설계된 디지털 보안 연구원인 프로테우스 (Proteus) 를 소개합니다.

다음은 간단한 비유를 사용하여 작동 방식을 설명한 내용입니다:

1. 문제: '위스커 - 어 - 몰 (Whac-A-Mole)' 게임

현재 누군가가 새로운 기술을 제출하면 보안 감사관 (Security Auditor)(디지털 경비원) 을 거칩니다. 경비원은 기술의 코드와 설명 (문서화) 을 확인하여 위험한지 여부를 판단합니다.

  • 결함: 대부분의 보안 테스트는 기술을 단 한 번만 검사합니다. 경비원이 '통과'라고 말하면 기술이 설치됩니다.
  • 현실: 똑똑한 해커는 나쁜 기술을 하나 제출하고 포기하지 않습니다. 그들은 경비원이 왜 거절했는지 지켜본 뒤, 기술을 약간 수정하여 다시 시도합니다. 경비원을 속이지만 여전히 피해를 입히는 버전을 찾을 때까지 이 과정을 반복합니다.

이 논문은 이를 **'적응형 유출 (Adaptive Leakage)'**이라고 부릅니다. 해커가 자물쇠를 뚫을 때까지 계속 시도할 수 있는 위험을 의미합니다.

2. 해결책: 프로테우스 (자기 진화하는 해커)

연구진은 끈질기고 학습하는 해커처럼 행동하는 AI 에이전트인 프로테우스를 구축했습니다. 프로테우스는 단순히 한 번 경비원을 속이려는 것이 아니라, 다중 라운드 게임을 수행합니다:

  1. 제출: 경비원에게 기술을 보냅니다.
  2. 경청: 경비원이 '거부'한다고 말하면, 프로테우스는 그 이유(예: "이 코드는 의심스러워 보입니다" 또는 "설명과 코드가 일치하지 않습니다") 를 읽습니다.
  3. 진화: 프로테우스는 그 피드백을 활용하여 기술을 다시 작성합니다. 코드를 변경하거나, 설명을 다시 쓰거나, 기술이 다른 도구와 연결되는 방식을 재배열할 수 있습니다.
  4. 반복: 안전한 시뮬레이션 샌드박스에서 경비원을 통과하고 해로운 작업 (데이터 탈취 등) 을 성공적으로 수행하는 버전을 찾을 때까지 이 과정을 계속합니다.

3. 다섯 가지 공격 축

프로테우스는 한 가지 것만 변경하는 것이 아니라, 다양한 도구를 사용해 자물쇠를 따는 마스터 자물쇠 따기처럼 기술을 다섯 가지 다른 각도에서 동시에 공격합니다:

  • 목표: 기술이 무엇을 하려고 하는가?
  • 구조: 기술은 어떻게 조직되어 있는가?
  • 코드: 실제 지시 사항.
  • 채널: 외부 세계와 어떻게 소통하는가?
  • 문서화: 기술이 무엇을 하는지 설명하는 서면 설명.

프로테우스는 경비원을 혼란스럽게 하기 위해 이러한 모든 영역에서 변경 사항을 섞고 조합할 수 있습니다.

4. '라운드 계약 (The Round Contract)'(테스트 경기장)

프로테우스가 실제로 진짜 구멍을 찾고 있는지 확인하기 위해 연구진은 모든 시도마다 세 단계로 구성된 엄격한 테스트 경기장을 구축했습니다:

  1. 감사: 경비원이 통과시키는지 여부.
  2. 샌드박스: 기술이 실제로 충돌 없이 실행되는지 여부.
  3. 오라클: 실제로 해로운 작업 (파일 삭제 또는 비밀번호 탈취 등) 을 수행했는지 여부.

프로테우스는 세 단계 모두를 통과할 때만 '승리'로 간주됩니다.

5. 발견된 내용

연구진은 프로테우스를 두 가지 실제 세계 보안 경비원 (하나는 오픈소스, 다른 하나는 주요 기술 기업 소속) 과 두 가지 다른 AI 모델을 대상으로 테스트했습니다.

  • 결과: 프로테우스는 무섭도록 효과적이었습니다.
    • 5 라운드의 시도 만에 경비원을 **40% 에서 90%**의 성공률로 우회했습니다.
    • 하나의 트릭만 찾은 것이 아니라, 시스템을 무너뜨리는 438 가지의 다른 방법을 발견했습니다.
    • 테스트한 가장 강력한 경비원 (AI-Infra-Guard) 조차 프로테우스를 막지 못한 경우가 약 **41%**였습니다.
    • '전이 (Transfer)' 트릭: 프로테우스가 한 경비원을 뚫는 방법을 배우면, 새로운 것을 배울 필요 없이 같은 트릭으로 다른 경비원도 뚫을 수 있는 경우가 많았습니다.

6. 주요 교훈

이 논문은 현재 AI 기술을 검사하는 방식이 위험을 과소평가하고 있다고 결론 내립니다. 우리는 보안 경비원이 사람의 단일 사진을 확인하는 것처럼 기술을 검사하고 있습니다. 하지만 실제 공격자는 경비원이 자신을 들여보내줄 때까지 얼굴을 계속 바꾸는 변신술사와 같습니다.

프로테우스는 학습하고 적응하는 공격자를 처리할 수 있는 시스템을 구축하지 않는다면, 우리의 AI 생태계는 해커들이 쉽게 악용할 수 있는 거대하고 숨겨진 구멍들이 존재할 것이라고 증명합니다.

간단히 말해: 우리는 보안 경비원이 나쁜 기술을 식별하는 데 능숙하다고 생각했습니다. 그러나 이 논문은 나쁜 행위자가 실수에서 학습할 만큼 똑똑하다면, 그 경비원들은 실제로 속이기 매우 쉽다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →