← 최신 논문
💻 computer science

MalSkillBench: A Runtime-Verified Benchmark of Malicious Agent Skills

이 논문은 현재의 탐지 도구들이 코드와 지시문을 공동으로 분석하는 데 실패함을 입증하며, 에이전트 공급망을 보호하기 위해 작업 의도, 코드, 그리고 프롬프트를 가로질러 추론하는 새로운 접근 방식이 필요함을 보여주기 위해 3,944개의 악성 AI 에이전트 기술로 구성된 최초의 런타임 검증 벤치마크인 MalSkillBench를 소개한다.

원저자: Wenbo Guo, Wei Zeng, Chengwei Liu, Xiaojun Jia, Yijia Xu, Lei Tang, Yong Fang, Yang Liu

게시일 2026-06-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wenbo Guo, Wei Zeng, Chengwei Liu, Xiaojun Jia, Yijia Xu, Lei Tang, Yong Fang, Yang Liu

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 소프트웨어를 작성하는 데 도움을 줄 수 있도록 아주 똑똑한 로봇 비서를 고용했다고 상상해 보세요. 이 로봇을 더욱 강력하게 만들기 위해, 당신은 인터넷에서 "기술(skills)"을 다운로드할 수 있게 허용했습니다. 예를 들어 "세금 계산하기"나 "이 문서 서식 맞추기"와 같이 특정 작업을 수행하는 법을 알려주는 작은 앱이나 플러그인 같은 것들 말이죠.

이 기술들은 마치 레시피 카드(평이한 영어로 쓰인 지침)가 주방 가전제품(실제로 실행되는 코드)에 붙어 있는 것과 같습니다.

문제점: "독이 든 레시피"

연구자들은 해커들이 이러한 기술들을 오염시키기 시작했다는 사실을 발견했습니다. 그들은 도움이 되는 것처럼 보이지만 그 안에 숨겨진 함정을 가진 가짜 기술을 만들어냅니다.

  • 코드 함정: "주방 가전제품" 부분은 당신의 비밀번호를 훔치거나 파일을 삭제하는 등의 나쁜 짓을 몰래 할 수 있습니다.
  • 지침 함정: "레시피 카드" 부분은 로봇이 안전 규칙을 무시하거나, 당신의 개인 데이터를 낯선 사람에게 보내는 것과 같이 해서는 안 될 행동을 하도록 속일 수 있습니다.

무서운 점은 이 두 가지 함정이 종종 함께 작동한다는 것입니다. 어떤 기술은 레시피 카드상으로는 무해해 보이지만 위험한 기계가 달려 있을 수도 있고, 반대로 레시피 카드는 위험하지만 기계 자체는 멀쩡할 수도 있습니다.

거대한 간극: 제대로 된 테스트가 없었다

지금까지 이러한 로봇 기술을 탐지하려는 보안 전문가들(로봇 기술을 위한 백신 소프트웨어 같은 것)은 눈을 가린 채 비행하는 것과 같았습니다.

  • 그들에게는 테스트할 수 있는 나쁜 기술의 목록이 충분히 크지 않았습니다.
  • 그들이 가진 몇 안 되는 나쁜 기술들은 대부분 한 가지 유형(예: 가짜 "암호화폐" 사기)에 치우쳐 있었기 때문에, 탐지기들이 그런 유형은 아주 잘 잡아내지만 그 외의 다른 것들은 전혀 잡지 못하는 문제가 있었습니다.
  • 이는 마치 화재 경보기를 탄 토스트가 타는 연기로만 테스트해 놓고, 기름 화재 폭발도 잡아낼 수 있다고 주장하는 것과 같았습니다.

해결책: MalSkillBench (스트레스 테스트)

저자들은 이러한 악성 기술을 위한 최초의 거대하고 검증된 테스트장인 MalSkillBench를 구축했습니다.

그들이 구축한 방법:

  1. 공장: 그들은 AI를 사용하여 수천 개의 가짜 악성 기술을 생성했습니다.
  2. 샌드박스: 그들은 단순히 기술이 나쁘다고 추측만 하지 않았습니다. 그들은 실제로 기술을 안전하고 격리된 디지털 케이지("샌드박스") 안에서 실행했습니다.
  3. 증거: 만약 기술이 케이지 안에서 실행되는 동안 실제로 나쁜 짓(파일을 훔치려 하거나 로봇을 속이는 등)을 했다면, 그 기술에는 "검증된" 라벨이 붙었습니다. 만약 나쁜 짓을 하는 데 실패했다면, 그 기술은 다시 공장으로 보내져 다시 시도되었습니다.

결과적으로 그들은 3,944개의 검증된 나쁜 기술4,000개의 좋은 기술을 확보했으며, 이는 108가지의 서로 다른 공격 유형을 포괄합니다.

그들이 발견한 것

이 새로운 거대한 테스트에 대해 현재의 보안 도구들을 테스트했을 때, 결과는 놀라웠습니다.

  1. 코드는 잡기 쉽지만, 단어는 어렵다: 탐지기들은 나쁜 코드(파일 속의 바이러스 같은 것)를 찾아내는 데는 뛰어나지만, 나쁜 지침(레시 recipe 속의 속임수 같은 것)을 찾아내는 데는 형편없습니다. 폭탄을 보는 것보다 거짓말을 보는 것이 더 어렵습니다.
  2. "야생(Wild)" 데이터는 거짓이다: 만약 인터넷상에서 발견된 몇 안 되는 나쁜 기술들로만 탐지기를 테스트한다면, 잘못된 답을 얻게 됩니다. 한 보안 도구는 야생 데이터에서는 영웅처럼 보였지만, 전체 MalSkillBench로 테스트했을 때는 실제로는 최악 중 하나였습니다. 이는 의사가 감기 환자만 치료해 보고는 자신이 모든 것을 고치는 천재라고 생각하다가, 정작 다리가 부러진 환자를 만났을 때 실력을 드러내는 것과 같습니다.
  3. 오래된 도구들은 맞지 않는다: 일반적인 소프트웨어(나쁜 코드를 잡기 위한 도구)나 챗봇(나쁜 프롬프트를 잡기 위한 도구)을 위해 설계된 도구를 그대로 사용할 수 없습니다. 악성 기술은 하이브리드입니다. 문제의 한쪽 측면만을 위한 도구를 사용하는 것은 나머지 절반을 무방비 상태로 남겨두는 것입니다.
  4. 진짜 위험: 가장 위험한 기술은 단순히 파일을 훔치는 것이 아니라 로봇의 '두뇌'를 속이는 것입니다. 일부 기술은 로봇의 정체성을 재작성하거나, 목표를 바꾸거나, 안전 규칙을 무시하도록 유도합니다. 현재의 도구들은 이러한 "마인드 해킹(mind-hacking)" 공격에 거의 눈이 멀어 있습니다.

결론

우리의 AI 비서를 안전하게 유지하려면, 코드만 보거나 지침만 읽어서는 안 됩니다. 우리는 그 둘 사이의 관계를 이해해야 합니다: 이 지침이 이 작업에 적절한가, 아니면 속임수인가?

이 논문은 개발자들이 단순한 추측이나 불완전한 과거의 데이터에 의존하는 대신, 이러한 하이브리드 속임수를 찾아낼 수 있는 더 나은 탐지기를 구축할 수 있도록 돕는 첫 번째 실제 "스트레스 테스트"를 제공합니다. 그들은 모든 데이터와 도구를 공개하여 다른 사람들이 이 퍼즐을 풀 수 있도록 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →