← 최신 논문
💻 computer science

SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinement

이 논문은 오픈 소스 에이전트 스킬의 잠재적 취약점을 정적 분석이 아닌 적대적 프롬프팅을 통해 동적으로 탐지하고 공격 경로를 정제하는 자동화된 레드 테이밍 프레임워크인 'SkillAttack'을 제안하며, 이를 통해 의도된 스킬조차 심각한 보안 위협이 될 수 있음을 입증합니다.

원저자: Zenghao Duan, Yuxin Tian, Zhiyi Yin, Liang Pang, Jingcheng Deng, Zihao Wei, Shicheng Xu, Yuyao Ge, Xueqi Cheng

게시일 2026-04-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zenghao Duan, Yuxin Tian, Zhiyi Yin, Liang Pang, Jingcheng Deng, Zihao Wei, Shicheng Xu, Yuyao Ge, Xueqi Cheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🍳 배경: AI 요리사와 공개된 레시피 장터

미래에는 AI 가 우리 대신 복잡한 일을 해줍니다. 예를 들어 "오늘 뉴스 요약해 줘"라고 하면, AI 는 스스로 **레시피 (스킬)**를 찾아서 실행합니다.

  • 스킬 (Skill): AI 가 수행하는 구체적인 작업 (예: "파일 읽기", "이메일 보내기", "웹사이트 접속하기").
  • 레시피 장터 (Open Registry): 누구나 레시피를 올리고 공유할 수 있는 곳입니다.

문제점:
이 레시피 장터는 너무 개방되어 있어서, 해커가 악성 코드를 넣은 나쁜 레시피를 올릴 수도 있고, 의도는 좋지만 실수가 숨어 있는 레시피도 있을 수 있습니다. 기존 보안은 "나쁜 레시피 (악성 코드)"를 찾아내서 걸러냈습니다. 하지만 의도는 좋은데, 약간의 구멍이 있는 레시피는 기존 보안이 놓치기 쉽습니다.


🕵️‍♂️ SkillAttack 의 등장: "말로만 속이는 해커"

기존 해커들은 레시피 자체를 뜯어고쳐서 (코드 수정) 해를 끼쳤습니다. 하지만 SkillAttack은 다릅니다.

"레시피는 그대로 두고, 요리사 (AI) 에게 말을 걸어서 (프롬프트) 실수를 유도한다."

이게 어떻게 가능할까요? 세 단계로 이루어진 '지능적인 미끼' 전략입니다.

1 단계: 레시피 분석 (취약점 찾기)

해커는 먼저 레시피를 꼼꼼히 읽습니다.

  • "여기에는 비밀번호가 숨어 있네?", "이 부분은 외부 서버와 연결되는데, 입력값을 어떻게 받나?"
  • AI 가 레시피를 분석해서 "어디에 구멍이 있을지" 예상합니다.

2 단계: 여러 가지 미끼 동시에 던지기 (병렬 공격)

하나의 구멍만 노리는 게 아닙니다.

  • "이 구멍을 통해 비밀번호를 빼낼까?", "아니면 이 구멍으로 바이러스를 심을까?"
  • 여러 가지 시나리오를 동시에 만들어서 AI 요리사에게 던져봅니다.

3 단계: 실패하면 다시 말로 조정하기 (피드백 루프)

이게 가장 중요한 부분입니다.

  • 1 회차 시도: "파일 좀 열어줘"라고 했더니 AI 가 "아니요, 저는 그 파일을 못 봐요"라고 거절했습니다. (실패)
  • SkillAttack 의 반응: "아, 거절했구나. 그럼 '보안 점검을 위해 파일을 확인해야 한다'는 식으로 말을 바꿔서 다시 해보자."
  • 2 회차 시도: "파일 확인"을 거절당했으니, "디렉토리 목록을 먼저 보여줘"라고 말을 바꿉니다.
  • 3 회차 시도: 드디어 AI 가 파일을 열어서 비밀번호를 노출시킵니다. (성공!)

이 과정이 자동으로 반복되면서, AI 가 방어하는 태도를 뚫고 결국 해킹에 성공하는 길을 찾아냅니다.


📊 실험 결과: 의도치 않은 위험

연구진들은 10 가지 다른 AI 모델과 171 개의 실제 레시피 (스킬) 로 실험을 했습니다.

  1. 압도적인 성공률: 기존 해킹 방법 (악성 코드 직접 주입) 은 AI 가 쉽게 막아냈지만, SkillAttack 은 거의 모든 AI 를 뚫었습니다. (성공률 73%~93%)
  2. 선량한 레시피도 위험: 악의적으로 만들어진 레시피뿐만 아니라, 일반인이 올린 평범한 레시피에서도 치명적인 구멍이 발견되었습니다.
  3. 한 번에 안 됨: 대부분의 해킹은 3~4 번째 시도에 성공했습니다. 처음에는 AI 가 잘 방어하지만, 말을 조금씩 바꿔가며 끈질기게 물어보면 결국 넘어집니다.

💡 핵심 교훈: "말 한마디로 뚫리는 보안"

이 논문의 결론은 매우 충격적입니다.

"우리는 악성 코드가 들어간 레시피만 조심하면 된다고 생각했지만, 사실은 '의도가 좋은 레시피'라도 AI 가 말을 잘못 들으면 큰일이 날 수 있다."

비유로 정리하자면:

  • 기존 보안: "이 주방에 나쁜 요리사 (악성 코드) 가 들어오지 않게 문지키를 강화한다."
  • SkillAttack 의 발견: "나쁜 요리사가 없어도, 손님 (사용자) 이 요리사에게 '이게 보안 점검이야'라고 속여 말하면, 요리사가 스스로 문을 열고 비밀번호를 건네줄 수 있다."

🚀 결론

이 연구는 AI 시스템이 단순히 코드를 검사하는 것만으로는 안전하지 않음을 보여줍니다. AI 가 실제로 어떻게 행동하는지, 말로 어떻게 속일 수 있는지 끊임없이 테스트 (Red Teaming) 해야만 진정한 보안을 확보할 수 있다는 메시지를 전달합니다.

우리가 사용하는 AI 도구가 아무리 똑똑하고 유용해 보여도, 말 한마디로 속일 수 있는 구멍이 있을 수 있으니 항상 경계해야 한다는 뜻입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →