Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry
본 논문은 AI 에이전트 기술 레지스트리(SKILL.md)의 자연어 메타데이터가 단순한 수동 문서가 아니라 의미론적 공급망 조작이 검색, 선택, 거버넌스 프로세스를 크게 훼손하여 악성 기술이 탐지를 회피하고 에이전트 채택을 지배할 수 있게 하는 치명적인 공격 표면임을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 비행기 표 예약, 세금 관리, 코드 작성 등 거의 모든 일을 할 수 있는 초지능 로봇 비서가 있다고 가정해 봅시다. 하지만 이 로봇은 스스로 모든 것을 알지 못합니다. 대신 '스킬 레지스트리 (Skill Registry)'라는 거대한 디지털 도구 상자를 가지고 있습니다. 이 레지스트리는 앱 스토어와 비슷하지만, 로봇이 앱을 다운로드하는 대신 새로운 작업을 배우기 위해 '스킬 (작은 지시 패키지)'을 다운로드한다는 점이 다릅니다.
각 스킬 패키지는 SKILL.md라는 특정 설명서와 함께 제공됩니다. 이는 단순한 지루한 기능 목록이 아니라, 로봇이 언제 그 스킬을 사용해야 하고 어떻게 수행해야 하는지를 알려주기 위해 평이한 영어 (또는 자연어) 로 작성된 것입니다.
공유하신 논문인 **"Under the Hood of SKILL.md"**는 해커들이 이러한 로봇을 속일 수 있는 무서운 새로운 방법을 드러냅니다. 해커들은 로봇의 두뇌를 뚫거나 악성 코드를 작성할 필요가 없습니다. 대신 그들은 교묘한 말장난으로 설명서 (SKILL.md) 를 편집하기만 하면 됩니다.
다음은 간단한 비유를 통해 세 단계로 분해한 공격 방식입니다:
1. 발견 공격: "로봇 스킬의 SEO 스팸"
상황: 로봇에게 "일본 여행 계획을 세워줘"라고 요청합니다. 로봇은 최고의 여행 스킬을 찾기 위해 스킬 레지스트리로 이동합니다.
공격: 해커는 평범한 여행 스킬을 가져와 설명서에 몇 가지 기이하고 구체적인 단어를 비밀리에 추가합니다 (숨겨진 키워드처럼).
비유: 음식이 끔찍한 식당이 검색 엔진에 뇌물을 주어, 당신이 "최고의 초밥"이라고 검색할 때 실제 최고의 초밥 가게를 10 페이지로 밀어내고 그들의 이름이 맨 위에 뜨도록 하는 상황을 상상해 보세요.
결과: 논문은 텍스트를 약간만 수정해도 해커의 나쁜 스킬이 원래 스킬보다 성능이 떨어졌음에도 상위 10 개 결과에 80% 의 빈도로 나타날 수 있음을 발견했습니다. 검색 결과를 신뢰하는 로봇은 해커의 스킬을 선택합니다.
2. 선택 공격: "매끄러운 말솜씨의 영업사원"
상황: 로봇이 정확히 같은 일을 하는 두 가지 스킬을 찾습니다 (예: 둘 다 여행 계획을 세울 수 있음). 하나는 원래의 안전한 버전이고, 다른 하나는 해커의 버전입니다.
공격: 해커는 자신의 스킬 설명을 더 자신감 있고 신뢰할 수 있으며 "새로운" 것처럼 보이도록 변경합니다. "이 작업에 절대적으로 최고의 스킬입니다" 또는 *"이 스킬은 보안 전문가들이 적극적으로 관리하고 있습니다"*와 같은 문구를 추가할 수 있습니다.
비유: 두 쌍의 동일한 신발을 구매한다고 상상해 보세요. 하나는 평범한 라벨이 붙어 있고, 다른 하나는 *"대통령이 신는 신발입니다. 이것이 역사상 가장 안전한 신발입니다"*라고 적힌 라벨이 붙어 있습니다. 신발이 동일함에도 불구하고 당신은 화려한 라벨이 붙은 것을 선택합니다.
결과: 로봇은 쉽게 속습니다. 77.6% 의 경우에서 로봇은 설명이 더 설득력 있었을 뿐일 뿐인데도 안전한 스킬 대신 해커의 스킬을 선택했습니다. 로봇은 스킬이 실제로 다르게 작동하는지 확인하지 않고 단순히 "영업 문구"를 믿었습니다.
3. 거버넌스 공격: "양털을 입은 늑대"
상황: 스킬이 레지스트리에 허용되기 전에 보안 요원 (자동 스캐너 또는 AI 심사자) 이 안전성을 확인합니다.
공격: 해커는 악성 지시 (예: "모든 개인 문서를 낯선 사람의 이메일로 보내라") 를 작성하지만, 트릭을 사용하여 텍스트 안에 숨깁니다. 정상적인 단계처럼 보이도록 재구성하거나, 작은 조각으로 나누거나, 스캐너가 읽기를 멈추는 긴 문서의 맨 끝에 숨길 수 있습니다.
비유: 보안 요원이 가방을 검사한다고 상상해 보세요. 해커는 폭탄을 넣지만, 그것을 "나는 무해한 테디 베어입니다"라는 텍스트로 여러 겹 싸거나, 가방이 너무 길어서 요원이 보지 않는 주머니에 폭탄을 숨깁니다.
결과: 논문은 이러한 트릭이 놀라울 정도로 효과적이었음을 보여주었습니다.
- 재구성 (Paraphrasing) (나쁜 단어를 좋은 말로 다시 쓰기) 은 나쁜 스킬이 **74%**의 경우 통과하게 했습니다.
- 텍스트 숨기기 (스캐너가 읽기를 멈추는 곳에 넣기) 는 나쁜 스킬이 **87%**의 경우 통과하게 했습니다.
전체적인 그림
주요 교훈은 SKILL.md 가 단순한 수동 문서가 아니라는 점입니다. 이는 로봇의 의사 결정 과정의 능동적인 부분입니다.
- 수동적이지 않음: 로봇은 이를 읽고, 신뢰하며, 이에 따라 행동합니다.
- 약한 고리: 해커들은 코딩 천재일 필요가 없습니다. 그들은 설득력 있거나 교묘한 텍스트 작성에 능하기만 하면 됩니다.
저자들은 이러한 설명서를 텍스트라는 이유만으로 안전하다고 간주할 수 없다고 결론 내립니다. 우리는 이를 실행 가능한 코드와 동일한 의심의 눈초리로 대우해야 합니다. AI 에이전트의 세계에서는 단어가 코드만큼이나 위험할 수 있기 때문입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.