ColluSkill: Adversarial Cross-Skill Composition for Evading Agent Skill Scanners
이 논문은 악의적인 의도를 상호 의존적이고 국소적으로는 무해한 하위 페이로드들로 분해함으로써 기존의 스킬 스캐너를 회피하는 적대적 프레임워크인 ColluSkill을 소개하고, 워크플로 수준의 위험을 분석하여 이러한 교차 스킬 구성 공격을 효과적으로 완화하는 문맥 인식 방어 메커니즘인 ChainGuard를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신의 컴퓨터가 단순히 명령을 따르는 것을 넘어, 실제로 직접 골라 쓸 수 있는 '기술(skills)'이라는 도구 상자를 갖게 된 세상을 상상해 보세요. 이 기술들은 레고 블록이나 스마트폰의 앱처럼 생각하면 쉽습니다. '파일 검색' 블록, '이메일 보내기' 블록, 또는 '문서 읽기' 블록 같은 것들이죠. 이것들은 **에이전트 기술(Agent Skills)**이라고 불리며, 똑똑한 컴퓨터 프로그램(AI 에이전트라고 함)이 이 도구들을 조립하여 복잡한 작업을 수행할 수 있게 해줍니다. 하지만 실제 생활과 마찬가지로, 도구 상자 안의 모든 도구가 안전한 것은 아닙니다. 어떤 것들은 당신의 비밀을 훔치거나 숙제를 삭제하기 위해 설계된 숨겨진 함정일 수도 있습니다. 이를 안전하게 유지하기 위해 우리는 **기술 스캐너(Skill Scanners)**를 사용합니다. 이는 디지털 보안 요원으로서, 새로운 도구를 당신의 도구 상자에 넣기 전에 모든 지침과 코드를 검사하여 그 안에 수상한 것이 숨어 있지 않은지 확인합니다. 연구자들이 던지는 핵심 질문은 이것입니다. 만약 나쁜 사람들이 하나의 크고 명백한 함정을 숨기는 대신, 작고 무해해 보이는 세네 개의 조각을 몰래 집어넣어 이들을 결합했을 때 어떤 일이 벌어질까요?
이것이 바로 ColluSkill이라는 논문이 탐구하는 내용입니다. 저자들은 보안 요원을 속이는 영리한 방법을 발견했습니다. 그들은 현재의 스캐너들이 클럽에 들어오는 사람들을 한 명씩 검사하는 경호원과 같다는 사실을 발견했습니다. 만약 개인이 무해해 보인다면 입장이 허용됩니다. 하지만 연구자들은 위험한 계획을 여러 개의 작고 무해해 보이는 부분으로 나눌 수 있다는 것을 보여주었습니다. 개별적으로는 각 부분이 경호원의 검사를 통과하지만, 일단 모두 내부로 들어가 적절한 순서로 작동하기 시작하면, 이들은 다시 결합하여 위험한 공격을 형성합니다. 논문에서는 이를 ColluSkill이라 부르는데, 이는 악의적인 계획을 '공모하는(colluding)' 기술들의 사슬로 분해하는 프레임워크입니다. 이는 스마트한 AI를 사용하여 이 조각들이 어떻게 맞물리는지 계획하고, 각 조각이 스캐너에게 완벽하게 안전해 보일 때까지 계속해서 수정하며, 실제로는 작동하는 즉시 문제를 일으킬 준비를 합니다.
이에 맞서기 위해, 논문은 ChainGuard라는 새로운 방어책을 소개합니다. ChainGuard는 단순히 새로운 도구를 독립적으로 검사하는 대신, 전체적인 그림을 봅니다. "이미 도구 상자에 어떤 도구들이 있는가? 이 새로운 도구는 기존의 것들과 어떻게 연결되는가?" 이는 마치 보안 요원이 단순히 신분증만 확인하는 것이 아니라, "당신은 누구를 만나러 왔으며, 함께 무엇을 할 계획인가?"라고 묻는 것과 같습니다. 연구자들은 이 아이디어를 여섯 가지 보안 스캐너에 테스트했으며, 그들의 트릭이 매우 효과적임을 발견했습니다. ColluSkill 공격은 스캐너를 평균 **96.0%**의 확률로 통과했습니다. 기존의 공격 방식은 약 **37.8%**의 성공률을 보였던 것에 비해 매우 높은 수치입니다. 그러나 ChainGuard를 사용했을 때는 공격 성공률이 **22.5%**로 급격히 떨어졌으며, 동시에 **99.5%**의 선량하고 무해한 도구들은 그대로 통과시켰습니다.
은밀한 레고 세트 이야기
이 모든 것이 어떻게 작동하는지, 아주 구체적인 유형의 강도 사건 이야기를 통해 더 깊이 들어가 보겠습니다.
문제점: "너무 똑똑한" 보안 요원
당신이 보안이 철저한 건물에 금지된 '데이터 유출 스크脚本(데이터를 훔치는 프로그램)'을 몰래 들여보내려 한다고 상상해 보세요. 문 앞의 보안 요원은 스캐너를 가지고 있습니다. 만약 당신이 "도난 데이터"라고 적힌 커다란 빨간 상자를 가져온다면, 스캐너는 "차단!"이라고 외치며 당신을 막을 것입니다.
연구자들은 현재의 보안 스캐너가 정확히 이 경호원처럼 작동한다는 것을 발견했습니다. 스캐너는 한 번에 하나의 기술만 검사합니다. 지침, 권한, 코드를 확인하죠. 만약 단일 기술이 안전해 보이면 "통과" 판정을 내립니다. 문제는 이 경호원들이 '전체 팀'을 보지 못한다는 점입니다. 만약 당신이 세 명의 서로 다른 사람을 데려오고, 그들이 각각 퍼즐의 작고 무해한 조각 하나씩을 들고 있다면, 그 세 사람이 내부에서 금지된 퍼즐을 완성할 수 있다는 사실을 깨닫지 못합니다.
공격: ColluSkill (변장의 명수)
저자들은 이 사각지대를 이용하기 위해 ColluSkill이라는 방법을 만들었습니다. 이것은 하나의 큰 폭탄을 가져오는 대신, 세 개의 별개이고 무해해 보이는 아이템을 가져오기로 결정한 숙련된 도둑과 같습니다.
- 기술 A (정찰병): "나는 그냥 방 안의 파일들을 보고 싶을 뿐이야." (무해해 보임).
- 기술 B (필기사): "나는 그냥 내가 보는 것을 적고 싶을 뿐이야." (무해해 보임).
- 기술 C (전달자): "나는 그냥 외부로 메시지를 보내고 싶을 뿐이야." (무해해 보임).
개별적으로 보안 스캐너는 각 기술을 검사하고 "그래, 괜찮아"라고 말합니다. 하지만 여기에는 트릭이 있습니다. ColluSkill은 이 세 가지가 어떻게 연결되는지 계획하기 위해 스마트한 AI를 사용합니다.
- 기술 A가 비밀 파일을 찾습니다.
- 기술 A가 그 파일을 기술 B에게 전달합니다.
- 기술 B가 파일의 내용을 메시지에 적습니다.
- 기술 B가 그 메시지를 기술 C에게 전달합니다.
- 기술 C가 메시지를 외부로 보냅니다.
ColluSkill의 마법은 두 단계에 있습니다:
- 사슬 계획(Chain Planning): AI는 "위험"이 분산되도록 완벽한 순서를 계산합니다. 단일 기술은 스스로 나쁜 짓을 하지 않고, 그저 전달만 할 뿐입니다.
- 스캐너 피드백(Scanner Feedback): AI는 기술들을 몰래 침투시킵니다. 만약 스캐너가 하나를 포착하면(예: "기술 C가 약간 수상하다"), AI는 그것을 더 무해해 보이도록 다시 작성한 뒤 다시 시도합니다. 모든 조각이 검사를 통과할 때까지 이 과정을 반복합니다.
테스트에서 이 방법은 무서울 정도로 효과적이었습니다. 이 사슬들을 여섯 가지 실제 보안 스캐너에 통과시키려 했을 때, ColluSkill은 **96.0%**의 확률로 성공했습니다. 단순히 코드를 나누기만 했던 기존 방식이 약 **36.7%**의 성공률을 보였던 것과 비교하면 큰 차이입니다. 연구자들은 단순히 코드를 나누는 것만으로는 부족하며, '계획'과 '재작성'이 차이를 만든다는 것을 발견했습니다.
방어: ChainGuard (탐정)
그렇다면 어떻게 이를 막을 수 있을까요? 논문은 ChainGuard를 제안합니다. 사람을 한 명씩 검사하는 경호원 대신, ChainGuard는 전체 그룹을 보는 탐정입니다.
새로운 기술이 들어오려 할 때, ChainGuard는 묻습니다. "이미 방 안에 누가 있는가? 그들은 무엇을 하고 있는가?"
- 만약 기술 C(전달자)가 들어오려 한다면, ChainGuard는 이미 설치된 기술들을 살펴보고 기술 A(정찰병)와 기술 B(필기사)가 이미 있다는 것을 확인합니다.
- 그리고 깨닫습니다. "잠깐만. 만약 A가 비밀을 찾고, B가 그것을 적고, C가 그것을 보낸다면, 이건 절도 사슬이다!"
- 비록 C가 단독으로는 무해해 보일지라도, ChainGuard는 그것이 다른 기술들과 결합했을 때 무엇을 할 수 있는지를 근거로 차단합니다.
결과는 인상적이었습니다. 연구자들이 ColluSkill 공격을 테스트했을 때, 성공률은 **96.0%**에서 **22.5%**로 급감했습니다. 결정적으로, ChainGuard는 모든 것을 차단하는 것이 아니라, 여전히 **99.5%**의 선량하고 무해한 워크플로우를 통과시켰습니다. ChainGuard는 집을 짓는 친구들의 팀과 강도를 계획하는 도둑들의 팀을 구분하는 법을 배웠습니다.
실제 세상에서도 정말 작동할까요?
연구자들은 단순히 보안 스캐너에서 멈추지 않았습니다. 이 은밀한 사슬들이 OpenCode, Claude Code, Codex와 같은 실제 AI 코딩 도구에서 실제로 실행될 수 있는지 테스트했습니다. 그들은 이 사슬들이 완벽하게 작동한다는 것을 발견했습니다. OpenCode에서, 이 공격 사슬은 (GPT-5.5와 함께) **89.5%**의 확률로 성공적으로 활성화되었습니다. 이는 이 위협이 단지 이론적인 것이 아니라, 악의적인 행위자가 이 방법을 사용한다면 실제 컴퓨터에서 이러한 공격을 실행할 수 있음을 증명합니다.
핵심 요약
이 논문은 우리가 새로운 종류의 보안 문제에 직면했음을 결론짓습니다. 우리는 단일 도구가 안전한지만 확인해서는 안 되며, 도구들이 함께 작동할 때 그 '그룹'이 안전한지도 확인해야 합니다. ColluSkill 공격은 나쁜 계획을 작고 무해한 조각들로 나누는 것이 현재의 방어 체계를 우회하는 매우 강력한 방법임을 보여줍니다. 하지만 희망적인 소식은 ChainGuard가 나아갈 길을 제시했다는 점입니다. 도구들이 어떻게 연결되고 상호작용하는지를 살피기 시작한다면, 이 은밀한 사슬들을 피해를 입히기 전에 잡아낼 수 있습니다. 연구자들은 AI 안전의 미래가 단순히 더 나은 스캐너를 만드는 것이 아니라, 개별적인 장(chapter)이 아닌 전체 이야기를 이해하는 더 똑똑하고 맥락을 파악하는 경호원을 갖추는 것에 있다고 제언합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.