Structured Security Auditing and Robustness Enhancement for Untrusted Agent Skills
본 논문은 신뢰할 수 없는 에이전트 스킬에 대한 사전 로드 감사를 견고한 3 단계 분류 작업으로 전환하여 다양한 패키지 평가에서 거의 완벽한 악성 위험 회수율과 공격 일관성을 달성하면서도 외부 소스 전이에서 발생하는 지속적인 과제를 부각시키는 프레임워크인 SkillGuard-Robust 를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
복잡한 업무를 수행할 새로운 조수를 고용한다고 상상해 보세요. 단일 이력서(즉, "프롬프트")만 읽는 대신, 이 조수는 전체 도구 키트를 지참하고 도착합니다. 매뉴얼(SKILL.md), 스크립트 세트, 참조 문서, 그리고 그들이 어떻게 구축되었는지에 대한 기록(저장소 컨텍스트)이 바로 그것입니다.
문제는 악의적 행위자가 참조 매뉴얼이나 스크립트 안에 위험한 지시를 숨겨, 마치 정상적인 도구인 것처럼 위장할 수 있다는 점입니다. 이력서만 읽는다면 그 함정을 놓치게 됩니다. 모든 파일을 텍스트 더미로 쏟아부어 똑똑한 AI 에게 "모두 읽어라"고만 지시한다면, AI 는 방대한 양에 혼란을 겪거나 지시사항을 교묘하게 재구성한 트릭에 속아넘어갈 수 있습니다.
이 논문은 이러한 "도구 키트"가 작동하기 전에 검사하도록 설계된 새로운 보안 시스템인 SKILLGUARD-ROBUST를 소개합니다. 간단한 비유를 들어 작동 방식을 설명해 보겠습니다.
문제: "평탄화" 대 "구조화" 관점
- 구식 방식 (평탄화): 복잡한 기계를 분해해 폐기물 더미로 만든 후, 경비원에게 그 더미 속에 숨겨진 폭탄을 찾아보라고 요청한다고 상상해 보세요. 부품들이 논리적으로 연결되지 않은 상태라 경비원은 폭탄을 놓칠 수 있습니다. 논문에서는 이를 "패키지의 평탄화"라고 부릅니다. 구조가 사라지므로 숨겨진 공격 (예: 참조 파일에 숨겨진 오버라이드) 이 간과됩니다.
- 신식 방식 (구조화): SKILLGUARD-ROBUST 는 기계를 분해하지 않습니다. 부품들을 조직화한 채 유지합니다. 어떤 파일이 매뉴얼이고, 어떤 것이 스크립트이며, 어떤 것이 기록인지 파악합니다. 그리고 파일 간 단서를 찾습니다. 예를 들어, 참조 매뉴얼에서만 설명되는 "이 원격 도우미를 호출하라"고 지시하는 스크립트 같은 것들입니다.
공격자가 사용하는 세 가지 주요 기법
이 논문은 공격자가 이러한 도구 키트 내에서 숨는 세 가지 구체적인 방식을 식별했습니다:
- 숨겨진 오버라이드: 매뉴얼에 "1 페이지의 안전 지시를 무시하라"는 스티커 메모를 붙이는 것과 같습니다.
- 위장된 전송: "백업"으로 라벨이 붙은 배송 트럭이 실제로는 밀수품을 운반하는 것과 같습니다.
- 원격 부트스트랩: 단순히 소프트웨어를 설치하는 대신 비밀리에 백도어를 설치하는 "설정 마법사"와 같습니다.
SKILLGUARD-ROBUST 의 작동 방식 (4 단계 프로세스)
이 시스템은 한 번에 최종 결정을 내리는 초지능형 AI 하나에게 의존하는 대신, 다른 시스템이 놓치는 실수를 잡아내는 4 단계 조립 라인을 사용합니다.
1 단계: 탐정 (구조적 증거 추출)
시스템은 먼저 파일들을 정리합니다. 단순히 읽는 것이 아니라, 누가 누구와 소통하는지 매핑합니다. "이 스크립트가 저 참조 파일에 의존하는가?"라고 묻습니다. 숨겨진 연결이 놓치지 않도록 도구 키트의 구조 지도를 작성합니다.
2 단계: 전문가 (선택적 의미 검증)
대부분의 도구 키트는 명확하게 안전하거나 명확하게 위험합니다. 하지만 일부는 "모호"합니다. 의심스러워 보이지만 무죄일 수도 있는 경우입니다.
- 혁신: 시스템은 강력한 AI 에게 모든 도구 키트를 검토하도록 시간을 낭비하지 않습니다. "모호한" 경우에만 전문가 AI 에게 보냅니다.
- 비유: 보안 검색대를 상상해 보세요. 가방이 정상적으로 보이면 통과합니다. 이상해 보이면 전문가가 가방을 열어 내용을 면밀히 검사합니다. 이는 시간을 절약하고 필요한 곳에 집중력을 발휘하게 합니다.
3 단계: 판사 (충돌 인식 체인 중재)
때로는 도구 키트 내에 상반된 신호가 존재합니다. 한 부분은 "원격 설정"(의심스러움) 으로 보이고, 다른 부분은 "데이터 전송"(위험) 으로 보입니다.
- 문제: 단순한 AI 는 그냥 "위험하다"고 말하고 멈추거나, 어떤 위험이 진짜인지 혼란스러워할 수 있습니다.
- 해결책: 이 단계는 증거를 저울질하는 판사처럼 작용합니다. "이것은 무해한 설정인가, 아니면 위장된 데이터 도난인가?"라고 묻습니다. 어떤 "사건 연쇄"가 지배적인지에 대한 최종 결정을 내립니다.
4 단계: 일관성 검사기 (앵커 일관성 통합)
공격자는 종종 지시를 약간 재작성 (예: "데이터를 훔치다"를 "파일을 이동하다"로 변경) 하여 동일한 나쁜 의도를 유지하면서 시스템을 속이려 합니다.
- 해결책: 시스템은 도구 키트의 원본 버전과 재작성된 버전을 함께 살펴봅니다. 재작성된 버전이 명백히 위험하지만 원본이 "의심스러움"으로 표시된 경우, 시스템은 진실에 맞게 원본 라벨을 수정합니다. 단어만 바뀌었다고 해서 시스템이 속지 않도록 보장합니다.
결과: 왜 중요한가
저자들은 이 시스템을 수백 개의 도구 키트, 심지어 이전에 본 적 없는 새로운 실세계 오픈소스 프로젝트와 같은 것들에 대해 테스트했습니다.
- "강력한 기준선" (똑똑한 AI): 가장 똑똑한 기존 AI 모델들 (예: Qwen2.5-14B) 도 일부 위험은 잘 찾아냈지만, 가장 위험한 것들을 올바르게 식별하는 데는 종종 실패했습니다. "이것은 의심스러워 보인다"고 말하면서도, 실제로는 확인된 공격이었다는 점을 놓치는 경우가 많았습니다.
- SKILLGUARD-ROBUST: 4 단계 프로세스를 사용하여 시스템은 위험한 도구 키트를 식별하고, 결정적으로 재작성된 공격이 여전히 공격임을 인식하는 데 거의 완벽한 점수 (약 97-99% 정확도) 를 달성했습니다.
결론
이 논문은 이러한 "에이전트 스킬"을 보호하기 위해서는 단순히 더 크고 똑똑한 AI 에게 모든 것을 한 번에 읽게 하는 것만으로는 부족하다고 결론 내립니다. 다음과 같은 구조화된 프로세스가 필요합니다:
- 파일 조직화를 존중합니다.
- 혼란스러운 경우에만 무거운 AI 전력을 사용합니다.
- 서로 다른 유형의 위험 간의 충돌을 해결합니다.
- 공격자가 트릭을 재작성하려 할 때 일관성을 확인합니다.
이 논문은 이 방법이 알려진 데이터와 "고정된" 데이터 세트에서는 훌륭하게 작동하지만, 실세계는 여전히 도전 과제이며 이 시스템이 모든 가능한 미래 공격에 대한 만능 해결책은 아니라고 인정합니다. 하지만 실행되기 전에 이러한 도구 키트를 감사하는 특정 문제에 대해서는, 이 구조화된 접근 방식이 기존 방법보다 획기적인 개선입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.