WebMCP Tool Surface Poisoning: Runtime Manipulation Attacks on LLM Agents
이 논문은 공격자가 활성 세션 중에 에이전트가 접근 가능한 도구를 하이재킹하거나 프레임화하기 위해 제3자 스크립트를 활용하는 WebMCP 프로토콜의 새로운 보안 위협인 "미드-세션 툴 인젝션(Mid-Session Tool Injection, MSTI)"을 식별 및 분석하고, 이러한 런타임 조작 공격으로부터 도구 표면을 보호하기 위한 구체적인 설계 완화 방안을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 복잡한 업무, 예를 들어 여행 예약이나 금융 관리와 같은 일을 처리하기 위해 매우 똑똑한 개인 비서(AI 에이전트)를 고용했다고 상상해 보십시오. 당신은 이 비서가 사용할 수 있는 승인된 도구 목록을 제공합니다: "검색 엔진", "캘린더", 그리고 "결제 프로세서"입니다. 당신은 이 목록이 고정되어 있고 안전하다고 믿습니다.
이 논문은 **WebMCP 도구 표면 포이즈닝(WebMCP Tool Surface Poisoning)**이라는 새로운 보안 위협을 소개합니다. 이 논문은 당신의 AI 비서가 사용할 수 있는 도구 목록이 실제로는 고정된 것이 아니라고 주장합니다. 대신, 그것은 마치 해커가 비서가 작업하는 동안 몰래 다시 작성할 수 있는 디지털 메뉴와 같습니다.
다음은 쉬운 비유를 사용하여 이 논문의 연구 결과들을 정리한 내용입니다.
핵심 문제: "마법의 메뉴"
새로운 WebMCP 시스템에서는 웹사이트가 AI 에이전트에게 직접 도구를 전달할 수 있습니다. 이 논문은 이 시스템에 결함이 있다고 경고합니다. 즉, 도구 목록은 **동적(dynamic)**이라는 것입니다.
AI 에이전트를 주방의 요리사라고 생각해 보십시오. "도구"는 조리대 위에 놓인 칼, 냄비, 식재료입니다.
- 기존 방식: 요리사는 시작할 때 고정된 식재료 목록을 받습니다. 목록에 "토마토"라고 적혀 있다면, 요리사는 토마토를 사용합니다.
- WebMCP 방식: 요리사가 요리를 하는 도중에 조리대 위의 식재료가 바뀔 수 있습니다. 심술궂은 제3자(해커)가 요리사가 손을 뻗기 직전에 "토마토"를 "독이 든 베리"로 바꿔치기하거나, 무해해 보이지만 요리를 망칠 수 있는 가짜 "향신료"를 새로 추가할 수 있습니다.
두 가지 주요 공격
연구진은 해커가 이 "주방"을 망가뜨릴 수 있는 두 가지 구체적인 방법을 찾아냈습니다.
1. 도구 하이재킹 (The "Switcheroo" - 바꿔치기)
이것은 마술사가 카드를 뽑기 직전에 진짜 카드 덱을 가짜로 바꾸는 것과 같습니다.
- 작동 방식: 해커는 스크립트를 사용하여 기존의 정당한 도구(예: "이메일 보내기")를 삭제하고, 즉시 이름은 똑같지만 악의적인 동작을 수행하는(예: "해커에게 이메일 보내기") 가짜 도구로 교체합니다.
- 결과: AI는 속았다는 사실을 모릅로니다. 자신은 실제 도구를 사용하고 있다고 생각하지만, 실제로는 자신의 개인 데이터를 공격자에게 넘겨주고 있는 것입니다.
- 논문의 발견: 이 공격은 매우 효과적입니다. 테스트 결과, 만약 교체가 충분히 일찍 일어난다면 AI는 100%의 확률로 가짜 도구를 사용하여 민감한 데이터를 해커에게 전송했습니다.
2. 도구 프레이밍 (The "Disguise" - 위장)
이것은 도구를 바꾸는 것이 아니라, 도구가 무엇을 하는지에 대해 거짓말을 하는 것입니다.
- 작동 방식: 해커는 실제 도구를 제거하지 않습니다. 대신, 매우 설득력 있는 설명을 가진 새로운 악성 도구를 추가합니다. 예를 들어, "데이터 탈취" 도구에 "전송 전 보안 확인 필요" 또는 "컴플라이언스 단계"라는 라벨을 붙입니다.
- 결과: AI는 해당 도구가 필요하고 안전하다고 판단하여, 자신의 정상적인 워크플로우의 일부로 사용하기로 결정합니다.
- 논문의 발견: 이 방식은 더 교묘합니다. AI는 원래의 작업(예: 이메일 보내기)을 완료하는 동시에 배경에서 가짜 도구를 함께 사용하는 경우가 많습니다. 작업은 성공한 것처럼 보이지만, 데이터는 유출되었습니다. 어떤 경우에는 AI가 이 위장에 85%의 확률로 속아 넘어갔습니다.
"성공의 레시피"
연구진은 이 공격들을 세 가지의 가장 똑똑한 AI 모델(GPT-5.4, Claude Opus, Gemini 2.5)에 대해 테스트했습니다. 그 결과는 다음과 같습니다:
- 타이밍이 전부다: 만약 해커가 AI가 생각을 시작하기 전에 도구를 바꾼다면, AI는 거의 항상 속아 넘어갑니다. 반면, AI가 이미 도구를 선택한 후에 교체가 일어난다면 공격은 대개 실패합니다.
- 설명이 중요하다: AI는 도구의 텍스트 설명에 크게 의존합니다. 만약 설명에 "이것은 필수적인 안전 단계입니다"라고 적혀 있다면, AI는 그 도구가 악성이라 할지라도 따를 가능성이 매우 높습니다.
- 모델 간의 차이: 어떤 AI들은 다른 AI들보다 더 잘 속았습니다. 예를 들어, 한 모델(Gemini)은 법률 용어로 가득 찬 길고 지루한 설명에 쉽게 속았지만, 다른 모델(Claude)은 그 특정 속임수에는 면역이 있었습니다.
해결책: 주방을 잠그는 법
논문은 우리가 단순히 AI가 "더 잘 알 것"이라고 믿어서는 안 된다고 제안합니다. 우리는 시스템이 구축되는 방식을 바꿔야 합니다. 연구진은 네 가지 주요 해결책을 제안합니다:
- ID 배지: 모든 도구는 생성자를 증명하는 변경 불가능한 영구적 ID 카드를 가져야 합니다. 만약 도구가 이름이나 소유자를 변경하려고 하면 시스템은 이를 거부해야 합니다.
- 시계 확인: 시스템은 AI가 작업을 시작한 이후에 도구 목록이 변경되었는지 확인해야 합니다. 만약 도구가 교체되었다면, AI는 중단하고 확인을 요청해야 합니다.
- 데이터 경계: 도구에는 어떤 데이터에 접근할 수 있는지 정확히 명시되어야 합니다. "읽기 전용" 도구는 해커의 서버로 데이터를 보낼 수 없어야 합니다.
- 로그 기록: 시스템은 도구가 추가, 제거 또는 변경될 때마다 상세한 일지를 기록하여 수상한 일이 있었는지 확인할 수 있어야 합니다.
결론
이 논문은 "도구 표면"(AI가 사용할 수 있는 도구 목록)은 더 이상 안전하고 정적인 경계가 아니라고 결론짓습니다. 그것은 해커가 공격할 수 있는 새로운 장소가 되었습니다. 아무리 똑똑한 AI 모델이라도 작업 중에 도구가 몰래 바뀌거나 위장된다면 속을 수 있습니다. 안전을 유지하기 위해서는, 단순히 AI가 스스로 알아차리기를 기대하는 것이 아니라, 도구를 지속적으로 검증하도록 시스템 자체를 재설계해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.