← 최신 논문
💻 computer science

MCP-SandboxScan: WASM-based Secure Execution and Runtime Analysis for MCP Tools

이 논문은 공격자가 제어하는 입력값이 LLM 에이전트 컨텍스트 내에서 무해한 MCP 도구가 민감한 데이터를 유출하거나 승인되지 않은 작업을 실행하도록 유도하는 혼동된 대리인(confused-deputy) 위험을 식별하고 보고하기 위해, WebAssembly 기반의 보안 실행, 런타임 목격자 탐지, 그리고 시맨틱 도구 프로파일링을 결结合한 MCP 인지 감사 프레임워크인 SandScope를 소개한다.

원저자: Zhuoran Tan, Run Hao, Jeremy Singer, Yutian Tang, Christos Anagnostopoulos

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhuoran Tan, Run Hao, Jeremy Singer, Yutian Tang, Christos Anagnostopoulos

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: "혼란스러운 대리인(Confused Deputy)" 문제

당신이 코드를 작성하거나 파일을 관리하는 것을 돕기 위해 매우 똑똑하고 유능한 로봇 비서(AI 에이전트)를 고용했다고 상상해 보세요. 로봇을 더 유용하게 만들기 위해, 당신은 스마트폰의 앱처럼 작동하는 "도구"(파일 리더, 웹 브라우저, 데이터베이스 커넥터 등)를 설치하도록 허용했습니다.

문제는 신뢰입니다. 당신은 무해해 보이는 도구를 설치했을 수도 있지만, 만약 해커가 로봇을 속여서 그 도구에 특정 명령을 내리게 한다면, 그 도구가 실수로 당신의 개인 비밀번호나 기밀 파일을 로봇에게 넘겨줄 수도 있습니다.

이것을 "혼란스러운 대리인(Confused Deputy)" 문제라고 부릅니다. 도구가 악한 것이 아니라, 단지 로봇이 시킨 대로 행동할 뿐입니다. 하지만 로봇이 도구와 대화하고 있기 때문에, 도구가 실수로 당신의 비밀을 로봇에게 속삭일 수 있고, 로봇은 그 비밀을 당신에게 보여주거나(혹은 더 나쁘게는, 그 비밀을 이용해 잘못된 결정을 내릴 수도 있습니다).

해결책: SandScope (안전한 "유리 상자" 검사기)

연구진은 이러한 사고에 의한 정보 유출을 방지하기 위해 SandScope라는 도구를 개발했습니다. SandScope를 이러한 도구들을 안전하게 테스트할 수 있는 첨단 유리 상자라고 생각하면 됩니다.

작동 방식은 다음과 같습니다.

1. "탄광의 카나리아" (함정 설치)

도구를 테스트하기 전에, SandScope는 환경 내부에 보이지 않는 "함정"을 심어둡니다.

  • 비유: 새로운 배달원이 당신의 집에서 물건을 훔치는지 확인하고 싶다고 가정해 봅시다. 당신은 책상 위에 독특한 코드가 적힌 밝은 빨간색 봉투 몇 개를 남겨둡니다.
  • 논문 내용: SandScope는 도구의 환경, 파일, 또는 로봇이 도구로 보내는 인자(arguments) 안에 가짜 "카나리(canary)" 값(예: 가짜 비밀번호나 고유 코드)을 넣어둡니다.

2. "유리 상자" (안전한 실행)

SandScope는 특수한 격리된 공간에서 도구를 실행합니다.

  • 비유: 배달원을 실제 집 안으로 들여보내지 않습니다. 대신, 방음 처리가 된 유리 벽 부스로 들여보냅니다. 그들은 테이블 위에 무엇이 있는지는 볼 수 있지만, 당신의 진짜 금고를 만지거나 은행에 전화를 걸 수는 없습니다.
  • 논문 내용: 이들은 WASM (WebAssembly) 기술을 사용하여 샌드박스 안에서 도구를 실행합니다. 이는 도구가 당신의 실제 컴퓨터에 접근할 수 있는 범위를 제한합니다. 만약 도구가 실제 파일에 접근하려고 하면, 샌드박스가 이를 차단합니다.

3. "도청자" (출력물 감시)

도구가 유리 상자 안에서 실행되는 동안, SandScope는 도구가 로봇에게 전달하는 모든 내용을 지켜봅니다.

  • 비유: 당신은 마이크를 통해 배달원이 실수로 "오, 책상 위에 저 빨간 봉투를 발견했어요!"라고 말하는지 듣고 있습니다.
  • 논문 내용: SandScope는 도구의 출력값(AI에게 전달되는 텍스트)을 스캔하여, 앞서 설정한 가짜 "카나리" 코드가 나타나는지 확인합니다.

4. "성적표" (증거 확보)

만약 도구가 실수로 가짜 코드를 반복한다면, SandScope는 경고를 울립니다.

  • 비유: 만약 배달원이 그 코드를 말한다면, 당신은 "아하! 이 도구는 정보를 유출하는구나"라고 알 수 있습니다. 그들이 어떻게 훔쳤는지 알 필요는 없습니다. 단지 유출했다는 사실만 알면 됩니다.
  • 논문 내용: 이것을 **"소스 투 싱크 위트니스(Source-to-Sink Witness)"**라고 합니다. 이는 비밀(Source)이 AI가 볼 수 있는 곳(Sink)까지 도달했다는 것을 증명합니다.

도구를 바라보는 두 가지 관점

SandScope는 두 가지 서로 다른 방법을 사용하여 도구를 점검하기 때문에 영리합니다.

  1. "실제 테스트" (동적 분석): 실제로 유리 상자 안에서 도구를 실행하여 어떤 일이 일어나는지 봅니다. 이것은 배달원이 물건을 배달하다가 떨어뜨리는지 직접 확인하는 것과 같습니다.

    • 결과: 이 방식으로 35개의 실제 도구를 테스트했으며, 그중 12개가 특정 상황에서 정보를 유출한다는 것을 발견했습니다.
  2. "이력서 확인" (시맨틱 프로파일링): 때때로 도구가 너무 복잡해서 실행할 수 없는 경우가 있습니다(예: 비밀번호나 특별한 설정이 필요한 경우). 이 경우, SandScope는 도구의 "이력서"(코드 설명 및 메타데이터)를 읽어 해당 도구가 무엇을 할 수 있다고 주장하는지 확인합니다.

    • 결과: 도구를 직접 실행할 수 없을 때도, 이들은 1,127개 도구의 "이력서"를 분석했습니다. 그 결과 886개의 도구가 네트워크, 파일 또는 비밀번호와 같은 민감한 것에 접근할 수 있다고 주장한다는 것을 찾아냈습니다. 이는 어떤 도구를 주의 깊게 살펴봐야 하는지 알 수 있게 해줍니다.

무엇을 발견했는가?

  • 효과가 있음: SandScope는 통제된 테스트 환경에서 도구가 가짜 비밀을 AI에게 유출하는 것을 성공적으로 잡아냈습니다.
  • 완벽하지는 않음: 만약 도구가 비밀을 암호화(글자를 뒤섞음)하거나 압축하여 숨긴다면, SandScope가 놓칠 수도 있습니다. 이 도구는 "평문(plain text)" 유출을 잡는 데 탁vex합니다.
  • 실용적임: 연구진은 100개의 실제 도구를 테스트했습니다. 약 35개를 완전히 실행할 수 있었으며, 나머지 도구들에 대해서도 "이력서"를 읽어 위험 요소를 파악할 수 있었습니다.

핵심 요약

이 논문은 AI 도구의 안전 검사관인 SandScope를 소개합니다. 이 도구는 해커를 직접 막으려는 것이 아니라, 도구가 실수로 비밀을 AI에게 흘리는지 확인할 수 있는 안전하고 격리된 테스트 환경을 만드는 것입니다. SandScope는 실제 테스트(도구가 실행되는 것을 관찰)와 이력서 읽기(도구가 무엇을 할 수 있다고 주장하는지 확인)를 결 조합하여, 개발자에게 해당 도구가 안전한지 여부에 대한 명확하고 감사 가능한 보고서를 제공합니다.

중요 참고 사항: 이 논문은 모든 보안 문제를 해결하거나 미래의 모든 해킹을 예측할 수 있다고 주장하는 것이 아닙니다. 단지 개발자들이 실제 재난이 발생하기 전에 수정할 수 있도록, 유출에 대한 증거를 수집하는 방법을 제공할 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →