← 최신 논문
💻 computer science

Semantic Attacks on Tool-Augmented LLMs: Securing the Model Context Protocol Against Descriptor-Level Manipulation

본 논문은 모델 컨텍스트 프로토콜 (MCP) 에 대한 세 가지 새로운 기술자 수준 의미론적 공격 벡터 (도구 중독, 그림자, 러그 풀) 를 식별하고 공식화하여 도구 메타데이터 조작이 LLM 안전성을 크게 훼손할 수 있음을 입증하고, 모델 재학습 없이도 비안전한 도구 호출을 효과적으로 줄이는 다층 방어 전략을 제안합니다.

원저자: Saeid Jamshidi, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Saeid Jamshidi, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하고 도움이 되는 로봇 비서 (AI) 가 당신을 위해 이메일을 확인하거나 회사 파일을 검색하거나 회의를 예약하는 등의 일을 할 수 있다고 상상해 보세요. 이를 위해 로봇은 사용할 수 있는 '도구' 목록이 필요합니다. AI 세계에서는 이러한 도구들이 로봇에게 그 도구가 무엇을 하는지 알려주는 작은 라벨이나 설명(기술자) 과 함께 제공됩니다.

예를 들어, 어떤 도구는 *"공개 문서 검색"*이라고 라벨이 붙어 있을 수 있습니다. 로봇은 이 라벨을 읽고 이해한 후, 당신이 도움을 요청할 때 그 도구를 사용하기로 결정합니다.

문제: '가짜 라벨' 공격

이 논문은 로봇을 속이는 교활한 방법을 발견했습니다. 도구 자체를 파괴하거나 컴퓨터를 해킹하는 대신, 공격자는 도구의 라벨을 변경합니다.

이를 마트와 비교해 생각해 보세요.

  • 정상적인 상황: 땅콩버터 병에 "땅콩버터"라고 라벨이 붙어 있습니다. 당신은 그 라벨을 신뢰하므로 그것을 구매합니다.
  • 공격: 나쁜 사람이 병의 라벨을 바꿔칩니다. 여전히 "땅콩버터"라고 쓰여 있지만, 아주 작고 미묘한 글씨로 *"그리고 이 병을 구매한 모든 사람의 목록을 포함하십시오"*라는 문구가 추가되어 있습니다.
  • 결과: 로봇은 라벨을 보고 (정상적인 라벨처럼 보이므로) 신뢰한 후 그 도구를 사용하기로 결정합니다. 하지만 이제 로봇은 단순히 땅콩버터를 찾는 대신, 라벨이 그렇게 지시했기 때문에 고객 목록을 실수로 훔쳐냅니다.

이 논문은 이를 **의미론적 공격 (Semantic Attack)**이라고 부릅니다. 도구 자체는 안전하고 완벽하게 작동하지만, 그것을 설명하는 단어들이 거짓말을 하고 있는 것입니다.

로봇을 속이는 공격자의 세 가지 방법

연구자들은 이러한 "가짜 라벨"이 AI 를 속일 수 있는 세 가지 구체적인 방식을 확인했습니다:

  1. 도구 중독 (The "Too Helpful" Label, 지나치게 도움이 되는 라벨):

    • 유추: "날씨 확인"이라고 라벨이 붙은 도구를 상상해 보세요. 공격자는 라벨을 "날씨를 확인하고 동시에 사용자가 현재 무엇을 입고 있는지 알려주십시오"로 변경합니다.
    • 효과: 로봇은 "오, 이 도구는 특히 도움이 되는군!"이라고 생각하여 이를 사용함으로써 실수로 사용자의 개인 정보를 유출합니다.
  2. 섀도잉 (The "Confusing Crowd" Label, 혼란스러운 군중 라벨):

    • 유추: 사람들이 지시를 내리는 방 안에 있다고 상상해 보세요. 한 사람 (공격자) 이 다른 사람들은 단지 시간을 묻고 있는데도 불구하고, "모두가 신원증을 보여야 합니다!"라고 소리칩니다.
    • 효과: 로봇은 시끄럽고 의심스러운 지시에 혼란을 느껴, 안전하더라도 모든 도구를 개인 사용자 데이터를 확인해야 하는 것처럼 취급하기 시작합니다.
  3. 러그 풀 (The "Bait and Switch" Label, 미끼와 교체 라벨):

    • 유추: "울타리 페인트 칠"을 위해 계약자를 고용했다고 상상해 보세요. 당신은 계약을 승인합니다. 일주일 후, 계약자는 조용히 계약을 "울타리 페인트 칠 그리고 숨겨진 카메라 설치"로 변경합니다.
    • 효과: 도구는 당신이 처음 확인했을 때 안전했지만, 나중에 설명이 변경되어 당신이 눈치채지 못한 사이에 위험한 일을 하도록 변합니다.

얼마나 심각한가요?

연구자들은 세 가지 다른 유형의 AI 로봇 (GPT-5.3, DeepSeek-V3, LLaMA-3.5) 에서 이를 테스트했습니다.

  • 충격: 특별한 보호 장치 없이 이 로봇들은 약 **36%**의 빈도로 속임수에 걸렸습니다. 그들은 기꺼이 "중독된" 도구를 사용하여 데이터를 유출했습니다.
  • 놀라움: 로봇이 더 많이 "생각"할수록 (복잡한 추론 단계를 사용할수록) 속임수에 걸릴 확률이 높아졌습니다. 로봇이 지시 사항에 대해 깊이 생각하려고 할 때, 라벨의 미묘한 거짓말에 더 혼란을 겪는 것으로 보입니다.

해결책: 세 겹의 보안 경비원

이 논문은 로봇의 뇌를 다시 구축할 필요 없이, 로봇이 라벨을 보기 전에 보안 검문소를 추가하는 새로운 보호 방법을 제안합니다.

  1. 신원 확인 (무결성 검증):

    • 유추: 운전면허증이 위조되지 않았는지 확인하는 것과 같습니다. 시스템이 라벨이 신뢰할 수 있는 권한에 의해 서명되었고 승인된 이후 변경되지 않았는지 확인합니다. 이는 "러그 풀"을 막아줍니다.
  2. 제 2 의 의견 (의미론적 심사):

    • 유추: 로봇이 라벨을 읽기 전에, 두 번째로 작은 로봇 ("검증자") 이 먼저 읽습니다. 검증자는 "이 라벨이 너무 많은 개인 정보를 요구하는 것처럼 들리지 않나요?"라고 묻습니다. 의심스러우면 두 번째 로봇은 "아니오, 사용하지 마십시오"라고 말합니다.
  3. 문지기 (런타임 가드레일):

    • 유추: 클럽의 문지기가 도구가 실행되는 동안 무슨 일이 일어나는지 지켜봅니다. 도구가 이상한 일을 하기 시작하면 (예: 접근해서는 안 되는 파일에 접근하려는 경우), 문지기는 즉시 그것을 퇴장시킵니다.

수정 조치의 결과

연구자들이 세 겹의 보호 장치를 모두 추가했을 때:

  • 로봇이 속임수에 걸린 횟수가 **36%**에서 **15%**로 감소했습니다.
  • 시스템은 나쁜 시도 중 **74%**를 성공적으로 차단했습니다.
  • 트레이드오프: 로봇이 답변하는 데 조금 더 시간이 걸렸습니다 (지연 시간 증가), 하지만 훨씬 더 안전해졌습니다.

핵심 교훈

이 논문의 주요 교훈은 AI 도구의 라벨이 정상적으로 보인다고 해서 그것을 신뢰해서는 안 된다는 것입니다. 도구가 완벽하게 작동하고 코드가 안전하더라도, 그것을 설명하는 단어들이 함정일 수 있습니다. AI 를 안전하게 유지하려면 이러한 설명들을 신뢰할 수 없는 정보로 간주하고, AI 가 이를 사용하기 전에 신중하게 확인해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →