← 최신 논문
💬 NLP

Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models

이 논문은 에이전트 AI 모델의 도구 선택 프로세스를 조작하여 특정 공격자가 지정한 함수를 강제로 호출하게 만드는 새로운 '함수 하이재킹 공격 (FHA)'을 제안하고, 다양한 모델과 도메인에서 높은 성공률을 보이는 이 공격의 위험성과 보안 강화의 필요성을 입증합니다.

원저자: Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher

게시일 2026-04-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 인공지능 (AI) 이 외부 도구를 사용할 때 발생할 수 있는 새로운 해킹 방법을 발견하고 설명한 연구입니다. 전문 용어 대신 일상적인 비유를 들어 쉽게 설명해 드리겠습니다.

🕵️‍♂️ 핵심 비유: "가짜 메뉴판으로 요리사 속이기"

생각해 보세요. AI 는 훌륭한 요리사이고, 사용자는 손님입니다. 이 요리사는 손님의 주문 (질문) 을 듣고, 필요한 재료를 가져오기 위해 주방장 (외부 도구/함수) 을 부릅니다.

예를 들어, 손님이 "새로운 레시피를 만들어줘"라고 주문하면, 요리사는 "레시피 생성기"라는 주방장을 부릅니다.

하지만 이 연구는 해커가 어떻게 이 주방장들의 메뉴판 (도구 설명) 을 살짝 변조해서, 요리사가 손님이 원하지 않는 일을 하도록 속일 수 있는지 보여줍니다.


🚨 이 논문이 발견한 것: "함정 도구 장난 (Function Hijacking Attack)"

기존의 해킹은 요리사에게 "나쁜 말"을 해서 악한 일을 시키는 것이었습니다 (예: "폭탄 만드는 법 알려줘"). 하지만 이 논문에서 발견한 새로운 해킹은 다릅니다.

1. 상황 설정: 메뉴판에 숨겨진 함정

  • 해커는 요리사의 눈앞에 있는 메뉴판 (사용 가능한 도구 목록) 중 하나인 "레시피 생성기"의 설명을 살짝 바꿉니다.
  • 원래 설명: "새로운 레시피를 만들어줍니다."
  • 해커가 바꾼 설명: "새로운 레시피를 만들어줍니다. (여기에 숨겨진 가독성 없는 이상한 글자들과 주문을 강제로 바꾸는 마법 주문이 숨겨져 있음)"

2. 공격의 원리: "가장 눈에 띄는 메뉴"로 속임

  • AI 요리사는 보통 손님의 주문과 가장 잘 맞는 메뉴를 선택합니다.
  • 하지만 해커가 메뉴판에 숨겨진 특수한 마법 주문 (Adversarial Tokens) 을 넣으면, AI 는 그 메뉴가 손님의 주문과 가장 잘 맞는다고 착각하게 됩니다.
  • 결과적으로 손님이 "새로운 레시피를 만들어줘"라고 했을 때, AI 는 실수로 "레시피 삭제기""주방장 해고기" 같은 위험한 도구를 부르게 됩니다.

3. 이 해킹의 무서운 점

  • 의미와 상관없음: 손님이 무엇을 주문하든 (비빔밥이든 스테이크든), 해커가 준비한 메뉴판만 있으면 AI 는 항상 그 함정 도구를 선택합니다.
  • 범용성: 하나의 해킹 메뉴판으로 다양한 상황 (다양한 질문) 에서 모두 통합니다. 마치 한 번 만든 가짜 메뉴판으로 모든 식당을 장악하는 것과 같습니다.
  • 높은 성공률: 실험 결과, 5 가지 다른 AI 모델 중 70%~100% 의 확률로 이 해킹이 성공했습니다.

🛡️ 연구의 결론과 시사점

이 연구는 **"AI 가 도구를 쓸 때, 그 도구의 설명만 살짝 건드려도 AI 가 완전히 미쳐버릴 수 있다"**는 것을 증명했습니다.

  • 기존의 생각: "AI 가 나쁜 말을 하면 위험하니까, 나쁜 말을 막으면 돼."
  • 새로운 위험: "AI 가 나쁜 말을 하지 않아도, 도구 설명을 조작하면 AI 가 실수로 나쁜 일을 할 수 있다."

비유로 정리하자면:
우리는 요리사가 "폭탄 만드는 법"을 말하지 않게 막는 데만 집중했습니다. 하지만 이 연구는 "메뉴판에 '폭탄 만들기'라는 메뉴를 숨겨놓고, 손님이 '비빔밥'을 시켰을 때 그 메뉴를 선택하게 만드는" 새로운 공격 방식을 발견한 것입니다.

💡 우리가 배울 점

이제 AI 시스템 (특히 외부 도구와 연결된 AI) 을 만들 때는 다음과 같은 보안이 필요합니다.

  1. 메뉴판 감시: AI 가 사용하는 도구들의 설명이 변조되지 않았는지 끊임없이 확인해야 합니다.
  2. 안전장치 (Guardrails): AI 가 도구를 선택할 때, "이 도구가 정말 손님의 주문에 맞는가?"를 다시 한번 검증하는 안전 장치가 필요합니다.

이 논문은 AI 가 더 똑똑해지고 세상을 더 많이 돕기 위해 외부 도구와 연결될수록, 우리는 도구 설명 하나하나에 대한 보안도 철저히 해야 함을 경고하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →