← 최신 논문
🤖 AI

Neural Honeytrace: Plug&Play Watermarking Framework against Model Extraction Attacks

Neural Honeytrace는 모델 추출 공격에 대해 최소한의 쿼리 비용으로 효율적이고 강력한 소유권 검증을 가능하게 하기 위해 백도어 학습의 롱테일 효과(long-tailed effect)에 기반한 다단계 전송 전략을 활용하는 플러그 앤 플레이 방식의 훈련이 필요 없는 워터마킹 프레임워크이다.

원저자: Yixiao Xu, Binxing Fang, Rui Wang, Yinghai Zhou, Yuan Liu, Mohan Li, Zhihong Tian

게시일 2026-01-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yixiao Xu, Binxing Fang, Rui Wang, Yinghai Zhou, Yuan Liu, Mohan Li, Zhihong Tian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: "비밀 레시피"를 훔치는 것

당신이 세계 최고의 버거를 만드는 비밀 레시피를 가진 유명한 레스토랑을 운영한다고 상상해 보세요. 당신은 레시피를 팔지 않고, 오직 사람들이 버거를 먹을 수 있게만 합니다(이는 기술 세계의 "Model as a Service"와 같습니다).

하지만 한 도둑이 나타납니다. 그들은 레시피 북을 훔치는 대신, 버거 1만 개를 주문하고 모든 맛을 본 뒤, 셰프가 다양한 재료에 어떻게 반응하는지를 정확히 기록합니다. 결국 그들은 당신의 레스토랑과 거의 똑같은 맛을 내는 자신들만의 버거 가게를 열 수 있을 만큼 레시피를 파악하게 됩니다. 이것이 바로 **모델 추출 공격(Model Extraction Attack)**입니다.

이를 막기 위해 레스토랑 주인들은 버거에 보이지 않는 "워터마크"를 남기려고 노력해 왔습니다. 만약 도둑이 경쟁 업소를 차린다면, 주인은 버거를 주문하여 숨겨진 워터마크를 찾아낸 뒤, "이봐, 이건 내 레시피야!"라고 증명할 수 있습니다.

기존 워터마크의 문제점:

  1. 새로운 주방이 필요함: 기존의 대부분의 워터마크는 셰프가 전체 레시피를 처음부터 다시 학습시켜야 하므로 비용이 많이 들고 시간이 오래 걸립니다.
  2. 취약함: 만약 도둑이 영리해서 버거를 "세척"하려고 시도한다면(적응형 공격 사용), 워터마크는 사라집니다.
  3. 증명이 어려움: 소유권을 증명하기 위해 주인은 워터마크가 있는 버거를 단 몇 개라도 찾기 위해 수천 개의 버거를 주문해야 하는 경우가 많습니다. 이는 마치 건초더미에서 바늘 찾기와 같습니다.

해결책: 뉴럴 허니트레이스 (Neural Honeytrace)

저자들은 **뉴럴 허니트레이스(Neural Honeytrace)**라는 새로운 시스템을 제안합니다. 이것을 "플러그 앤 플레이(Plug-and-Play)" 방식의 꿀 함정이라고 생각하세요. 주방을 새로 만들거나 셰프를 다시 훈련시킬 필요가 없습니다. 그저 서빙 과정에 특별한 꿀 층을 추가하기만 하면 됩니다.

작동 방식은 세 가지 간단한 개념으로 나뉩니다.

1. "롱테일(Long-Tailed)" 효과 (꿀의 흔적)

과거의 워터마크는 특정하고 찾기 어려운 트리거(예: "버거 왼쪽에 깨가 있다면 내 것이 맞다")와 같았습니다. 도둑들은 이러한 트리거를 쉽게 피할 수 있었습니다.

뉴럴 허니트레이스는 **"롱테일 효과(Long-Tailed Effect)"**라는 다른 아이디어를 사용합니다.

  • 비유: 셰프의 두뇌가 너무 뛰어나서, 설령 당신이 특정 "워터마크 버거"와 거의 유사한 버거를 준다 하더라도, 셰프는 여전히 그 버거가 그 워터마크 버거인 것처럼 미세하게 반응하는 것과 같습니다.
  • 작동 방식: 강제적인 트리거를 만드는 대신, 시스템은 부드러운 "꿀의 흔적(honey trail)"을 만듭니다. 만약 도둑의 버거가 워터마크와 90% 유사하다면, 시스템은 출력을 워터마크의 비밀 신호와 90% 유사하게 만듭니다. 50% 유사하다면, 신호도 50% 존재하게 됩니다.
  • 도움이 되는 이유: 도둑은 모델을 훔치기 위해 정확한 트리거를 알 필요가 없습니다. "유사성"이 수학적으로 녹아들어 있기 때문에, 도둑은 원래의 트리거를 보지 못하더라도 의도치 않게 레시피와 함께 이 꿀의 흔적을 훔치게 됩니다.

2. 정보 이론 (대역폭 문제)

저자들은 이전의 워터마크들이 왜 실패했는지 깨달았습니다. 그것들은 노이즈 속에서 너무 크게 소리를 지르려 했기 때문입니다.

  • 비유: 노이즈가 심한 라디오 채널(도둑이 훔친 모델)을 통해 비밀 메시지(워터마크)를 보내려고 한다고 상상해 보세요. 메시지가 너무 크거나 복잡하면, 노이즈가 메시지를 덮어버리거나 도둑의 "세척" 필터가 이를 제거해 버립니다.
  • 해결책: 뉴럴 허니트레이스는 도둑의 모델이 주요 레시피(버거의 맛)를 복사하는 데는 능숙하지만, 미세한 "꿀의 흔적"과 같은 유사성을 완벽하게 복사하는 데는 어려움을 겪는다는 점을 이용합니다. 메시지를 하나의 큰 외침으로 전달하는 대신, 수많은 작은 상호작용에 걸쳐 분산시킴으로써, 도둑이 필터링을 시도하더라도 메시지가 통과되도록 보장합니다.

3. "다단계" 전송 (벌집)

단 한두 개의 버거로 소유권을 증명하려 하는 대신, 뉴럴 허니트레이스는 증명을 전체 벌집에 퍼뜨립니다.

  • 비유: 만약 당신이 벌집의 소유권을 증명하고 싶다면, 단 한 마리의 벌만 찾는 것이 아니라 벌집 전체의 패턴을 봅니다.
  • 작동 방식: 시스템은 답변의 확률 안에 워터마크를 심습니다. 도둑이 모델에 수천 번 질문을 던질 때, 그 답변들의 패턴은 통계적으로 꿀의 흔적을 드러냅니다.
  • 결과: 저자들은 이것이 믿을 수 없을 정도로 효율적이라고 주장합니다. 기존 방식은 최악의 경우 소유권을 증명하기 위해 600만 개의 버거를 주문해야 할 수도 있지만, 뉴럴 허니트레이스는 약 590개만 있으면 됩니다. 이는 다른 방법들에 비해 필요한 노력이 단 2% 수준으로 줄어든 것입니다.

왜 특별한가 ("플러그 앤 플레이" 기능)

가장 큰 장점은 모델을 다시 학습시킬 필요가 없다는 것입니다.

  • 기존 방식: 워터마크를 추가하려면 실험실로 돌아가서 새로운 화학 물질을 섞고 전체 모델 배치를 다시 구워내야 했습니다.
  • 뉴럴 허니트레이스: 이것은 플러그인처럼 작동합니다. 이미 배포된(이미 영업 중인) 모델을 가져와서, 시스템이 쿼리를 가로채고 "유사성 꿀"을 계산한 뒤, 실시간으로 답변을 조정합니다. 나중에 워터마크를 제거하고 싶다면, 그냥 플러그를 뽑으면 됩니다. 재학습이 필요 없습니다.

결과

논문은 다양한 "도둑(공격자)"들을 대상으로 테스트를 진행했습니다. 여기에는 방어 체계를 알고 데이터를 정제하려는 매우 영리한 공격자도 포함되었습니다.

  • 강건성(Robustness): 도둑이 데이터를 매끄럽게 만들거나 고급 기술을 사용하여 데이터를 정제하려고 해도, "꿀의 흔적"은 여전히 탐지 가능한 상태로 남습니다.
  • 효율성: 소유권을 증명하는 데 필요한 쿼리 수를 획기적으로 줄여줍니다.
  • 비용: 구현하는 데 드는 학습 시간과 비용이 전혀 들지 않습니다.

요약

**뉴럴 허니트레이스(Neural Honeytrace)**는 AI 모델이 도난당하는 것을 방지하는 새로운 방법입니다. 강제로 찾기 어려운 트리거를 심는 대신, 모델의 답변 속에 수학적으로 매끄럽게 연결된 미세한 "꿀의 흔적(유사성)"을 남깁니다. 이 흔적은 매우 효과적이어서, 모델 소유자는 아주 적은 수의 질문만으로도 자신이 모델의 주인임을 증명할 수 있으며, 모델을 처음부터 다시 학습시킬 필요도 없이 이를 수행할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →