← 최신 논문
💻 computer science

Why Neural Structural Obfuscation Can't Kill White-Box Watermarks for Good!

본 논문은 신경망 구조 난독화 (NSO) 공격으로 손상된 화이트박스 워터마크를 복원하기 위해, 공격된 모델의 불필요한 뉴런을 식별하고 하위 소비자 레이어의 구조를 전역적으로 정합시키는 새로운 프레임워크인 'Canon'을 제안하여 100% 의 복원 성공률을 입증합니다.

원저자: Yanna Jiang, Guangsheng Yu, Qingyuan Yu, Yi Chen, Qin Wang

게시일 2026-03-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yanna Jiang, Guangsheng Yu, Qingyuan Yu, Yi Chen, Qin Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"인공지능 (AI) 모델의 소유권을 증명하는 '디지털 지문'이 어떻게 사라진 것처럼 보였는데, 사실은 다시 찾아낼 수 있었다"**는 놀라운 이야기를 담고 있습니다.

기존에 "이 지문을 지우는 방법은 비용도 없고 완벽하다"고 믿어졌던 공격 방법이 사실은 완벽하지 않았음을 증명하고, 그 지문을 다시 찾아내는 새로운 기술 CANON을 소개합니다.

이 복잡한 내용을 일상적인 비유로 쉽게 설명해 드릴게요.


1. 배경: AI 모델과 '디지털 지문' (워터마크)

우리가 만든 AI 모델은 마치 고유한 레시피를 가진 요리와 같습니다. 이 레시피가 내 것이라는 것을 증명하기 위해, 우리는 레시피의 특정 재료 (파라미터) 에 **보이지 않는 '디지털 지문' (워터마크)**을 숨겨둡니다.

  • 백박스 (White-box) 검증: 이 지문을 찾으려면 레시피의 모든 재료를 직접 열어봐야 합니다. "이 특정 재료의 순서와 양이 내 지문과 일치하니까, 이 레시피는 내 거야!"라고 주장하는 방식입니다.

2. 문제: '신경 구조 위장술' (NSO) 이라는 사기극

2023 년에 발표된 새로운 공격 방법 (NSO) 이 등장했습니다. 이 공격자는 레시피를 망가뜨리지 않으면서 지문을 숨기는 기묘한 방법을 썼습니다.

비유: 요리에 '맛없는 가짜 채소'를 넣는 사기

  • 공격자는 레시피에 **맛도 없고, 냄새도 없는 가짜 채소 (더미 뉴런)**를 대량으로 넣었습니다.
  • nso_zero: 아예 아무것도 안 하는 가짜 채소.
  • nso_clique: 서로 상쇄되는 가짜 채소 (하나를 넣으면 다른 하나가 그 효과를 없앰).
  • nso_split: 하나의 진짜 재료를 여러 조각으로 잘라내서 합치면 원래 양과 똑같게 만든 가짜 조합.

결과:

  • 요리 맛 (모델 성능): 가짜 채소를 넣어도 요리는 원래와 똑같이 맛있습니다. (기능은 유지됨)
  • 지문 찾기 실패: 하지만 지문을 찾으러 온 사람은 "어? 내가 찾던 '감자 3 번' 자리에 이제 '가짜 채소 100 개'가 끼어있네? 순서가 완전히 바뀌었잖아!"라고 혼란에 빠집니다.
  • 기존의 결론: "지문을 찾는 기준이 순서 (인덱스) 에 의존하는데, 순서가 뒤죽박죽이 되었으니 지문은 영원히 사라진 거야!"라고 믿게 되었습니다.

3. 해결책: CANON (정리 정돈의 대가)

이 논문은 **"아니야, 그건 지문이 사라진 게 아니라, 레시피가 너무 지저분해진 거야. 우리가 정리해 줄게!"**라고 말합니다.

저희가 개발한 CANON이라는 도구는 다음과 같이 작동합니다.

① 탐정 역할: "이건 가짜야!"

CANON 은 모델에 여러 가지 질문 (프로브) 을 던져보며 반응을 봅니다.

  • "이 가짜 채소는 요리에 전혀 영향을 안 주네?" (nso_zero)
  • "이 두 가짜 채소는 서로 상쇄되네?" (nso_clique)
  • "이 조각들은 합치면 원래 재료랑 똑같네?" (nso_split)

이처럼 **가짜 재료들이 남긴 '흔적' (신호 패턴)**을 찾아냅니다. 진짜 재료는 각자 고유한 역할을 하지만, 가짜 재료들은 특이하게도 서로 비슷하거나 상쇄되는 패턴을 보입니다.

② 정리 정돈: "원래대로 복원하기"

가짜 재료를 찾아낸 CANON 은 이제 전체 레시피를 다시 정리합니다.

  • 가짜 채소 제거: 요리에 필요 없는 가짜 채소는 과감히 버립니다.
  • 분할된 재료 합치기: 잘게 쪼개진 재료를 다시 하나로 합칩니다.
  • 순서 맞추기: 가장 중요한 것은, 이 정리를 할 때 요리 전체의 흐름을 고려한다는 점입니다.
    • 예시: 만약 '감자'가 두 가지 경로로 나뉘어 다른 요리에 쓰인다면, 한쪽만 정리하면 안 됩니다. 두 경로 모두를 동시에 정리해서 다시 합쳐야 요리가 망가지지 않습니다. (이를 그래프 일관성이라고 합니다.)

③ 결과: 지문 다시 발견!

정리된 레시피를 다시 보니, 원래의 '감자 3 번' 자리가 다시 원래 위치로 돌아왔습니다.

  • 요리는 여전히 맛있습니다 (성능 저하 없음).
  • 지문 찾는 사람은 "아! 내가 찾던 순서가 돌아왔네! 이 레시피는 확실히 내 거야!"라고 다시 소유권을 주장할 수 있습니다.

4. 왜 이 연구가 중요한가요?

  1. "제로 비용"은 거짓말이었다: 공격자들은 "지문을 지우는 데 비용도 안 들고 완벽하다"고 했지만, 사실은 **복잡한 구조 (현대 AI 모델의 복잡한 연결 구조)**를 고려하지 않은 단순한 공격이었습니다. CANON 은 이 복잡한 구조까지 완벽하게 분석해냅니다.
  2. 안전한 방어: CANON 은 공격이 없는 정상적인 모델에는 손을 대지 않습니다. (거짓 경보 없음). 오직 가짜가 섞인 모델만 골라내서 정리합니다.
  3. 완벽한 복구: 실험 결과, 어떤 복잡한 공격을 당해도 100% 성공하여 지문을 다시 찾아냈습니다.

요약

이 논문은 **"AI 모델의 소유권을 증명하는 지문이, 가짜 재료로 뒤덮여 숨겨졌을 때, 그 가짜를 찾아내고 원래 순서대로 정리해 지문을 다시 찾아내는 기술 (CANON)"**을 소개합니다.

마치 복잡하게 뒤섞인 퍼즐을 보고, "이건 원래 이랬어!"라고 알아맞혀서 다시 원래 모양으로 맞춰주는 것과 같습니다. 이제 AI 개발자들은 자신의 모델을 보호하는 지문이 더 이상 '영구적으로 지워질 수 있는' 위협이 아니라는 안도감을 가질 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →