← 최신 논문
💻 computer science

FedOT: Ownership Verification and Leakage Tracing via Watermarks for Federated LDMs

이 논문은 청크 기반 워터마킹 기법과 디코더 교체를 통한 워터마크 제거를 방지하기 위한 잠재 벡터 변환(LVT) 메커니즘을 채택하여, 소유권 검증을 보장하고 모델 유출을 특정 악의적 클라이언트로 추적하는 연합 잠재 확산 모델(Latent Diffusion Models)을 위한 새로운 프레임워크인 FedOT을 제안한다.

원저자: Wenlong Cheng, Yuan Gan, Yunqiu Xu, Jiaxu Miao

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wenlong Cheng, Yuan Gan, Yunqiu Xu, Jiaxu Miao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

여러 명의 예술가들(클라이언트)이 자신의 개인 스케치북을 누구에게도 보여주지 않으면서 함께 걸작을 만들고자 하는 상황을 상상해 보십시오. 그들은 강력한 AI 아티스트(잠재 확산 모델, Latent Diffusion Model)를 훈련시키기 위해 **연합 학습(Federated Learning)**이라는 특별한 협업 방식을 사용합니다.

하지만 문제가 하나 있습니다. 그룹이 훈련을 마치면, 최종적인 "마스터 레시피"(글로벌 모델)가 모두에게 공유됩니다. 이때 그룹 내의 교활한 예술가가 이 레시피를 훔쳐서 낯선 사람에게 팔거나 허가 없이 돈을 벌 수도 있습니다. 그룹은 "이것은 우리의 레시피다!"라고 증명하고, 만약 이것이 도난당한다면 "누가 훔쳤는가?"를 알아낼 방법이 필요합니다.

이 논문은 AI 예술가들이 그룹으로 작업할 때 발생하는 이 두 가지 문제를 해결하기 위해 설계된 새로운 보안 시스템인 FedOT를 소개합니다.

FedOT가 해결하는 두 가지 큰 문제

1. "누가 훔쳤나?"라는 미스터리
기존 방식들은 "네, 이 이미지는 우리 그룹에서 나온 것이 맞습니다"라고 말할 수는 있었지만, 구체적으로 어떤 사람이 모델을 유출했는지는 밝혀내지 못했습니다. 이는 마치 도난당한 자동차를 발견했을 때, 그 차가 특정 가족의 소유라는 것은 알지만, 정작 어떤 가족 구성원이 차를 몰고 갔는지는 모르는 것과 같았습니다. FedOT는 특정 범인을 직접 가리키는 숨겨진 "ID 태그"를 추가함으로써 이 문제를 해결합니다.

2. "엔진 교체" 수법
AI 모델을 엔진(이미지를 생성하는 부분)과 변속기(엔진의 힘을 움직임으로 번역하는 부분)라는 두 가지 주요 부품을 가진 자동차라고 상상해 보십시오.

  • 기존 방식: 이전의 보안 방식들은 변속기에 워터마크를 삽식했습니다. 하지만 도둑은 이 워터마크가 찍힌 변속기를 뽑아내고, 폐차장에서 가져온 깨끗하고 일반적인 변속기로 교체할 수 있습니다. 그러면 자동차는 여전히 잘 작동할 것이고, 워터마크는 사라질 것입니다.
  • FedOT 방식: FedOT는 도로 위의 규칙을 바꿉니다. FedOT는 변속기를 수정하여, 오직 그룹이 훈련시킨 특정 엔진하고만 작동하도록 만듭니다. 만약 도둑이 변속기를 일반적인 것으로 교체하려고 하면, 엔진이 덜컥거리며 바퀴가 빠지고, 자동차는 쓸모없는 고철 덩어리가 되어 버립니다. 도둑은 모델을 훔치더라도 망가뜨리지 않고는 가져갈 수 없습니다.

FedOT의 작동 원리 (비유)

FedOT는 그룹을 보호하기 위해 두 가지 주요 기술을 사용합니다.

1. "분할 티켓" (청크형 워터마크)

워터마크를 두 섹션으로 나뉜 긴 비밀 티켓이라고 생각하십시오.

  • 앞부분 (소유권): 이 부분은 그룹 내 모든 사람에게 동일합니다. 이 부분은 "이 모델이 우리 그룹의 것인가?"라는 질문에 답합니다.
  • 뒷부분 (추적): 이 부분은 모든 사람에게 고유합니다. 이 부분은 "누가 구체적으로 유출했는가?"라는 질문에 답합니다.

의심스러운 이미지가 나타나면, 시스템은 먼저 앞부분을 확인합니다. 만약 앞부분이 그룹과 일치하면, 그다음 뒷부분을 확인하여 구체적인 범인을 식별합니다. 이 방식은 빠르고 효율적입니다.

2. "비밀 언어" (잠재 벡터 변환)

이것이 핵심적인 혁신입니다.

  • 설정: 그룹이 훈련을 시작하기 전, 리더(서버)는 변속기(VAE)에게 비밀스럽고 약간 왜곡된 언어를 가르칩니다. 이는 마치 변속기에게 약간의 억양을 갖게 하거나, 단어를 아주 특이한 방식으로 번역하게 가르치는 것과 같습니다.
  • 훈련: 엔진(U-Net)은 이 새로운 왜곡된 언어를 완벽하게 구사하도록 학습합니다. 둘은 서로에게 익숙해집니다.
  • 함정: 만약 도둑이 워터마크가 있는 부분을 표준적인 "깨끗한" 것으로 교체하려고 하면, 엔진은 더 이상 그 언어를 이해하지 못합니다. 엔진은 자신의 비밀 언어로 말하려고 하지만, 새로운 변속기는 이를 횡설수설하는 말로 번역해 버립니다. 결과는 어떠할까요? 생성된 이미지는 흐릿하거나, 왜곡되거나, 완전히 잘못된 모습이 됩니다.

연구진은 이 "왜로된 언어"를 만드는 세 가지 방법을 테스트했습니다.

  • 번역 (Translation): 언어를 약간 이동시키는 것 (강한 억양으로 말하는 것과 같음).
  • 거울 (Mirror): 언어를 거꾸로 뒤집는 것.
  • 부정 (Negative): 언어의 색상을 반전시키는 것 (사진의 네거티브와 같음).

연구진은 "부정(Negative)" 방식이 가장 좋다는 것을 발견했습니다. 이 방식은 이미지를 양호하게 유지하면서도, 부품을 교체하면 품질을 파괴하게 만들어 교체를 불가능하게 만들었습니다.

실험 결과

저자들은 다양한 공격에 대해 FedOT를 테스트했습니다.

  • 교체 공격 (Swap Attack): 도둑들이 워터마크가 있는 부분을 깨끗한 것으로 교체하려 했을 때, 이미지 품질이 급격히 떨어졌습니다. 모델은 쓸모없게 되었습니다.
  • 정화 공격 (Purification Attack): 도둑들이 워터마크를 제거하기 위해 깨끗한 데이터로 모델을 다시 훈련시켜 "세척"하려 했음에도 불구하고, 품질은 여전히 크게 저하되었습니다.
  • 추적 (Trace): 이러한 공격 속에서도, 만약 모델이 살아남는다면 FedOT는 높은 정확도로 그룹과 특정 범인을 여전히 식별할 수 있었습니다.

결론

FedOT는 그룹 AI 프로젝트에서 소유권을 증명할 뿐만 아니라 특정 범인을 잡아낼 수 있는 최초의 시스템입니다. 이는 AI의 부품들을 너무나 단단하게 결합하여, 누군가 부품을 교체하여 모델을 훔치려 하면 전체가 망가지도록 만들기 때문입니다. 이는 모델 도난을 도둑에게 "패배가 확정된 상황"으로 만듭니다. 즉, 도둑은 잡히거나, 아니면 망가진 쓸모없는 모델을 갖게 될 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →