← 최신 논문
🤖 machine learning

Cert-LAS: Toward Certified Model Ownership Verification for Text-to-Image Diffusion Models via Layer-Adaptive Smoothing

본 논문은 악의적인 제거 공격 하에서도 신뢰할 수 있는 워터마크 검출을 보장하기 위해 계층 적응형 평활화를 활용하는 텍스트-이미지 확산 모델에 대한 최초의 인증된 모델 소유권 검증 방법인 Cert-LAS 를 소개합니다.

원저자: Leyi Qi, Yiming Li, Siyuan Liang, Zhengzhong Tu, Dacheng Tao

게시일 2026-05-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Leyi Qi, Yiming Li, Siyuan Liang, Zhengzhong Tu, Dacheng Tao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 특정 스타일로 그림을 그리도록 수년과 거액을 투자해 마법 로봇을 훈련시킨 예술가라고 상상해 보세요. 당신은 이 로봇을 "텍스트-이미지 확산 모델"이라고 부릅니다. 이제 누군가가 당신의 로봇을 훔쳐 살짝 조정하고는 그것이 자신 것이라고 주장한다고 가정해 봅시다. 어떻게 그것이 실제로 당신의 것임을 증명할 수 있을까요?

이것이 논문 Cert-LAS가 해결하려는 문제입니다.

문제: "취약한" 비밀 인사법

현재 많은 사람들이 AI 모델을 보호하기 위해 "백도어" 방법을 사용합니다. 이를 비밀 인사법이라고 생각하세요. 당신은 로봇을 훈련시켜, 특정하고 기이한 문구 (이를 "트리거"라고 함) 를 속삭이면 숨겨진 표시가 포함된 그림을 생성하도록 합니다. 다른 사람이 당신의 로봇을 가지고 있다면, 당신은 그 문구를 속삭이고 표시가 나타나면 그것이 당신의 소유임을 알 수 있습니다.

이 논문은 이 구식 방법이 두 가지 큰 결함이 있다고 주장합니다:

  1. 너무 눈에 띕니다: 기이한 문구나 숨겨진 표시는 "나는 비밀이다!"라고 외치는 네온 사인처럼 작동합니다. 도둑은 이를 쉽게 찾아내어 제거할 수 있습니다.
  2. 너무 취약합니다: 도둑이 실수로 로봇을 건드리거나 (무작위 변경) 고의로 비밀 인사법을 깨려고 시도 (적대적 공격) 하면, 표시가 사라져 더 이상 소유권을 증명할 수 없게 됩니다.

저자들은 기존 방법들은 도둑이 공정하게 행동하며 로봇의 두뇌를 건드리지 않을 것이라고 가정한다고 말합니다. 하지만 현실 세계에서는 도둑이 반드시 봉인을 깨려고 시도할 것입니다.

해결책: Cert-LAS ("레이어 적응형" 방패)

저자들은 취약한 비밀 인사법 대신 수학적으로 공격을 견딜 수 있음이 입증된 "인증된" 방패를 구축하는 새로운 방법인 Cert-LAS를 제안합니다.

간단한 비유를 들어 작동 방식을 설명해 보겠습니다:

1. "레이어 적응형" 노이즈 (맞춤형 담요)

AI 로봇을 여러 층으로 된 케이크라고 상상해 보세요. 일부 층은 "프로스팅" (변화에 매우 민감함) 이고, 일부 층은 "스펀지" (매우 튼튼함) 입니다.

  • 기존 방법은 케이크 전체를 동일하게 취급하여 골고루 흔듭니다.
  • Cert-LAS는 똑똑합니다. 먼저 케이크의 어떤 층이 "흔들리는" (미세 조정 민감) 층인지 확인한 다음, 그 흔들리는 층들을 두꺼운 보호 담요 (노이즈) 로 감싸고 튼튼한 층들은 얇은 담요로 감쌉니다.
  • 왜? 약점을 보호에 집중함으로써 전체 케이크를 훨씬 더 부수기 어렵게 만듭니다. 이를 레이어 적응형 평활화라고 합니다.

2. "트리거 없는" 워터마크 (투명 잉크)

도둑이 찾아낼 수 있는 기이한 비밀 문구 (트리거) 대신, Cert-LAS는 확산 분류기라는 트릭을 사용합니다.

  • 로봇에게 고양이 그림을 그리도록 훈련시킨다고 상상해 보세요.
  • 보통 로봇은 고양이를 그립니다.
  • Cert-LAS를 사용하면, "고양이"를 요청할 때 로봇은 고양이처럼 보이지만 당신의 비밀 디코더에 의해 수학적으로 로 "분류"되는 그림을 비밀리에 그리도록 훈련됩니다.
  • 마법: 도둑에게 그 그림은 완벽한 고양이처럼 보입니다. 기이한 단어나 숨겨진 픽셀은 없습니다. 하지만 당신이 비밀 디코더로 실행하면 그것은 "개!"라고 외치며 모델이 당신의 것임을 증명합니다. 찾아낼 "트리거"가 없기 때문에 도둑은 이를 감사하고 제거할 수 없습니다.

3. "인증된" 보장 (수학적 약속)

가장 중요한 부분은 인증된이라는 단어입니다.

  • 저자들은 단순히 이를 테스트하고 작동하기를 바란 것이 아닙니다. 그들은 "안전 반경"을 수학적으로 증명하기 위해 무거운 수학을 사용했습니다.
  • 그들은 도둑이 로봇의 두뇌를 특정 양 (특정 수학적 한계) 이상으로 변경하지 않는 한, 당신의 비밀 "고양이-개" 신호가 제거될 수 없다는 것을 증명했습니다.
  • 마치 "내가 5 파운드 미만의 망치로 자물쇠를 부수려고 한다면, 수학적으로 자물쇠가 열리지 않을 것이라고 보장할 수 있다"고 말하는 것과 같습니다.

테스트 방법

연구진은 Cert-LAS를 다음에 대해 테스트했습니다:

  • 우발적 손상: 새로운 데이터로 모델을 미세 조정하는 것 (예: 만화를 그리도록 가르치는 것).
  • 고의적 공격: 도둑이 고급 해킹 기술을 사용하여 워터마크를 특정 지워보려는 시도.

결과:

  • 기존 방법: 모델을 조정하거나 공격했을 때 워터마크가 빠르게 사라졌습니다.
  • Cert-LAS: 워터마크는 거의 모든 것을 견뎌냈습니다. 모델이 심하게 수정되었음에도 불구하고 "고양이-개" 신호는 소유권을 증명할 만큼 충분히 강력하게 남았습니다.
  • 품질: 워터마크가 적용된 모델이 생성한 그림은 여전히 훌륭하게 보였습니다. 워터마크가 예술을 망치지 않았습니다.

요약

Cert-LAS는 AI 예술 생성기를 보호하는 새로운 방법입니다. 취약하고 쉽게 눈에 띄는 비밀 코드를 사용하는 대신, 모델의 자연스러운 행동 안에 소유권 신호를 숨기는 지능적이고 수학적으로 입증된 방패를 사용합니다. 도둑이 모델의 기능 능력을 완전히 파괴하지 않는 한, 모델이 원래 창작자에게 속해 있다는 증거를 제거할 수 없음을 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →