← 최신 논문
🤖 AI

Bypassing Copyright Protection in Diffusion-based Customization via Two-Stage Latent Feature Optimization

이 논문은 잠재 디노이징(latent denoising)과 재구성을 통해 방해된 입력-잠재 매핑을 복원함으로써 확산 기반 커스텀화의 기존 저작권 방어 체계를 효과적으로 우회하는 2단계 잠재 특징 최적화 공격인 TS-LFO를 소개한다.

원저자: Ziang Xu, Wenbo Yu, Hongyao Yu, Hao Fang, Jiawei Kong, Bin Chen, Hao Wu, Shu-Tao Xia, Zhiyong Wu

게시일 2026-06-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ziang Xu, Wenbo Yu, Hongyao Yu, Hao Fang, Jiawei Kong, Bin Chen, Hao Wu, Shu-Tao Xia, Zhiyong Wu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: 디지털 열쇠공 vs. 디지털 락피커(Picklock)

당신에게 아주 특별하고 독특한 케이크 레시피(당신의 이미지)가 있다고 상상해 보세요. 당신은 로봇 요리사(AI)에게 이 특정 케이크를 만드는 법을 가르쳐서, 이와 비슷한 케이크를 더 많이 만들 수 있게 하고 싶습니다.

하지만 누군가 당신의 레시피를 훔쳐서 케이크를 팔아치울까 봐 걱정이 됩니다. 이를 막기 위해, 당신은 레시피 북에 아주 미세하고 눈에 보이지 않는 양의 "독"(적대적 섭동, adversarial perturbation)을 뿌리기로 합니다. 이 독은 인간이 보기에는 케이크의 외형을 바꾸지 않지만, 로봇 요리사를 혼란스럽게 만듭니다. 로봇이 당신의 책으로부터 학습하려고 할 때, 로봇은 어지러움을 느끼고 결국 형체를 알아볼 수 없는 엉망진창인 결과물을 만들어내게 됩니다. 이것이 현재의 저작권 보호 방식입니다.

이 논문은 TS-LFO라는 새로운 방법을 소개합니다. 이것을 숙련된 **디지털 락피커(Digital Picklock)**라고 생각하세요. 저자들은 당신의 "독이 든" 레시피 북을 살펴보고, 그 독이 로봇을 정확히 어떻게 혼란스럽게 만드는지 파악한 뒤, 로봇이 독을 무시하고 당신의 레시피를 다시 학습할 수 있도록 지침을 딱 적당한 만큼만 "정화"하는 방법을 찾아냈습니다.


현재의 방어 방식 작동 원리 (그 "독")

논문에 따르면 현재의 보호 방법들은 당신이 보여주는 이미지와 AI가 이미지를 이해하기 위해 사용하는 "비밀 코드"(잠재 공간, latent space) 사이의 연결을 망가뜨리는 방식으로 작동합니다.

  • 비유: 로봇에게 고양이 사진을 보여준다고 가정해 봅시다. 로봇은 그 사진을 비밀 코드로 번역하려고 시도합니다. 이때 "독"은 로봇이 "고양이"를 "토스터기"처럼 보이는 코드로 번로하게 만듭니다.
  • 결과: 로봇이 그 코드를 바탕으로 케이크를 구우려고 하면, 고양이 모양의 케이크 대신 토스터기 모양의 케이크를 만들게 됩니다. 보호 기능은 로봇이 올바른 개념을 학습할 수 없게 함으로써 작동합니다.

저자들이 발견한 문제점

연구진은 흥러운 점을 발견했습니다. "독"은 고주파 세부 사항(미세하고 노이즈가 섞인 정적)을 뒤섞는 데는 매우 뛰어나지만, 저주파 세부 사항(주요 형태와 구조)은 거의 온전하게 남겨둔다는 것입니다.

  • 비유: 고양이 사진에 엄청난 양의 정적 노이즈를 추가하더라도, 털 부분이 흐릿해 보일지언정 여전히 고양이라는 것은 알 수 있습니다. 현재의 방어 기제들은 로봇의 학습을 방해하기 위해 바로 이 '흐릿함(fuzziness)'에 의존하고 있습니다.

해결책: 2단계 잠재 특징 최적화 (TS-LFO)

저자들은 "독이 든" 코드를 수정하고 로봇이 실제 이미지를 다시 학습할 수 있도록 하는 2단계 프로세스를 구축했습니다.

1단계: "디노이징(Denoising)" 단계 (신호 정화)

이 단계에서는 로봇이 이미지를 다시 이해할 수 있도록 "비밀 코드"를 수정하는 것을 목표로 합니다.

  • 비유: 로봇이 노래를 들으려고 하는데, 방 안에 시끄러운 정적 소음(독)이 가득 차 있는 상황을 상상해 보세요.
    • A (정렬, Alignment): 이 방법은 로봇이 노래와 가사를 동시에 듣게 하여 두 가지가 서로 일치하도록 강제합니다.
    • B (확산 손실, Diffusion Loss): 이 방법은 로봇이 평소에 노이즈 섞인 신호를 정화하며 학습하는 방식을 시뮬레이션하여, 로봇이 정적 소음을 무시하는 법을 가르칩니다.
  • 마법 같은 기술: 이 과정이 진행됨에 따라 변하는 특별한 "조절 노브(tuning knob)"를 사용합니다. 처음에는 정적 소음을 제거하는 데 집중하고, 나중에는 노래가 제대로 들리는지에 집중합니다. 이를 통해 로봇이 독을 무시하고 음악에 집중할 수 있게 합니다.

2단계: "재구성(Reconstruction)" 단계 (이미지 다듬기)

1단계를 거친 후 코드는 개선되었지만, 이전의 "독" 때문에 이미지가 여전히 약간 흐릿하거나 이상해 보일 수 있습니다.

  • 비유: 로봇은 올바른 레시피를 가졌지만, 재료가 약간 잘못된 상태입니다. 이 단계는 엄격한 요리사가 되어 "최종 케이크는 아주 미세한 오차 범위 내에서 반드시 원래 사진과 똑같아야 한다"라고 말하는 것과 같습니다.
  • 결과: 이 단계는 최종 이미지가 원래의 선명하고 뚜렷한 형태로 다시 돌아오도록 강제하여, 보호 기능에 의해 남겨진 어떤 흐릿함도 제거합니다.

연구 결과 (Results)

저자들은 자신들의 락피커를 AdvDM, SimAC, DisDiff와 같은 현재 사용 가능한 최고의 "자물쇠(저작권 방어)"들과 테스트했습니다.

  • 결과: 그들의 방법은 이 모든 방어 체계를 성공적으로 우회했습니다.
  • 비교: 그들은 자신들의 방법을 다른 "락피커들"(DiffPure, GrIDPure 등)과 비교했습니다. 그들의 방법이 이미지의 정체성을 훔쳐오는 데 더 뛰어났습니다.
    • 얼굴 테스트: 얼굴을 훔치려 할 때, 그들의 방법은 다른 방법들보다 훨씬 더 원본 인물과 닮은 얼굴을 생성해 냈습니다.
    • 품질 테스트: 생성된 이미지들이 더 선명하고 정확했습니다.

이 연구가 중요한 이유 (논문에 따른 의견)

이 논문은 현재의 저작권 방어 기제들이 너무 취약하다고 주장합니다. 그것들은 특정 기술(코드를 뒤섞는 것)에 의존하고 있으며, 이 새로운 방법은 이를 쉽게 되돌릴 수 있기 때문입니다.

  • 경고: 저자들은 이것이 현재의 방어책들이 충분히 강력하지 않다는 것을 증명한다고 말합니다. 그들은 이 연구가 과학자들이 더 견고하고, 이렇게 쉽게 따일 수 없는 더 나은 자물쇠를 만들도록 촉구하기를 바랍니다.
  • 트레이드오프(Trade-off): 이 방법은 이미지 하나를 처리하는 데 약 6분이 걸립니다. 저자들은 AI가 해당 이미지를 학습하는 데 드는 시간(15~30분)보다 길지 않기 때문에 이 정도 시간은 수용 가능한 수준이라고 주장합니다.

요약

이 논문은 저작권 방어자가 이미지에 심어놓은 "보이지 않는 독"을 제거하는 영리한 2단계 트릭을 제시합니다. AI의 내부적인 이해도를 먼저 정화한 다음, 최종 이미지가 원본과 일치하도록 강제함으로써, 거의 모든 현재의 보호 기능을 우회하여 저작권이 있는 이미지를 완벽하게 생성해 낼 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →