Fingerprinting Text-to-Image Diffusion Models via Collapsed Generation
이 논문은 특정 입력 조건이 확률적 시드에 관계없이 일관되게 동일한 이미지를 생성하는 모델 특이적 현상인 "붕괴된 생성(collapsed generation)"을 활용하여, 침습적인 워터마크 없이도 화이트박스 및 블랙박스 설정 모두에서 신뢰할 수 있는 소유권 탐지를 가능하게 하는 텍스트-투-이미지 확산 모델의 소유권 검증을 위한 비침습적 프레임워크를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
예술가들이 단순히 붓으로 그림을 그리는 것이 아니라, 마법의 단어로 그림을 그리는 세상을 상상해 보십시오. 당신이 "피자를 먹는 사이버펑크 고양이"와 같은 문장을 입력하면, 컴퓨터는 즉시 완전히 새로운 고해상도 이미지를 만들어냅니다. 이것이 바로 최신 AI 아트 열풍의 배후에 있는 디지털 마법사, **텍스트-투-이미지 확산 모델(Text-to-Image Diffusion Models)**의 영역입니다. 이 모델들은 화면 가득한 정적 노이즈(신호가 없는 옛날 TV와 같은 상태)에서 시작하여, 단계별로 조금씩 노이즈를 제거하며 선명한 이미지가 나타날 때까지 정제하는 방식으로 작동합니다. 이 모델들은 매우 강력하기 때문에, 기업들은 이를 서비스로 판매하거나 다른 사람들이 사용할 수 있도록 "레시피"(모델 파일)를 공유하기도 합니다. 하지만 여기서 까다로운 문제가 발생합니다. 만약 누군가 회사의 비밀 레시피를 훔치거나, 그것을 약간 수정하여 자신의 것처럼 판매한다면, 원래 소유자는 그것이 자신의 것임을 어떻게 증명할 수 있을까요? 도둑이 코드를 숨겨버리면 내부를 들여다볼 수 없고, 예술성을 해치지 않으면서 비밀스러운 디지털 워터마크를 심기 위해 모델을 변경하는 것도 항상 가능한 일은 아닙니다. 그들은 모델이 무엇을 수행하는지를 관찰함으로써 도둑을 잡을 방법이 필요합니다.
이 논문은 **"붕괴된 생성(Collapsed Generation)"**이라는 영리하고 새로운 탐정 기술을 소개합니다. 이것은 마치 AI를 위한 성격 테스트와 같습니다. 보통 AI에게 같은 단어를 사용하되 서로 다른 무작위 시작점(주사위를 던지는 것과 같은)을 사용하여 다섯 번 그림을 그려달라고 요청하면, 다섯 개의 완전히 다르고 독특한 이미지를 얻게 됩니다. 이는 요리사에게 버거를 다섯 번 만들어 달라고 요청하는 것과 같으며, 당신은 다섯 개의 약간씩 다른 버거를 기대할 것입니다. 그러나 연구자들은 특정 특정 단어들에 대해 일부 AI 모델이 루프(loop)에 빠진다는 사실을 발견했습니다. 주사위를 몇 번을 던지더라도, 모델은 매번 거의 똑같은 이미지를 만들어냅니다. 마치 요리사에게 "버거"를 요청했을 때, 갑자기 레시피를 다양하게 만드는 법을 잊어버리고 다섯 번 연속으로 동일한 버거를 내놓는 것과 같습니다. 이 논문은 이러한 기이하고 반복적인 행동이 해당 특정 모델의 학습에 따른 고유한 지문이라고 제안합니다. 만약 당신이 적절한 질문을 던졌을 때 이 "동일한 버거" 이미지를 만들어내는 의심스러운 모델을 찾아낸다면, 그 모델이 비록 외형을 숨겼더라도 원래 소유자의 비밀 레시피를 사용했다는 것을 잡아낸 것입니다.
탐정의 새로운 도구: AI의 말을 더듬는 현상을 포착하다
푸단 대학교를 포함한 연구팀은 이러한 "더듬거림" 또는 붕괴된 생성이 버그가 아니라, 모델이 학습하는 방식의 하나의 특징이라는 점을 깨달았습니다. 모델이 훈련 데이터로부터 특정 패턴을 암기할 때, 때때로 특정 프롬프트에 대해 창의성을 발휘하는 능력을 상실하곤 합니다. 다양한 가능성을 탐색하는 대신, 모델은 단 하나의 매우 일관된 결과물로 붕괴됩니다. 연구팀은 이러한 행동이 마치 고유한 음성 지문과 같다는 것을 알아냈습니다. 두 사람이 같은 문장을 말하더라도 서로 다른 억양을 가질 수 있듯이, 서로 다른 데이터로 학습된 두 AI 모델은 동일한 프롬프트에 대해 다르게 반응할 것입니다. 하나는 혼란스럽고 다양한 이미지 세트를 생성하는 반면, "도난당한" 모델은 지루할 정도로 동일한 이미지 세트를 생성할 수 있습니다.
이 논문은 소유권을 증명하기 위한 두 단계의 '잡기 놀이(cat and mouse)'를 제안합니다. 먼저, 원래 소의 주인(탐정)은 자신의 모델에서 이 더듬거림을 유발하는 "마법의 단어"나 "마법의 설정"을 찾아내야 합니다. 그들은 의심스러운 대상에 대한 접근 권한이 어느 정도인지에 따라 두 가지 방식으로 이를 수행합니다.
- "화이트박스(White-Box)" 접근 방식 (내부자): 만약 탐정이 모델의 내부 기어(예: 도둑이 코드를 유출한 경우)를 볼 수 있다면, 컴퓨터를 사용하여 모델을 더듬거리게 만드는 완벽한 "임베딩"(프롬프트의 디지털 버전)을 수학적으로 찾아낼 수 있습니다. 이들은 최종 이미지를 기다릴 필요 없이, 모델이 과정 초기에 막히는 것을 볼 수 있으므로 엄청난 양의 컴퓨터 자원을 절약할 수 있습니다.
- "블랙박스(Black-Box)" 접근 방식 (외부자): 만약 의심스러운 모델이 텍스트를 입력하면 이미지를 돌려주는 웹사이트나 앱 뒤에 숨겨져 있다면, 탐정은 내부 기어를 수정할 수 없습니다. 대신, 그들은 원래의 훈련 데이터를 뒤져서 이미 모델을 더듬거리게 만드는 실제 자연스러운 문장들을 찾아냅니다. 그들은 이러한 "더듬거리는 프롬프트"가 모델이 매우 쉽게 학습한 이미지(학습 중 "손실(loss)"이 낮은 이미지)와 연관되어 있다는 것을 발견했습니다. 이러한 자연스러운 문장들을 테스트함으로써, 그들은 의심스러운 모델 또한 그 문장들에서 더듬거리는지 확인할 수 있습니다.
판결: 복제품인가?
탐정은 자신의 "더씀거림 트리거" 목록을 확보한 후, 의심스러운 모델을 테스트합니다. 탐정은 주사위(무작위 시드)를 바꾸며 이 트리거들을 사용하여 이미지를 생성하도록 의심스러운 모델에게 요청합니다. 만약 의심스러운 모델이 복제품이라면, 원래 모델과 마찬가지로 거의 동일한 이미지 더미를 만들어낼 것입니다. 만약 그것이 전혀 관련 없는 다른 모델이라면, 모델이 해당 특정 프롬프트에 대한 동일한 "기억"을 공유하지 않음을 보여주는 무질서하고 다양한 이미지 더미를 생성할 것입니다.
연구진은 구형 "UNet" 설계와 신형 "Transformer" 설계를 포함한 여러 유형의 AI 모델에 대해 이 아이디어를 테스트했습니다. 그들은 이 방법이 매우 효과적이라는 것을 발견했습니다. 이 방법은 겉보기에 비슷해 보이더라도 별도로 학습된 두 모델을 구별해 낼 수 있습니다. 더 중요한 것은, 이 지문이 파괴하기 어렵다는 점입니다. 설령 도둑이 다음과 같은 방법으로 흔적을 숨기려 해도 말입니다:
- 파인 튜닝(Fine-tuning) (모델에게 새로운 기술을 가르침),
- 프루닝(Pruning) (모델을 작게 만들기 위해 일부를 잘라냄),
- 양자화(Quantization) (모델이 사용하는 숫자를 단순화함),
- 또는 결과를 **은폐(Obfuscate)**하려고 시도하는 것까지,
... "더듬거리는" 행동은 종종 살아남습니다. 논문은 도둑을 잡기 위해 수백만 번의 질문을 던질 필요가 없으며, 적절한 수의 테스트만으로도 통계적으로 강력한 답변을 얻을 수 있다고 보여줍니다.
이것이 의미하는 바 (그리고 그렇지 않은 것)
논문은 이것이 모든 저작권 문제를 즉각 해결하는 마법 지팡이는 아니라는 점을 분명히 하고 있습니다. 이 방법이 도난을 막을 수 있다고 주장하거나, 모든 모델에 이러한 지문이 존재한다고 주장하는 것도 아닙니다(다만 테스트한 모델들에서는 발견되었습니다). 또한 "화이트박스" 방식은 매우 효율적이지만, "블랙박스" 방식은 적절한 자연스러운 프롬프트를 찾는 것에 의존하며, 이는 마치 건더기 속에서 바늘 찾기와 같을 수 있지만, "낮은 손실(low-loss)" 샘플을 조사하는 그들의 방식 덕분에 훨씬 빨라졌다고 언급합니다.
결정적으로, 저자들은 소유권을 증명하기 위해 모델 내부에 비밀스러운 워터마크를 심어야 한다는 생각에 반론을 제합니다. 그들은 모델의 고유한 행동, 즉 특정 입력에 대해 루프에 빠지는 경향 자체가 충분한 증거가 된다는 것을 보여줍니다. 이는 모델을 보호하기 위해 모델을 변경할 필요가 없다는 점에서 매우 중요한 의미를 갖습니다. 그저 모델이 어떻게 행동하는지를 관찰하기만 하면 됩니다.
결론적으로, 이 연구는 붕괴된 생성이 AI 아트 모델의 소유권을 검증하는 신뢰할 수 있고 비침습적인 방법임을 시사합니다. 이는 모델의 독특한 특성을 하나의 서명으로 바꿉니다. 만약 어떤 모델이 창의적이어야 할 순간에 똑같은 그림을 반복해서 만들어낸다면, 도둑이 아무리 가사를 바꾸려 애써도 그 모델은 결국 원래 소유자의 노래를 부르고 있는 것일지도 모릅니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.