← 최신 논문
💻 computer science

Filtering Memorization from Parameter-Space in Diffusion Models

본 논문은 확산 모델 LoRA의 암기 현상을 완화하기 위해 업데이트를 스펙트럼 채널로 분해하고 사전 학습된 백본의 주 부공간(principal subspace)과 약하게 정렬된 채널을 억제함으로써, 생성 품질을 저하시키지 않으면서도 저작권이 있는 콘텐츠나 민감한 콘텐츠의 재현을 줄이는 학습 및 데이터가 필요 없는 프레임워크인 베이스 앵커 필터링(Base-Anchored Filtering, BAF)을 제안한다.

원저자: Yu Zhe, Yang Jiayan, Wei Junhao, Yu-Lin Tsai, Wang Chen

게시일 2026-07-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yu Zhe, Yang Jiayan, Wei Junhao, Yu-Lin Tsai, Wang Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: "복사기"가 되어버린 LoRA

당신에게 세상의 모든 것을 그릴 줄 아는 거장 화가(Stable Diffusion과 같은 확산 모델)가 있다고 상상해 보세요. 이제 한 사용자가 이 화가에게 "포켓몬 스타일로만 그려줘"와 같이 매우 구체적인 화풍을 가르치고 싶어 합니다. 이때 그들은 LoRA(Low-Rank Adaptation)라는 기술을 사용합니다.

LoRA는 거장 화가에게 끼워주는 작고 가벼운 지침서 또는 **스텐실(도안)**이라고 생각하면 됩니다. 이것은 화가에게 "자, 그림을 그릴 때 이것처럼 보이게 만들어"라고 말해주는 역할을 합니다.

문제는 여기서 발생합니다: 가끔 스텐실을 만든 사람이 단순히 화가에게 '스타일'을 가르친 것이 아니라, 실수로(혹은 의도적으로) 훈련 폴더에 있던 특정 사진들을 완벽하게 복제하도록 가르칠 때가 있습니다.

  • 만약 훈련 폴더에 유명한 캐릭터의 저작권이 있는 이미지가 있었다면, 새로운 LoRA는 요청을 받을 때마다 그 캐릭터를 똑같이 찍어낼 수 있습니다.
  • 이것을 **암기(Memorization)**라고 부릅니다. 이는 마치 화가의 머릿속에 새로운 것을 창조하는 대신 훈련 이미지를 그대로 출력해 버리는 숨겨진 복사기가 들어있는 것과 같습니다.

딜레마: 현실 세계에서 사람들은 이러한 LoRA 스텐실을 CivitAI나 Hugging Face 같은 사이트에 공유합니다. 당신이 하나를 다운로드하면, 당신은 스텐실을 얻게 되지만, 원래의 훈련 사진이나 그 스텐실이 어떻게 만들어졌는지에 대한 메모는 얻지 못합니다. 기존의 안전 도구들은 보통 그 복제를 막기 위해 훈련 사진을 직접 보거나 그림이 그려지는 과정을 제어해야 합니다. 하지만 스텐실만 가지고 있다면, 당신은 속수무책으로 당할 수밖에 없습니다.

해결책: BAF (Base-Anchored Filtering, 베이스 고정 필터링)

저자들은 BAF라고 불리는 새로운 방법을 제안합니다. 이는 스텐실이 만들어진 후, 원래의 사진을 전혀 보지 않고도 스텐실을 정화할 수 있는 "훈련이 필요 없고(training-free)", "데이터가 필요 없는(data-free)" 방식입니다.

핵심 아이디어: "방향의 도서관"

BAF가 어떻게 작동하는지 이해하기 위해, 거장 화가의 뇌가 거대한 **방향(벡터)**들의 도서관이라고 상상해 보세요.

  • 주요 통로 (주성분 부공간, Principal Subspace): 이곳은 화가가 일반적인 개념(예: "얼굴을 그리는 법" 또는 "노을을 그리는 법")을 배운, 잘 닦인 주요 경로들입니다. 이 방향들은 거의 모든 이들이 공유하며 일반적인 지식을 나타냅니다.
  • 숨겨진 구석 (암기, Memorization): 화가가 특정하고 독특한 사진(예: 저작권이 있는 특정 이미지)을 암기할 때, 그들은 도서관의 숨겨진 구석에 아주 작고 기묘한 경로를 만들어냅니다. 이 경로는 주요 통로와 연결되지 않는, 오직 그 특정 이미지만을 위해 존재하는 고립되고 "독특한" 방향입니다.

BAF의 작동 방식: "나침반 체크"

BAF는 나침반처럼 작동하여 LoRA 스텐실의 모든 지침을 검사합니다.

  1. 분해 (Decomposition): BAF는 LoRA 지침을 개별적인 "채널"(작은 방향 화살표)로 분해합니다.
  2. 정렬 확인 (The Alignment Check): 각 화살표에 대해 BAF는 다음과 같이 묻습니다. "이 화살표가 거장 화가의 도서관에 있는 '주요 통로'와 같은 방향을 가리키고 있는가?"
    • 높은 정렬 (High Alignment): 만약 화살표가 주요 통로를 따라 향하고 있다면, 그것은 일반적인 스타일(예: "만화처럼 보이게 해줘")을 가르치고 있을 가능성이 높습니다. BAF는 이를 유지합니다.
    • 낮은 정렬 (Low Alignment): 만약 화살표가 메인 라이브러리와 일치하지 않는 이상하고 고립된 구석을 향하고 있다면, 그것은 특정 사진을 암기한 복제본일 가능성이 높습니다. BAF는 이를 의심스러운 것으로 간주합니다.
  3. 필터링 (The Filter): BAF는 기묘한 구석을 향하는 화살표의 볼륨을 줄이거나(삭제하거나) 제거하는 반면, 주요 통로를 향하는 화살표는 그대로 유지합니다.

결과: 더 깨끗해진 스텐실

BAF가 LoRA를 처리한 후에는 다음과 같은 결과가 나타납니다:

  • 좋은 것은 남습니다: 화가는 여전히 요청된 스타일(예: "포켓몬 스타일")로 그림을 그릴 수 있습니다.
  • 나쁜 것은 사라집니다: 화가는 저작권이 있는 특정 훈련 이미지를 그대로 찍어내는 일을 멈춥니다.

왜 특별한가?

다른 대부분의 안전 도구들은 무엇을 차단해야 할지 알기 위해 원본 사진을 봐야 하는 보안 요원과 같습니다. 만약 당신이 사진을 가지고 있지 않다면(다운로드한 LoRA의 경우처럼), 보안 요원은 제 역할을 할 수 없습니다.

BAF는 다릅니다. BAF는 건물의 설계도(LoLO의 가중치)를 보고 이렇게 말하는 구조 엔지니어와 같습니다. "이 벽은 불안정하고 고립된 지반 위에 세워졌군요. 주요 기초를 강화하고 저 불안정한 벽은 제거합시다." BAF는 건물이 어떻게 생겼는지 알 필요가 없습니다. 단지 구조의 기하학적 형태를 알 뿐입니다.

연구 결과 요요약

논문은 이 방법을 다양한 데이터셋(포켓몬, 유명인 얼굴 등)과 다양한 AI 모델에 대해 테스트했습니다. 연구 결과는 다음과 같습니다:

  • BAF는 AI가 특정 훈련 이미지를 복사하는 것을 성공적으로 차단했습니다.
  • BAF는 새로운 이미지의 품질을 망치지 않았습니다. 오히려 "노이즈"가 되는 암기된 방향들이 제거되었기 때문에 때때로 이미지가 더 좋아지기도 했습니다.
  • BAF는 원래의 훈련 데이터 없이도 작동하므로, 인터넷에 공유되는 수천 개의 LoRA를 정화하는 데 완벽합니다.

요약하자면, BAF는 지침이 우주의 일반적인 법칙을 따르는지, 아니면 단 하나의 특정 사진을 복제한 기묘한 복사본인지를 확인함으로써 AI의 지침서에서 "기억"을 깨끗이 씻어내는 도구입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →