← 최신 논문
🤖 AI

Look But Don't Touch with Sparse Autoencoders for Unlearning in Diffusion Models

이 논문은 희소 오토인코더(Sparse Autoencoders)가 확산 모델(diffusion models)에서 의미론적 개념을 효과적으로 탐지하지만, 이러한 특징들을 이용한 직접적인 잠재 변수 개입(latent intervention)이 시각적 아티팩트를 유발한다는 점을 입증하며, 모델의 활성화 통계량을 보존함으로써 더 우수한 객체 삭제를 달성하는 탐지 기반 대체 전략을 제안한다.

원저자: Enrico Cassano, Riccardo Renzulli, Rayyan Ahmed, Marco Grangetto, Stephan Alaniz

게시일 2026-07-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Enrico Cassano, Riccardo Renzulli, Rayyan Ahmed, Marco Grangetto, Stephan Alaniz

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신에게는 당신이 묘사하는 무엇이든 그려낼 수 있는 마법의 붓(디퓨전 모델)이 있습니다. 하지만 가끔은, 모델 전체를 처음부터 다시 학습시키지 않고도 말이나 저작권이 있는 캐릭터처럼 특정 사물을 그리는 법을 '잊게' 만들고 싶을 때가 있습니다. 이 과정을 '언러닝(unlearning, 망각)'이라고 부릅니다.

최 최근 연구자들은 이 붓을 돕기 위해 **희소 오토인코더(Sparse Autoencoder, SAE)**라는 특별한 도구를 사용해 보았습니다. SAE는 마치 매우 조직적인 사서와 같아서, 예술가의 뇌(모델의 내부 데이터)를 들여다보고 말이 그려지는 데 책임이 있는 특정 '생각'이나 '뉴런'이 정확히 어디인지 지목할 수 있습니다.

문제점: "보기만 하고 만지지는 마라 (Look But Don't Touch)"

연구자들은 다음과 같은 전략을 시도했습니다. 예술가에게 이렇게 말하는 것이죠. "이봐, 네가 지금 말을 생각하고 있는 게 보여. 그 생각을 멈춰!" 그들은 예술가의 뇌 속에서 그 특정 '말의 생각'에 대한 볼륨을 직접 줄이는 방식으로 이를 시도했습니다.

결과는 재앙이었습니다.

논문에서는 이를 **"Look But Don't Touch"**라고 부릅니다.

  • Look (보기): SAE는 말의 생각을 찾아내는 데 탁-월했습니다. 그것이 정확히 어디에 있는지 완벽하게 알고 있었습니다.
  • Don't Touch (만지지 마라): 하지만 그 생각을 바꾸려고 시도하자, 예술가의 뇌는 혼란에 빠졌습니다. '말의 생각'은 정체불명의 노이즈(out-of-distribution noise)로 대체되었습니다.

비유: 영화를 편집한다고 상상해 보세요. 당신은 말이 등장하는 정확한 프레임을 찾아냈습니다. 하지만 단순히 말을 잘라내는 대신, 영화 필름 전체에서 말의 색상을 '빼버리려고' 시도합니다. 그 결과는 말이 없는 깨끗한 장면이 아니라, 하늘은 보라색으로 변하고 풀밭은 노이즈처럼 보이는 글리치(glitch) 가득한 엉망진창이 됩니다. 예술가의 뇌는 한 번도 본 적 없는 상태로 내몰렸고, 이는 심각한 시각적 아티팩트(글리치)를 만들어냈습니다.

해결책: 패치 임베딩 교체 (Patch Embedding Replacement, PER)

저자들은 SAE가 훌륭한 '지우개'는 될 수 없지만, 아주 뛰어난 '탐지기'라는 사실을 깨달았습니다. 그래서 전략을 완전히 바꿨습니다.

예술가의 내부적인 생각을 직접 조작하는 대신, SAE를 오직 말을 찾아내는 데만 사용하기로 했습니다. SAE가 "이 이미지의 특정 패치에 말이 있다"라고 말하면, 연구자들은 단순히 그 패치를 동일한 이미지 내에서 말이 없는 깨끗한 패치로 **교체(swap)**해 버리는 것입니다.

비유:
사람들로 북적이는 공원 사진을 편집하면서 특정 인물(말)을 제거하고 싶다고 상상해 보세요.

  • 기존 방식 (Steering): 당신은 마법 지팡이를 사용해 그 사람을 '없던 일'로 만들려고 합니다. 하지만 지팡이가 오작동하여, 그 사람의 얼굴이 배경 속으로 녹아내리며 사진 전체를 망쳐버립니다.
  • 새로운 방식 (PER): 당신은 SAE를 사용하여 손가락으로 그 사람을 가리킵니다. 그런 다음, 같은 사진의 다른 부분에서 가져온 깨끗하고 빈 풀밭 조각을 그 사람 위에 덮어씌웁니다. 이미 존재하는, 그리고 완벽하게 어울리는 조각을 사용하기 때문에 결과는 자연스럽습니다. 글리치도, 이상한 색상도 없습니다.

핵심 발견

  1. 탐지는 쉽지만, 조작은 어렵다: 이 논문은 SAE가 이미지 안에 무엇이 있는지 식별하는 데는 뛰어나지만, 그것을 제거하기 위해 모델을 직접 제어하는 데는 서투르다는 것을 증명합니다. 직접적인 조작은 모델의 내부 로직을 파괴합니다.
  2. "교체(Swap)"가 더 효과적이다: SAE를 오직 대상을 찾는 용도로만 사용하고 이미지 조각(패치)을 교체함으로써, 훨씬 더 깔끔한 결과를 얻었습니다.
  3. 추측할 필요가 없다: 기존 방식은 '말의 생각'을 얼마나 줄일지 결정하기 위해 수십 가지의 강도 설정을 시도하는 지루한 '그리드 탐색(grid search)'이 필요했습니다. 새로운 방식은 이러한 시행착오 없이 자동으로 작동합니다.
  4. 더 나은 결과: "UnlearnCanvas"라는 테스트에서, 이들의 새로운 방식은 이전 방식들보다 훨씬 덜 글리치하며(아티팩트가 적음), 이미지의 다른 부분(스타일이나 배경 등)을 훨씬 더 온전하게 유지했습니다.

요약

이 논문은 AI 제어에 관한 귀중한 교훈을 줍니다. 모델 내부에서 어떤 개념을 찾아낼 수 있다고 해서, 그것을 직접 수정하려고 해서는 안 된다는 것입니다. 때로는 무언가를 제거하는 가장 좋은 방법은, AI가 자신의 역할을 다해 원치 않는 항목을 찾아내게 한 뒤, AI의 뇌에게 그 개념을 '생각하지 말라'고 강요하는 대신 이미 잘 어울리는 다른 것으로 그 특정 부분을 교체하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →