← 최신 논문
🤖 machine learning

Concept Unlearning via Cross-Attention Activation Projection for Diffusion Models

본 논문은 재구문화 및 적대적 프롬프트 하에서 확산 모델의 목표 개념을 효과적으로 소거하면서 유지된 개념의 생성은 보존하기 위해 활성화 공간 표현에 기반하여 교차 주의 키 및 값 가중치를 투영하는 폐형식 개념 망각 방법인 PURE 를 제안한다.

원저자: Saemi Moon, Suhyeon Jun, Seoyeon Lee, Dongwoo Kim

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Saemi Moon, Suhyeon Jun, Seoyeon Lee, Dongwoo Kim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 세상의 모든 것을 그리는 법을 배운 천재적인 예술가 (AI) 가 있다고 가정해 봅시다. 하지만 안전이나 법적 이유로 인해, 이 예술가에게 특정 사물, 예를 들어 유명한 만화 캐릭터 (피카츄) 나 특정 화풍 (반 고흐) 을 그리는 법을 잊게 만들어야 합니다.

어려운 점은 무엇일까요? 바로 예술가가 그 외의 모든 것을 잊지 않도록 해야 한다는 것입니다. 여전히 미키 마우스, 마리오, 또는 풍경화를 잘 그릴 수 있어야 합니다.

이 논문은 처음부터 예술가를 다시 훈련시키지 않고도 이러한 특정 개념들을 "잊게" 만드는 새롭고 영리한 방법을 소개합니다. 간단한 비유로 설명해 보겠습니다.

문제: "이름표" 실수

이전 방법들은 예술가가 이름표를 보고 잊게 하려고 시도했습니다.

  • 작동 방식: 예술가에게 "피카츄"를 잊게 하려면, 컴퓨터는 "피카츄의 사진"이나 "피카츄의 그림"과 같은 프롬프트를 살펴봅니다. 그리고 텍스트에서 "피카츄" 부분을 찾아 예술가의 뇌에서 해당 특정 텍스트 패턴을 삭제하려고 시도합니다.
  • 결함: 이는 친구의 이름을 금지함으로써 그 친구를 인식하지 못하게 하려는 것과 같습니다. 예술가에게 "빨간 볼을 가진 노란색 전기 생쥐를 그려라"라고 말하면, 예술가는 "오, '피카츄'가 뭔지는 모르겠지만 그 설명을 그리는 법은 알아요!"라고 답합니다. 이름을 금지했음에도 불구하고 예술가는 여전히 피카츄를 그립니다. 이전 방법들은 단어에만 너무 집중하여 개념을 놓쳤습니다.

해결책: "스케치 과정"을 지켜보기

저자 사이미 문 (Saemi Moon) 과 그의 팀은 예술가가 이름표만 보는 것이 아니라 실제 스케치 과정을 본다는 사실을 깨달았습니다.

  • 새로운 아이디어: 텍스트 프롬프트를 보는 대신, 예술가가 실제로 이미지를 그리는 동안 예술가의 내부 "붓질" (교차 주의 활성화, cross-attention activations이라고 함) 을 관찰했습니다.
  • 비유: 예술가가 그림을 그리고 있다고 상상해 보세요.
    • 이전 방법: 주문서를 보고 "피카츄"라는 단어를 지우라고 말합니다.
    • 새로운 방법 (PURE): 예술가가 노란 귀와 빨간 볼을 그리는 동안 예술가의 손을 지켜봅니다. 예술가의 손이 어떻게 움직여 그 특정 특징들을 만들어내는지 정확히 봅니다. 그런 다음 예술가가 다시 그 특징들을 그리려고 시도할 때마다 그 특정 동작에서 손을 부드럽게 돌려놓습니다.

예술가의 손 움직임 (활성화) 이 실제로 이미지를 생성하기 때문에, 단어만 차단하는 것보다 그 특정 움직임을 차단하는 것이 훨씬 효과적입니다. 이름을 사용하지 않고도 천 가지 다른 방식으로 설명하더라도 피카츄를 그리는 것을 막을 수 있습니다.

어떻게 구현했는지 ("한 번의 수정")

이 논문은 PURE라는 방법을 제안합니다. 이는 "폐형 (closed-form)"으로, 긴 훈련 과정이 아닌 한 번에 끝나는 빠른 수학적 수정이라는 뜻입니다.

  1. 관찰: 예술가에게 몇 가지 "피카츄" 프롬프트를 그리게 하고, 그림 과정의 모든 층에서 사용된 특정 손 움직임 (활성화) 을 기록했습니다.
  2. 지도: 이러한 움직임들의 "지도"를 만들었습니다. 이 지도는 예술가가 잊고자 하는 것을 그릴 때 정확히 무엇을 하는지 보여줍니다.
  3. 편집: 예술가의 뇌에 단일한 수학적 "필터"를 적용했습니다. 이 필터는 다음과 같이 말합니다. "손이 '피카츄' 방향으로 움직이려 하면 멈춰라. 하지만 '마리오'나 '풍경' 방향으로 움직이려 하면 계속하라."
  4. 결과: 예술가는 즉시 대상 개념을 그리는 법을 잊지만, 다른 모든 기술은 완벽하게 유지됩니다.

왜 더 나은가

이 논문은 "전체적 망각 벤치마크 (Holistic Unlearning Benchmark)" (스타일, 유명인, 만화 캐릭터 등 10 가지 다른 개념을 포함하는 테스트) 를 사용하여 이 방법을 다른 방법들과 비교 테스트했습니다.

  • 더 나은 망각: PURE 는 사람들이 "노란색 전기 설치류"와 같은 교묘하고 재구성된 설명을 사용하더라도 예술가가 금지된 개념을 그리지 못하게 막았습니다.
  • 더 나은 기억: 피카츄를 금지하려다 미키 마우스를 그리는 법을 잊게 만드는 등 다른 방법들이 실수로 예술가가 다른 것들도 잊게 만든 것과 달리, PURE 는 예술가의 다른 기술들을 날카롭게 유지했습니다.
  • 추가 비용 없음: 빠른 수학적 편집이기 때문에 예술가의 속도를 늦추거나 값비싼 재훈련을 요구하지 않습니다.

한 마디로 요약하면

이전 방법들은 사전에서 단어를 지우면서 기억을 지우려 했던 것과 같습니다. 새로운 방법 (PURE) 은 예술가에게 특정 손짓을 하지 않도록 가르치는 것과 같습니다. 그 손짓이 실제로 그림을 만들기 때문에, 이 접근 방식은 속이기 훨씬 어렵고 예술가의 다른 재능은 완전히 건드리지 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →