← 최신 논문
🤖 machine learning

TILDE: TILt-based Distributional Erasure for Concept Unlearning

본 논문은 텍스트-이미지 확산 모델의 개념 망각(concept unlearning)을 위한 새로운 프레임워크인 TILDE를 제안하며, 이는 무해한 데이터에 대한 모델의 품질, 다양성 및 의미적 범위를 보존하면서 원치 않는 개념을 효과적으로 억제하기 위해 해당 과업을 분포 정렬 문제로 정식화한다.

원저자: Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji

게시일 2026-07-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 세상의 모든 요리를 배운 마스터 셰프가 있다고 상상해 보세요. 이 셰프는 특정하고 논란이 될 만한 식재료(예를 들어, "매운 고스트 페퍼")에 대한 레시피까지 모두 알고 있습니다. 그런데 이제 당신은 이 셰프의 레시퍼리에서 그 재료를 완전히 제거하고 싶습니다.

문제는 까다롭습니다. 만약 당신이 단순히 셰프에게 "고스트 페퍼 요리를 하지 마세요"라고 말한다면, 셰프는 혼란에 빠져 다른 요리들까지 망칠 수도 있습니다. 예를 들어, 고스트 페퍼가 빨간색이라는 이유로 일반 토마토 수프를 만드는 법을 잊어버리거나, 매콤한 요리 자체를 아예 못 하게 될 수도 있습니다. 이것이 바로 AI 이미지 생성기에서의 **개념 망각(Concept Unlearning)**이 직면한 핵심 과제입니다. 즉, 어떻게 하면 다른 모든 것을 만드는 능력은 유지하면서 특정 대상(예: 유명인의 얼굴, 특정 작가의 화풍, 또는 저작권이 있는 캐릭터)을 잊게 만들 것인가 하는 문제입니다.

이 논문은 이를 해결하기 위해 TILDE(TILt-based Distributional Erasure)라는 새로운 방법을 소개합니다. 이해를 돕기 위해 쉬운 비유를 들어 설명하겠습니다.

1. 기존 방식: "식탁을 부수기" vs "덧칠하기"

이전 방법들은 개념을 망각시키기 위해 크게 두 가지 방식을 시도했으나, 둘 다 결함이 있었습니다.

  • 직접 억제(Direct Suppression): 셰프가 고스트 페퍼 양념통에 손을 뻗을 때마다 "안 돼!"라고 소리치며 고스트 페퍼 요리를 못 하게 하는 방식입니다. 이 방식은 종종 셰프를 긴장하게 만들어, 일반적인 칠리 같은 좋은 요리까지 포함하여 '매운 요리' 전체를 못 하게 만드는 부작용을 낳습니다.
  • 앵커 교체(Anchor Replacement): 셰프에게 "고스트 페퍼 대신 일반 페퍼를 사용하세요"라고 말하는 방식입니다. 이 방식은 작동은 하지만, 셰프의 스타일을 강제로 "일반 페퍼" 요리에 맞추도록 강요합니다. 이는 마치 화가에게 반 고흐를 그리지 말라고 하면서 동시에 모네의 화풍으로 그리라고 강요하는 것과 같습니다.

2. TILDE의 솔루션: "보이지 않는 필터"

TILDE는 다른 접근 방식을 취합니다. "안 돼"라고 소리치거나 새로운 스타일을 강요하는 대신, 셰프의 마음 위에 스마트한 필터를 만듭니다.

AI의 지식을 광활한 이미지의 풍경이라고 생각해 보세요.

  • "고스트 페퍼" 구역: 원치 않는 개념의 이미지들이 존재하는 풍경 속 특정 영역입니다.
  • "안전한" 구역: 그 외의 모든 곳은 아름답고 안전한 이미지들로 가득 차 있습니다.

TILDE는 "고스트 페퍼" 구역을 삭제하거나 셰프를 특정 "일반 페퍼" 구역으로 강제로 이동시키려 하지 않습니다. 대신, 풍경을 부드럽게 기울입니다(tilt).

  • "고스트 페퍼" 구역을 셰프가 자연스럽게 미끄러져 내려오게 되는 가파르고 미끄러운 언덕처럼 만듭니다.
  • 결정적으로, 나머지 풍경은 기울이지 않습니다. "안전한" 구역은 여전히 평평하고 편안합니다.

이것을 **"분포 정렬(Distributional Alignment)"**이라고 합니다. 목표는 새로운 목적지를 찾는 것이 아니라, 나머지 지도는 정확히 그대로 유지하면서 원치 않는 목적지에는 도달할 수 없도록 만드는 것입니다.

3. 무엇을 피해야 할지 아는 방법: "CLIP 점수"

AI는 어떤 이미지가 "고스트 페퍼"이고 어떤 이미지가 그냥 "빨간 토마토"인지 어떻게 구분할까요?
TILDE는 CLIP(텍스트와 이미지 사이의 연결 고리를 이해하는 시스템)을 보안 요원으로 사용합니다.

  • 보안 요원은 원치 않는 개념에 대한 설명 목록(예: "피카츄", "노란색 포켓몬")을 가지고 있습니다.
  • AI가 이미지를 생성할 때, 보안 요원은 확인합니다: "이것이 피카츄처럼 보이는가?"
  • 임계값(Threshold): 이것이 핵심 비법입니다. 보안 요원은 이미지가 매우 명확하게 피카츄일 때만 경보를 울립니다. 만약 이미지가 그저 "노란색 만화 캐릭터"일 뿐 피카츄와 완전히 일치하지 않는다면, 보안 요원은 "괜찮으니 계속 진행하세요"라고 말합니다.
  • 이를 통해 AI가 금지된 개념과 약간 닮았다는 이유만으로 무고한 이미지까지 처벌하는 것을 방지합니다.

4. 학습 과정: "교정 학습하기"

셰프를 처음부터 다시 교육하는 대신(시간이 너무 오래 걸립니다), TILDE는 Residual GFlowNet이라는 기술을 사용합니다.

  • 셰프는 이미 99%의 요리를 완벽하게 할 줄 압니다.
  • TILDE는 오직 셰프에게 교정 사항을 속삭여 주는 역할만 하는 작은 조수(리시듀얼 네트워크)만을 훈련시킵니다.
  • 만약 셰프가 "고스트 페퍼" 요리 쪽으로 향하려 하면, 조수가 속삭입니다. "잠깐, 그 길은 금지된 구역으로 이어지니 왼쪽으로 살짝 방향을 트세요."
  • 만약 셰프가 안전한 요리를 하고 있다면, 조수는 침묵을 지킵니다.
  • 조수는 오직 교정 사항만을 속삭이기 때문에, 셰프의 원래 기술은 온전히 유지되며 안전한 요리 만드는 법을 잊어버리지 않습니다.

결과

이 논문은 특정 작가(반 고흐), 캐릭터(피카츄), 또는 사물을 제거하는 테스트를 진행했습니다.

  • 성공: TILDE는 원치 않는 개념을 생성하는 것을 성공적으로 차단했습니다(거의 100% 성공).
  • 부수적 피해 없음: 다른 방법들과 달리, TILDE는 관련 있는 것을 생성하는 AI의 능력을 망가뜨리지 않았습니다. 예를 들어, "반 고흐"를 망각시킨 후에도 AI는 "인상주의" 스타일의 예술을 완벽하게 그려낼 수 있었습니다.
  • 다양성: AI가 "지루해져서" 한 가지 종류의 안전한 이미지만 만드는 것이 아니라, 원래의 다양한 출력물을 그대로 유지했습니다.

요약

TILDE는 AI를 특정 원치 않는 아이디어로부터 멀어지도록 유도하면서도, 그것을 새로운 아이디어로 강제 밀어넣거나 다른 모든 것을 수행하는 능력을 망가뜨리지 않는 부드럽고 보이지 않는 손과 같습니다. 이는 나쁜 이미지를 생성할 확률을 거의 제로로 "기울임(tilt)"으로써 달성하며, 동시에 모든 좋은 이미지의 확률은 이전과 똑같이 유지합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →