← 최신 논문
🤖 machine learning

Temper-Then-Tilt: Principled Unlearning for Generative Models through Tempering and Classifier Guidance

이 논문은 집중된 데이터 분포에서 표준 방식들이 실패하는 문제를 극복하기 위해 분포 템퍼링(distribution tempering)과 분류기 가이던스(classifier guidance)를 결합함으로써, 최소한의 계산 비용으로 우수한 망각 품질과 효용성을 달だけで 달성하며 생성 모델의 머신 언러닝을 개선하는 원칙적인 프레임워크인 Temper-Then-Tilt Unlearning (T3-Unlearning)을 소개한다.

원저자: Jacob L. Block, Mehryar Mohri, Aryan Mokhtari, Sanjay Shakkottai

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jacob L. Block, Mehryar Mohri, Aryan Mokhtari, Sanjay Shakkottai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제의 핵심: "건망증"에 걸린 AI

당신에게는 수백만 권의 책을 읽은 매우 똑똑하고 박식한 사서(생성형 AI 모델)가 있다고 상想像해 보세요. 당신이 질문을 던지면, 그 사서는 자신이 아는 모든 것을 바탕으로 훌륭한 답변을 내놓습니다.

그런데 문득 이런 생각이 듭니다. "잠깐, 저 책들 중에는 더 이상 도서관에 있어서는 안 될 비밀 일기가 있네. 주인은 그 안에 담긴 개인 정보나 저작권이 있는 자료를 삭제하기를 원하고 있어."

당신은 이 사서가 그 특정 책을 **망각(unlearn)**하도록 만들어야 합니다. 그렇다고 도서관 전체를 처음부터 다시 읽게 할 수는 없습니다(시간이 너무 오래 걸리고 비용도 엄청나게 들기 때문입니다). 당신은 다른 모든 것은 완벽하게 기억하면서, 오직 그 특정 책 하나만 잊게 만들고 싶을 뿐입니다.

기존 방식: "안 읽은 척" 하기

이 문제를 해결하려는 일반적인 방법은 사서에게 "그 일기에 대해서는 말하지 마"라고 지시하는 것입니다. 그러면 AI는 그 정보를 억제하기 위해 자신의 뇌를 조정하려고 시도합니다.

결함: 이 논문은 만약 "금지된" 정보가 매우 구체적이고 집중되어 있다면(예: 매우 독특하고 날카로운 이야기를 담은 일기), AI가 혼란을 겪는다고 주장합니다. 이는 마치 흰 벽에 있는 아주 밝은 빨간 점 하나를 지우기 위해, 그 위에 약간 다른 색조의 흰색 페인트를 덧칠하는 것과 같습니다. 빨간 점(기억)이 너무나 선명하고 강렬해서, AI는 결국 그것을 흘려보내게 됩니다. AI는 "그 일기를 기억하지 못합니다"라고 말할 수는 있지만, 그 기억이 뇌 속에서 너무 "시끄럽기" 때문에 실수로 그 일기의 문장을 인용하게 될 수도 있습니다.

새로운 솔루션: T3-Unlearning (Temper-Then-Tilt)

저자들은 T3-Unlearning이라 불리는 영리한 2단계 트릭을 제안합니다. 단순히 기억을 외과적으로 제거하려고 하는 대신, 그들은 사서가 도서관 전체를 "생각하는" 방식을 바꿉니다.

도서관의 지식을 언덕과 골짜기가 있는 지형이라고 생각해 보세요.

  • 높은 언덕 = AI가 매우 확신하는 것들 (예: 비밀 일기).
  • 낮은 골짜기 = AI가 덜 확신하는 것들.

1단계: Temper (템퍼링: "평탄화" 단계)

먼저, 그 지형에 "온도(temperature)"를 적용합니다. 거대한 뜨거운 다리미를 가져와서 도서관의 가장 높은 봉우리들을 부드럽게 눌러 평평하게 만든다고 상상해 보세요.

  • 하는 일: 높은 확신을 가진 날카로운 스파이크들을 평평하게 만듭니다. 비밀 일기는 더 이상 우뚝 솟은 산이 아니라, 작은 언덕이 됩니다.
  • 도움이 되는 이유: 날카로운 봉우리를 평평하게 만듦으로써, AI가 그 특정 정보에 너무 집착하지 않게 만듭니다. 이를 통해 "금지된" 데이터의 강도를 낮추어 관리하기 쉽게 만듭니다.

2단계: Tilt (틸팅: "유도" 단계)

이제 지형이 평평해졌으므로, 작고 가벼운 가이드(단순한 분류기)를 투입합니다. 이 가이드는 어떤 책이 "유지(Keep)" 더미에 속하고 어떤 책이 "망각(Forget)" 더미에 속하는지 정확히 알고 있습니다.

  • 하는 일: 가이드는 사서의 주의를 "망각"할 책들로부터 "유지"할 책들 쪽으로 부드럽게 밀어냅니다. 1단계에서 "망각"할 책들을 이미 평평하게 만들어 놓았기 때문에, 사서가 저항하지 않고도 가이드는 쉽게 그들을 아래로 밀어낼 수 있습니다.
  • 결과: 이제 사서는 "유지"할 책들을 바탕으로 이야기를 생성하며, "망각"할 책들은 효과적으로 침묵하게 됩니다.

이것이 왜 중요한가

이 논문은 만약 1단계(Tempering)를 건너뛰고 2단계(Tilting)만 수행한다면, 금지된 정보가 너무 날카로울 경우 실패할 것이라는 점을 수학적으로 증명합니다. 비밀이 새어 나가는 것(leakage)을 피할 수 없게 됩니다.

하지만 먼저 Tempering을 함으로써, 문제를 매끄럽게 다듬고, AI의 초점을 성공적으로 Tilt 할 수 있게 만듭니다.

장점

  1. 빠르고 저렴합니다: 거대한 AI를 다시 학습시키는 것(도서관을 통째로 재건축하는 것과 같은) 대신, 얼어붙은(frozen) AI 위에 아주 작고 단순한 "가이드"(작은 선형 헤드)만을 학습시킵니다. 이는 전체 직원을 해고하고 새로 채용하는 대신, 새로운 사서 보조를 고용하는 것과 같습니다.
  2. 더 효과적입니다: 테스트(TOFU라는 벤치마크 사용)에서, 이 방법은 AI의 다른 질문 답변 능력을 망가뜨리지 않으면서도 비밀 데이터를 실제로 잊게 만드는 데 훨씬 뛰어난 성능을 보였습니다.
  3. 안전합니다: 수학적으로 이 방법은 금지된 데이터가 매우 구체적이고 강렬하더라도 AI가 실수로 비밀을 유출하지 않음을 보장합니다.

요약 비유

당신이 시끄럽고 짜증 나는 알람 시계(비밀 데이터)가 당신을 깨우지 못하게 막으려고 한다고 상상해 보세요.

  • 기존 방식: 알람 위에 베개를 덮어 씌우려고 합니다. 하지만 그 아래에서는 여전히 소리가 크며, 때때로 소리가 뚫고 나옵니다.
  • T3-Unlearning: 먼저 볼륨 조절 다이 {음량 조절기}를 돌려 소리를 줄입니다 (Temper). 이제 알람은 그저 작은 삐 소리에 불과합니다. 그다음, 알람을 방의 반대편으로 부드럽게 옮깁니다 (Tilt). 이제 당신은 평온하게 잠들 수 있고, 알람은 효과적으로 사라졌지만, 당신의 다른 감각들(AI의 나머지 지식)은 여전히 예리하고 정상적으로 작동합니다.

논문은 알람을 옮기기 전에 반드시 먼저 볼륨을 줄여야 하며, 그렇지 않으면 소음이 항상 새어 나올 것이라는 점을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →