← 최신 논문
💬 NLP

Divergence Decoding: Inference-Time Unlearning via Auxiliary Models

이 논문은 소규모 보조 모델을 활용하여 대규모 언어 모델의 로짓(logits)을 민감한 데이터로부터 멀어지도록 유도함으로써, 유용성 손실을 최소화하면서도 텍스트와 이미지 도메인 모두에 적용 가능한 일반화된 솔루션을 제공하고 개인정보 보호 및 저작권 위험을 효과적으로 완화하는 추론 시점의 언러닝(unlearning) 방법론인 디버전스 디코딩(Divergence Decoding)을 소개한다.

원저자: Humzah Merchant, Bradford Levy

게시일 2026-06-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Humzah Merchant, Bradford Levy

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문인 "Divergence Decoding"에 대한 설명을 쉬운 언어와 일상적인 비유를 사용하여 설명해 드립니다.

문제점: "잊지 못하는" 뇌

당신에게 세상의 모든 책을 읽은 아주 똑똑한 사서(거대 언어 모델, LLM)가 있다고 상상해 보세요. 때때로 이 사서는 공유해서는 안 될 특정하고 민감한 세부 정보—예를 들어 개인적인 일기 내용이나 저작권이 있는 이야기—를 암기해 버리곤 합니다.

보통, 만약 당신이 이 사서에게 이 특정 비밀을 "잊게" 만들고 싶다면, 두 가지 나쁜 선택지가 있습니다:

  1. 처음부터 다시 시작하기: 도서관을 통째로 태워버리고 그 책 한 권 없이 처음부터 다시 짓는 것입니다. 여기에는 수백만 달러의 비용과 수년의 시간이 소요됩니다.
  2. 뇌 수술: 사서의 뇌에서 그 기억을 외과적으로 제거하려고 시도하는 것입니다. 이것은 위험합니다. 종종 시를 쓰거나 수학 문제를 푸는 것과 같은 다른 능력까지 실수로 손상시키기 때문입니다(이를 "파괴적 망각"이라고 부릅니다).

해결책: "가이드 독(Guide Dog)" 시스템

이 논문의 저자들은 **Divergence Decoding (DD)**이라는 영리한 새로운 기술을 제안합니다. 사서의 뇌를 바꾸려고 노력하는 대신, 사서는 그대로 둔 채 대화 중에 방향을 잡아줄 두 마리의 작고 전문화된 "가이드 독"을 추가하는 방식입니다.

시스템이 작동하는 방식은 다음과 같습니다:

  1. 사서 (거대 모델): 우리가 사용하는 메인 AI입니다. 비밀을 포함하여 모든 것을 알고 있습니다.
  2. 가이드 독 A ("망각" 모델): 우리가 제거하고자 하는 비밀 정보만을 학습한 아주 작고 저렴한 AI입니다. 이 모델은 그 특정 데이터에 집착합니다.
  3. 가이드 독 B ("기억" 모델): 안전하고 공개된 정보만을 학습한 또 다른 작은 AI입니다. 이 모델은 비밀을 제외한 모든 것을 알고 있습니다.

작동 원리: "스티어링 휠(조향 핸들)"

당신이 사서에게 질문을 던지면, 시스템은 단순히 사서가 대답하게 내버려 두지 않습니다. 대신 두 마리의 가이드 독에게 답이 무엇이어야 할지 묻습니다.

  • 논리: 시스템은 가이드 독 A(비밀에 집착하는 모델)가 말하고 싶어 하는 것과 가이드 독 B(안전한 모델)가 말하고 싶어 하는 것 사이의 차이를 살펴봅니다.
  • 조정: 만약 가이드 독 A가 "비밀을 말해!"라고 소리치고 있고, 가이드 독 B가 "안 돼, 그러지 마!"라고 말하고 있다면, 시스템은 그 차이를 이용하여 사서의 답변을 비밀로부터 멀어지게 하고 안전한 버전 쪽으로 유도합니다.

자동차를 운전하는 것을 상해해 보세요. 사서는 자동차입니다. 가이드 독은 조수석에 앉아 있는 두 사람입니다. 한 사람은 절벽(비밀)을 가리키고 있고, 다른 한 사람은 도로(안전한 답변)를 가리키고 있습니다. 운전자(시스템)는 자동차의 엔진을 다시 만들 필요 없이, 단순히 절벽을 무시하고 도로 방향으로 자동차를 조종합니다.

왜 더 나은가?

  • 뇌 수술 불필요: 메인 사서의 뇌는 손대지 않은 채 유지됩니다. 이는 사서가 다른 작업을 수행하는 능력을 잃지 않음을 의미합니다.
  • 저렴하고 빠름: 두 마리의 작은 가이드 독을 훈련시키는 것은 강아지를 훈련시키는 것과 같아서, 전체 도서관을 다시 짓는 것에 비해 빠르고 저렴합니다.
  • 어려운 질문에도 작동: 이전 방법들은 AI가 문장을 토씨 하나 안 틀리고 그대로 읊는 것은 잘 막았지만, AI가 비밀에 대해 복잡한 질문을 던질 때는 실패했습니다. 이 방법은 가이드 독의 "추론" 능력을 사용하여 AI가 복잡한 방식으로 비밀에 대해 생각하는 것조차 차단합니다.

"영구적인 해결책" (지식 증류, Distillation)

논문에서는 세 개의 모델(사서 + 두 마리의 개)을 동시에 실행하는 것이 약간의 추가 컴퓨터 자원을 소모한다고 언급합니다. 만약 나중에 하나의 모델만 실행할 수 있는 영구적인 해결책을 원한다면, **지식 증류(Distillation)**라는 과정을 사용할 수 있습니다.

사서가 가이드 독의 안내를 받아 비밀 없이 질문에 답하는 완벽한 "컨닝 페이퍼(요약본)"를 작성한다고 상상해 보세요. 그런 다음 당신은 새로운 단일 사서에게 이 컨닝 페이퍼를 암기하도록 가르칩니다. 이제 당신은 가이드 독 없이도 "잊는 법을 배운" 깨끗한 단일 모델을 갖게 됩니다.

효과가 있는가?

저자들은 "망각"에 대한 표준화된 테스트인 두 가지 주요 벤치마크(TOFU 및 MUSE)에서 이 방법을 테스트했습니다.

  • 결과: 이들의 방법은 기존의 모든 "최첨단(state-of-the-art)" 방법들을 이겼습니다. AI의 지능을 유지하면서 비밀을 제거하는 데 더 뛰어났습니다.
  • 텍스트를 넘어: 그들은 이미지 생성(그림 그리기)에도 이 방법을 적용했습니다. AI가 특정 종류의 개를 그리는 법을 "잊도록" 훈련했습니다. 이 방법은 다른 것을 그리는 능력은 망가뜨리지 않으면서도, 해당 개들을 그리지 못하게 하는 데 성공하며 거기에서도 작동했습니다.

요요약

거대하고 복잡한 뇌에서 기억을 지우려고 노력하는 대신(이는 어렵고 위험합니다), 이 논문은 뇌를 그대로 두고 두 마리의 작고 똑똑한 조수를 사용하여 금지된 주제로부터 대화를 부드럽게 돌리는 방법을 제안합니다. 이는 이전 방법들보다 더 저렴하고, 안전하며, 효과적인 "망각을 통한 학습" 접근 방식입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →