← 최신 논문
💬 NLP

Less is More: Geometric Unlearning for LLMs with Minimal Data Disclosure

본 논문은 최소한의 참조 프롬프트에서 추출한 컴팩트한 안전 기하학에 프롬프트 시 계획 상태를 투영하여 원본 학습 데이터에 접근하지 않고도 대규모 언어 모델에서 특정 콘텐츠를 효과적으로 제거함으로써 강력한 대상 억제를 달성하면서 일반적 유용성은 유지하는 새로운 방법인 기하학적 망각 (Geometric Unlearning, GU) 을 소개합니다.

원저자: Chenchen Tan, Xinghao Li, Shujie Cui, Youyang Qu, Cunjian Chen, Longxiang Gao

게시일 2026-05-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chenchen Tan, Xinghao Li, Shujie Cui, Youyang Qu, Cunjian Chen, Longxiang Gao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 수백만 권의 책을 암기해 둔 매우 똑똑하고 독서량이 풍부한 사서 (대형 언어 모델, 즉 LLM) 가 있다고 가정해 봅시다. 어느 날 한 사용자가 그 사서에게 특정 인물이나 주제에 대해 "잊어달라"고 요청합니다. 아마도 그 인물이 자신의 데이터 삭제를 요청했거나, 해당 정보가 민감하기 때문일 것입니다.

기존 방법의 문제점
일반적으로 사서에게 무언가를 잊게 하려면 원래 도서관 아카이브 (학습 데이터) 로 돌아가서 그 인물을 언급한 모든 책을 찾아내어, 해당 페이지를 물리적으로 찢어내거나 책을 다시 써야 합니다.

  • 문제점: 현실 세계에서는 서비스 제공자들이 개인정보 보호법이나 라이선스 문제로 인해 원래 아카이브에 접근하지 못하는 경우가 많습니다. 설령 접근할 수 있다 하더라도, 민감한 정보를 찾기 위해 아카이브를 뒤지는 과정에서 해당 개인정보가 다시 노출될 위험이 있습니다.
  • 부작용: 도서관에서 페이지를 찢어내려 할 때, 종종 선반을 손상시키거나 사서가 다른 것에 대해 이야기하는 방법까지 잊어버리게 만들기도 합니다.

새로운 해결책: "기하학적 망각" (Geometric Unlearning, GU)
이 논문은 기하학적 망각이라는 교묘한 트릭을 제안합니다. 이는 도서관 아카이브로 돌아가는 대신, 질문을 받을 때 사서가 특정 주제에 대해 생각하는 방식을 즉시 변경하는 것입니다.

간단한 비유를 통해 작동 원리를 설명해 보겠습니다:

1. "안전 구역" 지도 (기하학)

사서의 뇌를 거대한 3 차원 지도로 상상해 보세요. 모든 생각은 지도상의 특정 위치에 자리 잡고 있습니다.

  • 일반적인 생각: 사서가 "요리"에 대해 생각할 때, 지도상의 "부엌" 위치로 이동합니다. "역사"에 대해 생각할 때는 "박물관" 위치로 이동합니다.
  • "잊기" 위치: 연구자들은 먼저 "모르겠다"거나 "그것에 대해 이야기할 수 없다"고 말하는 안전한 예시들을 사서에게 몇 가지 보여줍니다. 그리고 이러한 "안전한 거절" 생각들이 뇌의 3 차원 공간에서 정확히 어디에 위치하는지 매핑합니다. 이를 **"안전 구역"**이라고 부르겠습니다.

2. "앵커" 트릭 (최소한의 데이터)

사서에게 잊는 법을 가르치기 위해 수천 권의 책이 필요한 대신, 몇 개의 "앵커"만 있으면 됩니다.

  • 앵커는 잊고 싶은 인물이나 주제의 이름일 뿐입니다 (예: "존 도").
  • 연구자들은 "존 도"를 다양한 맥락에 포함시킨 몇 가지 가짜 문장 (합성 프롬프트) 을 생성합니다 (예: "존 도에 대한 이야기를 써라", "존 도의 좋아하는 색깔은 무엇인가?").
  • 그들은 실제 책이 필요하지 않습니다. 사서의 뇌를 자극하는 데는 이 몇 가지 가짜 문장만 있으면 됩니다.

3. "자기적 인력" (망각 과정)

사서가 이러한 "앵커" 문장 중 하나를 보게 되면, 뇌는 생각 계획을 세우기 시작합니다.

  • 기존 방식: 사서는 질문에 정상적으로 답변할 계획을 세웁니다.
  • GU 방식: 시스템은 자석처럼 작용합니다. 사서가 "존 도"에 대해 생각하기 시작하자마자, 시스템은 생각 과정을 "답변" 위치에서 끌어당겨 "안전 구역" ("모르겠다"는 위치) 으로 밀어 넣습니다.
  • 이는 기억을 삭제하는 것이 아니라, 그 특정 이름이 나타날 때마다 사서가 즉시 "불확실성" 쪽으로 생각을 전환하도록 훈련시키는 것입니다.

4. 나머지는 온전하게 유지 (안전망)

사서에게 "존 도"를 잊게 하면 "제인 도"나 저녁 식사 조리법까지 잊게 될까 봐 큰 우려가 있습니다.

  • 이를 방지하기 위해 시스템은 **"동결된 교사"**를 사용합니다. 훈련받는 사서 옆에 완벽한 두 번째 사서가 서 있다고 상상해 보세요.
  • 훈련받는 사서가 "존 도"가 아닌 다른 것에 대해 이야기할 때마다 시스템은 확인합니다: "당신의 답변이 여전히 완벽한 교사와 일치합니까?" 훈련생이 빗나가기 시작하면 시스템은 부드럽게 교사의 스타일대로 다시 되돌려 놓습니다. 이를 통해 사서는 잊으라고 지시받은 특정 사항을 제외하고는 모든 것에 대해 똑똑한 상태를 유지합니다.

결과: "적은 것이 더 많다"

이 논문은 ToFU 와 UnlearnPII 라는 두 가지 주요 벤치마크에서 이를 테스트한 결과 다음과 같은 사실을 발견했습니다:

  • 원본 도서관 없이 작동: 거대한 원본 데이터셋이 필요하지 않았습니다. 몇 가지 가짜 문장만으로도 충분했습니다.
  • 정밀함: 사서는 대상 주제에 대한 이야기를 성공적으로 중단했습니다 (종종 "잘 모르겠다"거나 답변을 거절함). 동시에 "고장" 나거나 다른 질문에 답변하는 방법을 잊어버리지 않았습니다.
  • 더 안전함: 망각을 수행하기 위해 원래의 개인정보에 직접 접근할 필요가 없었기 때문에, 과정에서 해당 데이터가 실수로 유출될 위험이 전혀 없었습니다.

요약하자면:
거대한 데이터베이스에서 특정 기억을 지우려는 시도 (이는 어렵고 위험합니다) 대신, 이 방법은 AI 에게 특정 트리거 ("앵커") 를 즉시 인식하고 내부 "계획 모드"를 즉시 "안전/불확실" 상태로 전환하도록 가르칩니다. 이는 성채 전체를 재건할 필요 없이, 특정 열쇠가 제시될 때마다 특정 문을 즉시 잠그는 방법을 경비원에게 가르치는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →