← 최신 논문
🤖 machine learning

PURGE: Projected Unlearning via Retain-Guided Erasure

이 논문은 지속 학습과 언러닝 사이의 이중성을 활용하여, 모델의 유용성을 보존하고 멤버십 추론 공격에 저항하면서 특정 데이터를 효과적으로 제거하기 위해 그래디언트 투영 제약과 다층 표현 삭제 및 유지-혼동 타겟을 결합한 머신 언러닝 알고리즘인 PURGE를 소개한다.

원저자: Vedant Jawandhia, Daksh Ahuja, Ghufran Alam Siddiqui, Prashant Trivedi, Yash Sinha, Pratik Narang

게시일 2026-06-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Vedant Jawandhia, Daksh Ahuja, Ghufran Alam Siddiqui, Prashant Trivedi, Yash Sinha, Pratik Narang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑한 학생이 전문가가 되기 위해 방대한 도서관의 책들을 공부했다고 상상해 보세요. 이제, 특정 인물(이름을 "밥"이라고 부릅시다)이 개인정보 보호법 때문에 자신에 대한 모든 것을 잊어달라고 학생에게 요청합니다.

기존의 "순진한" 방식은 학생에게 이렇게 말하는 것입니다: "도서관으로 돌아가서 밥의 책들을 버리고 처음부터 다시 공부를 시작해." 이 방법은 완벽하게 작동하지만, 수년이 걸리고 엄청난 비용이 듭니다.

PURGE는 새로운, 영리한 지름길입니다. 이것은 마치 밥의 영향력을 학생의 뇌에서 제거하면서도, 그 외에 배운 다른 모든 것들을 잊게 만들지 않는 '마법 지우개'와 같습니다.

이 논문은 이 과정을 쉬운 비유를 사용하여 다음과 같이 설명합니다:

1. 핵심 아이디어: 동전의 양면

저자들은 흥weise로운 점을 발견했습니다: **학습(Learning)**과 **망각(Forgetting)**은 사실 동일한 문제의 반대 측면이라는 것입니다.

  • 학습 (연속 학습, Continual Learning): 피아노 연주라는 기존 기술을 잊지 않으면서 기타 연주라는 새로운 기술을 배우고 싶은 것입니다.
  • 망각 (기계 망각, Machine Unlearning): 도서관의 나머지 지식은 잊지 않으면서 특정 기억(밥)만을 지우고 싶은 것입니다.

논문은 이렇게 말합니다. "새로운 것을 배우는 데 사용되는 수학적 원리를 빌려와서, 이를 뒤집어 망각하는 데 도움을 얻자."

2. 마법의 기술: "가드레일" (그래디언트 투영, Gradient Projection)

학생이 밥의 기억을 지우려고 노력할 때, 실수로 꽃병(보존 데이터 세트 또는 다른 데이터)을 넘어뜨릴 수도 있습니다.

PURGE는 **그래디언트 투영(Gradient Projection)**이라는 기술을 사용합니다. 이것은 가드레일이나 경호원과 같습니다.

  • 학생이 밥을 지우기 위해 발걸음을 옮길 때마다, 경호원은 확인합니다: "이 발걸음이 꽃을 다치게 할 것인가?"
  • 만약 대답이 "예"라면, 경호원은 학생의 발을 부드럽게 밀어 꽃을 손상시키지 않는 방향으로만 움직이도록 유도합니다.
  • 이는 밥을 지우는 동안에도 나머지 지식은 안전하고 정확하게 유지됨을 보장합니다.

3. "가짜 혼란" 전략 (보존-혼란 타겟, Retain-Confusion Target)

보통 모델에게 무언가를 잊게 하려고 할 때, 주사위를 던지는 것처럼 무작위로 추측하라고 명령합니다. 논문은 이 방식의 문제를 발견했습니다: 로봇은 가짜 무작위성을 너무 잘 잡아냅니다. 모델이 갑자기 무작위로 추측하기 시작하면, 해커는 "아하! 이 모델은 무언가를 잊도록 강요당했구나!"라고 알아챌 수 있습니다.

대신, PURGE는 **보존-혼란 타겟(Retain-Confusion Target)**을 사용합니다.

  • 대신, 학생이 남겨둔 책들을 살펴보고 어디에서 혼란을 느끼는지 봅니다. 예를 들어, "고양이"와 "강아지"를 가끔 헷ful하게 섞어서 구분하는 식입니다.
  • 밥을 지울 때, 학생에게 다음과 같이 지시합니다: "무작위로 추측하지 마라. 대신, 네가 남겨진 책들을 볼 때 느끼는 것과 똑같은 방식으로 혼란스러워해라."
  • 이렇게 하면 "지워진" 모델은 마치 처음부터 밥을 본 적이 없는 학생처럼 보이게 됩니다. 해커에게는 두 모델의 차이를 구별하는 것이 불가능해집니다.

4. 딥 클리닝: "직감" 지우기

때로는 모델이 정답을 말하지 않더라도, 뇌 속 깊은 곳(중간 계층)에서는 여전히 틀린 답을 "느끼고" 있을 수 있습니다.

  • 기존 방식은 단순히 모델에게 마지막 단계(출력)에서 틀린 답을 말하지 말라고 지시합니다.
  • PURGE는 더 깊게 들어갑니다. "직감"(중간 표현)을 깨끗이 닦아내어, 내부의 뇌 활동이 밥을 알지 못했던 사람의 활동처럼 보이도록 만듭니다.

5. "자동 정지" 버튼

학생은 언제 멈춰야 할지 어떻게 알까요?

  • 기존 방식: 몇 분 동안 연습할지, 혹은 몇 번 반복할지 숫자를 세거나 추측해야 합니다.
  • PURGE 방식: 두 가지 자가 조절 정지 신호를 가지고 있습니다:
    1. 예산 (The Budget): "만약 우리가 꽃(보존 데이터)을 너무 많이 해치기 시작하면 즉시 멈춰라."
    2. 타겟 (The Target): "밥에 대한 기억이 너무 흐릿해져서 무작위 확률보다 더 잘 맞출 수 없게 되면 멈춰라."
      이것은 알고리즘이 스스로 언제 끝낼지를 결정하게 하여, 인간이 추측할 필요가 없게 만듭니다.

6. "고정된 통계치"의 놀라운 발견

논문은 숨겨진 함정을 발견했습니다: 특정 클래스의 데이터(예: 모든 고양이 사진)를 지울 때, 모델의 내부 계산기(BatchNorm)가 혼란을 겪습니다. 왜냐하면 모델이 "고양이"만 보고 있어서 "강아지"를 다루는 법을 잊어버리기 때문입니다.

  • 해결책: 저자들은 이 계산기를 **고정(freeze)**해야 한다는 것을 깨달았습니다. 그래로 계산기가 편향된 데이터로 인해 통계치를 업데이트하지 않도록 하는 것입니다. 이는 마치 계산기에게 "우리가 이 수술을 하는 동안에는 설정을 바꾸지 마라"고 말하는 것과 같습니다. 이것이 없으면 전체 시스템이 무너집니다.

결과: 무엇을 찾아냈는가?

저자들은 다섯 가지 다른 유형의 데이터(필기 숫자부터 의료 영상까지)로 테스트를 진행했습니다.

  • 개인정보 보호: "지워진" 모델은 너무나 정교하여 해커가 밥이 훈련 데이터에 있었는지 여부를 알아낼 수 없습니다 (점수 0.5, 이는 완벽한 수준입니다).
  • 유용성: 모델은 여전히 다른 모든 것의 96% 이상을 기억합니다.
  • 속도: 모델을 처음부터 다시 훈련시키는 것보다 약 13배 빠릅니다.

요약하자면: PURGE는 AI가 새로운 것을 배우는 법에서 얻은 기술을 활용하여, AI가 나머지 지식을 실수로 잊거나 해커에게 들키지 않도록 보장하면서 특정 데이터를 AI의 기억에서 빠르고 안전하며 똑똑하게 삭제하는 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →