← 최신 논문
🤖 machine learning

Forgetting Has Neighbors: Localized Collateral Forgetting in Machine Unlearning

이 논문은 머신 언러닝(machine unlearning) 방법들이 일관되지 않은 대리 타겟(surrogate targets)으로 인해 삭제된 데이터 근처의 훈련 예시들에 대한 예측 성능을 불균형적으로 저하시키는 현상인 "국소적 부수적 망각(localized collateral forgetting)"을 식별하고 해결하며, 언러닝된 모델을 전체 재학습 모델과 더 밀접하게 정렬시키는 효과적인 완화 전략으로서 "로컬 교사 증류(Local Teacher Distillation)"를 제안한다.

원저자: Polina Dolgova, Sebastian U. Stich

게시일 2026-06-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Polina Dolgova, Sebastian U. Stich

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수천 개의 예시가 담긴 방대한 교과서를 공부한 매우 똑똑한 학생이 있다고 상상해 보세요. 어느 날, 당신은 그 교과서에서 특정 장(chapter)을 제거하고 학생이 그 내용을 완전히 "잊도록" 만들어야 한다는 법령을 받았습니다.

목표: 당신은 학생이 전체 책을 처음부터 다시 읽지 않고도(그것은 너무 오래 걸릴 것입니다) 해당 장을 잊게 만들고 싶습니다. 당신은 학생이 처음부터 그 장을 건너뛰고 공부했을 때와 마찬가지로, 나머지 부분에 대해서는 여전히 뛰어난 실력을 발휘하기를 원합니다.

문제점: "부수적 피해 (Collateral Damage)"
이 논문은 우리가 보통 무언가를 "잊게" 만들려고 할 때 사용하는 방식에 숨겨진 결함이 있다는 것을 발견했습니다.

연구자들이 특정 주제를 잊게 하려고 시도할 때, 그들은 종종 투박한 도구를 사용합니다. 즉, 학생에게 그 주제를 "공부하지 말라"고 하거나(지식을 밀어내기), 그 주제가 터무니없는 것이라고 말하는 것(무작위로 틀린 답을 할당하기)입니다.

이 논문은 이러한 접근 방식이 **국소적 부수적 망각(Localized Collateral Forgetting)**을 일으킨다는 것을 보여줍니다. 다음과 같이 생각해 보세요:

  • 만약 당신이 학생에게 "‘소파(Couch)’에 대한 모든 것을 잊어라"라고 명령하고 이를 공격적으로 수행한다면, 학생은 '소파'뿐만 아니라 '의자(Sofa)', '안락의자(Armchair)', 그리고 '가구(Furniture)' 전반에 대해 혼란을 느끼기 시작할 수 있습니다.
  • 비록 이 다른 항목들이 "삭제" 목록에 없었더라도, 학생은 이 아이템들이 삭제 대상과 매우 유사하기 때문에 이들에 대한 이해도가 망가져 버립니다.
  • 결과적으로 학생은 단순히 그 장을 건너뛰고 나머지 부분을 정상적으로 공부했을 때보다, 주변 주제들에 대해 더 낮은 성능을 보이게 됩니다.

왜 이런 일이 일진가요?
저자들은 학생의 뇌(AI 모델)가 유사한 아이디어들을 서로 연결한다는 점을 설명합니다. 당신이 무작위적인 방식이나 잘못된 답을 사용하여 특정 아이디어를 잊게 강요하면, 그 혼란은 주변의 아이디어로 퍼져 나갑니다. 이는 마치 카펫에 걸려 넘어지는 것과 같습니다. 당신은 단지 카펫 위에서 넘어지는 것이 아니라, 그 바로 옆에 있는 램프까지 쓰러뜨릴 수 있습니다.

해결책: "로컬 선생님 (The Local Teacher)"
단순히 학생에게 "이것은 틀렸다"거나 "이것을 잊어라"라고 말하는 대신, 저자들은 **로컬 선생님 증류(Local Teacher Distillation)**라고 불리는 더 스마트한 전략을 제 제안합니다.

다음은 비유입니다:

  1. 문제: 당신은 '소파' 장을 건너뛰었다면 어떻게 행동했어야 하는지 알기 위해 학생에게 책 전체를 다시 읽으라고 요청할 수 없습니다. 그것은 비용이 너무 많이 듭니다.
  2. 해결책: 당신은 작고 전문화된 튜터(로컬 선생님)를 고용합니다.
  3. 작동 방식: 이 튜터는 '소파' 장의 이웃들, 즉 학생이 여전히 기억하고 있는 '의자'나 '안락의자' 같은 것들만을 살펴봅니다. 튜터는 이 안전한 예시들을 연구하여 다음과 같이 파악합니다. "좋아, 만약 '소파' 장이 없었다면, '의자'에 대한 질문에 어떻게 논리적으로 답했을까?"
  4. 결과: 튜터는 '소가' 장에 대해 무엇을 해야 할지에 대해 학생에게 "부드러운" 힌트(이웃에 기반한 부드럽고 올바른 예측)를 제공합니다. 이는 학생에게 무작위로 추측하라고 말하는 것보다 훨씬 더 낫습니다.

연구 결과
연구진은 컴퓨터 시스템이 이미지(고양이, 개, 소파 등)를 인식하는 방법을 학습하는 실험을 진행했습니다.

  • 기존 방식 (무작위 추측): '소파' 이미지를 삭제하려고 했을 때, 시스템은 주변의 다른 가구들에 대해 혼란을 겪었습니다.
  • 새로운 방식 (로컬 선생님): 유사하고 안전한 이미지들을 바탕으로 부드러운 힌트를 주는 로컬 선생님을 사용함으로써, 시스템은 기존 방식만큼 잘 '소파'를 잊었지만, 동시에 다른 가구들에 대해서는 혼란을 겪지 않았습니다. 이는 처음부터 해당 장을 건너뛰고 공부했을 때의 성능에 훨씬 더 근접한 결과를 보여주었습니다.

요약하자면
이 논문은 AI를 "잊게" 만들려고 할 때, 우리가 의도치 않게 유사한 지식까지 손상시킨다고 주장합니다. 무작위적인 노이즈 대신 부드럽고 논리적인 힌트를 통해 과정을 안내하는 작고 스마트한 조력자를 사용함으로써, 우리는 AI가 가진 나머지 지식을 손상시키지 않고 정확히 잊어야 할 것만을 잊게 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →