← 최신 논문
🤖 machine learning

Form and Function: Machine Unlearning as a Problem of Misaligned States

본 논문은 온라인 L-BFGS 를 위한 기계적 망각을 반사실적 상태 정렬 문제로 재정의하여, 효과적인 망각은 단순히 매개변수를 조정하는 것이 아니라 실현 가능한 반사실적 궤적과 일치하도록 모델 매개변수와 옵티마이저의 내부 메모리 상태 모두를 수정하는 것을 필요로 함을 보여줍니다.

원저자: Kennon Stewart

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kennon Stewart

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "형태와 기능: 정렬되지 않은 상태로서의 기계적 망각"이라는 논문을 간단한 언어와 창의적인 비유로 번역한 설명입니다.

핵심 아이디어: 메모지를 지우는 것만이 전부가 아닙니다. 수업을 잊는 것이 중요합니다

특정 공책으로 학생 (AI 모델) 을 가르친다고 상상해 보세요. 이 공책에는 학생의 현재 답변 (파라미터) 만이 아니라, 문제를 더 빠르게 풀기 위해 학생이 개발한 특별한 "경험칙"이나 "기억 단축키" (옵티마이저 상태 또는 곡률 기억) 도 포함되어 있습니다.

보통 AI 가 나쁜 데이터 (개인 사진이나 실수 등) 를 "망각"하도록 하려면, 학생이 그 사진을 본 적이 없도록 답변만 조정하려 합니다. 답변이 맞다면 학생은 "깨끗하다"고 가정합니다.

이 논문은 이것이 잘못되었다고 주장합니다.

저자들은 특히 온라인 L-BFGS라는 방법을 사용하는 고급 AI 학습자의 경우, 공책에 있는 "경험칙"이 답변만큼이나 중요하다고 말합니다. 답변은 수정하더라도 나쁜 데이터에 기반한 "경험칙"을 그대로 두면, 학생은 잊어야 할 것에 여전히 비밀리에 영향을 받고 있습니다. 그들은 정렬되지 않은 (misaligned) 상태입니다.

핵심 문제: 기계 속의 "유령"

이 논문은 **상태 정렬 (State Alignment)**이라는 개념을 도입합니다. 다음과 같이 생각해보세요:

  • 실제 세계: 학생은 사건들의 흐름으로부터 배웁니다.
  • 반사실적 상황 ("만약에"): 나쁜 데이터가 존재하지 않았던 평행 우주를 상상해 보세요. 이 우주에서 학생은 다른 답변과 다른 "경험칙" 세트를 가지고 있습니다.
  • 목표: 실제 세계에서 데이터를 삭제할 때, 단순히 답변이 "만약에" 우주와 일치하기를 원하는 것이 아닙니다. 학생이 처음부터 나쁜 데이터를 본 적이 없었을 때 가졌을 것과 정확히 일치하도록 **공책 전체 (답변 + 경험칙)**를 맞추고자 합니다.

이 논문은 현재의 방법들이 **답변 (파라미터)**만 수정하고 **규칙 (기억)**은 무시한다고 주장합니다. 이로 인해 "프랑켄슈타인" 같은 학생이 만들어집니다. 존재하지 않는 세계에 맞는 답변을 가지고 있지만, 거기에 도달하기 위해 잘못된 단축키를 사용하는 것입니다.

두 가지 유형의 기억

저자들은 AI 의 기억이 두 가지 층위로 작동함을 발견했습니다:

  1. 직접 기억 (명시적 목록): AI 가 현재 단기 기억에 보유하고 있는 구체적인 예시 목록입니다. 사진을 삭제하면 결국 이 목록에서 사라집니다.
  2. 간접 기억 (잔물결 효과): 사진이 목록에서 사라진 후에도, 그 사진으로부터 배운 방식이 미래의 사진들을 해석하는 방식을 바꿀 수 있습니다. 원래 사진이 사라졌더라도 나쁜 데이터의 "잔물결"은 학생의 미래 결정에 영향을 미칩니다.

비유: 당신이 차를 운전한다고 상상해 보세요.

  • 직접 기억은 화면에 표시된 현재 GPS 경로입니다. 목적지를 삭제하면 화면에서 사라집니다.
  • 간접 기억은 그 경로를 운전하며 쌓은 근육 기억입니다. 목적지를 삭제하더라도, 어제 그 경로를 운전했기 때문에 다음 교차로에서 왼쪽으로 돌아갈 것으로 예상하며 핸들을 잡는 방식이 그대로 유지될 수 있습니다.

이 논문은 단순히 GPS 목적지 (데이터) 를 삭제하는 것만으로는 부족하며, 근육 기억 (옵티마이저 상태) 도 재설정해야 한다고 보여줍니다.

실험: "망각"을 시도할 때 무슨 일이 일어나는가?

연구자들은 데이터를 삭제한 후 AI 를 수정하기 위해 여러 가지 방법을 테스트했습니다:

  • "파라미터 전용" 수정: 답변은 변경했지만 규칙은 그대로 두었습니다.
    • 결과: 처음에는 학생이 괜찮아 보였지만, 계속 학습함에 따라 답변과 규칙이 맞지 않아 이상한 실수를 하기 시작했습니다. 그들은 "정렬되지 않은" 상태였습니다.
  • "기억 전용" 수정: 규칙은 지웠지만 답변은 그대로 두었습니다.
    • 결과: 학생은 깨끗한 규칙을 가지고 있었지만, 새로운 상황에 맞지 않는 답변에 갇혀 있었습니다.
  • "재연습" 수정 (승자): 학생을 되돌려 과거에서 나쁜 데이터를 삭제한 후, 마지막 몇 단계를 처음부터 다시 학습하게 했습니다.
    • 결과: 이것이 학생이 "만약에" 우주와 완벽하게 일치하도록 만드는 유일한 방법이었습니다. 답변과 규칙이 완벽하게 동기화되었습니다.

핵심 교훈

이 논문은 기계적 망각은 단순히 숫자를 변경하는 수학 문제가 아니라, 상태를 정렬하는 기하학 문제라고 결론 내립니다.

고급 기억 기술을 사용하는 AI 에서 데이터를 진정으로 삭제하려면 최종 출력만 조정해서는 안 됩니다. 그 데이터가 존재하지 않았던 타임라인과 일치하도록 AI 의 내부 "근육 기억"과 "단축키"도 재설정되어야 합니다. 그렇지 않으면 AI 는 이름상으로는 "망각"되었지만, 삭제된 데이터의 유령이 미래 행동에 여전히 남아 있게 됩니다.

간단히 말해: 메모지를 지우는 것만으로는 부족합니다. 수업을 지워야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →