← 최신 논문
💬 NLP

ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models

ZeroUnlearn은 모델 편집을 통해 작업을 정밀한 지식 재 매핑 문제로 재구성하고, 민감한 정보를 효율적으로 제거하면서 전체 모델의 유용성을 유지하기 위해 곱셈적 파라미터 업데이트를 활용하는 퓨샷 지식 망각 프레임워크입니다.

원저자: Yujie Lin, Chengyi Yang, Zhishang Xiang, Yiping Song, Jinsong Su

게시일 2026-05-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yujie Lin, Chengyi Yang, Zhishang Xiang, Yiping Song, Jinsong Su

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델 (LLM) 을 인터넷의 거의 모든 책을 읽은 거대하고 초지능적인 사서로 상상해 보세요. 이 사서는 매우 도움이 되지만, 너무 많은 책을 읽었기 때문에 때로는 기억해서는 안 되는 것들—예를 들어 사적인 비밀, 구식 사실, 또는 해로운 지시사항—을 기억하기도 합니다.

문제는 사서에게 특정 정보를 "잊게" 하라고 요청하면, 그것이 매우 어렵다는 점입니다.

  • 옛 방법 (재학습): 사서에게 잊게 하려면, 나쁜 페이지를 제외한 모든 책을 다시 읽게 할 수 있습니다. 이는 한 권의 책을 제거하기 위해 도서관을 불태우고 처음부터 다시 짓는 것과 같습니다. 이는 영원히 걸리고 천문학적인 비용이 듭니다.
  • "공격적인" 방법 (파인튜닝): 또는 사서가 나쁜 사실을 언급할 때마다 그들을 꾸짖을 수도 있습니다. 이는 효과가 있지만, 종종 사서를 짜증나게 만들고 시를 쓰거나 수학 문제를 푸는 것과 같은 그들이 알고 있던 다른 좋은 것들을 잊게 만듭니다.

ZeroUnlearn 등장: "외과적 지우개"

이 논문의 저자들은 ZeroUnlearn이라는 새로운 방법을 제안합니다. 소리를 지르거나 도서관을 다시 짓는 대신, 그들은 사서의 기억을 외과적으로 편집할 수 있는 지도처럼 다룹니다.

간단한 비유를 사용하여 이것이 어떻게 작동하는지 살펴보겠습니다:

1. "널 공간 (Null Space)" 트릭 (보이지 않는 방)

사서의 뇌를 다양한 아이디어를 나타내는 가구로 가득 찬 거대한 방이라고 상상해 보세요. "민감한" 정보 (잊고자 하는 것) 는 구석에 있는 특정 의자입니다.

대부분의 방법은 의자를 부수거나 다른 방으로 옮기려 시도하는데, 이는 종종 옆의 테이블을 넘어뜨려 (다른 지식을 손상시킴) 문제를 일으킵니다.

ZeroUnlearn은 교묘한 일을 합니다: 의자가 실제로 차지하지 않는 특별한 보이지 않는 "널 공간 (차원)"을 찾습니다. 그런 다음 의자를 가져와 이 보이지 않는 방으로 투영하여 사서의 시야에서 사실상 존재하지 않게 만듭니다.

  • 비유: 그림에서 특정 색상을 가져와 "투명 잉크"로 바꾸는 것과 같습니다. 그림은 여전히 아름답고 완전하게 보입니다 (사서는 여전히 시를 쓰고 수학을 할 수 있음), 하지만 그 특정 색상은 사라졌습니다.

2. "한 걸음" 마법 (폐형 해법)

보통 실수를 고치려면 많은 시도 (시행착오) 가 필요합니다. ZeroUnlearn 은 다릅니다. 저자들은 단 한 걸음으로 필요한 정확한 움직임을 계산하는 수학적 "마법 공식" (폐형 해법) 을 발견했습니다.

  • 비유: 무거운 바위를 산을 따라 인치 단위로 밀어 올리는 대신, 바위를 완벽하게 제자리에 즉시 들어 올리는 지렛대를 찾은 것입니다. 이는 잊어야 할 몇 가지 예시만 있더라도 ("Few-Shot"이라고 함) 과정을 놀라울 정도로 빠르게 만듭니다.

3. "중립적 목표" ( 버튼)

사서가 민감한 정보를 마주칠 때, ZeroUnlearn 은 그들을 단순히 혼란스럽게 만드는 것이 아니라 "정지" 버튼을 누르도록 가르칩니다.

  • 비유: 누군가 "비밀 비밀번호가 무엇입니까?"라고 물으면, 사서는 과거에 비밀번호를 말했습니다. 이제 ZeroUnlearn 은 사서를 재프로그래밍하여 그 질문을 들으면 즉시 "모릅니다"라고 말하거나 단순히 말을 멈추게 (와 같은 토큰으로 표현됨) 합니다. 이는 위험한 답변을 안전하고 중립적인 침묵으로 덮어씌웁니다.

4. 왜 이것이 사서를 망치지 않는가

이러한 방법들에 대한 가장 큰 두려움은 실수로 사서가 영어를 말하는 법 전체를 잊게 만들 수 있다는 점입니다.

  • 논문의 주장: ZeroUnlearn 은 "직교 (orthogonal)"하도록 설계되었습니다. 다른 방송국의 볼륨 노브를 건드리지 않고 라디오 방송국의 볼륨만 조절하는 것과 같습니다. 논문은 이 특정 수학적 투영을 사용하여 좋은 기억들의 "이웃"을 방해하지 않고 나쁜 기억을 지울 수 있다고 주장합니다.
  • 결과: 그들의 테스트에서 ZeroUnlearn 이 나쁜 사실을 성공적으로 제거했음을 (종종 모델이 이를 회상하는 능력을 0% 로 감소시킴) 보여주었으며, 모델의 일반 지능과 언어 능력은 이전과 거의 정확히 동일하게 유지되었습니다.

요약

ZeroUnlearn은 처음부터 다시 재학습하거나 실수로 다른 능력을 망치지 않고 AI 모델에서 특정, 민감하거나 해로운 기억들을 외과적으로 제거할 수 있게 해주는 새로운 도구입니다. 이는 나쁜 기억들을 보이지 않는 공허 속으로 수학적으로 "투영"하고, 이를 안전하고 중립적인 응답으로 대체함으로써, 모든 것을 단일하고 효율적인 단계에서 수행합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →