← 최신 논문
💬 NLP

Learning What to Forget: Improving LLM Unlearning via Learned Token-Level Importance

이 논문은 망각(forget)과 유지(retain) 목적 함수 간의 충돌을 통해 토큰 수준의 중요성을 공동으로 학습함으로써 외부 감독이나 보조 모델 없이도 최첨단 성능을 달리는 경량화된 프레임워크인 교대 토큰 가중치 언러닝(Alternating Token-Weighted Unlearning, ATWU)을 소개한다.

원저자: Gizem Yüce, Giorgos Nikolaou, Nicolas Flammarion

게시일 2026-06-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Gizem Yüce, Giorgos Nikolaou, Nicolas Flammarion

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제의 핵심: 페이지 전체를 번지게 만드는 "지우개"

당신에게 아주 거대하고 똑똑한 도서관(거대 언어 모델, LLM)이 있다고 상상해 보세요. 이 도서관은 인터넷에 있는 거의 모든 것을 읽었습니다. 그런데 어느 날, 누군가의 비밀 일기 내용이 도서관에 저장되어 있다는 사실을 알게 되었고, 이를 즉시 삭제해야 합니다.

문제는 도서관이 너무 방대해서 그 일기가 적힌 특정 페이지를 그냥 찢어낼 수 없다는 점입니다. 만약 그 일기를 제외하고 도서 전체를 다시 학습시켜서 그 내용을 "망각(unlearn)"하게 하려 한다면, 예의 바른 이메일을 쓰는 법이나 수학 문제를 푸는 법 같은 다른 유용한 지식들까지 실수로 함께 지워버릴 수도 있습니다.

현재의 "망각" 방식은 거대하고 뭉툭한 지우개를 사용하는 것과 같습니다. 그들은 비밀이 담긴 문장이나 단락 전체를 지우려고 시도합니다. 하지만 그 과정에서 비밀뿐만 아니라 문법, 구두점, 그리고 일반적인 단어들(예: "그", "그리고" 등)까지 함께 지워버리곤 합니다. 이는 결국 도서관의 글쓰기 스타일을 망가뜨리고 서툴게 만듭니다.

핵심 아이디어: 스마트한 정밀 외과용 메스

이 논문의 저자들은 '망각'에 대해 새로운 방식으로 접근할 것을 제안합니다. 그들은 비밀 문장의 모든 단어가 비밀을 유지하는 데 똑같이 중요한 것은 아니라는 사실을 깨달았습니다.

  • 비밀 부분: 제거하고자 하는 특정 이름, 날짜 또는 사실 (예: "Hina Ameen").
  • 구조적 부분: 문장을 유지하는 데 필요한 지루하지만 필수적인 단어들 (예: "저자는...").

만약 모델에게 "그(The)"라는 단어를 잊게 만들려고 한다면, 당신은 비밀을 제거하는 것이 아니라 문법을 파괴하는 것입니다. 모델은 "그"라는 단어를 사용하는 법을 계속 알고 있어야 합니다.

해결책: ATWU (교차 토큰 가중치 망각)

이 논문은 ATWU라고 불리는 방법을 소개합니다. 이것은 도서관에 뭉툭한 지우개 대신 스마트한 정밀 외과용 메스를 쥐여주는 것과 같습니다.

작동 방식은 다음과 같습니다:

  1. 충돌 테스트 (The Conflict Test): 저자들은 어떤 단어를 지울지 결정하는 가장 좋은 방법은, 그 단어를 잊었을 때 도서관에 얼마나 많은 "고통"을 주는지 확인하는 것이라는 점을 발견했습니다.

    • 만약 도서관가 "Hina"(비밀)라는 단어를 잊으려 한다면, 그것은 좋은 문장을 쓰는 능력에 타격을 주지 않습니다.
    • 하지만 "그(The)"라는 단어를 잊으려 한다면, 모델은 횡설수설하기 시작합니다.
    • 통찰: 만약 어떤 단어를 잊는 것이 도서관의 일반적인 기술에 해를 끼치지 않는다면, 그 단어는 삭제하기에 적합한 후보입니다. 만약 기술에 해를 끼친다면, 그 단어는 남겨두어야 합니다.
  2. "점수 기록원" (선형 스코러, Linear Scorer):

    • 모든 문장을 읽고 삭제할 단어에 동그라미를 치기 위해 사람을 고용하는 대신(이는 느리고 비용이 많이 듭니다), 저자들은 모델 내부에 작고 단순한 "점수 기록원"을 구축했습니다.
    • 이 점수 기록원은 모델의 "뇌"(은닉 상태, hidden states)를 관찰하여 모든 단어에 점수를 부여합니다.
    • 높은 점수: "이 단어는 비밀입니다. 반드시 지워야 합니다."
    • 낮은 점 점수: "이 단어는 그저 문법일 뿐입니다. 그대로 두십시오."
  3. 춤추는 단계 (교차 최적화, Alternating Optimization):

    • 모델과 점수 기록원은 번갈아 가며 학습합니다.
    • 먼저, 점수 기록원이 어떤 단어를 잊어야 할지 결정합니다.
    • 그다음, 모델은 나머지 기술들을 온전히 유지하면서도 그 특정 단어들만을 잊으려고 노력합니다.
    • 그 후, 점수 기록원은 모델이 어떻게 변했는지 관찰하고, 더 정확해지도록 점수를 업데이트합니다.
    • 그들은 모델이 다른 것을 망가뜨리지 않고 정확히 무엇을 잊어야 하는지 배울 때까지 이 과정을 반복하며 번갈아 춤을 춥니다.

왜 더 나은가 (결과)

이 논문은 이 방법을 두 가지 서로 다른 "도서관"(데이터셋)에서 테스트했으며, ATWU가 기존 방식보다 훨씬 뛰어나다는 것을 발견했습니다.

  • 정밀도 (Precision): 특정 비밀(예: "Hina Ameen"이라는 이름)을 성공적으로 제거하면서도, 모델이 정상적이고 고품질의 텍스트를 쓰는 능력은 그대로 유지했습니다.
  • 추가 도움 불필요: 삭제할 단어를 파악하기 위해 별도의 외부 AI의 도움을 받아야 하는 다른 방식들과 달리, ATWU는 모델 자체의 내부 신호를 사용하여 스스로 문제를 해결합니다.
  • 더 나은 균형: ATWU는 다른 어떤 테스트된 방법보다 나쁜 정보는 더 효과적으로 잊으면서, 좋은 정보는 더 잘 유지하는 더 나은 트레이드오프(trade-off)를 달성했습니다.

비유의 "마법"

당신이 흰 셔츠에서 특정 얼룩을 제거하려고 한다고 상상해 보세요.

  • 기존 방식: 셔츠 전체에 표백제를 뿌려 문지릅니다. 얼룩은 사라졌지만, 셔츠는 노랗게 변하고 망가져 버립니다.
  • ATWU: 얼룩의 색상만을 정밀하게 타격하는 레이저를 사용합니다. 레이저는 얼룩만 완벽하게 태워 없애고, 흰색 천 부분은 전혀 손상시키지 않습니다.

요약된 주장

이 논문은 "망각"을 모델이 무엇을 잊어야 하는지와 어떻게 잊어야 하는지를 동시에 배우는 공동의 문제로 다룸으로써, 다음과 같은 "머신 언러닝(machine unlearning)"을 달성할 수 있다고 주장합니다:

  1. 비지도 학습 (Unsupervised): 어떤 단어를 지울지 라벨링하기 위해 인간의 도움이 필요하지 않습니다.
  2. 효율성 (Efficient): 매우 단순하고 가벼운 메커니즘(선형 스코러)을 사용하여 작업을 수행합니다.
  3. 효과성 (Effective): 모델이 가진 "비밀을 기억하려는 것"과 "기술을 유지하려는 것" 사이의 내부적 충돌이 모델에게 무엇을 잊어야 하는지에 대한 모든 단서를 제공함으로써, 훨씬 더 깨끗한 분리를 만들어냅니다.

저자들은 이 접근 방식이 모델에게 무엇을 잊게 가르치기 위해 외부 도구나 값비싼 주석(annotation)이 필요하지 않다는 것을 증명한다고 결론짓습니다. 모델 자신의 내부적 충돌 자체가 필요한 모든 실마리를 제공하기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →