← 최신 논문
💬 NLP

LLM Unlearning with LLM Beliefs

이 논문은 기존 LLM 망각 기법이 '압착 효과'로 인해 표적 응답을 억제하는 대신 관련 재표현으로 확률 질량이 이동하는 문제를 해결하기 위해, 모델의 고신뢰도 생성물인 '모델 신념'을 직접적으로 억제하는 부트스트래핑 프레임워크를 제안합니다.

원저자: Kemou Li, Qizhou Wang, Yue Wang, Fengpeng Li, Jun Liu, Bo Han, Jiantao Zhou

게시일 2026-03-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kemou Li, Qizhou Wang, Yue Wang, Fengpeng Li, Jun Liu, Bo Han, Jiantao Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 문제: "기억 지우기"의 함정 (짜깁기 효과)

AI 를 훈련시키면 엄청난 양의 데이터를 학습하게 되는데, 가끔은 비밀 정보나 위험한 내용도 함께 기억하게 됩니다. 이걸 지우려고 할 때, 기존 방법들은 마치 "특정 단어를 입에 올리지 못하게 막는" 방식을 썼습니다.

하지만 여기서 재미있는 (하지만 위험한) 현상이 발생합니다.

  • 비유: imagine(상상해 보세요) AI 가 **"비밀 번호 1234"**를 기억하고 있다고 칩시다.
    • 기존 방법 (기존의 '경사 상승' 방식) 은 "1234"라고 말하면 벌을 주니까, AI 는 "1234"라고 말하지 않겠다라고 생각합니다.
    • 그런데 AI 의 머릿속에는 "1234"와 매우 비슷한 "1235", "비밀번호 1234", "그 숫자 조합" 같은 것들이 여전히 강하게 남아있습니다.
    • AI 는 "1234"를 말하지 않으려고 애쓰다가, 대신 **"1235"**나 **"비밀번호 1234"**라고 말하게 됩니다.
    • 결과: 겉보기엔 "1234"를 잊은 것처럼 보이지만, 사실은 비밀을 다른 말로 살짝 바꿔서 여전히 말하고 있는 것입니다.

논문의 저자들은 이를 **"짜깁기 효과 (Squeezing Effect)"**라고 부릅니다.

비유: 물풍선을 손으로 꾹 누르면 물이 한쪽으로 쏠리듯, AI 가 특정 단어를 억지로 지우려고 하면 그 무게 (확률) 가 가장 비슷한 다른 단어로 밀려나는 현상입니다. 그래서 자동 평가 프로그램은 "성공!"이라고 점수를 주지만, 실제로는 비밀이 그대로 노출되는 **'가짜 망각 (Spurious Unlearning)'**이 일어납니다.

2. 해결책: AI 의 '자신감'을 역이용하다 (부트스트래핑)

이 문제를 해결하기 위해 저자들은 **"AI 가 스스로 가장 확신하는 말 (Model Beliefs)"**을 이용하자고 제안합니다.

  • 핵심 아이디어: "AI 가 '1234'를 말하지 않으려고 할 때, AI 가 가장 확신하며 말하려던 '1235'나 '비밀번호 1234' 같은 말도 같이 지워버리자!"
  • 비유:
    • 아이가 "초콜릿을 먹고 싶다"고 떼를 쓴다고 칩시다.
    • 기존 방법: "초콜릿"이라는 말만 금지합니다.
    • 새로운 방법 (이 논문): 아이는 "초콜릿" 대신 "초코파이", "초코 쿠키"라고 말하려 할 것입니다. 그래서 우리는 "초콜릿"뿐만 아니라 아이가 가장 좋아할 만한 "초코파이", "초코 쿠키"까지 모두 금지해버립니다.
    • 이렇게 하면 아이는 더 이상 초콜릿 관련 말을 할 수 없게 되어, 진짜로 그 생각을 잊게 됩니다.

이 방법을 **부트스트래핑 (Bootstrapping)**이라고 부릅니다. AI 가 스스로 믿는 (자신감 있는) 내용을 학습 데이터로 다시 가져와서, 그 내용까지 지우는 방식입니다.

3. 두 가지 실행 전략

이 아이디어를 두 가지 방식으로 적용했습니다.

  1. 단어 수준 (BS-T):

    • AI 가 문장을 만들 때, 특정 단어를 지우려고 하면 그 단어를 제외하고 AI 가 가장 확신하는 다른 단어들도 같이 지시합니다.
    • 비유: "비밀 번호"라는 단어를 지우려는데, AI 가 "비밀"이나 "번호"라는 단어를 확신하며 쓰려 하면, 이 단어들도 같이 막아주는 것입니다.
  2. 문장 수준 (BS-S):

    • 단순히 단어만 지우는 게 아니라, AI 가 비밀 정보를 포함해 길게 쓴 문장 전체를 AI 가 스스로 만들어내게 한 뒤, 그 문장 전체를 지우는 데이터로 사용합니다.
    • 비유: 아이가 "초콜릿을 먹고 싶다"는 문장 전체를 말하려 하면, 그 문장 전체를 "잊어야 할 것"으로 등록해버리는 것입니다.

4. 결과: 진짜로 잊고, 똑똑하게 남기다

이 방법을 다양한 시험 (TOFU, MUSE, WMDP 등) 에서 해본 결과:

  • 기존 방법들: 점수는 좋게 나왔지만, 실제로는 비밀을 다른 말로 바꿔서 계속 말함 (가짜 망각).
  • 이 논문의 방법 (BS-T, BS-S):
    • 진짜 망각: 비밀을 다른 말로 바꿔서 말하지 못하게 함.
    • 유용성 유지: 비밀만 지우고, 나머지 지능 (수학, 일반 상식 등) 은 그대로 잘 유지함.

요약

이 논문은 **"AI 의 기억을 지울 때, 단순히 '지우려는 말'만 막으면 AI 는 그걸 다른 말로 우회해서 말하게 된다"**는 사실을 발견했습니다.

그래서 "AI 가 가장 확신하며 말하려던 다른 말들까지 같이 지워버리는 (AI 의 자존심을 꺾는)" 새로운 방식을 제안했습니다. 마치 물풍선을 누를 때 물이 새는 구멍을 모두 막아주는 것처럼, AI 가 비밀을 다른 형태로 흘려보내지 못하게 완전히 차단하는 것입니다.

이제 AI 는 나쁜 기억을 진짜로 잊고, 우리는 더 안전하고 신뢰할 수 있는 AI 를 사용할 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →