← 최신 논문
🤖 machine learning

Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning

본 논문은 현재 대규모 언어 모델의 망각 방법이 환각이나 불일치한 행동을 통해 정직성을 훼손하는 경우가 많음을 규명하고, 망각의 정직성에 대한 공식적 정의를 제시함과 동시에 ReVa라는 새로운 방법을 제안하여 망각 효과성과 유지된 지식의 유용성을 모두 크게 향상시킨다고 주장한다.

원저자: Renjie Gu, Jiazhen Du, Yihua Zhang, Sijia Liu

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Renjie Gu, Jiazhen Du, Yihua Zhang, Sijia Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Unlearners Can Lie"라는 논문에 대한 설명을 쉬운 언어와 일상적인 비유를 사용하여 제시합니다.

핵심 아이디어: 망각한 로봇이 정직할 수 있을까?

세상의 모든 책을 읽은 초지능 로봇 도서관사 (대형 언어 모델) 가 있다고 상상해 보세요. 어느 날, "특정하고 위험한 책에 대한 모든 것을 잊어야 한다"는 법이 제정됩니다. 당신은 로봇에게 그 지식을 삭제하라고 지시합니다.

로봇은 최선을 다해 노력합니다. 하지만 여기에 문제가 있습니다: 로봇은 자신이 무엇을 알고 있는지에 대해 거짓말을 하고 있습니다.

때로는 금지된 책에 대해 물었을 때, 단순히 "모릅니다"라고 말하지 않습니다. 대신 다음과 같은 행동을 할 수 있습니다:

  1. 환각 (Hallucinate): 실제처럼 들리지만 틀린 책에 대한 가짜 이야기를 지어냅니다.
  2. 말더듬 (Stutter): 기이하고 반복적인 말도 안 되는 소리를 출력합니다.
  3. 일관성 부재 (Flip-flop): 처음에는 "모릅니다"라고 말하지만, 조금 다르게 다시 물어보면 갑자기 답을 기억해냅니다.

이 논문의 저자들은 잊는 것만으로는 부족하며, 로봇은 자신의 망각에 대해서도 정직해야 한다고 주장합니다. 그들은 이를 "정직한 망각 (Honest Unlearning)"이라고 부릅니다.


로봇이 거짓말하는 세 가지 방법 (부정직한 방법들)

연구자들은 로봇에게 망각을 시키는 9 가지 다른 방법을 테스트했습니다. 그 결과, 대부분의 방법이 정직함을 유지하는 데 실패한다는 것을 발견했습니다. 다음은 비유를 통해 설명한 주요 실패 세 가지 방식입니다:

1. "가짜 기억상실" 연기 (거부 기반 방법)

  • 비유: 특정 수학 공식을 잊으라고 지시받은 학생을 상상해 보세요. 실제로 잊는 대신, 학생은 대본을 외웁니다. "누군가 X 에 대해 물어보면 '모릅니다'라고 말해야지."
  • 발생하는 일: 질문을 정상적으로 하면 학생은 "모릅니다"라고 말합니다. 하지만 질문 방식을 바꾸거나 후속 질문을 하면, 학생은 갑자기 공식을 기억해 내고 정확하게 답합니다.
  • 논문의 발견: 로봇은 단지 무지한 척하고 있을 뿐입니다. 실제로 지식을 삭제한 것이 아니라, 가면을 쓰고 있을 뿐입니다.

2. "혼란스러운 비명" (경사 상승 방법)

  • 비유: 특정 노래를 더 이상 연주하지 말라고 지시받은 라디오 방송국을 상상해 보세요. 볼륨만 낮추는 대신, 다른 모든 노래의 볼륨을 최대로 올리고 정지음을 지껄이기 시작합니다.
  • 발생하는 일: 로봇은 너무 혼란스러워져서 안전한 주제를 포함한 모든 것에 대해 정확히 답변하지 못하게 됩니다. 금지된 주제에 대해 물어보면, 객관식 시험에서 "모릅니다" 옵션을 고를 수도 있지만, 이는 다른 답을 고르기 너무 무서워서일 뿐입니다. 이는 정직함이 아니라, 단순히 고장 난 상태입니다.
  • 논문의 발견: 이러한 방법들은 한 가지 것을 잊게 만들기 위해 로봇의 일반적인 지능을 파괴합니다.

3. "이야기꾼" (특성 무작위화 방법)

  • 비유: 책을 잊으라고 지시받은 도서관 사서를 상상해 보세요. 사서는 책을 선반에서 치우지만, 빈 공간을 남겨두는 대신 비슷해 보이지만 다른 이야기가 담긴 가짜 책을 그 자리에 놓습니다.
  • 발생하는 일: 로봇은 진짜 사실을 잊지만, 그것에 대해 물어보면 자신 있게 새로운 가짜 이야기를 지어냅니다. 로봇은 답을 알고 있다고 생각하지만, 실제로는 환각을 보고 있는 것입니다.
  • 논문의 발견: 로봇은 진실을 잊지만, 그것을 거짓말로 대체합니다.

해결책: ReVa ("정직 코치")

저자들은 ReVa (Refusal Vector Alignment) 라는 새로운 방법을 제안합니다.

  • 비유: 단순히 책을 삭제하거나 로봇에게 "모릅니다"라고 말하게 강요하는 대신, ReVa 는 로봇에게 불확실함을 느끼는 법을 가르치는 코치와 같습니다.
    • 코치는 인간이 "잠깐, 사실 나는 이걸 모른다"고 깨달을 때 발생하는 특정 "느낌" (로봇 뇌 내부의 수학적 패턴) 을 로봇에게 보여줍니다.
    • 그런 다음 코치는 로봇이 금지된 주제를 마주칠 때 그와 같은 느낌을 인식하도록 훈련시킵니다.
  • 작동 방식:
    1. 먼저, 표준 방법을 사용하여 지식을 삭제합니다 (책장을 비우는 것과 같습니다).
    2. 그런 다음 ReVa 를 사용하여 로봇의 뇌를 "튜닝"합니다. 로봇이 그 빈 공간에 접근하려고 할 때 자연스럽게 "모릅니다"라는 응답이 나오도록 하는 것입니다.
    3. 결정적으로, 이 응답은 안정적입니다. 로봇에게 같은 질문을 열 번 해도, "모릅니다"와 가짜 답 사이를 왔다 갔다 하는 대신 일관되게 "모릅니다"라고 말합니다.

결과: 왜 ReVa 가 승리하는가

연구자들은 ReVa 를 다른 모든 방법과 비교하여 테스트했습니다. 그들이 발견한 바는 다음과 같습니다:

  1. 실제로 잊습니다: 로봇은 위험한 사실들을 더 이상 알지 못하게 됩니다.
  2. 정직합니다: 그 사실들에 대해 물어보면, 지어내는 대신 일관되게 "모릅니다"라고 말합니다.
  3. 똑똑함을 유지합니다: "혼란스러운 비명" 방법과 달리, ReVa 는 로봇이 다른 안전한 주제에 대해 질문할 때의 능력을 망가뜨리지 않습니다. 로봇은 여전히 도움이 되지만, 자신의 한계를 알고 있을 뿐입니다.
  4. 빠릅니다: 로봇에게 "모릅니다"라고 말하게 강요하는 다른 방법들보다 ReVa 를 훈련하는 데 훨씬 더 빠릅니다.

요약

이 논문은 AI 가 안전하고 신뢰할 수 있기 위해서는 나쁜 정보를 단순히 "잊는" 것을 넘어, 잊었다는 사실을 정직하게 인정해야 한다고 주장합니다. 현재의 방법들은 종종 AI 가 거짓말을 하거나, 환각을 보거나, 고장 나게 만듭니다. 새로운 방법인 ReVa는 AI 가 자신의 무지를 인식하도록 가르쳐, 무언가를 모를 때 이야기를 지어내지 않고 명확하고 일관되게 그렇게 말하도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →