← 최신 논문
🤖 machine learning

Unlearning Isn't Invisible: Detecting Unlearning Traces in LLMs from Model Outputs

이 논문은 거대 언어 모델에서의 머신 언러닝(machine unlearning)이 모델의 출력과 내부 활성화 모두에 지속적이고 탐지 가능한 "지문"을 남기며, 이를 통해 무관한 입력값으로 프롬프트를 작성하더라도 분류기가 모델이 언러닝을 거쳤는지 여부를 90% 이상의 정확도로 식별할 수 있음을 밝혀낸다.

원저자: Yiwei Chen, Soumyadeep Pal, Yimeng Zhang, Qing Qu, Sijia Liu

게시일 2026-06-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yiwei Chen, Soumyadeep Pal, Yimeng Zhang, Qing Qu, Sijia Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 수백만 권의 책을 읽은 거대하고 매우 똑똑한 도서관(거대 언어 모델)이 있다고 상상해 보세요. 때때로 비밀이나 저작권이 있는 자료, 혹은 위험한 지침이 담긴 특정 책들을 도서관에서 제거해야 할 때가 있습니다. 이 과정을 **"머신 언러닝(Machine Unlearning, 기계 망각)"**이라고 부릅니다.

언러닝의 목표는 도서관이 그 특정 책들을 읽지 않은 것처럼 행동하게 만들면서도, 그 외의 다른 모든 것에 대해서는 여전히 완벽하게 대답할 수 있도록 하는 것입니다.

하지만 이번 ICLR 2026의 새로운 논문은 놀라운 문제를 발견했습니다. 당신은 책을 제거했다는 사실을 결코 완전히 숨길 수 없다는 것입니다.

다음은 비유를 사용한 연구 결과의 요약입니다.

1. "기계 속의 유령" (언러닝의 흔적)

무언가를 "언러닝"하려고 할 때, 도서관은 단순히 그 책을 지우고 빈 공간을 남기는 것이 아닙니다. 대신, 그것은 지문을 남깁니다.

이렇게 생각해 보세요. 흰 셔츠에 묻은 얼룩을 지우려고 노력할 때, 색깔은 빠질지 몰라도 직물의 질감이 미세하게 거칠어지거나 현미경으로 봤을 때 다르게 보일 수 있습니다. 논문에서는 이를 "언러닝 흔적(unlearning traces)"이라고 부릅니다. 설령 도서관가 관련 없는 주제(예: "프랑스의 수도는 어디인가요?")에 대해 질문에 답하더라도, 그 방식과 답변에는 편집되었다는 사실에서 기인한 미묘한 "흉터"가 남아 있습니다.

2. 탐정의 도구 상자

연구진은 이러한 흉터를 찾아낼 수 있는 간단한 "탐정"(컴퓨터 분류기)을 만들었습니다. 그들은 도서관을 관찰하는 두 가지 방법을 테스트했습니다.

  • "무엇을 말하는가" 테스트 (텍xtual Responses): 그들은 도서한이 실제로 쓴 단어들을 살펴보았습니다.

    • 결과: 때로는 이것이 통합니다. 만약 도서관이 NPO라는 방식으로 편집되었다면, "흉터"가 매우 명확하게 드러납니다. 도서관은 안전한 주제에 대해 이야기할 때조차 약간 로봇처럼 변하거나 혼란스러워 보이기 시작합니다. 이는 마치 누군가가 정상적으로 행동하려고 애쓰지만 말을 더듬는 것과 같습니다.
    • 결과: 만약 도서관이 RMU라는 방식으로 편집되었다면, 텍스트는 거의 완벽해 보입니다. "무엇을 말하는가" 테스트는 여기서 종종 실패하는데, 이는 도서관이 최종적인 단어들을 통해 자신의 흔적을 숨기는 데 매우 능숙하기 때문입니다.
  • "어떻게 생각하는가" 테스트 (Internal Activations): 그들은 도서관의 내부 "뇌파"(컴퓨터가 단어를 쓰기 전 일어나는 수학적 연산)를 살펴보았습니다.

    • 결과: 바로 여기서 마법이 일어납니다. 도서관이 완벽하게 들릴 때조차, 내부의 "뇌파"는 명확한 패턴을 보여줍니다. 이는 사람의 심장 박동 소리를 듣는 것과 같습니다. 비록 그 사람이 속삭이고 있을지라도, 무언가를 숨기고 있기 때문에 리듬이 약간 어긋나 있을 수 있습니다. 연구진은 이러한 내부 패턴이 컴퓨터가 쉽게 포착할 수 있는 특정한 저차원적 형태를 형성한다는 것을 발견했습니다.

3. 크기가 중요하다

논문은 재미있는 경향을 발견했습니다: 도서관이 클수록 잡기가 더 쉽습니다.

  • 작은 도서관(70억 파라미터 모델 등)은 흔적이 희미하고 흐릿하기 때문에 탐지하기 어렵습니다.
  • 거대한 도서관(340억 파라미터 모델 등)은 더 명확한 지문을 남깁니다. 이는 방 안의 거대한 코끼리를 숨기려는 것과 같습니다. 코끼리가 클수록, 그곳에 없다는 척하기가 더 어려워집니다.

4. 큰 위험: 역공학 (Reverse Engineering)

이것이 왜 중요할까요? 논문은 이것이 새로운 보안 위험을 초래한다고 경고합니다.

악의적인 공격자(adversary)가 도서관이 잊어야 했던 "금지된 정보"를 복구하고 싶어 한다고 가정해 봅시다.

  • 이 발견 이전에는: 그들은 어떤 도서관이 편집되었는지 추측하고 모든 도서관을 무작위로 해킹하려고 시도해야 했습니다.
  • 이 발견 이후에는: 그들은 빠른 "흔적 탐지기"를 실행할 수 있습니다. 만약 탐지기가 "네, 이 도서관은 편집되었습니다"라고 말한다면, 악의적인 공격자는 정확히 어디에 집중해야 할지 알게 됩니다. 그러면 그들은 안전 조치를 우회하여 금지된 정보를 다시 "학습(re-learn)"하기 위한 특정 기술을 사용할 수 있습니다.

요약

논문의 결론은 언러닝은 보이지 않는 것이 아니다라는 것입니다. 모델이 특정 데이터를 잊도록 편집되더라도, 내부의 뇌 활동에는 지속적인 "지문"이 남습니다. 단순한 컴퓨터 프로그램조차 완전히 관련 없는 주제에 대한 질문을 던지는 모델로부터 이러한 지문을 90% 이상의 정확도로 찾아낼 수 있습니다. 이는 모델이 무언가를 "잊었다"고 주장하는 것이 우리가 생각했던 것만큼 안전하지 않을 수 있음을 의미합니다. 왜냐하면 잊는 행위 자체가 감지 가능한 서명을 남기기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →