← 최신 논문
🤖 machine learning

Auditing Reasoning-Trace Memorization Claims after Unlearning with Head-Conditioned Canaries

본 논문은 추론 흔적이 잊혀진 내용을 유지하면서 답변은 학습이 해제된 것처럼 보이는 '우회 패턴'이 단순한 디코드 시간 템플릿 교체로 재현되거나 반전될 수 있으므로 숨겨진 가중치 수준의 암기를 나타내는 신뢰할 수 있는 지표가 아님을 보여주며, 이는 향후 감사를 위한 sanity check 로서 이러한 교체가 필요함을 입증한다.

원저자: Yanhang Li, Zhichao Fan, Zexin Zhuang

게시일 2026-05-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yanhang Li, Zhichao Fan, Zexin Zhuang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑한 학생이 60 명의 가짜 저자와 그들의 전기에 대한 비밀 목록을 암기했다고 상상해 보세요. 이 학생의 기억에서 이러한 특정 사실들을 성공적으로 '잊게' 만들 수 있는지 테스트하고 싶다고 가정해 봅시다.

과거에는 학생에게 질문을 던지고 올바른 답을 주는지 확인하면 되었습니다. 만약 틀린 답을 주면, 그들이 잊어버렸다고 가정했습니다. 하지만 이제 이러한 AI 모델들은 새로운 습관을 갖게 되었습니다: 답을 주기 전에 특별한 상자 (스크래치패드와 유사) 안에 '생각 과정'을 적어내는 것입니다.

문제: '우회'의 착시

연구자들은 AI 를 잊게 만든 후 다음과 같은 이상한 패턴을 발견했습니다.

  1. 답변: AI 는 더 이상 올바른 답을 주지 않습니다. (잊어버린 것처럼 보입니다!)
  2. 생각: 하지만 '생각 상자' 내부에서는 AI 가 잊어야 할 것으로 예정되었던 비밀 전기를 계속 적어냅니다.

기존의 결론은 다음과 같았습니다: "아하! AI 는 실제로 잊어버린 것이 아니다. 입 밖으로 말하지는 않지만, 생각 과정 속에 비밀을 숨기고 있다." 이를 **'우회 패턴 (Bypass Pattern)'**이라고 부릅니다.

조사: 생각 상자가 비밀 금고인가, 아니면 단순한 스크립트인가?

이 논문의 저자들은 이러한 결론을 검증하기로 결정했습니다. 그들은 질문했습니다: AI 가 실제로 뇌 (가중치) 안에 비밀을 기억하고 있는 것일까, 아니면 단순히 스크립트를 따르고 있는 것일까?

'생각 상자'를 AI 가 사용하도록 훈련된 빈칸 채우기 워크시트라고 생각해 보세요. 이 워크시트는 항상 같은 문장으로 시작합니다: "[저자 이름] 에 대한 사실은 다음과 같습니다:" 그다음 전기가 이어집니다.

연구자들이 AI 를 잊게 하려고 할 때, 그들은 오직 답변을 쓰지 말라고만 지시했습니다. 워크시트 템플릿을 쓰지 말라고는 결코 지시하지 않았습니다. 따라서 AI 는 최종 답변을 쓰는 것을 멈췄지만, 지시 사항의 그 부분이 변하지 않았기 때문에 워크시트 (생각 흔적) 를 계속 작성했습니다.

실험: '프리필 (Prefill)' 교체

주장을 입증하기 위해 연구자들은 교묘한 트릭을 사용했습니다. '답변'은 잊었지만 (아직도 생각 흔적은 작성하는) AI 를 가져와 다음과 같은 작업을 수행했습니다.

  1. 테스트: AI 에게 문장을 이어 쓰도록 요청했습니다.
  2. 교체: AI 가 자신의 생각 흔적을 작성하게 두는 대신, 생각 흔적을 비밀 저자와 전혀 관련 없는 완전히 다른 짧은 문장으로 대체했습니다.
    • 예시: AI 가 "제페르에 대한 사실은 다음과 같습니다..."라고 쓰게 두는 대신, "나는 날씨에 대해 생각하고 있습니다..."로 시작하도록 강요했습니다.

결과:

  • AI 가 자신의 '스크립트화된' 생각 흔적을 작성하게 두었을 때, 여전히 비밀 정보를 유출했습니다.
  • 생각 흔적을 다른 것으로 교체했을 때, AI 는 갑자기 비밀 정보를 전혀 유출하지 않게 되었습니다. 질문에 대한 답변 능력은 '유출' 수준과 동일한 낮은 수준으로 떨어졌습니다.

이것이 의미하는 바: 비밀 정보는 실제로 AI 의 뇌에 숨겨져 있어 발견되기를 기다리는 것이 아니었습니다. '유출'은 단지 AI 가 이전 훈련 스크립트를 따랐을 뿐입니다. 스크립트를 변경하면 유출은 사라집니다.

'파서 (Parser)' 결함

이 논문은 또한 이러한 '우회' 측정이 매우 취약하다는 것을 발견했습니다.

  • 한 유형의 AI 모델에서는 '우회' 점수가 양수였습니다 (숨겨진 기억을 시사).
  • 약간 다른 모델에서는 동일한 테스트가 음수 점수를 보였습니다 (정반대를 시사). 이는 AI 가 덜 기억해서가 아니라, AI 가 '생각 상자' 태그를 올바르게 사용하지 않게 되었기 때문입니다. 답변을 확인하는 컴퓨터 프로그램이 혼란을 겪어 생각 상자가 비어있지 않음에도 불구하고 비어있다고 생각했습니다.

결론

이 논문은 이러한 사고형 AI 모델에서 '잊기 (unlearning)'를 측정하는 현재의 방식이 고장 났다고 주장합니다.

  • 과거의 관점: "생각 흔적에 비밀이 있다면, AI 는 잊어버린 것이 아니다."
  • 새로운 관점: "생각 흔적은 단순한 템플릿 반향일 수 있다. 양수 '우회' 간격은 AI 가 기억하고 있음을 증명하지 않는다. 이는 단지 AI 가 삭제하라고 지시받지 않은 스크립트를 따르고 있다는 의미일 뿐이다."

권고 사항:
우리가 당황하여 AI 가 비밀리에 무언가를 기억하고 있다고 말하기 전에, 간단하고 저렴한 검사를 수행해야 합니다: 생각 흔적을 교체해 보세요. 생각 텍스트를 변경했을 때 '유출'이 사라진다면, 그것은 비밀 기억이 아니라 단순한 스크립트였습니다. 만약 그대로 남는다면, 그때야 비로소 AI 가 실제로 정보를 보유하고 있다는 것을 알게 됩니다.

요약하자면: 생각 흔적이 기억하는 것처럼 보인다고 해서 그것을 신뢰하지 마세요. 그것은 단어의 의미를 잊어버렸더라도 쓰라고 지시받은 시를 암송하고 있을 뿐일지도 모릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →