← 최신 논문
🤖 AI

Probe-Geometry Alignment: Erasing the Cross-Sequence Memorization Signature Below Chance

본 논문은 대규모 언어 모델의 무작위 확률 미만의 교차 시퀀스 암기 서명을 소거하면서도 기능적 능력을 유지하도록 모델 활성화를 정렬하는 수술적 개입인 Probe-Geometry Alignment(PGA)를 소개합니다.

원저자: Anamika Paul Rupa, Anietie Andy

게시일 2026-05-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Anamika Paul Rupa, Anietie Andy

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

가정해 보세요. 특정 비밀 이야기를 암기해 둔 책 도서관 (대형 언어 모델) 이 있다고 칩시다. 도서관 사서에게 이 이야기를 '잊어버리게' 하라고 요청합니다. 즉, 사서는 이 이야기를 누구에게도 다시는 말하지 않아야 합니다.

현재 대부분의 '기억 삭제' 방법들은 사서에게 "누군가 이 이야기를 물어보면 그냥 '모른다'고 하거나 다른 결말로 지어내라"고 말하는 것과 같습니다. 사서는 이를 따르고 이야기를 말하는 것을 멈춥니다. 하지만 이 논문은 이야기가 여전히 사서의 뇌에 기록되어 있으며, 단지 숨기도록 배웠을 뿐이라고 주장합니다. 적절한 까다로운 질문을 던지면 사서는 실수로 여전히 알고 있음을 드러낼 수 있습니다.

이 논문은 이야기가 사서의 뇌에서 진정으로 사라졌는지 확인하는 방법과, 사서가 자신의 업무를 수행하는 법을 잊지 않도록 실제로 그것을 지우는 새로운 방법을 소개합니다.

문제: 기계 속의 '유령'

저자들은 모델이 암기된 비밀을 말하는 것을 멈추더라도 내부적으로는 여전히 그것을 알고 있음을 발견했습니다. 그들은 이를 '교차 시퀀스 서명 (cross-sequence signature)'이라고 부릅니다.

비유:
도서관 사서의 뇌에 비밀 이야기를 생각할 때마다 켜지는 숨겨진 '예/아니오' 스위치가 있다고 상상해 보세요.

  • 기존 기억 삭제: 사서가 입을 다물도록 훈련시킵니다. 사서는 이야기를 말하지 않습니다.
  • 현실: 비밀 이야기에 대해 질문하면 숨겨진 '예/아니오' 스위치는 여전히 밝게 켜집니다. 지식은 여전히 존재하며, 단지 억압되었을 뿐입니다.

저자들은 이 스위치가 켜지는지 확인하기 위한 특수한 테스트 (프로브) 를 개발했습니다. 그들은 이 기억의 '유령'이 작은 장난감 모델부터 Mistral-7B 같은 거대 모델에 이르기까지 모든 크기의 모델에 존재함을 발견했습니다.

발견: 기억과 말하기는 분리되어 있음

이 논문의 가장 큰 발견 중 하나는 기억하기말하기가 뇌의 서로 다른 부분에서 일어난다는 것입니다.

비유:
모델을 라디오 방송국으로 생각해 보세요.

  • 저장소: 비밀은 '녹음 스튜디오' (모델의 깊은 층) 에 저장되어 있습니다.
  • 방송: '방송 중' 스위치 (어텐션 헤드) 가 녹음을 재생할지 여부를 결정합니다.

저자들은 '방송 중' 스위치를 고장 나게 하여 비밀이 결코 방송되지 않도록 (모델이 이야기를 말하지 않도록) 할 수 있음을 보여주었습니다. 하지만 스튜디오의 녹음은 완벽하게 선명하고 온전하게 남아 있습니다. 라디오가 침묵하고 있더라도 녹음을 가리키며 "저것이 비밀이다!"라고 말할 수 있습니다.

해결책: '프로브 - 기하학적 정렬 (Probe-Geometry Alignment, PGA)'

기존 방법들이 '방송 중' 스위치만 고장 냈기 때문에, 저자들은 **프로브 - 기하학적 정렬 (PGA)**이라는 새로운 외과적 도구를 고안해냈습니다.

비유:
마이크만 고장 내는 대신, PGA 는 녹음 스튜디오로 들어가 음파를 정렬합니다.

  1. 신호 찾기: 먼저 특수한 테스트를 사용하여 비밀이 숨어 있는 뇌의 정확한 방향을 찾습니다.
  2. 외과적 정렬: 그런 다음 모델의 모든 층에서 미세하고 정밀한 조정을 수행합니다. 뇌 전체를 삭제하는 것이 아니라, 비밀이 존재하는 특정 '방향'만 살짝 밀어내어 더 이상 비밀처럼 보이지 않도록 합니다. 이는 모델의 일반 지식 (나머지 사진) 은 완벽하게 선명하게 유지하면서, 비밀이 있던 특정 영역에서만 선명한 고화질 사진을 정적 노이즈로 바꾸는 것과 같습니다.

결과:

  • 유령은 사라짐: PGA 를 사용한 후 특수 테스트는 더 이상 켜지지 않습니다. 오히려 테스트가 무작위 추측보다 더 나쁜 성능을 보일 정도로, 모델은 비밀의 내부 구조를 진정으로 잊어버렸습니다.
  • 부작용 없음: 중요한 점은 이 수술로 인해 사서가 다른 일을 하는 법을 잊게 만들지 않았다는 것입니다. 일반 질문에 답하거나, 이야기를 쓰거나, 논리 퍼즐을 해결하는 능력은 정확히 그대로 유지되었습니다.

쉬운 영어로 정리한 핵심 요약

  1. 침묵은 망각이 아님: 모델이 비밀을 말하지 않는다고 해서 그것을 잊은 것은 아닙니다. 기억은 여전히 내부에 숨어 있습니다.
  2. 숨은 장소를 볼 수 있음: 저자들은 다양한 크기의 모델에서 이러한 숨겨진 기억을 탐지할 수 있는 방법을 고안했습니다.
  3. 삭제 가능함: 그들은 이러한 숨겨진 기억을 외과적으로 제거하는 방법 (PGA) 을 개발했습니다.
  4. 안전함: 이 삭제는 매우 정밀하여 모델의 일반 지능을 손상시키지 않습니다. 흰 셔츠에서 특정 얼룩만 제거하되 셔츠를 수축시키거나 색을 바꾸지 않는 것과 같습니다.

이 논문은 AI 에서 무언가를 진정으로 '잊게' 하려면 출력을 침묵시키는 것이 아니라 내부 표현을 지워야 한다고 결론지었습니다. 그들의 새로운 방법인 PGA 가 바로 그것을 수행합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →