Understanding Verbatim Memorization in LLMs Through Circuit Discovery
이 논문은 기계론적 해석 가능성과 트랜스포머 회로 발견 기법을 활용하여, 거대언어모델(LLM)에서 문구 그대로의 암기(verbatim memorization)를 시작하는 단계와 유지하는 단계를 담당하는 신경 서브그래프가 서로 구별됨을 밝히며, 이때 시작 단계는 문맥 의존적인 반면 방지 메커니즘은 도메인 간에 강건하게 전이된다는 것을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대 언어 모델(LLM)을 지금까지 쓰인 모든 책이 저장된 거대하고 초정밀하게 조직된 도서관이라고 상상해 보세요. 가끔 당신이 사서에게 질문을 던지면, 사서는 단순히 이야기를 요약하는 데 그치지 않고 어떤 책의 한 단락을 토씨 하나 틀리지 않고 그대로 읊기도 합니다. 이것을 **암기(memorization)**라고 부릅니다.
당신이 공유한 논문은 마치 탐정 팀이 사서가 정확히 어떻게 그 책을 읊기 시작하기로 결정하는지, 그리고 어떻게 그 과정을 계속 유지하는지를 알아내려는 시도와 같습니다. 이들은 단순히 추측하는 대신, "회로 발견(circuit discovery)"이라는 특별한 도구를 사용하여 이 작업을 처리하는 사서의 뇌 내부의 구체적인 전기적 경로를 지도화했습니다.
다음은 쉬운 비유를 사용한 연구 결과의 요약입니다:
1. 두 가지 서로 다른 직무: "시작 스위치"와 "트레드밀"
연구진은 문장을 암기하는 것이 단순히 하나의 큰 동작이 아니라는 점을 깨달았습니다. 이는 마치 기계를 켜고 나서 그것을 계속 돌아가게 만드는 것처럼, 실제로 두 가지 별개의 단계로 이루어져 있습니다.
- "시작 스위치" (암기 결정): 모델이 당신의 프롬프트를 보고 "헤이, 나 이 문장 정확히 알고 있어! 그대로 복사하자"라고 결정하는 순간입니다.
- "트레드밀" (분기 비교): 일단 모델이 복사를 시작하면, 이는 모델이 딴 길로 새지 않고 같은 경로를 따라 단어 하나하나를 계속 따라가도록 유지하는 메커니즘입니다.
2. 탐정 작업: 미세한 회로 찾기
이 메커니즘을 찾기 위해 연구진은 "틀린 그림 찾기" 게임을 만들었습니다. 그들은 모델에게 매우 유사한 두 가지 프롬프트를 주었습니다:
- 클린 프롬프트 (Clean Prompt): 암기된 응답을 유발하기까지 딱 한 단계 직전의 문장입니다.
- 오염된 프파롬프트 (Corrupted Prompt): 모델을 완전히 다른, 암기되지 않은 답변으로 이끄는 유사한 형태의 문장입니다.
이 두 프롬프트 사이의 "뇌 활동(활성화 값)"을 서로 맞바꿈으로써, 그들은 어떤 미세한 전선(회로)이 스위치 역할을 하는지 확인할 수 있었습니다. 그들은 두 가지 놀라운 사실을 발견했습니다:
- "시작 스위치"는 마스터 컨트롤러입니다: 암기를 시작하는 데 책임이 있는 이 작은 전선 그룹은 암기를 계속 유지할 수 있을 만큼 강력합니다. 만약 당신이 "시작 스위치"를 건드리면, 모델은 암기를 완전히 멈춥니다.
- "트레드밀"은 일방통행입니다: 이미 암기된 경로에 올라탄 모델이 계속 그 경로를 유지하도록 만드는 전선들은, 스스로 암기 과정을 시작할 수는 없습니다. 이들은 마치 누군가 이미 달리고 있어야만 작동하는 트레드밀과 같아서, 스스로 엔진을 걸 수는 없습니다.
3. "범용 정지 버튼" vs "맥락 특화형 시작 버튼"
연구진은 이 회로들이 위키피디아뿐만 아니라 다른 종류의 텍스트(예: 코드, 이메일, 웹 페이지)에서도 작동하는지 테스트했습니다.
- "범용 정지 버튼": 암기를 방지하는(모델의 낭독을 멈추는) 회로는 어디에서나 작동했습니다. 텍스트가 GitHub 코드이든 Enron 이메일이든 상관없이, 동일한 "브레이크"를 적용하여 모델의 낭독을 멈출 수 있었습니다.
- "맥락 특화형 시작 버튼": 암기를 유발하는 회로는 까다로웠습니다. 이메일에서 문장을 암기하도록 만드는 트리거가 코드 파일에서 문장을 암기하도록 만드는 트리거와 반드시 일치하지는 않았습니다. 즉, "시작" 메커니즘은 특정 텍젝트 유형에 크게 의존했습니다.
4. 핵심 결론: 트리거를 깨뜨리는 것이 기억을 깨뜨리는 것보다 쉽다
가장 흥ante로운 결론은 이러한 행동을 어떻게 제어할 것인가에 대한 것입니다.
연구진은 "시작 스위치"를 깨뜨리는 것(모델이 암기하기로 결정하는 것을 방지하는 것)이 새로운 것을 암기하도록 강제하는 것보다 훨씬 쉽다는 것을 발견했습니다.
그들은 이를 보안 시스템이 있는 집과 비교합니다:
- 저장된 정보(도서관 안의 책들)는 변경하거나 지우기가 매우 어렵습니다.
- 하지만 트리거(도서관 문을 여는 열쇠)는 취약합니다. 만약 열쇠를 손상시킨다면, 책들은 여전히 그 안에 있더라도 도서관은 잠긴 상태로 유지됩니다.
요약하자면: 이 논문은 만약 우리가 AI가 개인 정보나 저작권이 있는 텍스트를 유출하는 것을 막고 싶다면, 기억 자체를 삭제하려고 노력하는 대신(그것은 어렵습니다), 언제 낭독을 시작할지 결정하는 특정 "트리거 회로"를 찾아내어 비활성화하는 데 집중해야 한다고 제안합니다. 왜냐하면 그 부분이 다양한 유형의 텍스트에 걸쳐 작동하는 약점이기 때문입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.