← 최신 논문
🤖 machine learning

WriteSAE: Sparse Autoencoders for Recurrent State

본 논문은 디코더 원자를 고유한 랭크 1 업데이트 형태로 분해하여 상태 공간 및 하이브리드 순환 언어 모델의 행렬 캐시 쓰기를 분해하고 편집하도록 설계된 최초의 희소 오토인코더인 WriteSAE 를 소개하며, 이를 통해 정밀한 행동 개입과 매우 정확한 효과 예측을 가능하게 합니다.

원저자: Jack Young

게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jack Young

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델 (이야기를 쓰거나 질문에 답하는 모델들) 을 거대하고 고속의 공장으로 상상해 보세요. 이 공장 내부에는 기계가 다음 단계로 이동하기 전에 현재 생각을 기록하는 특별한 '메모리 보드'가 있습니다.

오랫동안 과학자들은 **희소 오토인코더 (Sparse Autoencoders, SAEs)**라는 도구를 사용하여 이 보드에 무엇이 쓰여 있는지 이해하려 노력해 왔습니다. 이러한 도구를 연구자가 기계가 생각하고 있는 개별 '아이디어'나 '특징'을 볼 수 있게 해주는 안경으로 생각할 수 있습니다. 그러나 문제가 있었습니다. 이러한 안경은 공장의 출력에만 작동했을 뿐, 특정 고급 모델에서 기계가 메모리 보드에 쓰는 구체적인 방식에는 작동하지 않았던 것입니다.

이 논문은 WriteSAE라는 새로운 도구를 소개합니다. 그 작동 원리를 간단히 설명하면 다음과 같습니다:

1. 문제: 안경의 잘못된 모양

구형 모델에서 기계는 생각을 단순한 숫자 목록으로 기록했습니다. 기존 안경 (표준 SAE) 은 목록을 읽도록 설계되었습니다.
하지만 Gated DeltaNet, Mamba-2, RWKV-7 과 같은 더 빠르고 새로운 모델에서는 기계가 목록을 쓰지 않습니다. 대신 '랭크 -1 업데이트 (rank-1 update)'라는 특정 수학적 트릭을 사용하여 **행렬 (숫자의 격자)**을 씁니다.

  • 비유: 기계가 그림을 그리는 상황을 상상해 보세요. 기존 도구는 완성된 캔버스를 바라보며 그림을 설명하려 했습니다. 하지만 새로운 기계는 복잡한 격자에 한 번에 하나의 특정 붓질 (단일 색상 선) 을 추가하며 그림을 그립니다. 기존 도구는 전체 색상 목록을 찾으려 했지 단일 붓질을 찾으려 하지 않았기 때문에 그 단일 붓질을 볼 수 없었습니다.

2. 해결책: WriteSAE

저자들은 그 단일 붓질을 보도록 특별히 설계된 새로운 안경인 WriteSAE를 개발했습니다.

  • 모양 일치: 목록을 읽으려 시도하는 대신, WriteSAE 의 '원자 (atoms)' (찾아내는 조각들) 는 기계가 사용하는 붓질과 정확히 같은 모양을 하고 있습니다. 이들은 미세한 단일 붓질 패턴입니다.
  • 결과: 모양이 완벽하게 일치하기 때문에 WriteSAE 는 기계가 메모리에 쓰는 내용을 어떤 순간이든 정확히 분리해 낼 수 있습니다.

3. 실험: 붓질 바꾸기

이것이 작동함을 증명하기 위해 연구자들은 기계의 메모리에 '수술'을 가했습니다.

  • 교체: 그들은 기계가 특정 붓질을 쓴 순간을 찾아냈습니다. 그 붓질을 지우고 새로운 사전 (WriteSAE) 에서 배운 붓질로 대체했습니다.
  • 테스트: 이를 두 가지 다른 시나리오와 비교했습니다.
    1. 완전히 지우기 (빈 자국 남기기).
    2. 무작위 낙서 넣기.
  • 결과: WriteSAE 붓질을 교체했을 때, 기계는 이전과 거의 정확히 동일하게 작동했습니다 (92.4% 의 경우). 반면 지우거나 무작위 낙서를 넣었을 때 기계는 혼란을 겪고 실수를 했습니다.
  • 비유: 시계의 특정 기어를 완벽하게 맞는 맞춤형 기어로 교체하는 것과 같습니다. 시계는 계속 틱틱거립니다. 기어를 제거하거나 무작위 돌을 넣으면 시계는 멈춥니다.

4. 발견한 내용

  • 두 가지 유형의 붓질: 그들은 기계가 두 가지 주요 유형의 붓질을 사용한다는 것을 발견했습니다.
    • 레지스터 (Registers): 문장의 시작이나 고유명사처럼 특정 작업을 수행하는 정밀하고 집중된 붓질입니다.
    • 번들 (Bundles): 여러 가지 일을 혼합하여 수행하는 것처럼 보이는 더 산만하게 퍼진 붓질입니다.
  • 미래 예측: 특정 붓질을 변경하면 기계의 다음 단어가 어떻게 변할지 정확히 예측할 수 있는 수학적 공식을 발견했습니다. 마치 이 특정 기어 하나를 조정하면 시계가 1 초 일찍 종소리를 울린다는 것을 아는 것과 같습니다.
  • 기계 편집: 이 도구를 사용하여 새로운 행동을 '설치'하는 데 성공했습니다. 예를 들어, 올바른 붓질을 메모리 보드에 삽입함으로써 기계가 평소에는 선택하지 않을 특정 주제 (예: '중간 순위' 단어) 에 대해 계속 말하도록 강요할 수 있었습니다.

5. 한계

이 논문은 이 도구가 이러한 특정 '단일 붓질' (랭크 -1) 방식으로 쓰는 모델에서 가장 잘 작동한다고 매우 신중하게 말합니다.

  • 만약 모델이 두 번의 붓질을 동시에 사용하거나 대각선 패턴과 같이 더 복잡한 방식으로 쓴다면, 도구는 완벽하게 작동하지는 않지만 여전히 일부 패턴을 찾아냅니다.
  • 이 도구는 Qwen3.5 모델 (특정 유형의 AI) 에서 훌륭하게 작동하며, 다른 유사 모델에서도 작동함을 보여주었습니다. 하지만 미래를 예측하는 '마법 공식'은 모델의 아키텍처에 따라 달라집니다.

요약

WriteSAE는 고급 AI 모델이 내부 메모리에 쓰는 구체적인 방식을 보고 편집할 수 있게 해주는 새로운 도구입니다. 도구의 모양을 기계의 쓰기 방식 모양에 맞추어 연구자들은 특정 생각을 교체하고, 기계의 반응을 예측하며, 심지어 기계가 평소에는 말하지 않을 내용도 말하도록 유도할 수 있습니다. 이는 기계가 고장 나지 않은 채로 이루어집니다. 과학자들이 이러한 특정 유형의 모델의 메모리 작성 사이트에서 직접 이러한 종류의 '수술'을 성공적으로 수행한 것은 이번이 처음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →