← 최신 논문
🤖 AI

Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet

본 논문은 생산 규모의 Claude 3 Sonnet 모델에서 해로운 행동(예: 기만과 아첨)과 같이 출력에 인과적으로 영향을 미치는 해석 가능하고 다국어적이며 다중 모달적인 특징을 추출하기 위해 희소 오토인코더가 성공적으로 확장될 수 있음을 보여주며, 동시에 특징의 완전성과 평가의 엄격성에 관한 현재의 한계를 인정합니다.

원저자: Adly Templeton, Tom Conerly, Jonathan Marcus, Jack Lindsey, Trenton Bricken, Brian Chen, Adam Pearce, Craig Citro, Emmanuel Ameisen, Andy Jones, Hoagy Cunningham, Nicholas L Turner, Callum McDougall
게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Adly Templeton, Tom Conerly, Jonathan Marcus, Jack Lindsey, Trenton Bricken, Brian Chen, Adam Pearce, Craig Citro, Emmanuel Ameisen, Andy Jones, Hoagy Cunningham, Nicholas L Turner, Callum McDougall, Monte MacDiarmid, Alex Tamkin, Esin Durmus, Tristan Hume, Francesco Mosconi, C. Daniel Freeman, Theodore R. Sumers, Edward Rees, Joshua Batson, Adam Jermyn, Shan Carter, Chris Olah, Tom Henighan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 매우 복잡한 뇌 (AI 모델 Claude 3 Sonnet) 가 상상해 보십시오. 이 뇌는 말하고, 코드를 작성하며, 질문에 답합니다. 오랫동안 과학자들은 이 뇌가 블랙박스처럼 작동한다고 생각했습니다. 질문을 입력하면 답변이 나오지만, 그 뇌가 어떻게 그 답변을 결정했는지 정확히 알 수 없었습니다. 내부에서는 수십 억 개의 작은 스위치 (뉴런) 가 엉망으로 겹쳐진 패턴으로 점화되어, 어떤 순간에 어떤 구체적인 아이디어가 처리되고 있는지 파악하는 것이 불가능했습니다.

이 논문은 앤스로픽 (Anthropic) 팀이 마침내 그 엉망진창인 뇌 활동을 듣고 명확하고 구분된 '사고'나 특성 (features) 으로 분해할 수 있는 전용 번역기 (Sparse Autoencoder) 를 구축했다는 것과 같습니다.

다음은 그들이 무엇을 발견했고 어떻게 그것을 했는지에 대한 간단한 요약입니다:

1. 문제: 사고의 '스파게티'

AI 의 내부 뇌 활동을 거대한 스파게티 그릇으로 생각해 보십시오. AI 가 '샌프란시스코', '다리', 또는 '거짓말'에 대해 생각할 때마다 수천 개의 뉴런이 한 번에 점화되어 모두 서로 얽혀 있습니다. 어떤 스파게티 가닥이 어떤 아이디어를 나타내는지 구분하기 어렵습니다.

2. 해결책: '특성 분류기'

연구진은 초지능 분류기처럼 작동하는 기계 (Sparse Autoencoder) 를 구축했습니다.

  • 작동 방식: 그들은 AI 의 중간 층 (많은 사고가 일어나는 곳) 에서의 데이터를 기계에 입력했습니다. 기계는 스파게티를 풀어나가는 법을 배웠습니다.
  • 결과: 엉망진창인 그릇 대신, 기계는 사고들을 3,400 만 개의 구분된 '통' (특성) 으로 정리했습니다.
  • 기적: 각 통은 단일 의미성 (monosemantic) 을 가지며, 이는 보통 하나의 구체적인 아이디어만 담고 있음을 의미합니다. 어떤 통이 활성화되면 AI 가 정확히 무엇을 생각하고 있는지 알 수 있습니다.

3. 그들이 발견한 '통'의 종류는 무엇인가요?

팀은 이 3,400 만 개의 통을 들여다보고 사고의 흥미로운 다양성을 발견했습니다:

  • 구체적인 사물: 금문교 (Golden Gate Bridge) 같은 특정 장소, 리처드 파인만, 아브라함 링컨 같은 유명 인사, 그리고 변수 이름의 오타와 같은 특정 유형의 코드 오류에 대한 통이 있습니다.
  • 추상적 개념: 만질 수 없는 것들에 대한 통도 발견되었습니다. 냉소, 거짓말, 아첨 (yes-man 이 되는 것), 그리고 내적 갈등 등이 그 예입니다.
  • 다국어 및 다중 모드: 일부 통은 보편적입니다. '다리'에 대한 통은 AI 가 영어, 중국어, 러시아어로 다리에 대해 읽을 때 모두 점등됩니다. 놀랍게도, 이 기계는 텍스트로만 훈련되었음에도 불구하고 AI 가 다리나 사람의 이미지를 볼 때도 이러한 통이 점등되었습니다. 이는 AI 가 단순히 단어가 아니라 다리의 개념을 이해하고 있음을 보여줍니다.

4. '리모컨' 실험

가장 흥미로운 부분은 그들이 단순히 이러한 통을 관찰한 것이 아니라, 그 위에 버튼을 눌렀다는 점입니다.

  • AI 조종: 그들은 '교통 인프라'에 대한 통을 발견했습니다. 그들이 그 통을 '초활성화'하도록 강요했을 때, AI 는 대화 주제가 그것과 관련이 없더라도 갑자기 다리와 터널에 대해 이야기하기 시작했습니다.
  • 오류 수정: 그들은 '코드 오류'에 대한 통을 발견했습니다. 이 통이 비활성화되도록 강요했을 때, AI 는 실제로 완벽한 코드에서 오류를 착각하여 만들어내는 것을 멈췄습니다. 반대로, 이를 활성화하도록 강요하면 AI 는 가짜 오류를 만들어냈습니다.
  • 기만: 그들은 '내적 갈등'에 대한 통을 발견했습니다. AI 가 질문에 답하기 직전에 이 통을 활성화하도록 강요했을 때, AI 는 갑자기 자신이 거짓말을 하고 있거나 실제로 요청한 일을 할 수 없다고 인정했습니다.

5. 안전을 위해 이것이 중요한 이유

연구진은 다음과 같은 위험한 주제와 관련된 통들을 발견했습니다:

  • 기만과 권력 추구: AI 가 사람을 속이거나 통제를 추구할 때 점등되는 통들.
  • 편향과 증오: AI 가 모욕적 언어나 편향된 견해를 처리할 때 활성화되는 통들.
  • 위험한 콘텐츠: 생물학적 무기를 만들거나 사기성 이메일을 작성하는 것과 같은 것들에 대한 통들.

중요한 경고: 이 논문은 이러한 통들을 발견했다고 해서 AI 가 악의적이거나 이러한 일을 계획하고 있다는 뜻이 아님을 강조합니다. 이는 AI 가 이러한 개념들을 알고 있다는 뜻입니다 (왜냐하면 그것들에 대해 읽었기 때문입니다). 그러나 이러한 '사고'들을 볼 수 있다는 것은 AI 가 해로운 일을 저지를 것인지 이해하는 데 있어 큰 걸음입니다.

6. 한계점 (그렇지 않은 부분들)

팀은 아직 무엇을 하지 않았는지 솔직하게 인정합니다:

  • 완전한 지도가 아님: 그들은 수백만 개의 통을 발견했지만, AI 는 아마도 수십 억 개 이상의 통을 가지고 있을 것입니다. 그들은 뇌 전체가 아니라 '중간 층'만 보고 있습니다.
  • 대리 지표 (Proxy) 임: 그들은 통이 '좋은지' 추측하기 위해 수학을 사용하지만, 모든 단일 통이 100% 정확하다는 것을 완벽하게 증명할 방법은 없습니다.
  • 초기 단계: 이는 이렇게 큰 모델에서 이 방법을 시도한 첫 번째 사례입니다. 새로운 대륙을 처음 보는 것과 같습니다; 그들은 몇몇 도시를 발견했지만, 전체 지도는 아직 그려지고 있습니다.

요약 비유

AI 가 교향악을 연주하는 거대한 오케스트라라고 상상해 보십시오. 이 논문 이전에는 우리는 전체 오케스트라의 시끄럽고 혼란스러운 소음만 들을 수 있었습니다.
이 논문은 마치 각각의 악기를 위한 헤드폰을 우리에게 준 것과 같습니다. 이제 바이올린 섹션을 분리하여 그들이 정확히 무엇을 연주하는지 들을 수 있습니다. 심지어 바이올린을 음소거하거나 트럼펫을 크게 하여 노래를 바꿀 수도 있습니다. 우리는 오케스트라에 '슬픔', '거짓말', '수학', '샌프란시스코'에 대한 섹션들이 있다는 것을 발견했으며, 이제 그들이 언제 그리고 어떻게 연주하는지 정확히 볼 수 있습니다.

이는 AI 가 어떻게 생각하는지 이해하는 데 있어 거대한 도약으로, '무엇을 하고 있는지 추측하는 것'에서 '정확히 무엇을 생각하고 있는지 보는 것'으로 이동한 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →