← 최신 논문
💬 NLP

Constructing Interpretable Features from Compositional Neuron Groups

본 논문은 MLP 활성화 값을 공활성화된 뉴런으로 구성된 희소하고 해석 가능한 특징으로 분해하기 위해 준비음수 행렬 분해 (SNMF) 를 사용하는 것을 제안하며, 이 접근법이 인과적 조종에서 희소 오토인코더 및 지도 학습 기반 방법보다 우수하면서도 대규모 언어 모델 내 개념 표현의 계층적 구조를 드러낸다는 것을 보여줍니다.

원저자: Or Shafran, Atticus Geiger, Mor Geva

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Or Shafran, Atticus Geiger, Mor Geva

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 대규모 언어 모델 (LLM) 을 방대하고 복잡한 오케스트라로 상상해 보세요. 오랫동안 이 오케스트라가 어떻게 작동하는지 이해하려는 과학자들은 개별 음악가 (뉴런) 에 집중해 왔습니다. 그들은 "만약 한 명의 바이올리니스트가 무엇을 하는지 파악할 수 있다면, 그 음악을 이해할 수 있을 것이다"라고 생각했습니다.

그러나 이 논문은 이러한 접근 방식이 결함이 있다고 주장합니다. 실제로 음악가들은 종종 특정 소리를 만들어내기 위해 그룹으로 함께 연주합니다. 한 명의 바이올리니스트가 한 곡에서는 슬픈 음을 연주하고 다른 곡에서는 행복한 음을 연주할 수도 있습니다. 그 '의미'는 바이올리니스트 한 명에 있는 것이 아니라, 동시에 연주하는 음악가들의 조합에 있습니다.

다음은 이 논문의 이야기를 단순한 개념으로 분해한 것입니다:

1. 문제: "사전"이 너무 지저분했다

이전까지 연구자들은 **희소 오토인코더 (Sparse Autoencoder, SAE)**라는 도구를 사용하여 이러한 음악 그룹을 찾으려 했습니다. SAE 를 매우 야심 찬 사서로 생각할 수 있는데, 그는 혼란스러운 도서관을 정리하려 합니다. 그는 책 (데이터) 을 분류하기 위해 처음부터 새로운 '선반' (특징) 을 발명하려 합니다.

문제는 무엇일까요? 사서가 때로는 인간에게 이해되지 않는 선반을 만들거나, 선반에 있는 책들이 실제로 그곳에 속하지 않는 경우가 있습니다. 연구자들이 이러한 선반을 사용하여 오케스트라를 조종하려 할 때 (특정 곡을 연주하게 하려 할 때), 사서의 시스템은 종종 실패했습니다. 이는 바다를 보지 않고 처음부터 그려진 지도를 사용하여 배를 조종하려는 것과 같습니다.

2. 해결책: "구성적" 접근법

저자들은 SNMF(Semi-Nonnegative Matrix Factorization, 준비음수 행렬 분해) 라는 새로운 방법을 제안합니다.

새로운 선반을 발명하는 대신, SNMF 는 오케스트라의 악보(모델의 내부 수학) 를 보고 "지금 어떤 음악가들이 함께 연주하고 있는가?"라고 묻습니다.

  • 비유: 오케스트라가 "비"에 관한 곡을 연주한다고 상상해 보세요. SNMF 는 새로운 "비" 버튼을 발명하지 않습니다. 대신 플루트, 첼로, 팀파니가 모두 동시에 크게 연주하고 있음을 알아차립니다. 이들을 한 그룹으로 묶고 "이 특정 트리오가 '비' 특징이다"라고 말합니다.
  • 핵심 차이: SNMF 는 실제로 연주하고 있는 음악가들로부터 직접 그룹을 구성하기 때문에, 정확히 어떤 음 (입력) 이 그 그룹을 촉발시켰는지 알고 있습니다. 이는 "이 세 가지 악기를 보면 비가 오는 것임을 안다"는 지휘자에게 직접 연결된 라인을 가진 것과 같습니다.

3. 결과: 더 나은 제어와 명확한 의미

연구자들은 이 새로운 방법을 Llama 3.1 과 Gemma 2 와 같은 여러 유명한 AI 모델에서 테스트했습니다. 그들은 이를 기존의 "사서" 방법 (SAE) 과 인간이 컴퓨터에게 정확히 무엇을 찾아야 하는지 알려주는 매우 엄격한 감독 방법과 비교했습니다.

  • "조종" 테스트: 그들은 AI 를 "경찰"이나 "역사"와 같은 특정 주제에 대해 이야기하도록 "조종"해 보았습니다. SNMF 는 이 부분에서 훨씬 더 뛰어났습니다. 기존 방법들보다 AI 의 출력을 원하는 주제로 더 효과적으로 전환할 수 있었으며, 동시에 문장이 문법적으로 정확하고 유창하게 유지되었습니다.
  • "탐지" 테스트: 그들은 AI 가 주제가 논의될 때 이를 인식할 수 있는지 확인했습니다. SNMF 는 이러한 개념을 포착하는 데 있어 기존 최선 방법들과 동등한 성능을 보였습니다.

4. 큰 발견: "레고" 구조

이 논문의 가장 매혹적인 부분은 이러한 그룹이 어떻게 구축되는지에 대한 발견입니다.

그들은 AI 가 레고 블록처럼 더 간단한 것들을 쌓아 복잡한 아이디어를 구축한다는 것을 발견했습니다.

  • 비유: "날짜"를 나타내는 뉴런 그룹이 있다고 가정해 보세요. 그런 다음 "평일"을 나타내는 약간 다른 그룹이 있습니다. "평일" 그룹은 "날짜" 그룹에 "아니요, 토요일이나 일요일은 아닙니다"라고 말하는 몇 개의 추가 뉴런이 더해진 것입니다.
  • 계층 구조: 그들의 방법을 재귀적으로 (반복적으로) 적용함으로써 그들은 트리 구조를 보았습니다.
    • 하위 수준: "월요일", "화요일" 등을 위한 구체적인 뉴런.
    • 중간 수준: "평일" (월요일~금요일을 결합) 을 위한 그룹.
    • 상위 수준: "요일" (평일과 주말을 결합) 을 위한 그룹.

이는 AI 가 단순히 무작위 뉴런을 가지고 있는 것이 아니라, 계층적 아키텍처를 가지고 있음을 보여줍니다. AI 는 더 복잡한 아이디어를 생성하기 위해 동일한 핵심 "빌딩 블록"(뉴런) 을 재사용합니다. 예를 들어, "날짜"에 대한 핵심 뉴런은 "월요일", "화요일", "주말"에 재사용되며, 이를 구분하기 위해 몇 개의 추가 뉴런만 추가됩니다.

요약

이 논문은 함께 작동하는 뉴런 그룹(개인이 아닌) 을 살펴보고 모델이 실제로 어떻게 계산하는지를 존중하는 수학 도구를 사용함으로써 다음과 같은 것이 가능하다고 주장합니다:

  1. 인간이 쉽게 이해할 수 있는 개념을 발견할 수 있습니다.
  2. 이전보다 AI 의 출력을 훨씬 더 효과적으로 제어할 수 있습니다.
  3. AI 가 벽돌로 집을 짓는 것처럼 더 간단하고 재사용 가능한 부분을 결합하여 복잡한 아이디어를 구축한다는 것을 볼 수 있습니다.

저자들은 이 방법이 AI 모델이 어떻게 생각하는지 "해부"하는 간단하고 효과적인 방법이며, 우리가 이제 보고 사용할 수 있는 논리적이고 계층적인 방식으로 조직되어 있음을 드러낸다고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →