← 최신 논문
🤖 machine learning

Spectral Probe-Circuits: A Three-Step Recipe for Identifying Attention-Head Circuits in Pretrained Transformers

본 논문은 사전 훈련된 트랜스포머에서 인과적 어텐션 헤드 회로를 식별하기 위한 3 단계 비지도 방법론을 제시하며, 스펙트럼 신호 기반 접근법이 다양한 모델 규모, 아키텍처, 훈련 파이프라인에 걸쳐 작업별 유도 회로를 성공적으로 분리해 낸다는 것을 입증합니다.

원저자: Yongzhong Xu

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yongzhong Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 책 도서관 (신경망) 이 말하기 방법을 배우기 위해 수백만 개의 이야기를 읽었다고 상상해 보세요. 이 도서관 안에는 문장을 형성할 때 어떤 단어에 주의를 기울일지 결정하는 수천 명의 작은 사서들 ( '어텐션 헤드'라고 함) 이 있습니다.

이 논문은 '유도' ( 'A, B... A, B'와 같은 패턴을 발견하고 다음 B 를 예측하는 것) 와 같은 특정 트릭을 담당하는 사서 그룹을 찾기 위한 3 단계 레시피를 제시합니다. 저자들은 다음과 같은 점을 알고 싶어 합니다: 정확히 어떤 사서들이 이 일을 하고 있으며, 이를 증명할 수 있을까요?

다음은 간단히 설명한 레시피입니다:

1 단계: '활동계' (스펙트럼 신호)

문제: 도서관을 그냥 봐서는 누가 일하고 있는지 알 수 없습니다. 이야기를 단순히 멍하니 바라보거나 경직된 규칙만 따르는 것이 아니라, 이야기의 내용을 실제로 생각하고 있는 사서를 찾아낼 방법이 필요합니다.

해결책: 저자들은 '참여 비율' 계를 발명했습니다.

  • 유추: 어떤 책에 대해 물어보든 항상 같은 책장을 가리키는 사서를 상상해 보세요. 이는 지루한 일입니다; 그들은 실제로 생각하고 있지 않습니다. 이제 당신이 물어보는 모든 책마다 다른 책장을 바라보는 사서를 상상해 보세요. 그 사서는 내용을 적극적으로 처리하고 있습니다.
  • 도구: 저자들은 시간이 지남에 따라 사서의 주의가 얼마나 '퍼져 있는지' 측정합니다. 사서의 주의가 이야기에 따라 다양한 곳으로 뛰어다닌다면, 그들의 '계' 수치는 올라갑니다. 이는 아직 그들이 어떤 구체적인 작업을 하고 있는지 알 필요 없이, 전문적인 작업을 수행하는 사서들을 찾아내는 데 도움이 됩니다. 마치 공장에서 얼마나 많이 움직이는지 관찰함으로써 가장 활발한 근로자들을 찾아내는 것과 같습니다.

2 단계: '직무 설명' 스크린

문제: 1 단계의 '활동계'는 모든 바쁜 근로자들을 찾아냅니다. 하지만 우리는 하나의 특정 작업 (예: 유도) 을 수행하는 근로자들을 찾고 싶습니다. 계는 완전히 다른 일을 하는 바쁜 근로자를 강조할 수도 있습니다.

해결책: 목록을 필터링하기 위해 '스크린'을 적용합니다.

  • 유추: 100 명의 활발한 근로자 목록이 있다고 가정해 보세요. 그들에게 물어봅니다: "현재 단어 바로 앞의 단어를 보고 있는 사람은 누구인가?" (이전 토큰) 또는 "'A... A' 패턴을 보고 있는 사람은 누구인가?" (유도).
  • 도구: 그들은 활발한 근로자들의 주의 패턴을 확인합니다. 특정 작업에 맞는 올바른 위치를 보고 있는 근로자 (예: 두 번째 'A'를 볼 때 첫 번째 'A'를 다시 보는 것) 가 있다면, 그들은 후보 목록에 들어갈 '권장'을 받습니다. 이렇게 하면 '바쁜 근로자'에 대한 일반적인 목록이 '유도 근로자'에 대한 구체적인 목록으로 바뀝니다.

3 단계: '소방 훈련' (인과적 검증)

문제: 근로자가 올바른 곳을 보고 있다고 해서 그들이 결과를 유발하고 있다는 뜻은 아닙니다. 아마도 그들은 단순히 지켜보고 있을 뿐, 실제 작업을 수행하는 사람은 다른 사람일 수 있습니다.

해결책: 그들은 '소방 훈련' (제거) 을 수행합니다.

  • 유추: 2 단계에서 식별된 특정 '유도 근로자' 그룹에게 작업을 중단하라고 지시합니다 (출력을 0 으로 설정).
    • 테스트: 도서관이 다음 단어를 올바르게 예측하는 것을 멈추나요?
    • 통제: 무작위로 사람을 해고하여 도서관을 망가뜨리는 것이 아닌지 확인하기 위해, 목록에 없었던 같은 부서의 다른 근로자 그룹도 해고합니다.
    • 결과: '유도 근로자'를 해고할 때만 도서관이 멈추고, 무작위 그룹을 해고할 때는 정상적으로 작동한다면, 특정 그룹이 그 일을 수행하고 있었다는 것을 증명하게 됩니다.

그들이 발견한 것

  1. 레시피는 어디에서나 작동합니다: 그들은 5 천만 개의 매개변수를 가진 매우 작은 모델부터 10 억 개의 매개변수를 가진 꽤 큰 모델까지 다양한 모델에서 이 레시피를 테스트했습니다. 모든 모델에서 유도 트릭을 담당하는 3 명에서 6 명의 작은 사서 팀을 발견했습니다.
  2. 예측 가능합니다: 그들은 모델이 아직 완성되기 전, 훈련 에 이러한 특정 팀을 찾을 수 있었습니다. '활동계'는 모델이 아직 그 작업에 능숙해지기 전에 올바른 근로자들을 위해 점등되었습니다.
  3. '전문가' 비율은 일정합니다: 도서관이 아무리 커져도 이러한 전문적이고 고차원적인 작업을 수행하는 사서의 비율은 거의 일정하게 유지됩니다 (약 17~19%). 도서관의 나머지는 일반적인 일을 처리합니다.
  4. 다른 모델, 다른 팀: 작업 (유도) 은 동일하지만, 다른 모델들은 이를 수행하기 위해 서로 다른 의 사서들을 사용합니다. 한 모델은 앞쪽 행의 근로자들을 사용할 수 있고, 다른 모델은 중간 행의 근로자들을 사용할 수 있습니다. 하지만 레시피는 각 특정 모델에 맞는 올바른 팀을 찾아냅니다.

요약

이 논문은 AI 의 특정 트릭을 수행하는 '뇌 세포'를 찾는 신뢰할 수 있는 3 단계 방법을 제공합니다. 단순히 추측하는 것이 아니라, 활발한 근로자들을 찾아내고, 직무 설명으로 필터링한 다음, 그들을 끄고 무엇이 고장 나는지 관찰함으로써 그들이 필수적임을 증명합니다. 이는 AI 모델이 거대해짐에 따라 정교한 작업을 수행하는 핵심 팀은 작고 일관되게 유지됨을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →