How Much Do Circuits Tell Us? Measuring the Consistency and Specificity of Language Model Circuits
본 논문은 식별된 언어 모델 회로가 작업 수행에 대해 매우 일관적이고 필수적이지만 상당한 작업 간 중첩으로 인해 작업 특이성이 결여되어 있어, 표적 개입 및 이해를 위한 프레임워크의 유용성에 의문을 제기한다는 것을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 복잡한 공장 (대형 언어 모델) 이 상상해 보세요. 수학 문제를 풀고 농담을 하는 등 모든 종류의 문제를 해결할 수 있는 공장입니다. 오랫동안 과학자들은 이 공장 내부의 어떤 기계들이 어떤 일을 담당하는지 정확히 파악하려고 노력해 왔습니다. 그들은 이러한 특정 기계 그룹을 '회로 (circuits)'라고 부릅니다.
이 논문은 이러한 회로에 대해 두 가지 간단한 질문을 던집니다:
- 일관성: 공장이 같은 작업 (예: 숫자 더하기) 을 열 번 수행할 때, 매번 정확히 같은 기계들을 사용할까요?
- 특이성: 공장이 수학 작업을 할 때, 역사 작업을 할 때와 다른 기계들을 사용할까요?
연구자들은 간단한 비유를 사용하여 다음과 같은 결과를 발견했습니다:
1. "일관성" 테스트: 네, 그들은 신뢰할 수 있습니다.
연구자들은 공장이 같은 작업을 위해 같은 도구를 사용하는지 확인했습니다.
- 결과: 네! 공장에 숫자 더하기를 요청하면, 거의 모든 수학 문제에서 특정 기계 세트 (대부분의 'MLP 레이어'로, 이는 공장의 중장비 작업대 같은 역할을 합니다) 를 일관되게 사용합니다.
- 비유: 이는 특정 케이크를 만드는 셰프와 같습니다. 그들이 그 케이크를 만들 때마다 같은 믹서와 같은 오븐을 사용합니다. 중간에 블렌더나 토스터로 바꾸지 않습니다. 연구자들은 이러한 특정 기계들을 '플러그를 뽑으면' 공장이 해당 작업을 거의 완전히 수행하지 못한다는 사실을 발견했습니다. 이는 이러한 기계들이 단순히 바쁘게 보이는 척하는 것이 아니라 실제로 일을 하고 있음을 증명합니다.
2. "특이성" 테스트: 아니요, 그들은 고유하지 않습니다.
이 부분이 놀랍습니다. 연구자들은 '수학'에 사용되는 기계들이 '역사'나 '논리'에 사용되는 기계들과 완전히 다를 것이라고 예상했습니다.
- 결과: 그들은 틀렸습니다. 수학에 사용되는 기계들은 역사, 논리, 심지어 독해에 사용되는 기계들과 거의 정확히 동일합니다.
- 비유: 공구함을 상상해 보세요. 당신은 '수학 상자'에는 자와 계산기 같은 수학 도구만 들어 있고, '역사 상자'에는 지도와 책 같은 역사 도구만 들어 있을 것이라고 생각했습니다. 하지만 상자를 열어 보니 두 상자 모두 도구의 90% 를 공유하고 있는 것을 발견했습니다.
- 만약 '수학 도구'를 공구함에서 제거하면 공장은 수학을 할 수 없게 됩니다.
- 하지만 바로 그 같은 도구들을 제거하면 공장은 역사나 논리도 할 수 없게 됩니다.
- 사실 공장은 모든 작업을 수행하기 위해 거대한 공유 '인프라' (작업대/MLP 레이어) 에 의존합니다. 이러한 도구들은 단일 작업뿐만 아니라 모든 작업의 기초입니다.
3. "숨겨진 보석": 아주 작은 고유성.
작업 사이에 아무런 차이도 없을까요?
- 결과: 네, 하지만 매우 작습니다. 공유된 도구들의 큰 더미 안에, 특정 작업에만 고유한 아주 작고 전문화된 도구 세트 (전체의 약 10~30%) 가 있습니다.
- 비유: 공구함 이야기를 다시 해 보면, 도구의 90% 는 공유되지만 '수학 상자' 안에는 '역사 상자'에는 없는 아주 작은 특수 계산기가 들어 있습니다. 만약 그 계산기만 제거하면 수학은 실패하지만 역사는 여전히 작동합니다. 그러나 공유된 90% 가 너무 크고 중요하기 때문에, '수학 상자' 전체를 제거하면 모든 것이 망가져서 마치 수학 도구만이 중요했던 것처럼 보입니다.
큰 그림
이 논문은 우리가 '어텐션 헤드'와 'MLP 레이어' (공장의 크고 눈에 보이는 부분) 수준에서 언어 모델을 볼 때, 주로 각 작업의 구체적인 설계도가 아니라 건물의 일반적인 인프라를 보고 있다는 결론을 내립니다.
- 이해에 대한 의미: 우리는 모델이 사용하는 '작업대'를 쉽게 찾을 수 있지만, 어떤 작업대가 오직 수학을 위한 것인지, 어떤 작업대가 오직 역사를 위한 것인지 쉽게 구별할 수 없습니다. 왜냐하면 그것들은 모두 두 가지 작업에 모두 사용되기 때문입니다.
- 주의점: 연구자들은 진정한 고유한 '전문 도구' (작은 10%) 를 찾기 위해서는 아마도 전체 작업대가 아니라 개별 나사나 전선 (뉴런 또는 특징) 을 더 자세히 살펴볼 필요가 있다고 제안합니다.
요약하자면: 모델은 일관적입니다 (같은 작업을 위해 같은 도구를 사용합니다), 하지만 특이하지는 않습니다 (모든 작업을 위해 같은 도구를 사용합니다). 우리가 발견하는 '회로'들은 대부분 모델의 공유된 기초이며, 단일 작업을 위한 고유한 지시사항이 아닙니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.