← 최신 논문
🤖 AI

RACE: Scalable Statistical Estimation of Functional Consistency in LLM Neurons

이 논문은 기존의 그래디언트 기반 방식보다 우수한 확장성과 특이성을 입증하며, 트랜스포머 뉴런의 도메인 전반에 걸친 기능적 일관성을 평가하는 계산 효율적인 순전파 통계 프레임워크인 RACE를 소개한다.

원저자: Runyu Wang, Bo Liu, Xiaxin Zhang, Yu Han, Jiawei Cao, Xiaoye Zhang, Zhe Zhang, Yifan Yang, Peng Ping

게시일 2026-08-26
📖 5 분 읽기🧠 심층 분석

원저자: Runyu Wang, Bo Liu, Xiaxin Zhang, Yu Han, Jiawei Cao, Xiaoye Zhang, Zhe Zhang, Yifan Yang, Peng Ping

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능의 거대한 디지털 정신 내부에는 연구자들이 이제 겨우 지도를 그리기 시작한 숨겨진 활동 층이 존재합니다. 대규모 언어 모델로 알려진 이 시스템들은 인간처럼 문장이나 단락 단위로 생각하지 않습니다. 대신, 이들은 뉴런이라고 불리는 수십억 개의 작고 서로 연결된 스위치를 통해 정보를 처리합니다. 당신이 컴퓨터에게 시를 쓰거나, 수학 문제를 풀거나, 코드 한 줄을 디버깅하라고 요청할 때, 이러한 작업을 수행하기 위해 특정 뉴런 그룹들이 불을 밝힙니다. 수년 동안 과학자들은 어떤 뉴런이 어떤 작업에 책임이 있는지를 이해하기 위해 고군분투해 왔습니다. 어려움은 운영 규모의 방대함에 있습니다. 이 모델들은 너무나 복격적이어서, 모델이 작동하는 것을 관찰하는 것은 종종 단 하나의 가로등을 보고 도시 전체를 이해하려고 노력하는 것처럼 느껴집니다. 적절한 스위치를 찾는 기존의 방법들은 실용적이지 않을 정도로 너무 느리거나, 혹은 개별적인 순간에만 너무 집중한 나머지 시스템이 시간이 흐름에 따라 어떻게 행동하는지에 대한 더 큰 그림을 놓치곤 했습니다.

이제 한 연구팀이 이 디지털 정신의 소리를 듣는 새로운 방법, 즉 그들이 RACE라고 부르는 방법을 도입했습니다. 시스템 전체를 역설계하거나 모든 개별 연결의 영향력을 계산하려 하는 대신, 이 접근 방식은 모델의 내부 활동을 통계적 패턴으로 취급합니다. 연구진은 파이썬 코드를 작성하거나 대수 방정식을 푸는 것과 같은 특정 목적을 수행하는 뉴런들이 단순히 무작위로 발화하는 것이 아님을 깨달았습니다. 대신, 이들은 특정 유형의 작업이 수행될 때마다 모델의 내부 상태에 일관되고 안정적인 방식으로 기여합니다. 수천 개의 사례에 걸쳐 이러한 일관된 기여를 추적함으로써, 연구진은 어떤 뉴런이 주어진 작업에 대한 진정한 전문가인지를 식별할 수 있습니다. 이것은 한 번 발화하고 잊어버리는 뉴런을 찾는 것이 아니라, 모델이 특정한 일을 하도록 요청받을 때마다 매번 성실하게 출근하는 뉴런을 찾는 것에 관한 것입니다.

이 발견의 핵심은 과학자들이 중요성을 측정하는 방식의 변화에 있습니다. 기존 기술들은 흔ert히 컴퓨터가 자신의 논리를 역방향으로 실행해야 하는 복잡한 계산에 의존했는데, 이는 믿기 힘들 정도로 느리고 계산 비용이 많이 드는 과정이었습니다. 새로운 방법인 RACE는 단 한 번의 순방향 패스(forward pass)로 작동하며, 모델이 정보가 시작부터 끝까지 자연스럽게 흐르는 과정을 관찰합니다. 이 방식은 각 뉴런이 모델의 내부 메모리 스트림에 가하는 아주 작은 업데이트를 살펴봅니다. 만약 어떤 뉴런이 특정 작업을 위해 모델의 사고를 올바른 방향으로 일관되게 밀어준다면, 그 뉴한 높은 점수를 받습니다. 만약 그 행동이 불규칙하거나 오직 몇 번의 드문 경우에만 도움이 된다면, 무시됩니다. 이를 통해 연구진은 가능한 모든 결과를 계산하기 위해 멈출 필요 없이, 모델의 능력을 나타내는 신뢰할 수 있는 지도를 구축할 수 있습니다.

이 지도가 정확한지 테스트하기 위해, 연구진은 40억 개의 파라미터를 가진 작은 모델부터 320억 개의 파라미터를 가진 거대한 모델에 이르기까지 여러 다양한 대규모 언어 모델을 대상으로 일련의 통제된 실험을 수행했습니다. 그들은 세 가지 뚜렷한 영역에 집중했습니다: 컴퓨터 코드 작성, 수학 문제 풀이, 그리고 특정 문장 구조를 사용하는 것과 같은 특정 행동 제어입니다. 각 경우에 대해, 그들은 RACE 방법을 사용하여 해당 작업에 책임이 있는 상위 뉴로들을 식별했습니다. 그런 다음, 그들은 정교한 작업을 수행했습니다: 모델이 작동하는 동안 그 특정 뉴런들을 일시적으로 침묵시킨 것입니다.

결과는 놀라웠습니다. 연구진이 코딩 작업을 위해 RACE에 의해 식별된 뉴런들을 음소거했을 때, 모델의 올바른 코드를 작성하는 능력은 크게 떨어졌지만, 일반적인 질문에 답하거나 수학 문제를 푸는 능력은 거의 온전하게 유지되었습니다. 수학의 경우도 마찬가지였습니다. 수학 뉴런을 침묵시키면 모델의 추론 능력은 손상되었지만, 일반적인 언어 능력에는 영향을 미치지 않았습니다. 이는 이 방법이 특정 기술을 담당하는 구체적인 구성 요소를 성공적으로 분리해 냈음을 확인시켜 주었습니다. 반면, 더 덜 정밀한 기존의 방법들을 사용하여 침 silence할 뉴런을 선택했을 때는, 피해가 단 하나의 기술에만 국한되지 않고 모델의 전반적인 성능에 광범위하게 영향을 미쳤습니다.

가장 중요한 발견 중 하나는 이 모델들 내부의 두 가지 주요 뉴런 유형 간의 차이점이었습니다. 연구진은 수학적 추론과 코딩을 담당하는 뉴런들이 매우 전문화되어 있으며 작업 간에 거의 공유되지 않는다는 것을 발견했습니다. 그러나 어텐션(attention, 주의 집중)—모델이 어떤 단어에 집중할지를 결정하는 부분—에 관여하는 뉴런들은 훨씬 더 일반적이었습니다. 이 어텐션 뉴런들은 시를 쓰는 것부터 방정식을 푸는 것까지 모델이 수행하는 거의 모든 일에 도움을 주는 재사용 가능한 도구처럼 보였습니다. 이러한 구분은 왜 모델의 어떤 부분은 가지치기하거나 수정하기가 더 쉬운지를 설명해 줍니다. 전문화된 부분은 작업장의 전용 도구와 같고, 어텐션 부분은 그 도구들을 잡는 손과 같습니다.

연구진은 또한 자신들의 방법이 믿기지 않을 정도로 효율적이라는 것을 발견했습니다. 이전 기술들이 뉴런의 점수를 매기기 위해 모델을 144번 실행하는 것과 맞먹는 계산을 수행해야 했던 반면, 새로운 방법은 단 한 번의 전체 실행(full run)도 채 되지 않는 데가 필요했습니다. 이 속도는 그 전보다 훨씬 더 큰 모델을 분석하는 것을 가능하게 합니다. 또한, 이는 미래에 개발자들이 전체 시스템을 처음부터 다시 훈련할 필요 없이, 원치 않는 행동을 제거하거나 특정 기술을 강화하기 위해 이 기술을 미세 조정(fine-tuning)에 사용할 수 있음을 의미합니다.

연구진은 모델이 훈련받은 것과 약간 다른 일을 수행하도록 요청받았을 때 이 전문화된 뉴런들이 어떻게 행동하는지도 살펴보았습니다. 연구진이 모델에 대해 본 적 없는 새로운 수학 문제를 테스트했을 때도, RACE에 의해 식별된 뉴런들은 침묵 시 여전히 상당한 성능 저하를 일으켰습니다. 이는 이 방법이 단순히 특정 질문 세트에 대한 암기된 패턴을 찾는 것이 아니라, 기술의 근본적인 메커니데를 찾아낸다는 것을 시사합니다. 지식을 일반화하는 모델의 능력은 바로 이 동일한 안정적인 뉴런들에 달려 있습니다.

아마도 가장 미묘한 발견은 모델이 특정 스타일의 선택, 예를 들어 특정 종류의 리스트 구조를 사용하는 파이썬 코드를 작성하는 능력을 다루는 것이었을 것입니다. 연구진은 시스템이 이 특정 스타일을 인식하도록 훈련시킨 후, 그에 대응하는 뉴런들을 침묵시켰습니다. 결과는 모델이 여전히 코드를 작성할 수는 있지만, 다른 방식으로는 올바른 코드를 작성할 수 있음에도 불구하고 그 특정 스타일은 거의 완전히 사용하지 않게 되었다는 것이었습니다. 이러한 수준의 정밀함은 이 방법이 매우 좁은 범위의 행동을 격리할 수 있음을 시사하며, 외과적인 정확도로 모델의 출력을 조종할 수 있는 길을 제시합니다.

연구진은 자신들의 방법이 모든 문제에 대한 완벽한 해결책은 아니라는 점을 인정합니다. 그들은 이 방법이 정보가 직선적이고 가산적인(additive) 방식으로 처리되는 모델의 부분에서 가장 잘 작동하며, 어텐션 메커니즘에서 발생하는 더 복잡하고 중첩된 상호작용을 매핑하는 데는 덜 효과적이라는 것을 발견했습니다. 또한 그들은 이 방법이 선형 패턴에 의존하기 때문에, 뉴런들이 함께 작용하는 더 복잡한 비선형적 방식을 놓칠 수 있다고 언급했습니다. 그러나 그들이 테스트한 대다수의 작업에 대해, 이 접근 방식은 모델이 무엇을 하고 있는지에 대해 명확하고 신뢰할 수 있으며 빠른 방법을 제공했습니다.

이 연구는 인공지능의 "블랙박스"를 열고자 하는 기계적 해석 가능성(mechanistic interpretability) 분야의 중요한 진전을 나타냅니다. 거대한 시스템 내에서 특정 기능적 구성 요소를 식별하고 격리하는 방법을 제공함으로써, 연구진은 우리가 이 기술을 이해하고, 디버그하고, 개선할 수 있는 새로운 도구 세트를 제공했습니다. 모델의 특정 기술을 담당하는 부분이 정확히 어디인지 짚어낼 수 있는 능력은, 우리가 추측을 넘어 이 시스템이 어떻게 구축되어야 하고 어떻게 사용되어야 하는지에 대해 정보에 입각한 결정을 내릴 수 있게 해줍니다. 앞으로의 경로는 한 번에 도시 전체를 이해하려고 노력하는 것이 아니라, 특정 거리를 걸으며 그곳에서 정확히 무슨 일이 일어나고 있는지 알 수 있게 되는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →