← 최신 논문
🤖 machine learning

Distributed Sparse Interventions in Language Models

이 논문은 기존의 선형 스티어링 방식이 놓치는 비선형적 효과와 상호작용을 포착함으로써 언어 모델에서 작업 동작을 효과적으로 활성화하기 위해 여러 계층에 걸쳐 희소한 뉴런 집합을 식별하는 새로운 방법인 분산 희소 개입(Distributed Sparse Interventions, DSI)을 소개한다.

원저자: Maximilian S. Ernst (Max Planck School of Cognition, Center for Lifespan Psychology Max Planck Institute for Human Development, Machine Learning Group Technische Universität Berlin), Lorenz Linhardt (
게시일 2026-07-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Maximilian S. Ernst (Max Planck School of Cognition, Center for Lifespan Psychology Max Planck Institute for Human Development, Machine Learning Group Technische Universität Berlin), Lorenz Linhardt (Machine Learning Group Technische Universität Berlin, Berlin Institute for the Foundations of Learning and Data), Aaron Peikert (Center for Lifespan Psychology Max Planck Institute for Human Development), Oliver Eberle (Machine Learning Group Technische Universität Berlin, Berlin Institute for the Foundations of Learning and Data)

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델(챗봇을 구동하는 것과 같은)을 수백만 명의 작은 노동자(뉴런)들이 서로 다른 건물(레이어)에서 일하고 있는 거대하고 북적이는 도시라고 상상해 보십시오. 여러분이 모델에게 특정 작업(예: 문장을 번역하거나 동사를 과거형으로 바꾸는 일)을 수행하도록 요청할 때, 대부분의 사람은 도시 전체가 함께 움직여야 한다거나, 그 작업을 수행하기 위해 돌려야 하는 하나의 거대한 '스위치'가 존재한다고 생각합니다.

**"Distributed Sparse Interventions"**라는 이 논문은 이러한 가정이 틀렸다고 주장합니다. 저자들은 도시 전체를 움직이거나 거대한 스위치를 올리는 대신, 단 몇 명의 특정 노동자들을 살짝 건드리는 것만으로도 복잡한 작업을 유발할 수 있다는 것을 발견했습니다. 때로는 전체 인구의 **0.01%**만큼의 아주 적은 인원만으로도 가능합니다.

다음은 이들의 발견을 쉬운 비유를 통해 정리한 내용입니다.

1. 과거의 방식: "글로벌 볼륨 조절기"

이전의 연구들은 모델을 스테레오 시스템처럼 취급했습니다. 음악의 '분위기'(작업)를 바꾸고 싶다면, 방 전체의 볼륨을 높이는 글로벌 볼륨 조절기를 돌리거나 페이더를 밀어 올렸습니다. 이는 작업이 단순한 직선 형태라고 가정하는 것입니다. 즉, 조절기를 조금 올리면 음악 소리가 조금 커지는 식입니다.

문제점: 저자들은 모델이 단순한 스테레오가 아니라, 복잡한 오케스트라와 같다는 것을 발견했습니다. 단순히 방 전체의 볼륨을 높이기만 하면 소음만 발생할 뿐입니다. 진짜 마법은 특정 연주자들이 정확한 타이밍에 특정 음을 연주할 때 일어납니다. 이 노동자들 사이의 관계는 단순한 직선이 아니라, 뒤엉킨 그물망과 같습니다.

2. 새로운 방식: "분산 희소 개입" (Distributed Sparse Intervention, DSI)

저자들은 DSI라고 불리는 방법을 개발했습니다. 이것은 오케스트라 전체에 더 크게 연주하라고 명령하지 않는, 매우 숙련된 지휘자를 떠올리게 합니다. 대신 지휘자는 다음과 같이 행동합니다:

  1. 경청한다: 오케스트라가 곡을 알고 있을 때(10-shot 예시)와 모를 때(0-shot)의 연주 차이를 비교합니다.
  2. 식별한다: 나쁜 공연과 좋은 공연을 가르는 아주 작고 특정한 연주자 그룹을 찾아냅니다.
  3. 넛지(Nudge)한다: 그들이 자신의 역할을 다할 수 있도록 그 몇 안 되는 연주자들을 살짝 건드립니다.

결과: 수만 개의 뉴런 중 단 8개에서 64개의 뉴런에만 개입함으로써, 저자들은 모델이 명시적으로 배우지 않은 작업을 수행하게 만들 수 있었으며, 이는 종종 모델에게 10개의 예시를 주어 학습시킨 성능과 일치했습니다.

3. "비선형성"의 놀라움

이 논문은 이 뉴런들이 단순한 스위치처럼 작동하지 않는다는 점을 강조합니다.

  • 비유: 케이크를 굽는 과정을 상상해 보십시오. 만약 선형적이라고 가정한다면, "계란 하나를 더 넣으면 케이크가 두 배로 맛있어질 것"이라고 생각할 수 있습니다. 하지만 실제로는 계란 하나를 더 넣으면 케이크가 눅눅해질 수도 있고, 두 개를 넣으면 완벽해질 수도 있으며, 세 개를 넣으면 망칠 수도 있습니다.
  • 발견: 저자들은 뉴런을 건드리는 효과가 다른 뉴런들이 무엇을 하고 있는지에 따라 크게 달라진다는 것을 발견했습니다. 단순히 "가장 좋은" 뉴런을 골라 건드리는 것이 아니라, 적절한 조합의 뉴런을 찾아내어 적절한 강도로 건드려야 합니다. 저자들의 방법인 DSI는 한 번에 넛지를 주고 운에 맡기는 것이 아니라, 완벽한 레시피를 찾기 위해 이러한 넛지를 반복적으로 조정합니다.

4. "작업"의 해부 (복사 vs 변형의 비유)

이 논문에서 가장 흥고한 부분 중 하나는 그들이 이 방법을 통해 모델이 어떻게 생각하는지를 이해한 방식입니다. 그들은 "run"을 "ran"으로 바꾸는 것(시제 전환)과 같은 작업을 살펴보았습니다.

그들은 모델이 실제로 이 작업을 두 단계로 나눈다는 것을 발견했습니다.

  1. 복사(Copying): 모델은 먼저 "run"이라는 단어를 복사합니다.
  2. 변형(Transforming): 그 다음 "run"을 "ran"으로 변형합니다.

DSI를 사용하여, 그들은 오직 "복사" 부분만을 담당하는 뉴런과 "변형" 부분을 담당하는 뉴런을 분리해 낼 수 있었습니다.

  • 실험: "복사" 뉴-런들만 활성화했을 때, 모델은 입력된 단어를 끊임없이 반복했습니다(마치 고장 난 레코드판처럼). "변형" 뉴런들을 활성화했을 때는 시제를 바꾸려고 시도했지만, 중간에 막히거나 반복되는 모습을 보였습니다.
  • 통찰: 이는 복잡한 작업이 더 작고 재사용 가능한 "레고 블록" 형태의 뉴런들로 구축되어 있음을 증명합니다. 모델은 하나의 거대한 "과거 시제" 뇌를 가진 것이 아니라, 함께 작동하는 "복사" 뇌와 "변형" 뇌를 가지고 있는 것입니다.

요약

이 논문은 언어 모델이 하나의 거대한 덩어리가 아님을 보여줍니다. 모델은 **희소하고 분산된 회로(sparse, distributed circuits)**로 이루어져 있습니다. 새로운 작업을 수행하게 만들기 위해 모델 전체를 다시 훈련시키거나 방대한 양의 데이터를 사용할 필요는 없습니다. 그저 그 작업의 "열쇠"를 쥐고 있는 아주 작고 특정한 뉴론 그룹을 찾아 살짝 건드려 주기만 하면 됩니다.

요약하자면: 도시 전체에 소리를 지르는 대신, 저자들은 몇몇 특정 사람들에게 속삭이는 방법을 찾아냈고, 그러자 도시 전체가 갑자기 새로운 언어로 말하기 시작했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →