← 최신 논문
💬 NLP

Function-Vector Heads Are Two Populations: Writers and Cancellers in In-Context Learning

이 논문은 함수-벡터 헤드(function-vector heads)가 올바른 규칙을 촉진하는 라이터(writers)와 이를 억제하는 캔슬러(cancellers)라는 두 개의 대립하는 하위 집단으로 구성되어 있으며, 이들은 크기 기반의 순위 매기기에는 보이지 않지만 식별 및 제거 시 모델 성능에 상당한 영향을 미친다는 점을 밝힘으로써 함수-벡터 헤드가 동질적인 집단이라는 가설에 이의를 제기한다.

원저자: Han-yu Wang

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Han-yu Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신과 대화하는 거대 언어 모델(LLM)을 몇 가지 예시를 바탕으로 퍼즐을 풀려고 노력하는 거대한 오케스트라라고 상상해 보십시오. 이 오케스트라에는 **어텐션 헤드(attention heads)**라고 불리는 특정한 연주자들이 있습니다. 오랫동안 연구자들은 가장 중요한 연주자가 단순히 가장 큰 소리로 연주하는 연주자라고 믿어 왔습니다. 그들은 만약 어떤 연주자가 매우 크게 연주한다면, 그 연주자가 분명히 오케스트라가 올바른 곡을 연주하는 데 도움을 주고 있을 것이라고 가정했습니다.

하지만 이 논문은 그 가정이 틀렸음을 발견했습니다. 알고 보니 "가장 큰 소리를 내는" 연주자들은 사실 완전히 다른 두 개의 대립하는 집단, 즉 **라이터(Writers, 쓰는 자들)**와 **캔슬러(Cancellers, 지우는 자들)**에 속해 있었습니다.

이 논문이 발견한 내용을 쉬운 비유를 통해 정리하면 다음과 같습니다.

1. 거대한 오해: 음량 vs 방향

이전의 연구자들은 이 연주자들을 관찰하고 음량(정답에 얼마나 기여했는가)에 따라 순위를 매겼습니다. 그들은 가장 큰 소리를 내는 상위 20명의 연주자가 모두 "조력자"일 것이라고 가정했습니다.

이 논문의 저자들은 음량만으로는 충분하지 않으며, 방향을 알아야 한다는 점을 깨달았습니다.

  • 라이터(Writers): 이들은 오케스트라가 올바른 답을 향해 나아가도록 밀어붙이는 큰 소리의 음을 연주합니다.
  • 캔슬러(Cancellers): 이들 역시 큰 소리를 내지만, 오케스트라를 틀린 답 쪽으로 밀어냅니다. 이들은 올바른 답을 적극적으로 상쇄시키려 합니다.

비유: 줄다리기를 상상해 보십시오.

  • 라이터는 줄을 결승선을 향해 당기는 팀입니다.
  • 캔슬러는 똑같이 강하게 줄을 당기지만, 반대 방향으로 당기는 두 번째 팀입니다.
  • 만약 당신이 그들이 당기는 힘(크기)만 본다면, 둘 다 똑같이 중요한 "당기는 사람"이라고 생각할 것입니다. 하지만 방향을 본다면, 그들이 서로 싸우고 있다는 것을 알 수 있습니다.

2. 발견: 두 개의 집단

연구진은 여러 가지 모델(소형부터 대형까지)과 다양한 유형의 논리 퍼즐을 대상으로 이 테스트를 진행했습니다. 그 결과, 거의 모든 경우에서 "상위" 연주자들이 이 두 개의 대립하는 진영으로 나뉜다는 것을 발견했습니다.

  • **"라이터"**는 정답의 확률을 높입니다.
  • **"캔슬러"**는 정답의 확률을 낮춥니다.

연구진이 캔슬러를 침묵(절제/ablation)시켰을 때, 모델은 퍼즐을 푸는 능력이 실제로 향상되었습니다. 이는 마치 줄다리기 팀에서 방해꾼을 제거한 것과 같았습니다. 갑자기 "라이터"들이 저항 없이 결승선을 향해 줄을 당길 수 있게 된 것입니다.

3. 이전 연구가 놓친 이유

이 논문은 이전 연구(Todd et al., 2024 등)가 왜 이 부분을 놓쳤는지 설명합니다. 이전 연구들은 기여도의 "음량"만을 보는 방식을 사용했습니다. 이 때문에 의도치 않게 라이터와 캔슬러가 섞인 결과를 얻었으며, 그 혼합된 양상은 퍼즐마다 달라졌습니다.

  • 어떤 퍼즐에서는 "캔슬러"가 더 큰 소리를 냈기에, 기존 방식은 그들이 주요 조력자라고 생각했습니다.
  • 다른 퍼즐에서는 "라이터"가 더 큰 소리를 냈기에, 기존 방식은 그들이 주요 조력자라고 생각했습니다.

이 논문은 "부호(sign, 방향)"를 무시함으로써, 이전의 연구들이 영웅과 악당을 뒤섞어 놓고 그들이 모두 단순히 "큰 소리를 내는 조력자"라고 착각했음을 보여줍니다.

4. 캔슬러는 단순한 실수인가?

연구진은 "캔슬러"가 모델의 고장 난 부품이나 우연한 노이즈가 아님을 확인하기 위해 많은 테스트를 수행했습니다. 그들은 캔슬러가 실제적이고 기능적인 부분임을 증명했습니다.

  • 그들은 서로 다른 것을 읽습니다: 라이터는 예시의 "레이블(정답)"에 집중합니다. 캔슬러는 "형식(구두점 및 공백)"에 집중합니다. 이들은 페이지의 서로 다른 부분을 보고 있습니다.
  • 그들은 내용에 기반합니다: 캔슬러는 단순히 답을 억제하는 것이 아니라, 예시에서 방금 보여준 답을 구체적으로 억제하려고 합니다.
  • 그들은 "복사 억제기"가 아닙니다: 논문은 이들이 단순히 일반적인 "복사 방지" 메커니즘이 아니라는 점을 입증했습니다. 이들은 과제의 논리에 특화되어 있습니다.

5. "L11.H4" 캐릭터 연구

논문은 특정 연주자인 L11.H4를 정밀 분석하여 어떻게 작동하는지 살펴봅니다.

  • 이 연주자는 논리 퍼즐에서는 "캔슬러" 역할을 합니다(틀린 답을 밀어내려 함).
  • 그러나 퍼즐을 어휘 과제(예: 반의어 맞추기)로 바꾸면, 이 동일한 연주자는 역할이 바뀌어 "라이터"가 됩니다(올바른 답을 도움).
  • 교훈: 이 연주자는 본질적으로 "선"하거나 "악"한 것이 아닙니다. 이의 역할은 방금 제시된 것을 억제하는 것입니다. 제시된 것이 정답이라면 그것을 억제합니다(캔슬러). 만약 다른 맥 contextos에서 제시된 것이 오답이라면, 오답을 억제함으로써 결과적으로 정답을 돕게 됩니다(라이터).

6. 시사점

이 논문의 핵심 결론은 AI 모델의 가장 "활발한" 부분들을 하나의 균일한 집단으로 취급해서는 안 된다는 것입니다.

  • 과거의 관점: "이들은 상위 20개의 중요한 헤드들이다. 이들을 이용해 모델을 조종하자."
  • 새로운 관점: "이 상위 20개의 헤드들은 사실 내전 중이다. 절반은 모델을 올바른 곳으로 밀고 있고, 나머지 절반은 잘못된 곳으로 밀고 있다. 모델을 조종하고 싶다면, 단순히 라이터를 증폭하는 것이 아니라 캔슬러를 침묵시켜야 한다."

이 논문은 이것이 모델을 "안전"하게 만들거나 의료 또는 법률 분야의 실무에 바로 사용할 수 있게 만든다고 주장하는 것이 아닙니다. 단지 모델이 예시로부터 규칙을 학습하는 방식을 이해하려면, 내부의 "연주자들"이 협력하는 것이 아니라 종종 서로 싸우고 있다는 사실을 인식해야 한다고 명시하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →