← 최신 논문
🤖 machine learning

Induction Heads Interpolate N-Grams

이 논문은 트랜스포머의 유도 헤드(induction heads)가 소프트 컨텍스트 매칭 보간(soft context-matching interpolation)과 가산적 유사 횟수 평활화(additive pseudo-count smoothing)를 결면한 정교한 인컨텍스트 학습 메커니즘을 구현하며, 이를 통해 고전적인 횟수 기반 베이스라인을 능가하도록 추정치를 효과적으로 정규화한다는 것을 입증한다.

원저자: Francesco D'Angelo, Oguz Kaan Yuksel, Swathi Shree Narashiman, Nicolas Flammarion

게시일 2026-07-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Francesco D'Angelo, Oguz Kaan Yuksel, Swathi Shree Narashiman, Nicolas Flammarion

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 이야기의 다음 단어를 추측하려고 노력하고 있다고 상상해 보세요. 당신은 이미 읽은 단어들을 보고 패턴을 찾습니다. 이것이 트랜스포머와 같은 AI 모델이 자신의 내부 두뇌를 바꾸지 않고 프롬프트로부터 "학습"할 때(인컨텍스트 러닝이라 불리는 과정) 하는 방식입니다.

오랫동안 과학자들은 이 모델들이 엄격한 사서처럼 작동한다고 생각했습니다. 즉, 마지막 몇 단어와 정확히 일치하는 것만을 찾을 것이라고 믿었습니다. 만약 이야기가 "고양이가 ... 위에 앉아 있었다"라고 한다면, 모델은 오직 이전에 이야기에 "고양이가 ... 위에 앉아 있었다"라는 문구가 정확히 나타났던 경우만을 찾아내어 다음에 올 단어를 추측할 것입니다. 만약 그 정확한 문구가 이전에 등장한 적이 없다면, 모델은 무작위로 추측하거나 포기해 버릴 것입니다.

이 새로운 논문은 모델들이 실제로는 이보다 훨씬 더 똑똑하고 유연하다고 주장합니다. 모델은 단순히 정확한 일치 횟수를 세는 것이 아니라, 인간이 맥락적 단서를 사용하는 것과 유사하게 기억의 공백을 메우기 위한 두 가지 영리한 기술을 사용합니다.

이 논문에서 발견한 두 가지 주요 기술을 쉬운 비유로 설명하면 다음과 같습니다.

1. "소프트 매치" (Jelinek-Mercer Smoothing)

과거의 방식 (하드 카운팅): 당신이 문장의 다음 단어를 맞히려고 한다고 가정해 봅시다. 당신은 지금 읽고 있는 문장과 동일한 문장만을 찾습니다. 만약 당신이 한 번도 본 적 없는 문장이라면, 당신은 다음에 무엇이 올지 전혀 알 수 없습니다.

새로운 방식 (소프트 매칭): 논문은 모델의 "유도 헤드(induction heads)"(이 작업을 수행하는 특정 두뇌 부위)가 부분적인 일치 또한 찾는다고 보여줍니다.

  • 비유: 당신이 문장의 결말을 추측하려고 합니다: "빨간 고양이가 ... 위에 앉아 있었다"
    • 당신은 "빨간 고양이가 ... 위에 앉아 있었다"라는 문장을 찾았습니다. (완벽한 일치).
    • 당신은 "검은 고양이가 ... 위에 앉아 있었다"라는 문장을 찾았습니다. ( "고양이가" 부분만 일치).
    • 당신은 "빨간 개가 ... 위에 앉아 있었다"라는 문장을 찾았습니다. ("빨간" 부분만 일치).

모델은 이러한 부분적인 일치를 무시하는 대신, 그것들에게도 투표권을 줍니다. 문장의 많은 부분이 일치할수록 투표의 목소리는 더 커집니다. 만약 정확한 일치가 드물다면, 모델은 부분적인 일치의 목소리에 더 귀를 기울입니다. 모델은 이 투표들을 하나로 혼합하여 예측을 만듭니다.

논문은 이를 **보간(interpolation)**이라고 부릅니다. 이것은 요리사가 수프의 맛을 보는 것과 같습니다. 만약 정확한 레시피가 없더라도, 요리사는 그냥 추측하는 것이 아니라 자신이 알고 있는 유사한 레시피들을 살펴보고 그 맛들을 섞어서 새롭고 합리적인 추측을 만들어냅니다. 모델은 수학적으로 "전체 일치"를 얼마나 신뢰할지, 아니면 "부분 일치"를 얼마나 신뢰할지 가중치를 두며 이 과정을 수행합니다.

2. 안전망으로서의 "BOS 토큰" (Add-α Smoothing)

문제점: 만약 현재 문장의 어떤 버전도 본 적이 없다면 어떻게 될까요? 부분적인 일치조차 없을 수도 있습니다.

해결책: 논문은 BOS(Beginning of Sequence, 문장 시작)라고 불리는 특별한 토큰의 역할을 강조합니다. 이것을 모든 이야기의 맨 처음에 있는 "시작 버튼"이라고 생각하세요.

  • 비유: 모델이 탐정이라고 상상해 보세요. 보통 탐정은 범죄 현장(텍text)에서 단서를 찾습니다. 하지만 때때로 범죄 현장이 너무 생소하거나 엉망이라서 단서를 찾을 수 없을 때가 있습니다. 이때 BOS 토큰은 기본 안전망 역할을 합니다.
  • 모델이 BOS 토큰을 보면 이렇게 인식합니다: "좋아, 나는 이 구체적인 상황을 본 적이 없어. 그럼 모든 단어의 평균적인 행동 패턴으로 돌아가자."
  • 이는 가능한 모든 추측에 아주 작은 양의 "가짜 데이터"(pseudo-count라고 불림)를 추가합니다. 이는 모델이 "증거가 전혀 없으므로 추측할 수 없다"라고 말하는 것을 방지합니다. 대신, "구체적인 증거는 없지만, 일반적으로 흔한 것에 기반하여 추측하겠다"라고 말하게 합니다.

논문은 이 BOS 토큰이 존재할 때, 모델이 자동으로 이러한 "안전망"을 예측에 추가하도록 학습된다는 점을 보여줍니다. 이는 수학적으로 add-α smoothing이라 불리는 고전적인 통계 기법과 동일합니다.

무엇을 증명했는-가?

연구진은 단순히 추측한 것이 아니라, 단순화된 버전의 AI("disentangled transformer")를 구축하였고, 설정값(knobs)을 적절히 조절하면 모델이 정확히 이 두 가지 동작을 수행한다는 것을 수학적으로 증명했습니다:

  1. 정확한 일치와 부분적인 일치를 혼합합니다 (Soft Matching).
  2. BOS 토큰을 사용하여 안전망을 추가합니다 (Add-α Smoothing).

그 후, 실제 AI 모델을 간단한 패턴 게임(마르코프 체인)으로 학습시켰습니다. 그 결과 다음과 같은 사실을 발견했습니다:

  • 모델들은 학습 과정에서 이러한 기술들을 자연스럽게 학습했습니다.
  • 모델들은 단순히 정확한 일치 횟수를 세는 것이 아니라, 추측을 매끄럽게 만드는 정규화(smoothing) 과정을 학습했습니다.
  • 부분적인 일치가 유용하게 작용하는 상황(예: 유사한 단어들이 공통된 부모를 공유하는 경우)에서, 이 모델들은 기존의 "엄격한 카운팅" 방식보다 뛰어난 성능을 보였습니다.

핵심 요약

논문은 결론적으로, 이러한 AI 모델들이 단순히 정확한 구절을 암기하는 단순한 "카운팅 기계"가 아니라고 말합니다. 이들은 정교한 **통계적 정규화 도구(statistical regularizers)**입니다. 모델은 다음과 같은 능력을 학습했습니다:

  • 정확한 일치와 유사한 부분적 일치로부터 정보를 혼합하기.
  • 구체적인 증거가 부족할 때 일반적인 평균값으로 돌아가기.

이것이 거대 언어 모델(LLM)이 본 적 없는 새로운 상황을 매우 잘 다루는 이유를 설명해 줍니다. 모델은 단순히 과거 기록에서 완벽한 일치를 찾는 것이 아니라, 자신이 본 모든 것을 지능적으로 가중치를 두어 혼합함으로써 최선의 추측을 만들어내기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →