← 최신 논문
💬 NLP

How Do Transformers Learn to Associate Tokens: Gradient Leading Terms Bring Mechanistic Interpretability

본 논문은 훈련 경사 역학을 기반으로 이그램, 토큰 교환 가능성, 그리고 문맥 매핑의 합성으로 표현되는 초기 단계 가중치에 대한 폐형식을 유도함으로써 트랜스포머가 어떻게 의미적 연관성을 학습하는지에 대한 기작적 해석을 제공합니다.

원저자: Shawn Im, Changdae Oh, Zhen Fang, Sharon Li

게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shawn Im, Changdae Oh, Zhen Fang, Sharon Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 AI 챗봇의 두뇌인 트랜스포머를 거대한 빈 공책이라고 상상해 보세요. 학습을 시작할 때 이 공책의 페이지는 비어 있습니다. 여러분이 질문하신 논문은 단순하지만 심오한 질문을 던집니다: 이 공책은 수백만 개의 문장을 읽는 것만으로 '새'와 '날았다' 같은 단어를 어떻게 연결하는 법을 배우는 걸까요?

저자들은 완성된 복잡한 AI 를 바라보는 대신, 학습의 아주 초기 순간들에 초점을 맞추기로 결정했습니다. 그들은 AI 가 기억을 업데이트하기 시작할 때 취하는 처음 몇 걸음을 살펴보기 위해 수학적 '확대경'을 사용했습니다.

다음은 그들의 발견을 간단한 비유로 풀어낸 내용입니다:

1. '첫걸음' 단축키

AI 를 학습시키는 것은 문장에서 다음 단어를 예측하는 것과 같습니다. 보통 AI 가 기억을 업데이트하는 방식 뒤에 숨겨진 수학은 매우 지저분하고 복잡합니다.

저자들은 아주 초기 단계에서는 AI 가 복잡한 미적분학을 수행할 필요가 없다는 것을 깨달았습니다. 대신 데이터에서 가장 강하고 명백한 신호만 따르기만 하면 됩니다. 이를 '주도 항 (leading term)'이라고 부릅니다. 마치 산을 오르는 등산객을 생각해 보세요. 시작할 때 길은 명확하고 곧습니다. 고도가 높아질수록 길이 구불구불하고 복잡해지기만 합니다. 저자들은 놀랍게도 오랫동안 AI 의 '기억 가중치'가 그 단순하고 곧은 초기 경로에 매우 가깝게 머무른다는 것을 증명했습니다.

2. 세 가지 구성 블록

이 논문은 AI 의 기억이 무작위한 혼란이 아니라, 세 가지 특정 유형의 '레고 블록'(저자들이 기저 함수라고 부르는 것) 을 쌓아 올려 만들어졌음을 보여줍니다. 이 블록들은 AI 가 읽는 텍스트의 통계에서 직접 파생됩니다:

  • '다음 단어' 블록 (빅그램 매핑):

    • 비유: 'The'라는 단어가 거의 항상 '고양이'나 '개' 같은 명사를 따라온다는 것을 배우는 아이를 상상해 보세요.
    • 기능: 이 블록은 단순히 기록합니다: "A 단어를 보았다면, 다음에 올 가장 가능성 높은 B 단어는 무엇인가?" 이는 단순하고 즉각적인 연결을 포착합니다.
  • '교환 가능' 블록 (교환성 매핑):

    • 비유: 동의어 사전을 생각해 보세요. 문장에서 '자동차'를 '트럭'으로 바꿔도 문법이 깨지지 않는다면, 이 두 단어는 '교환 가능'합니다.
    • 기능: 이 블록은 특정 단어들이 같은 역할을 한다는 것을 학습합니다. 만약 '빨간색'이 보통 '자동차'를 수식하고, '빠른'도 '자동차'를 수식한다면, 이 블록은 '빨간색'과 '빠른'이 같은 단어들과 어울리기 때문에 서로 관련이 있을 수 있음을 AI 가 깨닫도록 돕습니다. 이는 단어들을 즉각적인 이웃이 아닌 기능에 따라 그룹화합니다.
  • '맥락' 블록 (맥락 매핑):

    • 비유: '물고기'에 대한 이야기를 읽는다고 상상해 보세요. '연못'이라는 단어가 '물고기' 바로 옆에 없더라도, 이야기에서 앞서 '물', '호수', 또는 '배'를 언급했을 수 있습니다.
    • 기능: 이 블록은 문장 속으로 더 멀리 거슬러 올라갑니다. 만약 어떤 단어가 특정 맥락(예: 자연에 대한 이야기) 에 나타난다면, 그 단어는 멀리 떨어져 있더라도 같은 맥락의 다른 단어들과 연관될 가능성이 높다는 것을 학습합니다.

3. 이들이 어떻게 함께 작동하는가

이 논문은 AI 의 내부 '가중치'(그것이 어떻게 생각하는지 결정하는 숫자) 가 단순히 이 세 블록의 조합임을 보여줍니다.

  • 출력 레이어(다음 단어를 추측하는 부분) 는 주로 다음 단어 블록입니다. 이는 AI 가 "방금 본 것에 기반해, 다음에 무엇이 올까?"라고 말하는 것입니다.
  • 어텐션 레이어(무엇에 집중할지 결정하는 부분) 는 교환 가능 블록과 맥락 블록의 혼합입니다. 이는 AI 가 "'물고기'라는 단어를 보았다. '연못'이라는 단어를 뒤로 살펴봐야겠다. 왜냐하면 이 두 단어는 서로 닿아 있지 않더라도 비슷한 이야기에서 자주 함께 등장하기 때문이다"라고 말하는 것입니다.

4. 증명: 실제로 작동합니다

저자들은 단순히 방정식을 작성한 것이 아니라, 실제 AI 모델에서 이를 테스트했습니다.

  • 그들은 어린이 동화 데이터셋으로 작은 AI 를 학습시켰습니다.
  • 그들은 AI 가 실제로 학습한 기억과 그들의 수학적 공식을 비교했습니다.
  • 결과: 일치도가 놀라울 정도로 높았습니다 (일부 경우 99% 이상 유사). 심지어 거대한 실제 AI(Pythia-1.4B) 를 살펴본 때도 동일한 패턴이 유지되었습니다. AI 는 실제로 이 세 가지 간단한 통계적 구성 블록을 사용하여 기억을 조직화하고 있었습니다.

핵심 교훈

이 논문은 AI 를 언어를 마법처럼 이해하는 신비한 '블랙박스'로 볼 필요가 없다고 주장합니다. 대신, 그 핵심은 단순히 다음과 같이 세상을 통계적으로 조직화하는 것입니다:

  1. 무엇이 무엇을 따르는지 기록합니다.
  2. 같은 역할을 하는 단어들을 그룹화합니다.
  3. 배경 이야기를 공유하는 단어들을 연결합니다.

이 세 가지 간단한 규칙을 이해함으로써, 우리는 마침내 기계가 '새'와 '날았다'를, '국가'와 '수도'를 어떻게 연관시키는지 어떻게 배우는지 볼 수 있습니다. 이는 마법이 아닙니다. 이는 읽은 텍스트를 요약하는 매우 구조화된 방식일 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →