← 최신 논문
💬 NLP

Inside the LLM Word Factory

이 논문은 활성화 패칭(activation patching)을 사용하여, 어텐션이 토큰 특유의 신호를 전달하고 MLP가 이를 로컬 임베딩과 합성하는 2단계 디토크나이제이션(detokenization) 과정을 거치며, 위치 인코딩에 따라 다양한 깊이에서 이 과정이 수행됨을 밝힘으로써, 초기 레이어의 활성화를 기반으로 디토크나이제이션 성공 여부를 매우 정확하게 판별할 수 있는 프로브(probe)를 가능하게 한다.

원저자: Benzi Busigin, Yuval Pinter

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Benzi Busigin, Yuval Pinter

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 똑똑한 공장인 **LLM 단어 공장(LLM Word Factory)**을 상상해 보세요. 이 공장의 임무는 문장을 받아들여 이해한 뒤 새로운 문장을 쓰는 것입니다. 하지만 함정이 하나 있습니다. 이 공장은 "table"이나 "error" 같은 "인간의 단어"를 말하지 못합니다. 대신, _table 같은 작은 퍼즐 조각인 **서브워드 파편(subword fragments)**만을 이해합니다.

여러분이 "table"이라는 단어를 입력하면, 공장은 이를 하나의 조각(_table)으로 보거나 두 개로 나눌 수도 있습니다(_ta + ble). 만약 조각이 나뉜다면, 공장에는 문제가 생깁니다. 공장은 유용한 작업을 하기 전에 이 조각들을 다시 합쳐서 "table"이라는 전체 개념을 이해해야 합니다. 이 결합 과정을 **디토크나이제이션(detokenization, 역토큰화)**이라고 부릅니다.

만약 공장이 조각들을 제대로 붙이지 못하면 혼란에 빠집니다. "table"을 "ta"와 "ble"라는 별개의 조각으로 생각할 수 있으며, 이는 이상한 실수로 이어집니다.

이 논문은 특수한 "시간 여행 현미경"(**활성화 패칭(activation patching)**이라 불리는 도구)을 사용하여 공장 내부를 들여 들여다보고, 이 결합이 정확히 어떻게, 어디에서 일어나는지 밝혀낸 탐정 팀의 이야기입니다. 그들이 발견한 내용은 다음과 같습니다.

1. 2단계 조립 라인

탐정들은 공장이 퍼즐 조각들을 한 번에 모두 붙이는 것이 아니라는 사실을 발견했습니다. 결합은 조립 라인의 맨 앞부분(컴퓨터 모델의 초기 몇 개 레이어)에서 매우 구체적인 2단계 댄스를 통해 일어납니다.

  • 1단계: 메신저 (Attention)
    첫 번째 퍼즐 조각(_ta)에 아주 작은 쪽지가 붙어 있다고 상상해 보세요. 특별한 메신저(Attention 메커니즘)가 이 쪽지를 집어 들어 두 번째 조각(_ble)에게 전달합니다.

    • 함정: 이 쪽지는 단어의 전체 그림이 아닙니다. 그것은 단지 "나는 특정 단어의 일부다"라는 아주 작고 약한 "넛지(nudge, 툭 치는 듯한 신호)" 혹은 힌트일 뿐입니다. 마치 우편 배달원이 "택배 도착 예정"이라고 적힌 편지 한 통을 떨어뜨리고 가는 것과 같습니다.
  • 2단계: 빌더 (MLP)
    두 번째 조각(_ble)이 그 작은 쪽지를 받으면, 빌더(MLP)가 등장합니다. 빌더는 로컬 조각(_ble)과 메신저로부터 온 작은 쪽지를 결합합니다.

    • 마법: 빌더는 단순히 두 조각을 딱 맞게 끼워 넣는 것이 아니라, 그것들을 부드럽게 섞어서 "table"이라는 완전하고 통일된 개념을 만들어냅니다.

2. 조립 라인은 얼마나 길어야 할까?

연구 결과, 이 2단계 댄스는 거의 즉시, 보통 공장의 처음 1~10개 레이어 내에서 발생한다는 것을 발견했습니다.

  • "RoPE" 공장: 어떤 공장들은 특정한 주소 체계(RoPE)를 사용합니다. 이 공장들에서는 결합이 매우 빠르게 일어나며, 종종 첫 1~2개 레이어 안에서 끝납니다. 이는 조각들이 거의 즉시 만나는 매우 효율적인 컨베이어 벨트를 가진 공장과 같습니다.
  • "Learned" 공장: 다른 공장들은 다른 주소 체계(Learned Absolute)를 사용합니다. 여기서는 결합이 더 오래 걸려 5~10개 레이어까지 늘어집니다. 이는 조각들이 결합되기 전까지 조금 더 멀리 이동해야 하는 더 느린 컨베이어 벨트와 같습니다.

3. 더 긴 단어는 어떻게 될까?

만약 단어가 세 개나 네 개의 조각(_an + ti + ci + pa + tion)으로 나뉘어 있다면 어떻게 될까요?
논문은 공장이 계주(relay race) 전략을 사용한다는 것을 발견했습니다.

  • 첫 번째 조각이 두 번째 조각에게 바통을 넘깁니다.
  • 두 번째 조각이 세 번째 조각에게 바통을 넘깁니다.
  • 세 번째 조각이 마지막 조각에게 바통을 넘깁니다.
    각 중간 조각은 계주 지점 역할을 하며, 마지막 결합이 일어날 때까지 "넛지"를 전달합니다. 단어가 길수록 더 많은 계주 지점이 필요하지만, 과정은 동일합니다.

4. 실패를 예측할 수 있을까?

가장 흥ante한 발견은 공장이 과정 초기에 **"연기 신호(smoke signal)"**를 남긴다는 점입니다.

  • 결합이 성공할 것이라면, 초기 레이어들은 특정한 방식으로 나타납니다.
  • 결합이 실패할 것이라면, 이들은 다르게 나타납니다.

연구진은 단 몇 개의 초기 레이어만 보고도 단어가 올바르게 이해될지 아니면 실패할지를 94%에서 97%의 정확도로 예측할 수 있는 간단한 **탐지기(probe)**를 만들었습니다. 이는 마치 자동차가 완성되기도 전에 엔진만 보고도 나중에 고장이 날지 안 날지를 알아맞히는 품질 관리 검사관과 같습니다.

요약

단순하게 말하자면, 이 논문은 AI 모델이 나누어진 단어를 이해하려고 할 때, 시작 부분에서 바로 2단계 과정을 사용한다는 것을 설명합니다:

  1. Attention이 첫 번째 조각으로부터 마지막 조각까지 작은 힌트를 전달합니다.
  2. MLP가 그 힌트를 사용하여 완전한 단어를 완성합니다.

이 과정은 빠르고, 초기에 발생하며, 모델은 성공할지 실패할지를 알려주는 명확한 "서명(signature)"을 초기 레이어에 남깁니다. 이 과정의 속도는 공장이 얼마나 크거나 똑똑한지가 아니라, 공장이 어떻게 구축되었는지(구체적으로 위치를 어떻게 처리하는지)에 달려 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →