← 최신 논문
🤖 machine learning

A Geometric Perspective on Next-Token Prediction in Large Language Models: Three Emerging Phases

본 연구는 표현 렌즈를 기하학적 진단 도구로 재창용하여 계층 간 예측 판독 부분 공간의 진화를 추적함으로써, 대규모 언어 모델이 다음 토큰 예측을 처리할 때 시드 멀티플렉싱, 호스팅 오버라이딩, 초점 수렴이라는 세 가지 구별되는 기하학적 단계를 거치며, 모델의 깊이가 증가하는 주된 효과는 표현 용량의 확장이 아닌 후보의 모호성 해소에 있음을 밝힌다.

원저자: Gianfranco Lombardo, Giuseppe Trimigno, Stefano Cagnoni

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Gianfranco Lombardo, Giuseppe Trimigno, Stefano Cagnoni

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 다층 공장을 상상해 보세요. 한 조각의 정보 (단어) 가 1 층에서 지붕까지 이동합니다. 각 층마다 작업자 팀이 패킷에 약간의 새로운 정보를 추가한 후 위층으로 전달합니다. 이 논문이 해결한 큰 미스터리는 다음과 같습니다: 공장은 다음에 출력할 단어를 어떻게 결정하며, 그 결정은 실제로 어디서 일어날까요?

저자들은 각 층에서 모델이 무엇을 예측하는지뿐만 아니라, 그 예측이 공장 기계 내부의 어디에 존재하며 위로 올라가면서 어떻게 이동하는지 질문했습니다.

다음은 그들의 발견을 간단한 개념과 비유로 풀어낸 이야기입니다.

도구: "표현 렌즈 (Representation Lens)"

보통 공장 중간 층을 엿보면 작업자들이 혼란스러워 보입니다. 그들은 뒤죽박죽 섞인 가능성들을 들고 있으며, 그들이 들고 있는 것을 바탕으로 최종 단어를 추측하려 하면 틀리게 됩니다. 이는 작업자들이 정보를 "중첩 (superposition)" 상태로 들고 있기 때문입니다. 마치 모든 카드가 섞여 있는 채로 앞을 향해 있지 않은 카드 덱을 마술사가 들고 있는 것과 같습니다.

연구자들은 표현 렌즈 (Representation Lens) 라는 특별한 도구를 사용했습니다. 이는 작업자들의 시야를 회전시키고 초점을 맞출 수 있는 마법의 안경과 같습니다. 단순히 지저분한 카드 더미를 보는 대신, 렌즈는 "승리 카드 (올바른 다음 단어)"가 다른 카드들 아래에 묻혀 있더라도 실제로 보이는 특정 각도를 찾아냅니다.

발견: 세 막으로 이루어진 연극

이 안경을 이용해 공장 전체를 통과하는 "승리 카드"의 움직임을 추적한 결과, 이 과정은 무작위가 아님이 밝혀졌습니다. 그들이 테스트한 거의 모든 모델 (10 억 파라미터 규모의 작은 모델부터 320 억 파라미터 규모의 거대 모델까지) 에서 엄격한 3 단계 기하학적 춤이 일어납니다.

1 단계: "시딩 멀티플렉싱 (Seeding Multiplexing)" (군중 모이기)

  • 무슨 일이 일어나는가: 정보가 공장에 들어오자마자 작업자들은 한 번에 많은 가능한 다음 단어들을 내던집니다. 아직 승자를 선택하지는 않습니다.
  • 비유: 다양한 아이디어를 외치는 사람들이 가득 찬 방을 상상해 보세요. 방은 소음으로 가득 차 있지만, "올바른" 아이디어는 이미 수백 개의 다른 아이디어와 섞여 존재합니다.
  • 기하학: 공장은 자신의 "랭크 (많은 다른 아이디어를 수용할 수 있는 능력)"를 확장합니다. 올바른 단어가 존재하지만, 합창단 속의 한 목소리에 불과합니다. 마법의 렌즈에는 보이지만, 아직 가장 큰 목소리는 아닙니다.

2 단계: "호이스팅 오버라이딩 (Hoisting Overriding)" (침묵의 필터)

  • 무슨 일이 일어나는가: 이는 여정의 가장 긴 부분 (공장 높이의 약 60%) 입니다. 작업자들은 새로운 유형의 아이디어를 추가하는 것을 멈춥니다. 대신 잘못된 아이디어의 볼륨을 조용히 낮추고 올바른 아이디어의 볼륨을 높이기 시작합니다.
  • 비유: 제어실의 사운드 엔지니어를 상상해 보세요. 그들은 새로운 가수들을 데려오지 않습니다. 단지 배경 소음을 서서히 줄이고 리드 싱어의 볼륨을 높일 뿐입니다. 리드 싱어는 여전히 군중으로 둘러싸여 있지만, 점차 명확한 초점이 됩니다.
  • 기하학: "랭크 (활성화된 아이디어의 수)"는 안정적으로 유지됩니다. 작업자들은 여기서 매우 정밀하게 움직여 방의 모양을 바꾸지는 않지만, 누가 들리는지를 바꾸는 미세하고 거의 보이지 않는 조정을 가합니다. 여기서 모델이 중추적인 역할을 수행합니다: 모호성 해소 (disambiguation) (많은 후보 중 실제로 올바른 것이 무엇인지 파악하는 것).

3 단계: "포컬 컨버전스 (Focal Convergence)" (스포트라이트)

  • 무슨 일이 일어나는가: 마지막 구간에서 공장은 거대하고 결정적인 움직임을 취합니다. 모든 에너지를 단일 방향으로 쏟아붓습니다.
  • 비유: 사운드 엔지니어가 갑자기 방 안의 다른 모든 사람에게 전원을 차단합니다. 스포트라이트가 리드 싱어에게 딱 맞춰집니다. 군중은 침묵하고, 이제 싱어는 유일하게 중요한 존재가 됩니다.
  • 기하학: 작업자들은 더 이상 온건하지 않습니다. 최종 출력 방향과 완벽하게 정렬되는 거대하고 강력한 업데이트를 가합니다. "랭크"는 축소됩니다. 모든 에너지를 오직 한 명의 승자에게 집중하기 때문입니다. 이제 마법의 렌즈는 어떤 도움 없이도 답을 명확하게 볼 수 있습니다.

핵심 결론: 더 큰 모델 = 더 나은 필터, 더 나은 시작자가 아님

가장 놀라운 발견은 모델 크기가 이 과정에 미치는 영향에 관한 것입니다.

저자들은 공장을 더 크게 만들 때 (층/레이어를 추가할 때) 다음과 같은 사실을 발견했습니다:

  1. 1 단계 (군중) 는 크기가 거의 동일하게 유지됩니다.
  2. 3 단계 (스포트라이트) 는 크기가 거의 동일하게 유지됩니다.
  3. 2 단계 (침묵의 필터)훨씬 더 길어집니다.

비유: 작은 공장을 가진다면 "필터링" 공간은 작습니다. 거대한 공장을 가진다면 "필터링" 공간은 거대합니다.

이는 우리가 더 크고 똑똑한 AI 모델을 구축할 때, 반드시 그들이 올바른 아이디어로 시작하거나 일을 완료하는 능력을 향상시키는 것은 아니라는 것을 의미합니다. 우리는 그들에게 혼란을 정리하고 수많은 가능성 중 무엇이 올바른 것인지 파악할 수 있도록 훨씬 더 크고 상세한 공간을 제공합니다. 대형 모델의 추가적인 힘은 주로 후보 모호성 해소 (candidate disambiguation) 에 사용됩니다. 즉, "아마도 이것, 아마도 저것"이라는 지저분한 더미를 단일하고 자신감 있는 "예스"로 바꾸는 것입니다.

요약

이 논문은 다음 토큰 예측이 끝날 때의 갑작스러운 통찰의 번개가 아님을 보여줍니다. 그것은 기하학적 여정입니다:

  1. 시드 (Seed): 모든 것을 섞어 던진다.
  2. 호이스트 (Hoist): 소음을 조용히 필터링한다 (모델이 더 커지는 부분).
  3. 컨버지 (Converge): 높은 에너지로 승자에게 고정된다.

거대 언어 모델의 "마법"은 바로 그 중간 단계에 있습니다. 그곳에서 그들은 신호와 소음을 신중하게 분리할 공간과 시간을 갖습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →