← 최신 논문
📊 statistics

Deriving Neural Scaling Laws from the statistics of natural language

이 논문은 자연어의 쌍별 토큰 상관관계의 붕괴와 다음 토큰 조건부 엔트로피의 붕괴에만 기반하여 파라미터가 없는 공식을 유도함으로써, 대규모 언어 모델의 데이터 제한적 뉴럴 스케일링 지수를 제1원리로부터 정량적으로 예측하는 최초의 이론을 제시한다.

원저자: Francesco Cagnetta, Allan Raventós, Surya Ganguli, Matthieu Wyart

게시일 2026-07-07✓ Author reviewed
📖 4 분 읽기☕ 가벼운 읽기

원저자: Francesco Cagnetta, Allan Raventós, Surya Ganguli, Matthieu Wyart

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 새로운 언어를 가르치려 한다고 상상해 보세요. 당신에게는 방대한 양의 책(데이터)이 있지만, 로봇이 유창해지기 위해 얼마나 많은 책을 읽어야 하는지, 혹은 도서관에 책을 추가할 때마다 로봇의 성능이 어떻게 향상되는지는 알지 못합니다.

오랫동안 과학자들은 한 가지 패턴을 발견해 왔습니다. 로봇에게 더 많은 데이터를 제공할수록, 실수가 예측 가능한 방식으로 줄어든다는 것입니다. 마치 미끄럼틀을 타는 것처럼 말이죠. 이것을 "스케일링 법칙(scaling law)"이라고 부릅니다. 하지만 지금까지는 왜 이런 현상이 발생하는지, 혹은 언어 자체만을 보고 그 미끄럼틀의 정확한 모양을 어떻게 예측할 수 있는지 설명할 수 있는 사람이 없었습니다.

이 논문은 바로 이 일을 해내는 최초의 이론을 제공합니다. 이 논문은 언어 모델이 학습하는 "속도"가 컴퓨터 아키텍처나 훈련에 들인 비용이 아니라, 언어 자체가 가진 두 가지 단순하고 숨겨진 통계적 특성에 의해 결정된다고 주장합니다.

다음은 쉬운 비유를 사용한 요약입니다.

1. 언어의 두 가지 숨겨진 규칙

저자들은 모든 언어에는 학습 난이도를 결정하는 두 가지 "성격적 특성"이 있다고 주장합니다.

  • "기억 범위" 규칙 (상관관계): 문장 속에서 단어들이 얼마나 멀리 떨어진 단어와 서로 의존하는가?
    • 비유: "전화기 게임(Telephone game)"을 상상해 보세요. 어떤 언어에서는 줄의 맨 처음에 속삭인 단어가 맨 끝의 단어를 바꿀 수도 있습니다. 반면 다른 언어에서는 그 연결이 빠르게 사라집니다. 이 논문은 단어 사이의 거리가 멀어짐에 따라 이 연결이 얼마나 빨리 사라지는지를 측정합니다.
  • "놀라움" 규칙 (엔트로피): 다음 단어를 예측하기가 얼마나 어려운가?
    • 비유: 문장을 읽다가 "고양이가 매트 위에..."라는 문구를 보았다면, 다음에 올 단어(아마도 "앉았다")에 대해 별로 놀랍지 않을 것입니다. 하지만 만약 언어가 매우 복잡하다면, "고양이가 매트 위에..." 다음에 어떤 단어가 올지 예측하기 매우 어려울 수 있습니다. 이 논문은 문장을 길게 읽어 나감에 따라 "놀라움(또는 불확실성)"이 얼마나 남는지를 측정합니다.

2. 학습 메커니즘: "과거를 잠금 해제하기"

논문은 언어를 배우는 것이 단순히 더 많은 단어를 암기하는 것이 아니라, 더 긴 기억을 잠금 해제하는 것이라고 제안합니다.

  • 비유: 훈련 데이터(데이터 포인트의 수)를 "열쇠"라고 생각해 보세요.
    • 적은 양의 책(적은 데이터)이 있으면, 로봇는 문장의 마지막 몇 단어만 "들을" 수 있습니다. 이는 이야기를 듣고 싶지만 마지막 5단어만 들리는 상황과 같습니다.
    • 더 많은 책(더 많은 데이터)을 추가하면, 로봇는 더 멀리 있는 과거를 "듣는" 능력을 갖게 됩니다. 이제는 단어 "고양이"와 "앉았다" 사이에 10개의 단어가 있더라도 둘을 연결할 수 있습니다.
    • 이 이론은 로봇이 청취 범위를 확장함으로써 학습한다고 말합니다. 로봇은 이미 듣고 있는 단어들을 처리하는 능력이 똑똑해지는 것이 아니라, 단지 과거를 더 많이 들을 수 있는 능력을 얻는 것입니다.

3. 마법의 공식

저자들은 로봇에게 데이터를 추가함에 따라 실수가 얼마나 빨리 줄어드는지 예측하는 간단한 공식을 도출했습니다.

  • 공식: 학습 속도 = (놀라움이 감소하는 속도) ÷ (2 × 연결이 감소하는 속도).
  • 중요한 이유: 이 사실을 알아내기 위해 로봇을 직접 훈련시킬 필요는 없습니다. 텍스트 자체에 대한 수학적 계산을 통해 언어의 두 가지 "성격적 특성"(기억 범위와 놀라움 규칙)을 측정하기만 하면 됩니다. 일단 이 두 숫자를 구하면, 공식이 로봇의 성능이 어떻게 스케일링될지 정확히 알려줍니다.

4. "붕괴(Collapse)" 실험

이를 증명하기 위해 연구진은 영리한 트릭을 사용했습니다. 그들은 서로 다른 유형의 언어 모델(예: GPT-2, LLaMA)을 가져와 두 가지 매우 다른 데이터셋으로 훈련시켰습니다.

  1. TinyStories: 아이들을 위한 단순하고 만들어진 이야기들.
  2. WikiText: 복잡하고 실제적인 백과사전 기사들.

그들은 각 데이터셋에 대한 두 가지 언어적 특성을 측정했습니다. 그런 다음 학습 곡선을 그렸습니다.

  • 결과: 연구진이 자신들의 공식을 사용하여 그래프를 조정했을 때(언어의 특성에 따라 축을 스케일링했을 때), 서로 다른 모델과 서로 다른 데이터 크기에 따른 모든 곡선이 하나의 완벽한 선으로 합쳐졌습니다(collapse).

마치 엉클어진 다양한 색깔의 실 뭉치를 가져와서, 적절한 자를 사용하여 그것들이 사실은 단지 길게 늘어져 있을 뿐 동일한 하나의 실줄기임을 보여준 것과 같습니다.

요약

이 논문은 AI가 언어를 배우는 "마법"이 사실은 마법이 아니라고 주장합니다. 그것은 언어 자체가 가진 통계적 구조의 직접적인 반영입니다.

  • 만약 어떤 언어가 긴 거리의 연결(멀리 떨어진 단어 간의 의존성)을 가지고 있다면, 모델은 이를 배우기 위해 많은 데이터가 필요합니다.
  • 만약 어떤 언어가 매우 예측 가능하다면, 모델은 이를 빠르게 배웁니다.

저자들은 우리가 언어를 보고, 그 언어의 두 가지 기본적인 통계적 특성을 측정하여, 값비싼 훈련 실험을 미리 수행하지 않고도 AI가 그 언어를 마스터하는 데 정확히 얼마나 많은 데이터가 필요할지 수학적으로 예측할 수 있게 해주는 "해독 키(decoder ring)"를 제공했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →