← 최신 논문
📊 statistics

Universal One-third Time Scaling in Learning Peaked Distributions

이 논문은 대규모 언어 모델 학습에서 관찰되는 계산 비용이 많이 들고 느린 멱법칙 수렴이 소프트맥스와 교차 엔트로피를 사용하여 정점 분포를 학습하는 데서 기인하는 내재적 결과이며, 이것이 보편적으로 1/3의 손실 시간 스케일링 지수를 초래한다는 것을 입증한다.

원저자: Yizhou Liu, Ziming Liu, Cengiz Pehlevan, Jeff Gore

게시일 2026-08-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yizhou Liu, Ziming Liu, Cengiz Pehlevan, Jeff Gore

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 문장을 완성하는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇에게 수백만 권의 책을 주고, 로봇은 인간 언어의 패턴을 배우기 시작합니다. 하지만 여기 함정이 있습니다. 로봇이 커지고 더 많은 데이터를 주입하더라도, 즉시 완벽해지는 것이 아니라 매우 특정한 방식으로, 아주 느리게 개선된다는 점입니다. 이것은 마치 자동차가 언덕을 올라가는 것을 지켜보는 것과 같습니다. 언덕이 가팔라질수록 자동차의 속도는 점점 더 느려지며, 예측 가능한 곡선을 따라 움직입니다. 과학자들은 이를 "신경 스케일링(neural scaling)"이라고 부르며, 오랫동안 그들은 이 느린 곡선이 데이터 자체가 지저분하거나 복잡하기 때문, 즉 어떤 책은 흔하고 어떤 책은 희귀한 도서관처럼 데이터의 문제라고 생각했습니다. 그들은 로봇이 단지 희귀한 책을 찾는 데 어려움을 겪고 있다고 가정했습니다. 하지만 만약 로봇이 어려움을 겪는 이유가 도서관 때문이 아니라, 로봇이 '생각하는 방식' 때문이라면 어떨까요? 이 논문은 왜 학습이 느려지는지, 그리고 우리가 그 속도를 정확히 예측할 수 있는지 알아보기 위해 로봇의 뇌 내부에 있는 수학적 "기어"들을 들여다보며 이 미스터리를 파헤칩니다.

이 연구의 저자인 이주(Yizhou Liu), 짐 류(Ziming Liu), 첸기즈 페흘레반(Cengiz Pehlevan), 제프 고어(Jeff Gore)는 도서관의 복잡함에 대해 추측하는 대신, 로봇의 내부 엔진을 들여다보기로 했습니다. 그들은 로봇이 매우 특정한 종류의 패턴, 즉 "피크형(peaked)" 분포를 학습하려고 할 때 어떤 일이 일어나는지 보기 위해 아주 단순화된 형태의 언어 모델인 "토이 모델(toy model)"을 구축했습니다. "비 올 확률 99%, 맑을 확률 1%"라고 말하는 일기예보를 상상해 보세요. 이것이 피크형 분포입니다. 답은 거의 확실하지만, 모델이 이를 정확하게 맞추기 위해서는 매우 정밀해야 합니다.

그들이 이 토이 모델이 이러한 날카롭고 확실한 결과를 예측하도록 훈련했을 때, 그들은 놀라운 사실을 발견했습니다. 느린 멱법칙(power-law) 학습 곡선은 데이터가 어려워서가 아니라, 모델이 사용하는 두 가지 특정 도구인 **소프트맥스(softmax)**와 크로스 엔트로피(cross-entropy) 때문이었습니다. 소프트맥스를 숫자를 확률로 변환하여 합계가 100%가 되도록 만드는 "투표 기계"라고 생각하고, 크로스 엔트로피를 모델이 얼마나 틀렸는지를 알려주는 "성적표"라고 생각할 수 있습니다. 이 논문은 당신이 이 두 가지 도구를 결합하여 매우 날카롭고 확실한 답을 배우려고 할 때, 수학적으로 학습 속도가 특정한 방식으로 느려지도록 강제한다는 것을 보여줍니다. 모델의 크기나 데이터를 어떻게 조정하든 상관없이, 오차(loss)는 시간의 1/3 승에 비례하는 보편적인 규칙을 따르며 감소합니다.

장난스러운 비유를 들어보겠습니다. 연필을 끝으로 세워 균형을 잡으려고 노력한다고 상상해 보세요. 처음에는 작은 조정을 하는 것이 쉽습니다. 하지만 연필이 완벽하게 수직(피크 상태)에 가까워질수록, 아주 미세한 흔들림조차 점점 더 중요해집니다. 이 논문은 모델이 실수를 계산하는 방식이, 완벽한 답에 가까워질수록 마치 모델이 끈적한 꿀 속을 걷는 것처럼 느끼게 만든다고 제안합니다. 이 "꿀"은 데이터가 아니라, 투표 기계와 성적표의 수학적 원리입니다. 저자들은 이 "꿀" 속에서 오차가 빠르게 줄어드는 것이 아니라, 일정한 예측 가능한 속도로 줄어든다는 것을 발견했습니다. 즉, 훈련 시간을 두 배로 늘린다고 해서 오차가 절반으로 줄어드는 것이 아니라, 특정 비율만큼만 줄어듭니다. 이 비율은 정확히 시간의 세제곱근인 1/3입니다.

연구진은 단순히 이 작은 토이 모델에서 멈추지 않았습니다. 그들은 이 "꿀" 효과가 오늘 우리가 사용하는 거대하고 실제적인 언어 모델인 Pythia나 Olmo 모델에서도 실제로 나타나는지 알고 싶었습니다. 그들은 이 거대 모델들의 훈련 데이터를 살펴보았고, 실제로 모델들이 이 "저온(low-temperature, 매우 날카롭고 확실한)" 영역에서 작동하고 있다는 것을 발견했습니다. 거대 모델들의 오차율을 훈련 시간과 함께 그래프로 그렸을 때, 데이터는 그들의 예측과 완벽하게 일치했습니다. 오차는 1/3의 멱법칙 지수로 감소하고 있었습니다. 이는 우리가 보는 거대 AI의 느린 학습이 버그나 지저한 데이터의 징후가 아니라, 모델이 구축된 방식의 근본적인 특징임을 시사합니다.

또한 이 논문은 만약 속도를 높이려고 시도한다면 어떤 일이 벌어지는지도 탐구했습니다. 그들은 학습률(모델이 내딛는 발걸음의 크기)을 너무 크게 만들면 모델이 혼란을 느껴 꿀 속의 경로를 따라가지 못한다는 것을 발견했습니다. 하지만 발걸음을 작고 꾸준하게 유지하면, 모델은 1/3 규칙을 완벽하게 따릅니다. 흥란하게도, 모델이 시작 단계에서 스승(정답)과 완벽하게 일치하지 않더라도 결국 이 리듬에 빠져든다는 것을 발견했습니다. 이 규칙이 깨지는 유일한 경우는 데이터가 매우 "평탄하거나(flat)" 불확실할 때(예: 비 올 확률 50%, 맑을 확률 50%인 일기예보)이며, 이 경우 학습은 느린 멱법칙이 아닌 빠른 지수 함수 형태로 일어납니다.

그렇다면 이것이 미래에 무엇을 의미할까요? 저자들은 만약 우리가 AI를 더 빠르게 훈련시키고 싶다면, 우리가 사용하는 "투표 기계"와 "성적표"를 재고해야 할 수도 있다고 제안합니다. 아마도 답이 매우 확실할 때 꿀 속에 갇히지 않는 새로운 도구가 필요할 것입니다. 또한 그들은 이전의 실험들이 왜 1/3 지수(또는 0.28이나 0.30 같은 근사치)를 목격했는지 그 이유를 모른 채 지나쳤다는 점을 지적했습니다. 그것은 우연이 아니었습니다. 그것은 모델 자체의 수학이었습니다.

요약하자면, 이 논문은 거대 언어 모델의 느리고 꾸준한 개선이 데이터의 결함이 아니라 설계에 내장된 기능임을 밝혀냈습니다. 이것은 AI 학습에 대한 물리 법칙과 같습니다. 당신이 이러한 특정 도구들을 사용하여 매우 확실한 답을 배우려고 할 때, 당신은 1/3의 속도로 움직일 운명입니다. 저자들은 이것이 자신들의 시뮬레이션과 기존 모델에 대한 분석에 기반한 것임을 명시하며, AI 훈련 속도 문제를 완전히 해결했다고 주장하는 것이 아니라, 대신 어디에 속도 제한 구간이 있고 왜 존재하는지에 대한 지도를 우리에게 건네주고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →