← 최신 논문
🤖 machine learning

Data Predictability Shapes Weibull Weight-Scale Growth in Transformer Training

이 논문은 트랜스포머 가중치의 성장이 데이터 예측 가능성(바이그램 조건 엔트로피)의 사전 계산된 학습 불필요 통계량에 의해 예측 가능하게 지배되며, 서로 다른 학습률과 아키텍처에 걸쳐 가중치 크기 변화의 정확한 전방향 예측을 가능하게 하는 특정 멱법칙 관계를 따른다는 점을 입증한다.

원저자: Tiexin Ding

게시일 2026-08-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tiexin Ding

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 광활한 풍경 속에서 가장 강력한 도구는 흔히 트랜스포머라고 불리는 거대 언어 모델이다. 이 시스템들은 방대한 양의 텍스트를 읽고, 다음 단어를 더 잘 예측하기 위해 '가중치'라고 알려진 수십억 개의 내부 숫자들을 조정하며 학습한다. 수년 동안 연구자들은 이 내부 숫자들을 블랙박스로 취급해 왔다. 즉, 학습 중에 숫자들이 변한다는 것은 알지만, 읽고 있는 텍스트의 성격이 그 변화를 정확히 어떻게 형성하는지는 이해하는 데 어려움을 겪어왔다. 핵심적인 질문 하나가 해결되지 않은 채 남아 있었다. 텍스트 자체의 예측 가능성이 모델의 내부 숫자를 얼마나 성장시키거나 변화시키는가 하는 점이다. 만약 모델이 매우 구조적이고 예측 가능한 이야기를 읽을 때와 혼란스럽고 무작위적인 단어의 뭉치를 읽을 때, 그 차이가 기계 내부의 숫자 크기에서 나타날 것인가?

독립 연구자인 Tiexin Ding의 새로운 연구는 놀라울 정도로 정밀하게 이 질문에 답한다. 이 연구자는 내부 숫자의 성장이 전적으로 텍스트의 단 하나의 속성, 즉 이전 단어를 바탕으로 다음 단어를 얼마나 쉽게 추측할 수 있는지에 따라 결정되는 엄격하고 예측 가능한 패턴을 따른다는 사실을 발견했다. 특정 유형의 텍스트 손상(corruption)을 분석함으로써, 이 연구는 텍스트가 더 예측 가능할수록 모델의 내부 숫자가 특정한 방식으로 측정 가능한 만큼 팽창한다는 것을 찾아냈다. 이 관계는 학습 시 사용된 학습 속도와 상관없이 유효하며, 이는 가공되지 않은 데이터와 기계의 내부 구조를 연결하는 근본적인 법칙이 존재함을 시사한다.

연구는 훈련된 모델 내부 숫자의 형태에 대한 단순한 관찰에서 시작되었다. 연구자들이 모델의 여러 층(layer)에 걸쳐 이 숫자들의 크기를 조사했을 때, 이들은 와이불 분포(Weibull distribution)라고 알려진 일관된 패턴을 따르고 있음을 발견했다. 이 패턴은 두 가지 값으로 정의되는데, 하나는 놀라울 정도로 안정적인 '형태 계수(shape factor)'이고, 다른 하나는 학습에 따라 변하는 '척도 계수(scale factor)'이다. 안정적인 형태는 모델의 내부 구조가 일관되게 유지됨을 의미하며, 변하는 척도 계수는 학습에 따라 조절되는 다이얼처럼 작동한다. 연구는 바로 이 척도 계수에 주목하여, 무엇이 이를 성장시키는지를 탐구했다.

답을 찾기 위해 연구자는 표준 텍스트 데이터셋을 사용하여 통제된 실험을 설계했다. 서로 다른 책이나 주제로 학습시키는 대신, 연구자는 텍스트는 동일하게 유지하면서 체계적으로 이를 뒤섞었다. 텍스트의 일부를 가져와 단어의 순서를 섞음으로써, 완벽하게 질서 정연한 상태부터 완전히 혼란스러운 상태까지 스펙트럼을 가진 데이터셋들을 만들어냈다. 모델을 훈련시키기 전에, 연구자는 각 버전의 텍스트에 대해 특정 통계량을 측정했다. 즉, 이전 단어를 통해 다음 단어를 예측하는 것의 평균적인 난이도를 측정한 것이다. 깨끗한 텍사트에서는 다음 단어를 예측하기 쉬웠으나, 뒤섞인 텍스트에서는 그것이 거의 불가능했다.

결과는 이 예측 가능성과 모델의 내부 숫자 성장 사이의 명확한 수학적 관계를 드러냈다. 연구는 척도 계수의 성장이 무작위적인 것이 아니라, 텍스트의 예측 가능성과 완전한 무작위성 사이의 차이를 기반으로 하는 특정 곡선을 따른다는 것을 발견했다. 결정적으로, 이 관계는 단순히 추측에 의한 것이 아니라 두 가지 별개로 독립 측정된 사실으로부터 도출되었다. 첫째, 숫자의 성장은 텍스트에 남아 있는 구조의 양에 직접적으로 비례한다는 것이 밝혀졌다. 둘째, 텍스트가 더 많이 뒤섞임에 따라 다음 단어를 예측하는 난이도가 특정 곡선 형태의 포화 패턴을 따른다는 것이었다. 이 두 가지 사실이 결합되었을 때, 숫자의 성장은 정밀한 볼록한 곡선을 따를 수밖에 없었다. 이는 곡선의 모양이 우연히 데이터에 맞춰진 것이 아니라, 텍스트 구조와 학습 과정이 상호작용하는 방식의 필연적인 결과임을 의미한다.

이 연구는 모델이 숫자를 얼마나 빨리 업데이트하는지를 제어하는 학습 속도에 걸쳐 이 법칙을 테스트했다. 연구자가 이러한 속도를 조정했을 때, 모든 서로 다른 훈련 과정들이 하나의 통일된 선으로 수렴했다. 이 수렴은 이 관계가 특정 설정의 산물이 아니라 시스템의 근본적인 속성임을 증명했다. 그다음 연구자는 이 법칙이 미래를 예측할 수 있는지 확인하기 위해 엄격한 테스트를 수행했다. 사전 훈련 단계의 텍스트 예측도 측정값만을 사용하여, 새로운 버전의 뒤섞인 텍스트에서 내부 숫자가 얼마나 성장할지를 예측했다. 그 예측은 매우 작은 오차 범위 내에서 정확했으며, 이는 텍스트의 속성만으로도 모델의 내부 성장을 예측하기에 충분하다는 것을 확인시켜 주었다.

그러나 이 연구는 이 법칙이 적용되는 경계를 명확히 설정했다. 연구자가 컴퓨터 코드를 대상으로 모델을 테스트했을 때, 예측은 실패했다. 코드는 예측도가 낮으므로 이론적으로는 높은 성장을 보여야 하지만, 모델의 숫자는 예상보다 훨씬 적게 성장했다. 연구자는 코드가 자연어에서 발견되는 풍부한 맥락적 매핑보다는 반복과 템플릿에 크게 의존한다는 점을 확인했다. 이는 예측 가능성이 주요 동력이긴 하지만, '중복성(redundancy)'이라는 두 번째 요인 또한 역할을 한다는 것을 시사한다. 이 법칙은 다음 단어가 맥락에 의존하는 텍스트에서는 완벽하게 작동하지만, 단지 패턴을 반복하기 때문에 다음 단어를 예측할 수 있는 텍스트에서는 무너진다.

또한, 연구 결과는 모델 내부의 개별 층을 들여다보았을 때도 유효했다. 텍스트 예측도와 숫자 성장 사이의 동일한 관계가 모델의 모든 부분에서 나타났으나, 그 효과의 강도는 다양했다. 정보의 흐름을 처리하는 층이 가장 강한 반응을 보였으며, 다른 부분들은 덜 민감했다. 이를 통해 연구자는 네트워크의 정확히 어느 지점에서 텍스트의 구조가 숫자로 기록되는지를 지도화할 수 있었다. 나아가, 연구는 두 가지 서로 다른 모델 아키텍처를 테스트했으며, 구체적인 숫자는 달라질지라도 근본적인 관계의 형태는 동일하게 유지되었다. 이는 이 법칙이 기계의 특정 설계와 상관없이, 모델이 학습하는 방식의 견고한 특징임을 나타낸다.

궁극적으로, 이 작업은 인공지능을 이해하기 위한 명확하고 미래 지향적인 도구를 제공한다. 이는 모델이 훈련되기도 전에 데이터셋을 살펴봄으로써 모델의 내부 숫자가 어떻게 진화할지를 정확히 예측할 수 있음을 보여준다. 이는 데이터와 기계 사이의 오랜 고리를 닫으며, 텍스트의 구조가 단순히 수동적인 입력값이 아니라 모델의 내부 역학을 이끄는 능동적인 동력임을 보여준다. 이 법칙에는 특히 코드와 같이 반복성이 높은 데이터에 대한 한계가 있지만, 훈련 데이터의 품질과 구조를 측정하는 강력하고 새로운 방법을 제시하며, 복잡하고 보이지 않는 과정을 단순하고 구체적인 도구로 측정하고 예측하며 이해할 수 있게 해준다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →