← 최신 논문
📊 statistics

Anytime Pretraining: Horizon-Free Learning-Rate Schedules with Weight Averaging

이 논문은 가중치 평균화(weight averaging)를 단순한 호라이즌 프리(horizon-free) 학습률 스케줄(예: 다항식 감소 또는 1/t1/\sqrt{t})과 결면하는 것이 대규모 언어 모델에 대해 튜닝된 코사인 스케줄과 대등한 최종 성능을 달성함을 입증하며, 이는 전체 호라이즌을 알 수 없는 개방형 설정에서의 학습을 위한 실용적이고 이론적으로 근거가 확실한 대안을 제공한다.

원저자: Alexandru Meterez, Pranav Ajit Nair, Depen Morwani, Cengiz Pehlevan, Sham Kakade

게시일 2026-08-26
📖 5 분 읽기🧠 심층 분석

원저자: Alexandru Meterez, Pranav Ajit Nair, Depen Morwani, Cengiz Pehlevan, Sham Kakade

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서 대규모 언어 모델은 글쓰기 보조 도구부터 복잡한 추론 도구에 이르기까지 모든 것을 구동하는 엔진입니다. 이 엔진을 가동하기 위해 연구자들은 방대한 양의 텍스트를 주입하여 모델을 가르쳐야 하며, 이 과정을 사전 학습(pretraining)이라고 합니다. 이러한 교육에는 학습률(learning rate)이라는 설정에 의해 제어되는 속도와 정밀함 사이의 세심한 균형이 필요합니다. 이 비율을 모델이 새로운 정보에 따라 내부 지식을 조정하는 속도로 생각할 수 있습니다. 만약 속도가 너무 빠르면 모델은 진실을 지나쳐 버리고, 너무 느리면 아무것도 배우지 못합니다. 수년 동안 이 속도를 관리하는 표준 방법은 코사인 감쇠(cosine decay)라고 알려진 스케줄이었습니다. 이 방법은 모델을 적당한 속도로 시작하여 부드러운 곡선을 그리며 점진적으로 늦춘 뒤, 정해진 순간에 멈춥니다. 그러나 이 표준적인 접근 방식에는 중대한 결함이 있습니다. 바로 첫 단계를 밟기도 전에 훈련이 정확히 얼마나 오래 지속될지를 미리 알아야 한다는 점입니다. 데이터가 지속적으로 유입되고 전체 정보의 양을 알 수 없는 세상에서, 이러한 요구 사항은 목적지만 보여주고 그곳에 도달하기 위한 거리(남은 거리)는 보여주지 않는 지도를 가지고 자동차를 운전하려는 것과 같습니다.

하버드 대학교와 켐프너 연구소(Kempner Institute)의 연구진은 종료 시점을 미리 설정할 필요가 없는 새로운 모델 훈련 방식을 개발함으로써 이 문제를 해결했습니다. 수학적 이론과 대규모 실험을 결합한 이들의 연구는 훈련이 언제 멈출지 전혀 모르는 상태에서도 모델을 효과적으로 훈련할 수 있음을 입증했습니다. 그들은 시간이 지남에 따라 자연스럽게 느려지는 단순하고 꾸준한 속도를 사용하고, 여정 동안 모델의 진행 과정을 평균화함으로써 전통적인 방식만큼 좋은 결과를 얻을 수 있다는 것을 발견했습니다. 이 발견은 과거의 경직된 사전 계획형 스케줄이 가장 진보된 인공지능을 구축하는 데 반드시 필요한 것은 아님을 시사하며, 새로운 데이터가 가용해짐에 따라 지속적으로 학습할 수 있는 시스템을 구축할 수 있는 문을 열어주었습니다.

문제의 핵심은 현대 데이터의 본질에 있습니다. 과거의 고정된 데이터셋과 달리, 오늘날의 정보는 끊임없이 흘러 들어옵니다. 모델은 일주일, 한 달, 또는 데이터가 가용하다면 잠재적으로 몇 년 동안 훈련될 수 있습니다. 전통적인 코사인 감쇠 스케줄은 "호라이즌 의존적(horizon-dependent)"입니다. 즉, 알려진 기간에 맞춰 특별히 조정되어야 한다는 의미입니다. 만약 연구자가 한 달간의 실행에 맞춰 스케줄을 조정했는데 프로젝트가 세 달로 연장된다면, 학습률이 너무 일찍 느려지도록 설계되었기 때문에 모델의 성능이 저하됩니다. 연구진은 훈련이 내일 멈추든 내년에 멈추든 상관없이 잘 작동하는 "호라이즌 프리(horizon-free, 종료 시점 독립적)" 대안을 찾고자 했습니다. 그들은 복잡한 곡선 대신, 시간이 지남에 따라 천천히 감소하는 단순한 스케줄과 가중치 평균화(weight averaging)라는 기술을 결합하면 이 문제를 해결할 수 있다고 제안했습니다. 가중치 평균화는 최종 모델이 단순히 생성된 마지막 버전이 아니라, 훈련 과정 전반에 걸친 많은 버전의 혼합물이 되도록 하는 과정으로, 노이즈를 완화하고 결과를 안정화합니다.

이 아이디어를 테스트하기 위해 연구진은 먼저 수학적 이론에 의존했습니다. 그들은 언어에서 발견되는 복잡한 패턴을 모방하는 데이터에 대해 선형 회귀를 사용하여 학습의 단순화된 모델을 분석했습니다. 그들의 분석은 특정 유형의 데이터에 대해, 특히 시간이 증가함에 따라 비율이 감소하는 패턴(시간의 제곱근에 따라 비율이 떨어지는 방식)을 따르는 학습률이 이론적으로 최적임을 보여주었습니다. 결정적으로, 그들은 이 특정 감쇠가 가중치 평균화와 결합될 때, 전체 훈련 시간을 미리 알 필요 없이 최상의 학습 속도를 달라는 것을 증명했습니다. 이 이론적 발견은 강력한 토대를 제공했으며, 단순하고 꾸준한 접근 방식이 개방형 환경에서 복잡하고 사전 계획된 곡선보다 더 나은 성능을 낼 수 있음을 시사했습니다.

연구진은 이론에서 실무로 넘어가, 1억 5천만 개와 3억 개의 파라미터를 가진 대규모 언어 모델을 훈련시켰습니다. 그들은 이 모델들을 거대한 텍스트 데이터셋으로 훈련시켜, 해당 규모의 모델에 통상적으로 사용되는 양보다 최대 32배 많은 양의 데이터를 학습하도록 밀어붙였습니다. 이 규모는 중요한데, 이는 세계에서 가장 진보된 AI 시스템이 구축되는 조건을 반영하기 때문입니다. 그들은 자신들의 호라이즌 프리 스케줄을 각 훈련 기간에 맞춰 정교하게 조정된 표준 코사인 감쇠 스케줄과 비교했습니다. 결과는 놀라웠습니다. 평균화를 포함한 일정한 학습률 또는 평균화를 포함한 서서히 감소하는 학습률을 사용한 새로운 방법들은 최적화된 코사인 스케줄의 성능을 거의 완벽하게 따라갔습니다. 짧은 실행부터 가능한 가장 긴 기간에 이르기까지 전체 훈련 범위에 걸쳐, 호라이즌 프리 방식은 전통적인 방식과 구별할 수 없을 정도로 동일한 최종 결과를 달しまいました.

이 연구의 가장 설득력 있는 측면 중 하나는 실용성입니다. 연구진은 훈련 초기 단계에서 선택된 단 하나의 설정 세트가 프로젝트가 갑자기 확장되더라도 전체 기간 동안 사용될 수 있음을 보여주었습니다. 그들은 만약 모델이 표준 데이터 양의 4배와 같은 중간 지점에 맞춰 튜닝되었다면, 그 동일한 설정이 훈련이 32배까지 연장되더라도 계속해서 잘 작동할 것임을 입증했습니다. 이는 훈련 호라이즌이 바뀔 때마다 모델을 멈추고 다시 튜닝할 필요를 없애줍니다. 또한, 그들은 학습률을 대부분 일정하게 유지하다가 마지막에 감쇠시키는 '웜업-스테이블-디케이(warmup-stable-decay)'라고 알려진 인기 있는 대안 방법도 테스트했습니다. 이 방법은 두 방식의 장점을 모두 모방하려고 노력하며 잘 작동했지만, 여전히 감쇠 단계를 언제 시작할지를 알아야 했기에 저자들이 제안한 진정한 호라이즌 프리 방식보다는 유연성이 떨어졌습니다.

연구는 또한 훈련 데이터가 매우 커서 학습 과정의 노이즈가 자연스럽게 낮아지는 시나리오에서 이 방법들이 어떻게 작동하는지 탐구했습니다. 이러한 조건에서 연구진은 학습률이 전혀 감소할 필요가 없다는 것을 발견했습니다. 가중치 평균화와 결합된 일정한 학습률만으로도 최고 성능을 달성하기에 충분했습니다. 이는 데이터의 분산(노이즘)이 작을 때, 모델이 속도를 늦추기보다는 편향(오차)을 줄이기 위해 일정한 속도를 유지하는 것이 더 유리하다는 그들의 이론적 예측과 일치합니다. 이 통찰은 컴퓨팅 능력이 성장하고 모델이 더 큰 배치 데이터를 처리할 수 있게 됨에 따라, 복잡한 감쇠 스케ч줄의 필요성이 완전히 사라지고 더 단순하고 견고한 전략으로 대체될 수 있음을 시사합니다.

궁극적으로 이 연구는 인공지능 훈련의 미래에 대한 명확한 경로를 제시합니다. 이는 연속적인 데이터의 시대에 지난 수년간 분야를 지배해 온 경직되고 사전 계산된 스케줄이 유일한 방법, 혹은 아마도 최선의 방법은 아니라는 것을 시사합니다. 단순한 호라이즌 프리 스케줄이 가중치 평균화와 결합될 때 가장 정교하게 튜닝된 전통적 방식의 성능을 따라잡을 수 있음을 증명함으로써, 저자들은 개방형 학습을 위한 실용적인 솔루션을 제공했습니다. 이 접근 방식은 모델이 가용한 데이터의 양에 따라 적응할 수 있게 하여 훈련 과정을 더 유연하고 효율적으로 만듭니다. 이 연구 결과는 대규모 언어 모델 훈련의 미래가 더 복잡한 스케줄링 알고리즘에 있는 것이 아니라, 예정된 끝 없이 지속적으로 학습할 수 있는 더 단순하고 탄력적인 전략에 있음을 나타냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →