← 최신 논문
📊 statistics

Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models

이 논문은 훈련을 반복 평균 언어 모델의 오차를 최소화하기 위한 최적 제어 문제로 취급하는 AdamW의 옵티마이저 래퍼인 PACE를 제안하며, 이론적인 수렴 보증과 지도 미세 조정 및 사전 훈련 작업에서의 경험적 개선을 모두 입증한다.

원저자: Kwok Chun Au, Adam Block

게시일 2026-06-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kwok Chun Au, Adam Block

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 디지털 두뇌(언어 모델)에게 시 쓰기나 코딩과 같은 새로운 기술을 가르치고 있다고 상상해 보세요. 당신은 수천 개의 예시를 보여주며 단계별로 내부의 "가중치"(지식)를 조정합니다.

보통 훈련을 마치면, 당신은 그 마지막 버전의 두뇌를 가져와서 "이것이 완성된 제품이다"라고 말합니다. 하지만 많은 현대 연구자들은 비밀 하나를 발견했습니다. 바로 훈련 과정 중에 거쳐온 모든 버전의 평균이 마지막 버전 단독보다 더 똑똑하고 안정적이라는 사실입니다. 이것은 마치 "내가 치른 모든 연습 시험의 평균이, 마지막 날에 본 시험 점수보다 나의 최종 성적을 더 잘 예측한다"라고 말하는 것과 같습니다.

문제는 훈련 과정이 자신이 이 "평균"에 의해 평가받을 것이라는 사실을 모른다는 점입니다. 훈련은 그저 가능한 한 빨리 결승선에 도달하려고만 합니다. 이로 인해 경로는 요동칠 수 있고, 최종 평균은 덜 완벽해질 수 있습니다.

이 논문은 이 문제를 해결하기 위해 PACE(Pullback Averaging Control for Efficient Optimization)라고 불리는 새로운 방법을 소개합니다. 이 방법이 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.

1. 문제점: 흔들리는 외줄타기

언어 모델을 훈련하는 것을 특정 목적지(완벽한 정답)를 향해 외줄을 타고 가는 것에 비유해 보세요.

  • 표준 훈련 (AdamW): 당신은 앞으로 발을 내디딥니다. 때로는 너무 멀리 가기도 하고, 때로는 비틀거리기도 합니다. 끝에 도달했을 때, 당신은 중심에서 약간 벗어나 있을 수도 있습니다.
  • "평균" 기법: 우리가 단순히 도착한 지점을 보는 대신, 우리가 걸어온 모든 지점의 평균을 보기로 결정했다고 합시다.
  • 문제점: 만약 당신이 자신의 평균 위치로 평가받을 것이라는 것을 안다면, 당신은 다르게 걸어야 합니다. 단순히 끝을 향해 돌진하는 것이 아니라, 전체 경로를 일정하고 중심 잡힌 상태로 유지하려고 노력해야 합니다. 하지만 표준 훈련 알고리즘은 이를 알지 못하며, 그저 앞으로 돌진할 뿐입니다 무작정 달려갑니다.

2. 해결책: "유령 가이드" (최적 제어)

저자들은 근본적인 질문을 던졌습니다. 만약 우리가 평균으로 평가받을 것이라는 것을 안다면, 그 평균을 최대한 좋게 만들기 위해 우리가 걷는 방식을 어떻게 바꿔야 할까?

그들은 고급 수학(특히 로켓이나 로봇을 유도하는 데 사용되는 "최적 제어 이론")을 사용하여 이를 해결했습니다. 그들은 목표가 완벽한 골짜기이고, 훈련의 "노이즈"는 보행자를 경로에서 벗어나게 만드는 바람과 같은 단순화된 세상을 가정했습니다.

그들은 완벽한 전략을 계산했습니다: 단순히 앞으로만 걷지 마세요. 가끔씩 당신의 "유령 가이드"(당신이 지나온 곳들의 평균)를 바라보고, 그것을 향해 자신을 부드럽게 다시 끌어당기세요.

3. 실무 도구: PACE

완벽한 수학적 솔루션은 실제 거대한 컴퓨터에서 사용하기에는 너무 복يق했습니다. 그래서 저자들은 실용적이고 가벼운 버전인 PACE를 만들었습니다.

  • 작동 방식: PACE는 표준 훈련 도구(AdamW) 위에 올라타 있는 "래퍼(wrapper)"입니다.
  • 메커니즘: 몇 단계마다, PACE는 모델이 현재 있는 위치와 과거 단계들의 "평균" 사이의 차이를 확인합니다.
  • 풀백(Pullback): 만약 모델이 평균에서 너무 멀리 벗어났다면, PACE는 그것을 부드럽게 다시 밀어 넣습니다. 이것은 마치 개가 경로를 벗어나 계속 달려 나갈 때 목줄을 쥐고 있는 훈련사와 같습니다. 훈련사는 개의 움직임을 멈추지는 않지만, 무리 중앙으로 부드럽게 다시 끌어당깁니다.
  • 스마트한 넛지(Nudge): 이 당김의 강도는 무작위가 아닙니다. 이는 "클리핑(clipping, 제한)"되어 모델을 너무 세게 덜컥거리게 하지 않으며, 모델이 현재 단계에 대해 얼마나 확신하는지에 따라 조절됩니다.

4. 결과: 더 부드러운 여정

논문은 여러 가지 서로 다른 언어 모델(10억에서 20억 개의 파라미터 범위)에 대해 PACE를 테스트했습니다.

  • 비유: 두 명의 러너가 있다고 상상해 보세요. 한 명은 결승선을 향해 지그재그로 달리며 거칠게 달립니다 (표준 훈련). 다른 한 한 명은 중심을 유지하기 위해 끊임없이 경로를 수정하며 부드럽게 달립니다 (PACE).
  • 결과: "부드러운" 러너(PACE)는 "거친" 러너보다 일관되게 더 나은 "평균 위치"로 결승선을 통과했습니다.
  • 핵심 발견: PACE는 표준 방식이 마지막에 학습률을 늦추는 방식(학습을 안정화하기 위한 흔한 기법)을 허용했을 때조차도 더 효과적이었습니다. PACE는 마지막에만 안정화되는 것이 아니라, 훈련 과정 전체에 걸쳐 이러한 안정성을 달성했습니다.

요약

요약하자면, 이 논문은 만약 당신이 훈련 단계의 평균을 최종 모델로 사용할 계획이라면, 다르게 훈련해야 한다고 주장합니다. 단순히 결승선을 향해 달려가는 것이 아니라, 당신의 여정 전체를 중심 잡힌 상태로 유지하는 것을 목표로 해야 합니다. PACE는 모델을 자신의 과거 기록 쪽으로 부드럽게 끌어당기는 단순하고 새로운 도구이며, 결과적으로 더 똑똑하고 안정적인 최종 제품을 만들어냅니다.

이 논문이 주장하지 않는 것:

  • 이 방법이 의료 진단이나 임상 용도로 작동한다고 주장하지 않습니다.
  • 이 방법이 20억 개 이상의 파라미터를 가진 모델에서도 작동한다고 주장하지 않습니다 (테스트는 20억 개 규모까지만 진행되었습니다).
  • 이 방법이 다른 모든 방법을 대체한다고 주장하는 것이 아니라, 평균화와 결합했을 때 표준적인 "AdamW" 방법을 개선한다는 것을 의미합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →