← 최신 논문
🤖 machine learning

RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training

이 논문은 강화 학습(RL)을 지도 미세 조정(SFT) 이후에만 적용하는 표준 관행에 이의를 제기하며, 사전 학습 단계에서 더 일찍 강화 학습을 통합하고, 데이터 구성을 최적화하며, 강화 학습을 지도 미세 조정 목적 함수와 병합하는 것이 일반적인 능력을 보존하면서도 추론 능력을 효과적으로 향상시키고 모델의 분포를 확장할 수 있음을 입증한다.

원저자: Rachit Bansal, Clara Mohri, Tian Qin, David Alvarez-Melis, Sham Kakade

게시일 2026-06-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Rachit Bansal, Clara Mohri, Tian Qin, David Alvarez-Melis, Sham Kakade

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 뛰어난 재능을 가졌지만 아직 다듬어지지 않은 학생(AI 모델)에게 수학 문제를 푸는 법을 가르치고 있다고 상상해 보세요. 수년 동안 표준적인 레시피는 세 단계였습니다:

  1. 사전 학습(Pre-training): 학생이 일반적인 언어와 지식을 배우기 위해 수백만 권의 책을 읽습니다.
  2. SFT (지도 미세 조정, Supervised Fine-Tuning): 선생님이 학생에게 문제와 그에 대한 정확한 정답이 적힌 교과서를 주고, 학생이 풀이 과정을 암기하도록 강요합니다.
  3. RL (강화 학습, Reinforcement Learning): 학생은 게임에 투입되며, 오직 최종 정답을 맞혔을 때만 점수를 얻습니다. 이는 학생이 스스로 문제를 해결하는 새로운 방법들을 찾아내도록 독려합니다.

이 논문은 다음과 같이 질문합니다: 우리는 정말로 학생이 모든 책을 다 읽고 교과서를 다 암기할 때까지 기다렸다가 게임을 시작해야만 할까요?

연구진이 발견한 내용을 알기 쉽게 설명하면 다음과 같습니다:

1. 게임을 일찍 시작할 수 있습니다

표준 규칙은 "게임을 주기 전에 학생의 훈련이 완전히 끝날 때까지 기다려라"라고 말합니다. 연구진은 학생이 첫 몇 장의 챕터를 읽고 있는 중에도(사전 학습 초기 단계) 게임(RL)을 주는 실험을 했습니다.

  • 결과: 놀랍게도 잘 작동했습니다! 학생이 책의 아주 작은 부분만을 읽었을 때조차, 게임을 하는 것이 단순히 책을 더 많이 읽는 것보다 수학 문제를 훨씬 더 잘 풀도록 도왔습니다. 사실, 게임을 일찍 시작하는 것은 끝까지 기다렸다가 "읽기 → 암기하기 → 놀기"라는 전체 과정을 거치는 것만큼이나 효과적이었습니다.

2. 교과서가 없을 때 "게임"이 더 효과적입니다

보통 "암기" 단계(SFT)는 정답이 적힌 교과서를 필요로 합니다. 하지만 만약 교과서가 충분하지 않다면 어떻게 될까요?

  • 발견된 사실: 문제를 푸는 방법이 한두 개뿐이라면 "암기" 단계는 실패합니다. 하지만 "게임"(RL)은 번창합니다. 학생은 완벽한 답안지 없이도 스스로 탐구하고 해결책을 찾아내는 법을 배웁니다. 정답 예시가 부족할 때 게임은 훨씬 더 강력한 스승이 됩니다.

3. 비밀 재료는 학생의 크기가 아니라 "책의 종류"입니다

사람들은 흔히 "학생이 더 커지면(더 강력해지면), 더 잘 배울 것이다"라고 생각합니다. 연구진은 학생을 더 크게 만들어 이 점을 테스트했습니다.

  • 반전: 학생을 더 크게 만드는 것은 게임을 더 빨리 배우게 하지 못했습니다. 하지만 초기 읽기 단계에서 수학 책을 더 많이 주는 것은 도움이 되었습니다.
  • 교훈: 학생이 수학을 잘하게 만들고 싶다면, 초기에 수학 이야기를 먹여주세요. 학생의 뇌가 얼마나 큰가보다 무엇을 읽느냐 하는 콘텐츠가 더 중요합니다.

4. "날카롭게 만들기"의 신화 vs "확장하기"

최근 하나의 논쟁이 있습니다: "게임"(RL)이 기존의 답변을 더 날카롭고 자신감 있게 만드는 것뿐인가요, 아니면 실제로 새로운 사고방식을 가르치는 것인가요?

  • 기존의 관점: 많은 이들이 RL이 단지 학생을 "날카롭게" 만들 뿐이며, 더 똑똑하게 만드는 것이 아니라 확신만 갖게 한다고 생각했습니다.
  • 새로운 발견: 연구진은 "날카롭게 만드는" 효과가 사실 "암기" 단계(SFT) 때문에 발생한다는 것을 발견했습니다. 교과서를 먼저 암기하도록 강요하면, 학생은 탐구를 멈추게 됩니다.
  • 진정한 마법: 만약 교과서를 먼저 암기하지 않고 직접 게임을 하게 둔다면, 학생은 실제로 사고를 확장합니다. 그들은 다양한 경로를 시도하며 이전에 알지 못했던 새로운 해결책을 발견합니다. "암기" 단계가 학생의 창의성을 제한하는 것이지, 게임 자체가 아닙니다.

5. "슈퍼 학생" 레시피

연구진은 두 세계의 장점을 결합했습니다. "암기 후 놀기" 대신, 학생이 두 가지를 동시에 하도록 했습니다.

  • 작동 방식: 학생이 문제를 풀고 있다고 상상해 보세요. 뇌의 한 부분은 교과서를 확인하고(SFT), 다른 한 부분은 새로운 아이디어를 실험합니다(RL). 이들은 두 부분의 조언을 평균 내어 뇌를 업데이트합니다.
  • 결과: 이 "슈퍼 학생"(병렬 평균화)은 문제를 푸는 데 가장 뛰어났습니다. 그들은 누구보다 정답을 더 자주 맞혔으며, 교과서를 암기하기만 했던 학생들과 달리 일반적인 대화(같은 다른 능력)를 하는 법을 잊어버리지 않았습니다.

핵심 요약

  • 기다리지 마세요: 강화 학습(게임)은 모델의 생애 아주 초기, 즉 "읽기" 단계가 끝나기 전이라도 사용할 수 있습니다.
  • 데이터가 크기보다 중요합니다: 사전 학습 중에 수학과 같은 특정 유형의 데이터를 먹이는 것이 모델을 단순히 크게 만드는 것보다 더 중요합니다.
  • RL은 악당이 아닙니다: RL은 모델의 일반적인 기술을 망치거나 단순히 "날카롭게" 만드는 것이 아닙니다. 그러한 부정적인 효과는 "암기"(SFT) 단계에서 옵니다. RL은 실제로 모델이 탐구하고 새로운 해결책을 찾도록 돕습니다.
  • 함께 하세요: 최상의 결과는 "암기"와 "놀기" 단계를 차례대로 하는 것이 아니라 동시에 섞어서 진행할 때 나타납니다.

요약하자면, 이 논문은 강화 학습을 맨 마지막 단계의 최종 다듬기 과정으로 취급하는 것을 멈춰야 한다고 제안합니다. 대신, 이를 훈련 과정의 훨씬 더 이른 시점에 엮어 넣고 다른 방법들과 혼합함으로써 더 똑똑하고 유능한 모델을 얻을 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →