← 최신 논문
🤖 machine learning

Not only where, But when: Temporal Scheduling for RLVR

본 논문은 검증 가능한 보상을 활용한 강화 학습 (RLVR) 을 위한 '시간적 스케줄링'을 소개하며, 이는 훈련 과정에서 특정 정책 행동을 우선시한 후 일반 최적화로 전환하기 위해 신용 할당 기준을 동적으로 조정함으로써 정책 엔트로피를 유지하면서 더 안정적이고 효율적인 학습 역학을 달성하는 방법입니다.

원저자: Jinghao Zhang, Ruilin Li, Feng Zhao, Jiaqi Wang

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jinghao Zhang, Ruilin Li, Feng Zhao, Jiaqi Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑한 학생 (AI) 을 복잡한 수학 문제를 해결하도록 훈련한다고 상상해 보세요. 기존의 방식 (RLVR 라고 함) 에서는 학생이 에세이를 끝낸 직후 한 번만 성적을 부여합니다. 만약 'A'를 받으면 "잘했다!"라고 말해주고, 학생은 다음에도 'A'를 받기 위해 자신이 쓴 모든 단어를 기억하려고 노력합니다.

문제는 학생이 수천 단어를 썼다는 점입니다. 그중 일부는 논리를 파악한 결정적인 '아하!' 순간들이었고, 다른 일부는 '그리고 나서', '따라서', '결론적으로' 같은 채우기 단어에 불과했습니다. 기존 방식은 모든 단어를 동등하게 중요하게 취급하는데, 이는 실제 방정식을 풀었을 때만큼 'the'라는 단어를 썼다고 해서 학생에게 금별을 주는 것과 같습니다.

기존 방식: 정적인 스포트라이트

이전 연구자들은 이를 해결하기 위해 '스포트라이트'를 사용하려 했습니다. 그들은 어떤 단어가 중요한지 (예: 논리 단계) 파악하는 도구를 만들어 훈련 중에 그 단어에 더 밝은 빛을 비추었습니다. 이를 **크레딧 할당 (Credit Allocation)**이라고 합니다.

그러나 이 논문은 이 접근법에 결함이 있다고 주장합니다: 스포트라이트는 절대 움직이지 않습니다. 도구가 '500 번째 단어가 중요하다'고 결정하면, 첫날부터 마지막 날까지 훈련 내내 500 번째 단어를 비추는 것입니다. 이는 쿼터백이 자신의 역할을 완전히 마스터하고 다른 것에 집중해야 할 때도, 나머지 팀원을 무시하고 오직 쿼터백에게만 소리치는 코치와 같습니다. 이러한 경직된 집중은 결국 학생이 더 이상 발전하는 것을 막습니다.

새로운 아이디어: 동적 일정 (Temporal Scheduling)

저자들은 새로운 아이디어를 제시합니다: 빛을 비추는 '곳'뿐만 아니라 '때'도 중요합니다.

그들은 훈련 과정을 정적인 사진이 아니라 영화 대본처럼 다루기를 제안합니다.

  • 영화 초반 (훈련 초기): 학생은 막 시작하는 단계입니다. 그들은 장면을 설정하는 방법 (추론 발판) 을 배워야 합니다. 논문은 학생의 답변 부분에 훈련 초점을 먼저 맞추는 것을 제안합니다. 왜냐하면 그 부분이 (최종 답변처럼) 가장 신뢰할 수 있는 부분이기 때문입니다.
  • 영화 후반 (훈련 후기): 학생이 답변을 마무리하는 데 능숙해지면, 초점을 천천히 에세이의 시작 부분으로 뒤로 이동시킵니다. 이제 학생이 처음부터 더 나은 논증과 논리를 구축하도록 훈련합니다.

이를 **시간적 일정 (Temporal Scheduling)**이라고 합니다. 정적인 스포트라이트 대신, 장면이 진행됨에 따라 카메라의 초점을 바꾸는 감독이 있는 것입니다.

'궤적 백분위수 (Trajectory Percentile)' 트릭

어떤 부분의 에세이에 집중해야 할지 어떻게 알까요? 그들은 **궤적 백분위수 (Trajectory Percentiles)**라는 간단한 트릭을 사용합니다.

학생의 답변을 100 미터 달리기 트랙이라고 상상해 보세요.

  • 95 백분위수는 결승선 (최종 답변) 입니다.
  • 50 백분위수는 경기의 중간 (추론) 입니다.
  • 5 백분위수는 출발선 (서론) 입니다.

논문에 따르면, 학생의 답변 중 '결승선' 부분에 해당하는 부분으로만 훈련을 시작한 다음, 점차 '중간'과 마지막으로 '시작' 부분을 포함하도록 훈련 범위를 확장하면, 학생이 훨씬 더 빠르고 안정적으로 배웁니다. 운전 배우기와 같습니다. 먼저 주차 (목표 달성) 를 마스터한 다음, 직선 도로를 운전하고, 마지막으로 복잡한 교차로 (사고 과정의 시작) 를 navigating 합니다.

실험에서 무엇이 일어났나요?

연구자들은 수학 및 추론 퍼즐을 사용하여 대규모 AI 모델 (Qwen 등) 에서 이를 테스트했습니다.

  1. 더 높은 점수: 이 '일정' 방법을 사용한 모델들은 표준 모델보다 수학 시험 (AIME 및 HMMT 등) 과 일반 추론 시험에서 더 높은 점수를 받았습니다.
  2. 더 건강한 학습: 그들은 기존의 경직된 방법들이 AI 를 '공황'에 빠뜨리고 창의성 (엔트로피라고 함) 을 잃게 만든다는 사실을 발견했습니다. AI 는 너무 경직되어 문제를 해결하는 새로운 방법을 탐색하는 것을 멈췄습니다. 새로운 '일정' 방법은 AI 의 학습 과정을 건강하고 유연하게 유지하여 멈추지 않고 계속 발전할 수 있게 했습니다.
  3. 기존 도구와의 호환성: 이 새로운 일정 방법은 기존 '스포트라이트' 도구와 결합해도 작동합니다. 기존 코칭 위에 새로운 코칭 레이어를 추가하는 것과 같습니다.

결론

이 논문은 AI 를 더 똑똑하게 만들기 위해 어떤 단어를 훈련할지 결정하는 것뿐만 아니라 언제 훈련할지 결정해야 한다고 주장합니다. 답변의 가장 신뢰할 수 있는 부분부터 시작하여 복잡한 추론 부분으로 천천히 거슬러 올라가면, AI 는 더 효율적으로 배우고, 더 창의성을 유지하며, 더 나은 결과를 달성합니다. 이는 경직되고 일괄적인 훈련 세션을 역동적이고 타이밍이 잘 잡힌 코칭 세션으로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →