← 최신 논문
🤖 machine learning

Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards

본 논문은 대규모 언어 모델을 위한 검증 가능한 보상을 활용한 강화 학습에서 샘플 효율성과 성능을 향상시키기 위해 롤아웃을 컨텍스트 밴딧 암으로 간주하여 고가치 역사적 데이터를 적응적으로 선택하고 재사용하는 통합 신경 스케줄링 프레임워크인"컨텍스트롤아웃 밴딧"을 제안합니다.

원저자: Xiaodong Lu, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Zhijun Chen, Yu Luo, Fuzhen Zhuang, Yikun Ban, Deqing Wang

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xiaodong Lu, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Zhijun Chen, Yu Luo, Fuzhen Zhuang, Yikun Ban, Deqing Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 여러분은 어려운 수학 문제를 해결하도록 매우 똑똑하지만 약간 혼란스러운 학생 (대형 언어 모델) 을 훈련시키고 있습니다. 여러분은 학생에게 문제를 주고, 학생은 답에 도달하기 위해 긴 사고의 연쇄를 작성합니다. 이 사고의 연쇄를 **"롤아웃 (rollout)"**이라고 부릅니다.

현재의 AI 훈련 상태에서는, 교사 (훈련 알고리즘) 가 보통 학생이 시도하는 모든 시도를 동등하게 중요하게 취급합니다. 학생이 문제를 해결하기 위해 8 가지 다른 방법을 시도한다면, 교사는 8 가지 모두를 살펴봅니다. 그중 5 가지는 말도 안 되는 내용이고, 2 가지는 운 좋게도 맞은 추측이며, 오직 1 가지만은 훌륭하고 논리적인 해법이라 하더라도 말입니다. 또한 교사는 한 번 사용한 후 학생의 과거 시도들을 즉시 폐기하고 다시는 돌아보지 않습니다.

제공해주신 논문인 **"Contextual Rollout Bandits"**는 이 훈련 과정을 관리하는 더 똑똑한 방법을 제안합니다. 이는 **CBS(맥락형 밴딧 스케줄러)**라는 시스템을 도입합니다. 간단한 비유를 들어 그 작동 방식을 설명해 보겠습니다.

1. 문제: "소음이 많은 교실"

현재 훈련 과정은 교사가 품질과 상관없이 숙제 시도 하나하나를 똑같이 채점하는 교실과 같습니다.

  • 소음: 일부 학생의 답은 "맞은 추측"(논리는 틀렸지만 숫자는 맞음) 이거나 "중복"(원래 자리로 돌아감) 입니다. 이는 교사를 혼란스럽게 하고 학습을 늦추는 "나쁜 사과"들과 같습니다.
  • 낭비: 교사는 한 번 본 후 좋은 숙제를 폐기합니다. 학생이 화요일에 완벽한 해법을 작성했다 하더라도, 교사는 그것이 여전히 유용할 수 있음에도 불구하고 수요일에는 이를 무시합니다.

2. 해결책: "똑같은 코치"(CBS)

저자들은 어떤 숙제를 연구할지 선택하는 것을 **"맥락형 밴딧 (Contextual Bandit)"**이라는 게임으로 취급합니다. 이는 학생의 연습 시도 중 무엇에 집중할지 결정해야 하는 똑똑한 코치라고 생각하면 됩니다.

코치는 모든 시도를 맹목적으로 보는 대신, 모든 단일 시도마다 **10 차원 "성적표"**를 사용합니다. 이 성적표는 다음과 같은 것들을 추적합니다:

  • 학생의 자신감은 얼마나 되었는가? (엔트로피)
  • 이 답이 점수 향상에 얼마나 기여했는가? (이점)
  • 답의 길이는 얼마나 되었는가?
  • 이 특정 시도를 이전에 본 적이 있는가? (사용 횟수)

이 성적표를 바탕으로 코치는 작은 속도의 AI(신경망) 를 사용하여 예측합니다: "우리가 이 특정 시도를 연구하면 학생이 더 나아질까?"

3. 코치의 두 가지 초능력

초능력 A: "품질 필터"(그룹 내 선택)
학생이 하나의 수학 문제에 대해 8 개의 답을 생성할 때, 코치는 8 개 모두를 보지 않습니다. 대신 "성적표"를 빠르게 스캔하여 상위 3 개 또는 4 개의 최상위 답만 선택합니다.

  • 비유: 재능 쇼를 상상해 보세요. 모든 오디션을 보고 모두를 비평하는 대신, 코치는 즉석에서 상위 3 명의 가수들을 찾아내어 심사위원들에게 그들만 집중하라고 말합니다. 이는 시간을 절약하고 나쁜 가수들로 인한 심사위원들의 혼란을 막아줍니다.

초능력 B: "시간 여행자"(전역 재사용)
대부분의 훈련 방법은 최신 숙제 배치만 봅니다. CBS 는 다릅니다. CBS 는 학생의 과거 시도들을 담은 거대한 디지털 파일 캐비닛인 리플레이 버퍼를 유지합니다.

  • 비유: 코치가 오늘의 연습만 보는 것이 아니라, 지난주, 지난달, 그리고 작년의 학생 최고의 플레이들을 모아놓은 하이라이트 영상을 보관한다고 상상해 보세요. 학생이 막히면 코치는 훌륭한 옛 예시를 꺼내 "이런 유형의 문제를 어떻게 해결했었는지 기억나니?"라고 보여줍니다. 이는 학생이 최고의 순간들을 잊지 않기 때문에 더 빠르게 학습하도록 돕습니다.

4. 결과: 더 빠르고 더 똑똑함

이 논문은 이 "똑똑한 코치"를 AIME 와 MATH 와 같은 6 가지 다른 수학 벤치마크에서 테스트했습니다.

  • 더 좋은 성적: CBS 로 훈련된 모델들은 수학 문제에서 일관되게 더 높은 점수를 받았습니다.
  • 더 빠른 학습: 코치가 "나쁜 사과"를 필터링하고 "좋은 사과"를 재사용했기 때문에, 훈련 과정은 약 50% 더 짧은 시간이 소요되었습니다. 컴퓨터는 쓸모없는 데이터를 처리하는 데 에너지를 낭비할 필요가 없었습니다.
  • 안정성: 이 시스템은 학생이 "추측" 답이나 동일한 실수를 반복하는 것에 혼란을 느끼지 않도록 하여 학습 경로를 안정적으로 유지했습니다.

요약

간단히 말해, 이 논문은 다음과 같이 말합니다: 모든 AI 훈련 데이터를 동일하게 취급하지 마십시오.
생성된 모든 답을 맹목적으로 사용하고 즉시 폐기하는 대신, 소음을 필터링하고 최고의 예시들을 재사용할 수 있는 똑똑하고 적응형 시스템을 사용하십시오. 이는 모든 낙서까지 채점하는 교사에서, 학생이 이기는 법을 가르치기 위해 완벽한 하이라이트 영상을 큐레이션하는 코치로 업그레이드하는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →