← 최신 논문
🤖 AI

Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning

이 논문은 고정된 생성 예산을 보상 분산이 가장 높은 예시들에 동적으로 배분함으로써 계산 비용을 크게 줄이고 안정성을 높이는 동시에, 표준 GRPO와 비교하여 수학적 추론 및 코딩 작업에서 우수한 성능을 달리는 분산 가이드 온라인 롤아웃 할당 방식인 VIGOR을 제안한다.

원저자: Heyang Jiang, Henry Liu, Baharan Mirzasoleiman

게시일 2026-07-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Heyang Jiang, Henry Liu, Baharan Mirzasoleiman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하지만 약간은 산만한 로봇에게 수학 문제 풀기나 컴퓨터 코드 작성하기와 같은 복잡한 퍼즐을 푸는 법을 가르치려 한다고 상상해 보세요. 당신은 옆에 앉아 모든 단계를 일일이 설명할 수 없습니다. 대신 로봇이 스스로 시도하게 두고, 로봇이 정답을 맞히면 하이파이브(보상)를 해줍니다. 틀리면 "다시 해봐"라고 부드럽게 말해줍니다. 이 과정을 '강화 학습(Reinforcement Learning)'이라고 합니다. 로봇은 문제를 해결하기 위해 다양한 방법을 계속 시도하며, 시간이 흐름에 따라 어떤 경로가 하이파이브로 이어지고 어떤 경로가 막다른 길로 이어지는지를 배우게 됩니다.

하지만 여기에는 함정이 있습니다. 효과적으로 학습하려면 로봇이 아주 많은 경로를 시도해 봐야 합니다. 만약 로봇이 한두 번만 시도한다면, 운 좋게 맞힌 것을 보고 나쁜 경로가 사실은 좋은 경로라고 착각할 수도 있습니다. 하지만 수천 개의 경로를 시도한다면, 그것은 시간과 전기를 엄청나게 낭비하는 일이 됩니다. 특히 그 경로들 대부분이 지루하거나 쓸모없는 것들이라면 더욱 그렇습니다. 이는 마치 학생에게 글쓰기를 배우라고 하면서, 정작 배움에는 아무런 도움이 되지 않는 낙서 수준의 에세이를 100편이나 쓰라고 요구하는 것과 같습니다. 과학자들의 큰 고민은 바로 이것입니다. 어떻게 하면 지루한 경로에 에너지를 낭비하지 않으면서 로봇이 적절한 수의 경로를 시도하게 만들 것인가 하는 점입니다.

여기서 VIGOR라는 새로운 방법이 등장합니다. 로봇의 학습 과정을 '뜨겁다 차갑다(Hot and Cold)' 게임처럼 생각해 보세요. 기존 방식(GRDE라고 불리는 방식)에서는 로 much 로봇이 퍼즐의 난이도와 상관없이 무조건 정해진 횟수만큼 맹목적으로 추측을 시도했습니다. 이는 마치 어떤 학생은 이미 답을 알고 있고 어떤 학생은 완전히 헤매고 있음에도 불구하고, 교사가 모든 학생에게 똑같은 양의 숙제를 내주는 것과 같았습니다.

VIGOR의 연구자들은 로봇이 불확실함을 느끼는 순간에 가장 유용한 정보가 온다는 사실을 깨달았습니다. 로봇이 수학 문제를 풀었을 때 정답과 오답이 섞여서 나온다면, 그 '분산(variance)' 혹은 '불일치'는 로봇이 중요한 무언가를 배우고 있다는 신호입니다. 하지만 매번 똑같은 오답을 내거나 똑같은 정답을 낸다면, 그것은 그저 시간을 낭비하는 것일 뿐입니다.

VIGOR는 로봇의 첫 몇 번의 시도를 지켜보는 똑똑한 코치처럼 행동함으로써 게임의 판도를 바꿉니다. 모든 퍼즐에 고정된 횟수의 시도를 부여하는 대신, VIGOR는 우선 모든 퍼즐에 대해 로봇이 단 몇 번의 추측만 하도록 허용합니다. 그런 다음 결과를 살펴봅니다:

  1. 만약 로봇이 매번 똑같은 답을 냈다면(낮은 분산), 코치는 "알겠어, 이해했으니 다음으로 넘어가자"라고 말합니다.
  2. 만약 로봇의 답이 중구난방이었다면(높고 높은 분산), 코치는 "이건 까다롭네! 해결할 수 있도록 더 많이 시도해 보자"라고 말합니다.

그 후, VIGOR는 너무 쉽거나 혹은 배울 가치가 없을 정도로 망가진 문제들은 무시하고, 오직 혼란을 야기하는 퍼즐에만 더 많은 "추측 에너지(rollouts)"를 쏟아붓습니다. 이는 마치 플레이어가 힘들어하는 사람에게만 더 어려운 적을 생성해주고, 쉬운 단계의 난이도를 높여서 시간을 때우려 하지 않는 비디오 게임과 같습니다.

논문은 이 접근 방식이 게임 체인저임을 보여줍니다. 이 "분산 유도형(variance-guided)" 전략을 사용함으로써, 로봇은 훨씬 더 적은 횟수의 추측만으로도 목표한 숙련도에 도달했습니다. 수학 문제에서 VIGOR는 기존 방식보다 최대 **2.3배 적은 횟수의 시도(rollouts)**만으로 목표 정확도에 도달했습니다. 코딩 작업에서는 1.49배 적은 시도만으로 동일한 성공률에 도달했을 뿐만 아니라, 최종 성공률을 3.4포인트나 향상시켰습니다.

저자들은 이것이 단순한 미세한 조정이 아니라, AI가 추론하는 방식을 가르치는 근본적인 변화라고 제안합니다. 그들은 다양한 크기의 AI 모델에 걸쳐 이 결과를 측정했으며, VIGOR가 일관되게 더 빠르고 효율적으로 학습한다는 것을 발견했습니다. 이는 문제를 해결하기 위해 더 많은 컴퓨팅 파워를 쏟아부을 필요가 없음을 증명합니다. 단지 그 힘을 어디에 써야 할지 더 똑똑하게 결정하면 된다는 것입니다. 오직 불확실성의 순간에만 집중함으로써, VIGOR는 AI가 더 효과적으로 추론하도록 도우며, 혼란스러운 시행착오의 과정을 집중력 있고 효율적인 발견의 여정으로 바꿔 놓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →