GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero
이 논문은 수학 및 코딩과 같은 다양한 도메인에서 강력한 일반화를 달성하기 위해 소규모의 개방형 대화 상호작용 세트를 기반으로 처음부터 모델을 학습시키는 매우 효율적인 강화 학습 방법인 GRLO를 소개하며, 이는 전통적인 도메인 특화 RLVR 방법에 비해 데이터 및 컴퓨팅 요구 사항을 크게 줄입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑하고 독서량이 많은 학생(대규모 언어 모델)이 있다고 상상해 보세요. 이 학생은 '사전 학습' 단계에서 수백만 권의 책을 이미 읽었습니다. 이 학생은 지식이 많지만, 지시를 따르거나 퍼즐을 풀거나 코드를 작성하는 데는 다소 서툴러요. 이 학생을 최상위 전문가로 만들기 위해서는 보통 '사후 학습' 과정을 이수시켜야 합니다.
전통적으로 이 과정을 운영하는 두 가지 방법이 있습니다:
- 전문 튜터 (RLVR): 수학이나 코딩만 가르치는 튜터를 고용합니다. 이 튜터는 엄격한 정답 키(검증기)를 사용하여 매 단계를 채점합니다. 학생이 수학 문제를 맞히면 금색 별을 받고, 틀리면 빨간 X 를 받습니다. 이는 수학에는 놀라울 정도로 효과적이지만, 학생은 시험 준비만 했기 때문에 정상적인 대화를 나누거나 창의적인 이야기를 쓰는 방법을 종종 잊어버립니다.
- 일반 대화 코치 (RLHF): 학생이 일반적인 대화에서 친절하고 도움이 되며 매력적으로 행동하는 법을 가르치는 코치를 고용합니다. 이들은 엄격한 정답 키 대신 인간 피드백(예: "이 답변은 좋았다") 을 사용합니다.
문제점:
'전문 튜터' 방식은 비용이 많이 들고 막대한 컴퓨팅 파워를 필요로 합니다. 또한 학생을 수학에서는 뛰어나게 만들지만 대화에서는 서툴게 만듭니다. '일반 대화 코치'는 더 저렴하지만, 수학이나 코딩 같은 어려운 추론 작업을 수행하는 능력을 향상시키는 것으로 입증되지는 않았습니다.
새로운 아이디어: GRLO(열린 체육관)
이 논문의 저자들은 GRLO라는 새로운 학습 방법을 제안합니다. 학생을 수학 전용 부트캠프나 일반적인 대화 수업이 아닌, 열린 과제가 있는 체육관으로 보내는 것입니다.
수학용 러닝머신이나 대화용 펀치백만 있는 것이 아닌 체육관을 상상해 보세요. 대신 학생은 다음과 같은 5,000 개의 다양하고 까다롭고 열린 질문들을 받습니다:
- "달의 남극 역사 분석하기."
- "특정 철학이 현대 정치와 어떻게 연결되는지 설명하기."
- "이국적인 애완동물을 키우는 가이드 작성하기."
이 질문들은 컴퓨터로 확인할 수 있는 단일 '정답'이 없습니다. 대신 학생은 길고 상세한 답변이 얼마나 구조화되고 논리적이며 도움이 되는지에 따라 피드백을 받습니다.
큰 놀라움 (영의 마법)
이 논문은 놀라운 일이 발생했다고 주장합니다: 단순히 이 '열린 체육관'에서 연습한 것만으로도 학생은 수학, 코딩, 그리고 대화 모두에서 훨씬 더 나아졌습니다.
- 결과: 베이스 모델(Qwen3-4B) 을 소량의 데이터(5,000 개의 프롬프트) 로 단 22.7 시간만 학습시켰습니다.
- 비교: 이 미미한 양의 학습으로 모델의 평균 성능이 24.1 에서 63.1 로 향상되었습니다.
- 효율성: 이는 유사한 결과를 얻기 위해 일반적으로 필요한 거대한 '전문 튜터'(RLVR) 방식에 비해 데이터는 46 배 적고 컴퓨팅 파워는 68 배 적게 소모된 것입니다.
- 전이: 모델은 대화 능력만 향상된 것이 아니라, 사고하는 방법을 암묵적으로 학습하여 수학 문제를 풀고 코드를 작성하는 데도 도움이 되었습니다. 비록 이 특정 학습 단계 동안 단 하나의 수학 문제나 코딩 작업을 보지 않았음에도 불구하고요.
다음은?
저자들은 열린 체육관 훈련 이후에 약간의 '전문 튜터'(수학 전용) 훈련을 추가해 보았습니다. 이는 아주 조금 도움이 되었지만, 오직 가장 어렵고 대회 수준의 수학 문제에서만 효과가 있었습니다. 주요 향상은 전적으로 열린 훈련에서 비롯되었습니다.
핵심 교훈
이 논문은 똑똑하고 추론 능력이 뛰어난 AI 를 얻기 위해 거대하고 비싼 수학 전용 학습 파이프라인을 구축할 필요가 없다고 제안합니다. 강력한 베이스 모델을 가져와 깊이 생각하고 생각을 정리해야 하는 소량의 다양한 열린 대화 세트로 학습시키면, 자연스럽게 어려운 추론 작업을 포함한 모든 분야에서 더 나아집니다. 이는 "운동 선수를 다재다능하고 적응력이 뛰어난 올라운더로 훈련시키면, 특정 스포츠를 연습하게 하지 않더라도 달리기, 점프, 던지기 실력이 자연스럽게 향상된다"라고 말하는 것과 같습니다.
간단히 말해: 조금만 지능적이고 열린 대화 훈련을 거치면 모델의 숨겨진 추론 및 코딩 잠재력을 unlocking 할 수 있으며, 전통적인 방법에 비해 막대한 시간과 비용을 절약할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.