← 최신 논문
💬 NLP

PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning

PCL-Reasoner-V1.5는 Qwen2.5-32B를 기반으로 구축된 320억 파라미터 규모의 수학적 추론 모델로, 온라인 RL 방식에 비해 우수한 훈련 안정성과 효율성을 갖추며 AIME 벤치마크에서 최첨단 성능을 달성하기 위해 새로운 오프라인 강화 학습 방법을 활용합니다.

원저자: Yao Lu, Dengdong Fan, Jianzheng Nie, Fan Xu, Jie Chen, Bin Zhou, Yonghong Tian

게시일 2026-01-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yao Lu, Dengdong Fan, Jianzheng Nie, Fan Xu, Jie Chen, Bin Zhou, Yonghong Tian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: 다이어트 중인 수학 천재

매우 똑똑한 학생(AI 모델)이 이미 수학을 잘하지만, 세계적인 챔피언이 되고 싶어 한다고 상상해 보세요. Peng Cheng Laboratory와 베이징 대학교의 연구진은 Qwen2.5-32B라는 강력한 학생을 데려와서, PCL-Reasoner-V1.5를 만들기 위한 특별한 훈련 캠프를 열어주었습니다.

그 결과는 어땠을까요? 이 새로운 모델은 현재 이 특정 "학생" 기반으로 만들어진 모델들 중에서 어려운 수학 문제를 해결하는 데 가장 뛰어난 성적을 보이고 있습니다. 이 모델은 2024년 수학 경시 대회에서 90.9%, 2025년 버전에서 **85.6%**를 기록했습니다.

비법: 2단계 훈련 과정

연구진은 단순히 모델에게 무작위로 연습 세션을 던져준 것이 아닙니다. 그들은 두 단계의 과정을 사용했습니다.

  1. 지도 미세 조정(SFT) – "교과서 단계":
    먼저, 연구진은 고품질의 수학 문제와 그에 따른 단계별 풀이 과정(Chain-of-Thought라고 불리는)이 담긴 방대한 도서관을 사용하여 모델을 가르쳤습니다. 이것은 학생이 최고의 교과서를 읽고 문제를 올바르게 푸는 방법을 암기하는 것과 같습니다. 이를 통해 PCL-Reasoner-V1이라는 중간 단계 모델이 만들어졌습니다.

  2. 오프라인 강화 학습(Offline RL) – "연습 시험 단계":
    이 부분이 이 논문의 혁신적인 부분입니다. 보통 AI 모델은 테스트를 보고, 즉시 채점을 받은 뒤, 선생님이 지켜보는 동안 실시간으로 다시 시도하며 배웁니다(이를 온라인 RL이라고 합니다). 이것은 학생이 시험을 보고 성적을 받은 뒤, 즉시 뇌를 수정하여 실수를 바로잡는 것과 같습니다. 이는 매우 혼란스럽고 느릴 수 있습니다.

PCL-Reasoner-V1.5는 대신 오프라인 RL을 사용했습니다. 여기에는 다음과 같은 비유가 있습니다:

  • 기존 방식 (온라인 RL): 학생이 시험을 보면, 선생님이 채점하고, 학생은 뇌를 바꾸고, 그다음 즉시 다음 시험을 봅니다. 만약 선생님이 지치거나 채점 시스템에 오류가 생기면 전체 과정이 무너집니다.
  • 새로운 방식 (오프라인 RL): 학생이 한꺼번에 엄청난 양의 연습 시험지를 풀고 모든 답안을 작성합니다. 선생님은 그 후에야 전체 뭉치를 채점하고 단 하나의 완벽한 "정답지" 책을 만듭니다. 학생은 오직 이 고정된 책만을 가지고 공부합니다. 그들은 공부하는 동안 새로운 시험을 치르지 않습니다. 그저 고정된 데이터로부터 배울 뿐입니다.

왜 "오프라인"이 더 나은가요?

논문은 이 "정답지" 접근 방식(Offline RL)이 세 가지 주요 이유로 더 우수하다고 주장합니다.

  • 안정성 (롤러코스터 없음): 온라인 학습은 엔진을 재조립하면서 자동차를 운전하는 것과 같습니다. 불안정하고 충돌할 위험이 있습니다. 오프라인 학습은 조용한 도서관에서 공부하는 것과 같습니다. 데이터가 변하지 않으므로 학습 과정이 매끄럽고 예측 가능합니다.
  • 효율성 (조립 라인): 온라인 방식에서는 컴퓨터가 끊임없이 멈추고, 생각하고, 채점하고, 업데이트해야 합니다. 오프라인 방식에서는 컴퓨터가 한 번에 거대한 효율적인 분출(마치 공장의 조립 라인처럼)을 통해 모든 답을 생성할 수 있고, 그 후 훈련이 별도로 진행됩니다. 이는 많은 시간과 컴퓨팅 자원을 절약해 줍니다.
  • 단순성: 관리하기가 더 쉽습니다. 실시간 채점과 학습을 조율하기 위한 복잡한 시스템이 필요하지 않습니다. 데이터를 생성하고, 저장한 뒤, 나중에 훈련하면 됩니다.

모델은 실제로 무엇을 배웠나요?

연구진은 모델이 어떻게 개선되었는지에 대해 흥고로운 점을 발견했습니다.

  • 이전 (PCL-Reasoner-V1): 모델은 문제를 빠르게 해결하려고 노력했습니다. 만약 문제가 매우 길고 복잡한 추론 과정(예: 30,000단어 분량의 사고 과정)을 요구한다면, 모델은 종종 포기하거나 실수를 저질렀습니다.
  • 이후 (PCL-Reasoner-V1.5): 모델은 더 오래 생각하는 법을 배웠습니다. 모델은 훨씬 더 길고 상세한 추론 단계를 작성하기 시작했습니다. 모델은 어려운 문제일수록 서두를 수 없으며, 모든 경로를 신중하게 탐색해야 한다는 것을 배웠습니다.

결론

이 논문은 뛰어난 결과를 얻기 위해 모든 사람이 사용하는 복잡하고 불안정한 실시간 "온라인" 훈련 방식이 반드시 필요한 것은 아니라고 주장합니다. 고정된 정답 데이터셋을 생성하고 그것을 훈련하는 더 단순하고 안정적인 "오프라인" 방식을 사용함으로써, 모델은 수학 챔피언이 되었습니다.

핵심 요점: 때로는 선생님이 지켜보는 동안 계속 시험을 치르는 것보다, 엄청난 양의 연습 시험을 풀고, 완벽한 정답지를 얻은 뒤, 그 정답지를 철저하게 공부하는 것이 더 좋은 학습 방법이 될 수 있습니다. 이 접근 방식이 PCL-Reasoner-V1.5를 해당 분야의 새로운 최고 성능 모델로 만들었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →