← 최신 논문
🤖 AI

GRPO is Secretly a Process Reward Model

본 논문은 결과 보상 모델을 사용하는 그룹 상대적 정책 최적화 (GRPO) 가 과정 보상 모델과 동등함을 이론적으로 증명하고, 불균형 단계 처리에 있는 결함을 규명하며, 명시적인 과정 보상 모델을 요구하지 않으면서 추론 성능과 학습 효율성을 크게 향상시키는 간단한 수정안 (λ\lambda-GRPO) 을 제안한다.

원저자: Michael Sullivan, Alexander Koller

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Michael Sullivan, Alexander Koller

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"GRPO 는 비밀리에 프로세스 보상 모델이다"라는 논지에 대한 설명을 일상적인 비유와 함께 간단한 개념으로 분해하여 제시합니다.

핵심 아이디어: 레시피에 숨겨진 '비밀 재료'

복잡한 수학 문제를 해결하도록 로봇을 가르친다고 상상해 보세요. 로봇에게 프롬프트를 주면, 로봇은 해결책을 단계별로 작성해 보려고 합니다.

보통 로봇을 평가하는 두 가지 방법이 있습니다:

  1. 최종 성적 (결과 보상): 마지막 결과만 봅니다. 정답을 맞혔나요? 맞으면 +10 점, 틀리면 0 점입니다. 이는 학생이 문제를 푸는 과정을 무시하고 시험 점수만 보는 교사와 같습니다.
  2. 단계별 성적 (프로세스 보상): 모든 단계를 평가합니다. "방정식 세우기 잘했네", "여기 부호를 잘못 썼네"라고 말합니다. 이는 모든 줄을 사람이 (또는 똑똑한 AI 가) 확인해야 하므로 더 어렵습니다.

논지의 발견:
저자들은 GRPO(Group Relative Policy Optimization, 그룹 상대적 정책 최적화) 라는 인기 있는 학습 방법이 사실은 첫 번째 일 (최종 성적) 만 하도록 설계되었음에도 불구하고, 실수로 두 번째 일 (단계별 성적) 을 하고 있다는 사실을 발견했습니다.

저자들은 이를 '프로세스 보상 모델 (PRM)'이라고 부르지만, GRPO 는 '비밀스럽게' 그 역할을 한다고 말합니다. 마치 요리사가 케이크를 굽는다고 생각하지만, 자신이 모르고 있는 비밀 재료를 사용해 케이크가 완벽하게 부풀어 오르게 만드는 것과 같습니다.


'비밀'이 작동하는 방식: 그룹 채팅 비유

GRPO 가 어떻게 단계별로 비밀스럽게 평가하는지 이해하려면, 같은 수수께끼를 풀려고 하는 학생들 (한 '그룹') 이 있는 교실을 상상해 보세요.

  1. 준비: 교사가 질문을 던집니다. 다섯 명의 학생이 답을 적습니다.

  2. 중복:

    • 학생 A 는 씁니다: "먼저, 2 를 더하고..."
    • 학생 B 는 씁니다: "먼저, 2 를 더하고..."
    • 학생 C 는 씁니다: "먼저, 2 를 더하고..."
    • 학생 D 는 씁니다: "먼저, 5 를 곱하고..."
    • 학생 E 는 씁니다: "먼저, 5 를 곱하고..."

    학생 A, B, C 는 동일한 첫 번째 단계 ("2 를 더하기") 를 공유합니다. 학생 D 와 E 는 서로 다른 첫 번째 단계를 공유합니다.

  3. 비밀 평가:

    • 그룹의 최종 답이 좋으면, 교사는 전체 그룹에 높은 점수를 줍니다.
    • A, B, C 가 동일한 첫 번째 단계를 공유했기 때문에, 알고리즘은 이렇게 깨닫습니다: "이 특정 단계 ('2 를 더하기') 는 이 세 사람에게 좋은 결과를 가져오는 것 같네."
    • 그런 다음 이 특정 단계를 사용한 모든 사람에게 '보너스'를 줍니다.
    • 반대로 그룹이 실패하고 D 와 E 가 모두 "5 를 곱하기"로 시작했다면, 알고리즘은 그 단계가 위험하다고 판단하고 페널티를 줍니다.

결과: 교사는 최종 답만 보았지만, 알고리즘은 성공적인 그룹에서 어떤 단계들이 함께 나타났는지 관찰함으로써 어떤 단계가 좋고 어떤 것이 나쁜지 효과적으로 파악했습니다.


문제점: '불공평한 군중'

저자들은 이 비밀 메커니즘에 결함이 있음을 발견했습니다. 군중이 균형 잡혀 있을 때는 잘 작동하지만, 불균형할 때는 무너집니다.

비유:
특정 아이디어에 투표한 사람의 수를 세는 투표 시스템을 상상해 보세요.

  • 상황: 학급의 90% 가 "2 를 더하기"로 시작하고, 10% 만 "5 를 곱하기"로 시작합니다.
  • 결함: "2 를 더하기" 그룹이 평균보다 약간 낮은 점수를 받으면, 알고리즘은 "5 를 곱하기" 단계를 처벌하는 것보다 "2 를 더하기" 단계를 90 배 더 강하게 처벌합니다. 단순히 그 단계를 수행하는 사람이 너무 많기 때문입니다.
  • 결과: 로봇은 "2 를 더하기" 경로가 실제로는 좋은 경로임에도 불구하고, '군중'이 너무 크고 약간 나쁜 점수를 받았다는 이유만으로 해당 경로를 완전히 시도하지 않을 수 있습니다. 숫자가 왜곡되면 새로운 경로를 탐색하거나 좋은 경로에 머무르는 것을 두려워하게 됩니다.

해결책: λ\lambda-GRPO ('공정성 필터')

저자들은 λ\lambda-GRPO라는 간단한 해결책을 제안했습니다.

비유:
모든 표를 동등하게 세는 대신, '공정성 필터'를 추가합니다.

  • 어떤 단계가 매우 인기가 많다면 (많은 학생이 수행했다면), 필터는 "좋아, 점수를 사람 수로 나누자"라고 말합니다.
  • 어떤 단계가 드물다면, 필터는 "좋아, 이 하나에 더 많은 가중치를 주자"라고 말합니다.

이를 통해 각 단계가 특정 그룹에서 우연히 수행된 사람의 수에 따라 평가되는 것이 아니라, 그 자체의 가치에 따라 평가되도록 보장합니다. 알고리즘이 군중의 크기에 의해 괴롭힘을 당하지 않도록 막아줍니다.

결과: 더 빠르고 더 똑똑함

저자들은 이 해결책을 실제 수학 문제로 테스트했습니다:

  1. 더 나은 성능: 수정된 모델 (λ\lambda-GRPO) 은 표준 모델보다 수학 추론 작업에서 더 높은 점수를 받았습니다.
  2. 더 빠른 학습: 그들은 절반의 시간(더 적은 학습 단계) 에 최고 성능에 도달했습니다.
  3. 추가 비용 없음: 모든 단계를 평가하기 위해 비싼 사람을 고용할 필요가 없었습니다. 기존 알고리즘의 수학을 조정하기만 했습니다.

요약

이 논문은 인기 있는 AI 학습 방법 (GRPO) 이 사실은 처음부터 비밀리에 단계별 평가자처럼 행동하고 있었음을 밝힙니다. 그러나 불균형한 그룹에 혼란을 겪는 버그가 있었습니다. 저자들은 간단한 수학적 조정 (λ\lambda-GRPO) 으로 이 버그를 수정하여, 추가적인 비싼 도구가 필요 없이 AI 가 추론 작업을 더 빠르고 더 잘 학습하도록 만들었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →