GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
이 논문은 기존의 GRPO 및 DAPO와 같은 방법들의 조밀하지 못한 한계를 극복하기 위해, 미세한 토큰 수준 및 시퀀스 수준의 크레딧 할당을 달성하는 동적 엔트로피 기반 보상 형성(dynamic entropy-based reward shaping)을 구현함으로써 대규모 언어 모델의 추론 능력을 향상시키는 두 가지 새로운 강화 학습 알고리즘인 GTPO와 GRPO-S를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
다음은 "GTPO 및 GRPO-S: 정책 엔트로피를 이용한 토큰 및 시퀀스 수준의 보상 형성(GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy)" 논문을 쉬운 언어와 창의적인 비유를 사용하여 설명한 내용입니다.
거대한 문제: "전부 아니면 전무" 식의 성적 매기기
당신이 학생(AI)에게 매우 길고 복잡한 수학 문제를 푸는 법을 가르치고 있다고 상상해 보세요. 학생은 50단계에 걸친 풀이 과정을 작성합니다.
- 1단계부터 49단계까지는 매우 훌륭하고 논리적이며 정확합니다.
- 50단계(최종 정답)는 아주 작은 계산 실수 때문에 틀렸습니다.
현재의 주류 방식(GRPO 등)에서 선생님은 최종 결과만을 보고, 결과가 틀렸다는 이유로 **50단계 전체 에세이에 대해 낙제점(0점)**을 줍니다.
- 결과: 학생은 "아, 1단계부터 49단계까지의 과정도 다 쓸모없었구나"라고 생각하게 됩니다. 그들은 좋은 부분들을 잊어버리고, 다음번에는 완전히 다른 무작위적인 방식을 시도할 수도 있습니다.
- 결함: 이것은 **조립식 신용 할당(coarse-grained credit assignment)**이라 불리는 문제입니다. 이는 전체 사고 과정을 하나의 덩어리로 취급하여, 그 과정 중 대부분이 실제로는 완벽했다는 사실을 무시합니다.
해결책: "엔트로피" 나침반
이 논문의 저자들은 학생에게 더 나은 점수를 주는 새로운 방법을 제안합니다. 그들은 **정책 엔트로피(Policy Entropy)**라는 개념을 도입했습니다.
엔트로피를 "열심히 생각하기" 또는 **"불확실성"**의 척도로 생각해보세요.
- 낮은 엔트로피: 학생이 매우 확신에 차 있는 상태입니다. 이미 알고 있는 것을 그대로 타이핑하고 있습니다 (예: "1 + 1 = 2").
- 높니다 엔트로피: 학생이 잠시 멈춰서 여러 선택지를 고려하고, 어려운 선택과 씨름하며, 다양한 경로를 탐색하고 있는 상태입니다.
논문은 정답을 맞혔을 때는 높은 엔트로피가 좋다고 주장합니다(이는 올바른 경로를 신중하게 탐색했다는 의미입니다). 반대로, 오답일 때는 높은 엔트로피가 나쁘다고 말합니다(이는 잘못된 방향으로 자신 있게 추측하고 있었다는 의미입니다).
두 가지 새로운 알고리즘
이 논문은 이 엔트로피 나침반을 사용하여 더 나은 피드백을 주는 두 가지 새로운 "선생님"(알고리즘)을 소개합니다.
1. GTPO (Group Token Policy Optimization)
비유: "형광펜" 선생님
에세이 전체를 한꺼번에 채점하는 대신, GTPO는 **모든 단어(토큰)**를 개별적으로 채점합니다.
- 에세이가 정답일 경우: 선생님은 학생이 망설였거나 다양한 옵션을 탐색했던 단어들(높은 엔트로피)을 찾아 추가 보너스 점수를 줍니다. 이는 학생에게 "그 특정 단계에서 깊이 고민한 것을 잘했다!"라고 말해주는 것입니다.
- 에세이가 오답일 경우: 선생님은 학생이 너무 확신에 차 있었지만 틀렸던 단어들(낮은 엔트로피)을 찾아냅니다. 그리고 이 단어들에 엄격한 벌점을 줍니다. 이는 학생에게 "여기서 너무 자신만만했구나, 그리고 틀렸어. 다음에는 이렇게 확신하지 마라"라고 알려주는 것입니다.
왜 도움이 되는가: 이는 좋은 부분들을 보존하고, 실패를 초래한 구체적인 과잉 확신의 순간들을 처벌합니다.
2. GRPO-S (Sequence-Level GRPO)
비유: "성적표" 선생님
때로는 모든 단어를 하나하나 채점하는 것이 너무 느리거나 계산 비용이 많이 들 수 있습니다. GRPO-S는 더 가벼운 버전입니다.
- 개별 단어를 보는 대신, 에세이 전체의 **평균적인 "사고 노력"**을 살펴봅니다.
- 에세이가 정답일 경우: "학생이 전반적으로 깊이 생각하고 탐색했는가?"를 확인합니다. 그렇다면 에세이 전체에 보너스를 줍니다.
- 에세이가 오답일 경우: "학생이 자신 있게 틀렸는가?"를 확인합니다. 그렇다면 에세이 전체에 더 큰 벌점을 줍니다.
왜 도움이 되는가: 기존의 "전부 아니면 전무" 방식보다 더 똑똑하면서도 속도가 빠릅니다. 특히 매우 긴 추론 작업 중에 모델을 안정적으로 유지하는 데 효과적입니다.
결과: 어떤 일이 일어났는가?
저자들은 이 새로운 선생님들을 까다로운 수학 벤치마크(AIME 및 MATH 등)에서 테스트했습니다.
- 기존 방식 (GRPO/DAPO): 학생은 종종 막히곤 했습니다. 너무 빨리 포기하거나, 자신감은 있지만 틀린 답을 내놓는 루프에 빠져 "정책 붕괴(Policy Collapse)" 현상을 보이기도 했습니다.
- 새로운 방식 (GTPO/GRPO-S):
- 탐색: 학생들은 정답을 맞혔을 때 "깊이 생각하는 것(높은 엔트로피)"에 대해 보상을 받았기 때문에, 더 오랫동안 다양한 경로를 시도했습니다.
- 정밀도: 학생들은 자신 있게 틀리는 습관을 고쳤습니다.
- 성능: 어려운 수학 문제에서 훨씬 높은 점수를 기록했으며, 이전보다 더 복잡한 추론 과정을 해결해 냈습니다.
한 문장 요약
이 논문은 AI 모델이 긴 사고 과정을 단순히 "합격 아니면 불합격"이라는 점수로 처리하는 것을 멈추고, 정답일 때는 깊이 고민하도록 격려하고 오답일 때는 겸손해지도록 가르치는 상세한 성적표를 제공함으로써, 훨씬 더 똑똑한 추론을 할 수 있도록 가르칩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.