← 최신 논문
💬 NLP

Group Entropy-Controlled Policy Optimization

이 논문은 이질적인 강화 학습 작업에서 전역적 엔트로피 조절의 한계를 해결하기 위해 그룹 수준의 엔트로피 추정치를 사용하여 비대칭적 어드밴티지 셰이핑을 수행함으로써 탐험과 이용의 균형을 맞춰 우수한 교차 작업 성능을 달야내는 GRPO의 경량 확장 모델인 그룹 엔트로피 제어 정책 최적화(GEPO)를 소개한다.

원저자: Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen

게시일 2026-07-21
📖 1 분 읽기☕ 가벼운 읽기

원저자: Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기술 요약: 그룹 엔트로피 제어 정책 최적화 (GEPO)

1. 문제 정의

강화 학습(RL)은 대규모 언어 모델(LLM)의 정렬(alignment)과 추론 능력을 향상시키기 위한 사후 학습(post-training)의 지배적인 패러다임이 되었습니다. 그러나 탐색(exploration)과 이용(exploitation) 사이의 균형을 맞추는 것은 여전히 중요한 과제이며, 특히 이질적인 작업 혼합(예: 수학, 코딩, 물리학, 지시 이행의 결합)을 학습할 때 더욱 그러합니다.

현재의 엔트로피 제어 RL 방식은 주로 두 가지 수준에서 작동합니다:

  1. 정책 수준(Policy-level): 전체 배치에 대해 엔트로피를 계산하고 균일한 규제 신호를 적용합니다 (그림 1a).
  2. 토큰 수준(Token-level): 토큰 공분산을 계산하고 개별 토큰을 규제합니다 (그림 1b).

본 논문은 이러한 접근 방식이 그룹 상대 정책 최적화(GRPO)에 적용될 때 발생하는 근본적인 결함인 **엔트로피 이질성(Entropy Heterogeneity)**을 지적합니다. 서로 다른 작업 도메인은 동일한 정책 하에서도 뚜렷하게 구분되는 엔트로피 레짐(regime)을 보입니다. 예를 들어, 물리학 프롬프트는 자연스럽게 낮은 엔트로피 주변으로 집중되는 반면, 지시 이행 프롬프트는 높은 엔트로피를 나타낼 수 있습니다.

이러한 이질성은 표준 GRPO에서 두 가지 구체적인 병리 현상을 유발합니다:

  • 엔트로피 의존적 편향(Entropy-Dependent Bias): 그룹 내 이득(advantage)의 정규화는 엔트로피 수준이 다른 그룹 간에 통계적으로 비교 불가능한 신호를 생성합니다. 저엔트로피 그룹(종종 높은 정확도를 가진 작업)은 강력하고 일관된 그래디언트 신호를 생성하는 반면, 고엔트로피 그룹(종종 낮은 정확도를 가진 작업)은 약하고 노이즈가 많은 신호를 생성합니다.
  • 최적화 불균형(Optimization Imbalance): 배치 수준의 최적화가 저엔트로피 작업에 의해 지배되어, 고엔로피 작업이 받는 학습 신호가 감소하게 됩니다. 이는 저엔트로피 작업은 조기에 수렴하고, 고엔트로피 작업은 효과적으로 탐색하지 못하거나 퇴보적인 출력(degenerate outputs)으로 이어지는 '폭주하는 엔트로피'를 겪게 되는 자기 강화 순환을 초래합니다.

2. 방법론: GEPO

저자들은 기존 GRPO에 대한 경량화된 모델 불가지론적 확장으로서, 그룹 수준에서 **엔트로피 조건부 비대칭 이득 형성(entropy-conditioned asymmetric advantage shaping)**을 수행하는 **그룹 엔트로피 제어 정책 최적화(GEPO)**를 제안합니다.

핵심 메커니즘

GEPO는 프롬프트의 기존 그룹 샘플로부터 추정된 그룹 엔트로피(Hg\mathcal{H}_g)를 진단 신호로 활용합니다. 전역 엔트로피 목표를 적용하는 대신, GEPO는 그룹의 엔트로피 상태에 따라 각 응답의 이득 신호(AiA_i)를 형성합니다:

A^i=ω(Ai,Hg)Ai \hat{A}_i = \omega(A_i, \mathcal{H}_g) \cdot A_i

형성 함수는 비대칭 스케일링 계수(αlow,αhigh(0,1)\alpha_{low}, \alpha_{high} \in (0, 1))를 적용합니다:

  • 저엔트로피 그룹 (Hg<Hlow\mathcal{H}_g < \mathcal{H}_{low}): 양(+)의 이득은 αlow\alpha_{low}에 의해 감쇄됩니다. 이는 모델이 이미 확신을 가지고 있는 작업에서 과도한 이용(over-exploitation)과 조기 수렴을 방지합니다.
  • 고엔트로피 그룹 (Hg>Hhigh\mathcal{H}_g > \mathcal{H}_{high}): 음(-)의 이득은 αhigh\alpha_{high}에 의해 감쇄됩니다. 이는 모델이 불확실한 작업에서 탐색이 조기에 억제되는 것을 방지하여, 정책이 올바른 추론 경로를 발견할 수 있도록 합니다.
  • 그 외의 경우: 이득은 변하지 않습니다.

주요 설계 선택 사항

  1. 비대칭 형성 (αhigh<αlow\alpha_{high} < \alpha_{low}): 저자들은 경험적으로 저엔트로피 그룹이 더 취약하다는 것을 관찰했습니다. 즉, 이러한 그룹에서 음의 이득을 공격적으로 처벌하면 "길이 붕괴(length collapse, 모델이 불확실성을 줄이기 위해 응답을 짧게 만드는 현상)"가 발생할 수 있습니다. 따라서 GEPO는 고엔트로피 그룹에 적용되는 더 강한 감쇄(αhigh\alpha_{high}가 더 낮음)에 비해 저엔트로피 그룹에는 더 완만한 자극(αlow\alpha_{low}가 더 높음)을 가합니다.
  2. 적응형 임계값(Adaptive Thresholds): 고정된 엔트로피 임계값은 서로 다른 베이스 모델과 학습 단계에 걸쳐 취약할 수 있습니다. GEPO는 배치의 엔트로피 분포(평균 및 표준 편차)로부터 임계값(Hlow,Hhigh\mathcal{H}_{low}, \mathcal{H}_{high})을 동적으로 도출하고, 지수 이동 평균(EMA)을 사용하여 이를 부드럽게 만듭니다. 이를 통해 GEPO는 작업별 튜닝 없이도 베이스 모델의 특정 엔트로피 스케일에 자동으로 적응할 수 있습니다.

3. 주요 기여

  • 이론적 통찰: 본 논문은 GRPO에서 정규화된 이득이 그룹 엔트로피에 의해 구조적으로 편향된다는 것을 입증하는 이론적 분석(Proposition 2.1 및 2.2)을 제공합니다. 이는 정책 가중치와 참조 보상 분포 간의 차이가 엔트로피에 의존하며, 이로 인해 이질적인 작업 간에 비교 불가능한 이득 신호가 발생함을 증명합니다.
  • 알고리즘 혁신: GEPO는 그룹 수준의 엔트로피를 프롬프트-그룹 진단 도구로 사용하여 최적화 압력을 재균형 잡는 최초의 비대칭 이득 형성 메커니즘을 도입했습니다. 엔트로피를 전역적 또는 토큰 단위의 속성으로 취급하는 기존 방식과 달리, GEPO는 이를 그룹 수준의 진단 신호로 다룹니다.
  • 비용 없는 구현: 이 방법은 추가적인 샘플링이나 가치 함수(value function) 추정을 요구하지 않습니다. 기존 GRPO의 그룹 샘플을 활용하므로 계산 오버헤드가 매우 적습니다.

4. 실험 결과

저자들은 Intern-S1-miniQwen3.5-9B 두 가지 베이스 모델을 대상으로 수학, 물리학, 과학, 코드 생성, 지시 이행을 아우르는 13개 벤치마크에서 GEPO를 평가했습니다.

  • 성능: GEPO는 GRPO 및 최근의 엔트로피 제어 베이스라인(AEPO, Clip-Cov, KL-Cov)보다 일관되게 우수한 성능을 보였습니다.
    • Intern-S1-mini에서 GEPO는 최고 평균 점수(54.2)를 달 기록했으며, AIME25, IMO-Bench, GPQA를 포함한 13개 벤치마크 중 7개에서 승리했습니다.
    • Qwen3.5-9B에서 GEPO는 최고 평균 점수(71.2)를 달성하여, 강력한 베이스라인인 Clip-Cov(70.9)와 KL-Cov(69.9)를 넘어섰습니다.
  • 안정성: GEPO는 탁월한 학습 안정성을 보여주었습니다. GRPO는 무제한적인 엔트로피 증가로 인해 치명적인 성능 붕괴(예: Qwen3.5-9B의 약 170 스텝 부근)를 겪고, AEPO는 지속적인 진동을 보인 반면, GEPO는 매끄럽고 단조롭게 개선되는 검증 곡선을 유지했습니다.
  • 엔트로피 역학: 학습 역학 분석 결과, GEPO는 작업 간에 차별화된 탐색 수준을 보존함을 보여주었습니다. 균일한 엔트로피 패턴을 강요하는 AEPO와 달리, GEPO는 광범위한 탐색이 필요한 작업은 높은 엔트로피를 유지하도록 허용하고, 결정론적인 작업은 낮은 엔트로피로 안착하게 함으로써 조기 붕괴와 폭주하는 엔트로피를 모두 방지합니다.

5. 의의 및 주장

본 논문은 GEPO가 다중 작업 RL 사후 학습에서의 핵심적인 격차, 즉 다양한 작업 간의 엔트로피 이질성으로 인해 발생하는 구조적 편향을 해결한다고 주장합니다.

저자들의 주장은 다음과 같습니다:

  1. 작업별 규제의 필수성: 이질적인 작업들을 균일한 엔트로피 패턴으로 몰아넣는 것은 최적이 아닙니다. 효과적인 다중 작업 학습을 위해서는 작업별 탐색 레짐을 보존해야 합니다.
  2. 비대칭성의 중요성: 저엔트로피 그룹의 취약성은 길이 붕괴를 피하면서도 탐색을 장려하기 위해 비대칭적인 이득 형성 접근 방식이 필요함을 시사합니다.
  3. 확장성: 기존 롤아웃에서 추정된 그룹 엔트로피와 적응형 임계값에 의존함으로써, GEPO는 명시적인 작업 주석이나 추가적인 샘플링 비용 없이도 평균 성능과 작업 간 균형을 모두 개선하는 확장 가능한 모델 불가지론적 솔루션을 제공합니다.

결론적으로, 본 논문은 복잡한 다중 도메인 LLM 사후 학습 시나리오에서 RL 학습을 안정화하기 위한 견고한 프레임워크로서 GEPO를 제시하며, 최적화 과정이 서로 다른 작업 유형의 고유한 불확실성과 다양성을 존중하도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →