← 최신 논문
💬 NLP

Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities

본 논문은 다양한 정답 솔루션 간의 신뢰도를 균형 있게 맞추기 위해 보상 신호를 동적으로 재형성함으로써 모드 붕괴를 완화하고 LLM 추론에서의 탐색을 강화하는 이점 재가중 메커니즘(Advantage Re-weighting Mechanism)을 채택한 새로운 강화 학습 방식인 ProGRPO를 제안하며, 이를 통해 수학 및 코딩 벤치마크에서 정확도와 생성 다양성을 모두 유의미하게 향상시킨다.

원저자: Pengyi Li, Elizaveta Goncharova, Andrey Kuznetsov, Ivan Oseledets

게시일 2026-02-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Pengyi Li, Elizaveta Goncharova, Andrey Kuznetsov, Ivan Oseledets

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 요약: "지나치게 자신만만한" 학생

당신이 똑똑한 학생(AI)에게 어려운 수학 문제를 풀거나 코드를 작성하는 법을 가르치고 있다고 상상해 보세요. 당신은 **검증 가능한 보상을 사용하는 강화 학습(RLVR)**이라는 시스템을 사용합니다. 이것은 학생이 정확히 정답을 맞혔을 때만 금메달을 주는 엄격한 선생님이라고 생각하면 됩니다.

문제점:
현재의 방식(GRPO라고 불림)은 학생의 가장 자신 있는 추측만을 칭찬하는 선생님과 같습니다.

  • 만약 학생이 "정답은 42입니다"라고 말하고, 확신이 99%라면, 금메달을 받습니다.
  • 하지만 학생이 "정답은 42입니다"라고 말하면서, 확신이 60%뿐이라면, 아무것도 받지 못합니다.

시간이 흐르면서 학생은 오직 최대치의 자신감을 가지고 "42"라고만 말하는 법을 배웁니다. 학생은 문제를 해결하기 위한 다른 방법들을 시도하는 것을 멈춥니다. 만약 "42"가 틀렸다면, 학생에게는 플랜 B가 없습니다. AI 용어로 이를 엔트로피 붕괴(entropy collapse) 또는 **모드 붕ells(mode collapse)**라고 부릅니다. AI는 정답이 틀렸거나 다른 유효한 해결 방법이 여러 개 있음에도 불구하고, 단지 똑같은 몇 가지 답변만을 반복하는 지루한 로봇이 되어버립니다.

해결책: ProGRPO (공정한 선생님)

저자들은 ProGRPO라는 새로운 방법을 제안합니다. 이 새로운 선생님은 단순히 가장 큰 목소리만을 보상하는 대신, 학생이 생각하는 과정의 전체적인 모습을 살펴봅니다.

그들은 **이점 재가중치(Advantage Re-weighting, ARM)**라는 메커니즘을 도입했습니다. 간단한 비유를 통해 이 방식이 어떻게 작동하는지 설명하겠습니다.

1. "자신감 체크"

학생이 퍼즐을 풀고 있다고 상상해 보세요.

  • 시나리오 A: 학생이 매우 쉬운 퍼즐을 보고 즉시 100%의 자신감으로 정답을 외칩니다.
  • 시나리오 B: 학생이 어려운 퍼즐을 보고 한참 동안 고민한 끝에 정답을 찾아냈지만, 스스로 약간 불안해합니다(낮은 자신감).

기존의 선생님(GRPO)은 시나리오 A에 큰 보상을 주고 시나리오 B는 무시할 것입니다.
하지만 새로운 선생님(ProGRPO)은 이렇게 말합니다: "잠깐, 시나리오 B가 사실 더 인상적이야! 왜냐하면 어려웠으니까! 학생이 100% 확신하지 못했더라도 그 노력에 대해 추가 점수를 주자."

이는 학생이 단순히 "쉽고 자신감 있는" 답변에만 안주하는 것을 방지하고, 문제를 해결하기 위한 다양한 유효한 방법들을 탐색하도록 독려합니다.

2. "지루한 부분" 무시하기

학생이 긴 설명(사고의 사슬, Chain of Thought)을 작성할 때, 대부분의 단어는 매우 당연한 것들입니다.

  • 예시: "먼저, 2와 2를 더합니다. 그런 다음, 2를 곱합니다..."
  • "먼저", "그런 다음", "곱합니다"와 같은 단어들은 지루합니다. 학생은 이미 이 단어들을 완벽하게 알고 있기 때문입니다.

논문은 이러한 지루하고 높은 확률을 가진 단어들을 계산에 포함하는 것이 보상을 희석시킨다고 주장합니다. 이는 마치 시험을 채점하면서 "더"라는 단어를 맞게 썼다고 점수를 주는 것과 같습니다.

ProGRPO는 **저확률 토큰 길이 정규화(Low-Probability Token Length Normalization)**를 사용하여, 지루하고 쉬운 부분은 무시하고 학생이 실제로 고민하고 선택해야 했던 어려운 부분에만 집중합니다. 이를 통해 추론 과정이 얼마나 훌륭한지에 대한 훨씬 명확한 신호를 제공합니다.

결과: 다양성, 그리고 동일한 정확도

저자들은 Qwen 및 DeepSeek와 같은 모델을 사용하여 수학 및 코딩 작업에서 이 새로운 방법을 테스트했습니다.

  • 기존 방식 (GRPO): AI는 첫 번째 시도에서 정답을 37.6%의 확률로 맞혔습니다. 하지만 32번을 시도하라고 하면, 대부분 똑같은 3~4개의 답변만을 반복했습니다.
  • 새로운 방식 (ProGRPO):
    • 정확도: 첫 번째 시도에서 정답을 맞힐 확률이 43.3%로 높아졌습니다 (큰 개선).
    • 다양성: 32번을 시도했을 때, 정답을 68.5%의 확률로 찾아냈습니다. 결정적으로, 이 답변들은 서로 달랐습니다.

비유:
기존의 AI가 가장 안전한 선택인 한 종류의 파스타만 계속 만드는 요리사였다면, 새로운 AI는 파스타, 리조또, 수프를 모두 만들 수 있으면서도 모두 맛있는 음식을 만드는 요리사와 같습니다. 단순히 운이 좋았던 것이 아니라, 주방을 더 효과적으로 탐색하는 법을 배운 것입니다.

요약된 주장

이 논문은 AI가 자신의 "자신감"을 계산하는 방식을 조정하고 자신의 생각 중 지루한 부분을 무시함으로써, ProGRPO가 다음과 같은 성과를 낸다고 주장합니다:

  1. AI가 특정 루프에 갇히는 것을 방지하여 똑같은 몇 가지 답변만 반복하는 현상을 막습니다.
  2. 어려운 수학 및 코딩 문제에서 정확도를 향상시킵니다.
  3. 더 넓은 범위의 정답을 생성합니다 (이는 정답이 여러 개 존재할 수 있는 복잡한 작업에서 매우 중요합니다).

저자들은 이것이 탐색(새로운 것을 시도하는 것)과 활용(이미 아는 것을 사용하는 것) 사이의 더 나은 균형을 맞추며, 결과적으로 AI의 추론을 더 견고하고 신뢰할 수 있게 만든다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →