← 최신 논문
💬 NLP

Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective

본 논문은 검증 가능한 보상을 통한 강화 학습 (RLVR) 에서 발생하는 엔트로피 붕괴 문제를 해결하기 위해, 경험적으로 검증된 전략을 통해 정책 엔트로피를 정밀하게 제어함으로써 조기 과신 현상을 방지하고 대형 언어 모델의 추론 성능을 향상시키는 그라디언트 보존 관점을 활용한 새로운 동적 클리핑 메커니즘을 제안한다.

원저자: Kun Chen, Peng Shi, Fanfan Liu, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao

게시일 2026-05-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kun Chen, Peng Shi, Fanfan Liu, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 간단한 언어와 창의적인 비유를 사용하여 설명합니다.

큰 그림: "과신한 학생" 문제

수학 문제를 풀도록 뛰어난 학생 (대형 언어 모델) 을 훈련한다고 상상해 보세요. **검증 가능한 보상을 통한 강화 학습 (RLVR)**이라는 시스템을 사용합니다. 이는 정답을 맞출 때만 점수를 주는 엄격한 코치라고 생각하면 됩니다.

처음에는 학생이 호기심이 많습니다. 문제를 풀기 위해 다양한 방법을 시도하며 실수를 하지만 그로부터 배웁니다. 이 '호기심'을 엔트로피라고 합니다. 높은 엔트로피는 학생이 많은 가능성을 탐색하고 있음을 의미합니다.

그러나 훈련이 계속되면서 문제가 발생합니다. 학생이 과신하게 되는 것입니다. 그들은 새로운 접근법을 시도하는 것을 멈추고, 완벽하지 않더라도 효과가 있다고 알고 있는 몇 가지 답변만 반복합니다. 더 이상 탐색하지 않는 것입니다. 기술적인 용어로 말하면, 그들의 엔트로피가 붕괴되는 것입니다.

이렇게 되면 학생은 더 이상 위험을 감수하지 않기 때문에 학습을 멈춥니다. 그들은 '국소 최적점 (local optimum)'에 갇히게 됩니다. 자신이 훌륭하게 하고 있다고 생각하는 편안한 곳이지만, 실제로는 최선의 해결책을 놓치고 있는 상태입니다.

근본 원인: 너무 꽉 조여진 "안전망"

이 논문은 **기반 보존 클리핑 (Gradient-Preserving Clipping)**이라는 메커니즘을 범인으로 지목합니다.

코치에게 학생이 위험하고 터무니없는 추측을 하지 못하도록 막는 안전망 (클리핑 임계값) 이 있다고 상상해 보세요.

  • 학생이 새로운 저확률 아이디어를 시도하면, 그 그물이 보통 그것을 잡으며 "아니오, 그쪽으로 가지 마세요"라고 말합니다.
  • 문제는 이 그물이 **정적 (rigid)**이라는 점입니다. 모든 상황을 동일하게 취급합니다. 이는 학생이 저확률 아이디어를 탐색하는 능력을 너무 가혹하게 차단하고, 고확률 아이디어를 충분히 밀어붙이지 못하게 합니다.

그물이 너무 경직되어 있기 때문에 학생의 자신감 (엔트로피) 이 너무 빨리 떨어지고, 학생이 어떻게 개선해야 하는지 알려주는 '기울기 (gradients)' 신호가 사라집니다. 학생은 학습을 멈추게 됩니다.

해결책: "똑똑하고 유연한 코치"

저자들은 학생의 자신감을 관리하는 새로운 방법을 제안합니다. 경직된 안전망 대신 **동적 클리핑 임계값 (Dynamic Clipping Threshold)**을 사용합니다.

이는 학생의 현재 상태에 따라 규칙을 조정하는 코치라고 생각하세요:

  1. 학생이 불확실할 때 (저확률): 코치는 안전망을 느슨하게 합니다. "좋아, 그 기이한 아이디어를 시도해 봐! 설령 가능성이 낮더라도 결과가 어떻게 되는지 보자." 이는 탐색을 장려하고 학생의 호기심 (엔트로피) 을 높게 유지합니다.
  2. 학생이 너무 확신할 때 (고확률): 코치는 그물을 약간 조입니다. "이 답변에 이미 매우 확신하고 있군; 너무 오만해지지 마라. 다른 가능성을 무시하지 않는지 확인하자." 이는 학생이 너무 일찍 과신하는 것을 방지합니다.

규칙을 확률에 의존적으로 만들면, 시스템이 학생이 얼마나 탐색하고 얼마나 집중할 것인지를 정밀하게 통제할 수 있습니다.

세 가지 훈련 전략

이 논문은 그물을 고치는 것뿐만 아니라, 시간이 지남에 따라 이 유연한 그물을 사용하는 세 가지 다른 '훈련 일정 (전략)'을 설계합니다:

  1. 증가 후 감소 (ID):

    • 비유: '야생 아이' 단계로 시작하세요. 학생이 모든 것을 탐색하고 기발한 해결책을 시도하게 하세요. 좋은 기반을 마련한 후에는 규칙을 서서히 강화하여 집중하고 기술을 연마하도록 돕습니다.
    • 적합한 경우: 이미 어느 정도 훈련된 모델이 최종화하기 전에 창의적인 폭발이 필요한 경우.
  2. 감소 - 증가 - 감소 (DID):

    • 비유: 먼저 학생을 진정시켜 혼란을 줄이세요. 그런 다음, 갇히는 것을 피하기 위해 조금 더 탐색할 수 있도록 두 번째 숨을 불어넣어 호기심을 높입니다. 마지막으로 최선의 답변을 확정하기 위해 다시 진정시킵니다.
    • 적합한 경우: 시작 시 매우 혼란스럽거나 '원시적'인 모델로, 안전하게 탐색하기 전에 안정의 순간이 필요한 경우.
  3. 진동적 감쇠 (OD):

    • 비유: 리듬 있는 춤입니다. 코치는 전체 훈련 기간 동안 '탐색 모드'와 '집중 모드'를 끊임없이 전환합니다. 학생이 너무 지루해하면 (엔트로피가 너무 낮으면) 코치는 "탐색해!"라고 말합니다. 너무 난폭해지면 (엔트로피가 너무 높으면) "집중해!"라고 말합니다.
    • 적합한 경우: 학생이 고착될 수 있는 긴 훈련 세션; 이는 학생을 경계 상태로 유지합니다.

결과

저자들은 수학 문제 (AIME 및 MATH 벤치마크 등) 에서 이러한 방법들을 테스트했습니다.

  • 결과: 그들의 유연한 접근 방식은 '엔트로피 붕괴'를 방지했습니다. 학생들은 너무 일찍 과신하지 않았습니다.
  • 점수: 이러한 새로운 전략으로 훈련된 모델은 표준 방법보다 수학 문제를 더 정확하게 풀었습니다. 새로운 경로를 탐색하는 것을 너무 일찍 포기하지 않았기 때문에 올바른 답을 찾는 데 더 능했습니다.

요약

이 논문은 AI 를 더 똑똑하게 만들기 위해서는 무작위로 학습하게 내버려 둘 수도, 너무 경직되게 강요할 수도 없다고 주장합니다. 우리는 언제 야생적인 탐색을 장려하고 언제 집중을 요구할지 정확히 아는 동적 코치가 필요합니다. AI 가 호기심은 있지만 혼란스럽지 않도록 실시간으로 규칙을 조정해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →