← 최신 논문
🤖 machine learning

Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective

본 논문은 토큰 수준의 엔트로피 변화에 대한 이론적 프레임워크를 도출하고 토큰을 적응적으로 재가중하여 수학적 및 코딩 벤치마크에서 기존 휴리스틱 개입을 능가하는 엔트로피 붕괴를 해결하는 검증 가능한 보상을 위한 강화 학습 (RLVR) 을 위한 원칙적인 엔트로피 변조 방법인 STEER 를 소개합니다.

원저자: Zhezheng Hao, Hong Wang, Haoyang Liu, Jian Luo, Jiarui Yu, Hande Dong, Qiang Lin, Can Wang, Jiawei Chen

게시일 2026-04-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhezheng Hao, Hong Wang, Haoyang Liu, Jian Luo, Jiarui Yu, Hande Dong, Qiang Lin, Can Wang, Jiawei Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑한 로봇에게 복잡한 수학 문제를 풀거나 코드를 작성하도록 훈련한다고 상상해 보세요. 이때 **검증 가능한 보상을 활용한 강화 학습 (Reinforcement Learning with Verifiable Rewards, RLVR)**이라는 기법을 사용합니다. 이는 로봇이 다양한 해결책을 시도하는 게임과 같으며, 정답을 맞추면 '금색 별 (보상)'을 받고, 틀리면 아무것도 받지 못합니다. 시간이 지남에 따라 로봇은 더 많은 금색 별을 얻는 법을 배우게 됩니다.

그러나 이 논문에서 연구자들은 이 훈련 과정에서 **'엔트로피 붕괴 (Entropy Collapse)'**라는 중대한 결함을 발견했습니다.

문제: 로봇이 너무 자신 있게 되어 (고착됨)

'엔트로피'를 이해하려면 로봇의 마음을 가능한 답변들의 거대한 도서관으로 상상해 보세요.

  • 높은 엔트로피: 도서관은 다양하고 서로 다른 아이디어로 가득 차 있습니다. 로봇은 탐험하며 많은 경로를 시도하고 새로운 가능성에 열려 있습니다.
  • 낮은 엔트로피 (붕괴): 도서관이 갑자기 축소됩니다. 로봇은 더 이상 탐험하지 않고 자신이 최선이라고 생각하는 단 하나의 경로만 선택합니다. 이는 경직되고 반복적이게 됩니다.

RLVR 에서 로봇은 종종 이 '낮은 엔트로피' 상태에 너무 빨리 빠져듭니다. 실수를 두려워하기 때문에 새로운 시도를 멈추게 됩니다. 로봇은 똑같은 '추론'을 반복해서 생성하기 시작합니다. 만약 그 단 하나의 경로가 틀렸다면 로봇은 실패하게 되고, 더 나은 해결책을 발견할 수 없기 때문에 훈련이 멈추게 됩니다.

기존 해결책: 추측과 확인

이 논문 이전까지 과학자들은 '휴리스틱 (heuristic)' 방법을 사용하여 이를 해결하려 했습니다. 즉, 무엇이 작동할지 추측하는 방식이었습니다.

  • 'Clip-High' 방법: 로봇의 신뢰도가 얼마나 변할 수 있는지에 대한 규칙을 완화하여 로봇이 더 많은 것을 시도하도록 강제하려 했습니다.
  • 'Reweighting (가중치 재조정)' 방법: 희귀한 답변에는 추가 점수를 주고 흔한 답변에서는 점수를 빼는 시도를 했습니다.

이러한 기존 방법들의 문제는 마치 다른 구멍은 무시한 채 배의 구멍 하나만 막아 누수를 고치려 하는 것과 같다는 점입니다. 그들은 로봇이 왜 붕괴하는지 완전히 이해하지 못했기 때문에, 그들의 해결책은 운에 맡기는 식이었습니다.

새로운 통찰: 수학적 지도

이 논문의 저자들은 내부 구조를 살펴보기로 결정했습니다. 그들은 로봇의 학습 단계 하나하나마다 로봇의 '다양성 (엔트로피)'이 어떻게 변하는지 정확히 추적할 수 있는 정밀한 수학적 공식 ('tight analytical approximation') 을 만들었습니다.

그들은 다양성의 변화가 네 가지 특정 요인에 의해 통제된다는 것을 발견했습니다.

  1. 클리핑 규칙 (The Clipping Rule): 훈련 알고리즘이 큰 변화를 얼마나 제한하는지.
  2. 어드밴티지 점수 (The Advantage Score): 특정 답변이 평균보다 얼마나 더 나은지.
  3. 확률 (The Probability): 로봇이 처음에 그 답변을 선택했을 가능성.
  4. 현재 엔트로피 (The Current Entropy): 그 정확한 순간 로봇의 마음이 얼마나 다양한지.

그들은 이를 4 분할 지도로 시각화했습니다. 답변이 '맞음/틀림'과 '유력함/비유력함'에 따라 로봇은 더 다양해지거나 덜 다양해집니다. 그들은 이전 방법들이 이러한 사분면 중 하나나 두 개만 보았을 뿐, 더 큰 그림을 놓치고 있었다는 것을 깨달았습니다.

해결책: STEER

이 지도를 바탕으로 그들은 STEER(Stabilizing Token-level Entropy-changE via Reweighting, 재가중치를 통한 토큰 수준 엔트로피 변화 안정화) 라는 새로운 도구를 개발했습니다.

STEER 를 로봇의 학습 과정을 위한 스마트 교통 관제사로 생각하세요.

  • 추측 대신 STEER 는 로봇이 생성하는 모든 단어 (토큰) 에 대해 다양성이 얼마나 변하는지 정확히 계산합니다.
  • 로봇이 다양성이 너무 빨리 무너지는 (엔트로피 붕괴) 행동을 하려 할 때, STEER 는 그 특정 행동에 부드럽게 브레이크를 겁니다.
  • 이는 로봇이 학습하는 것을 멈추게 하는 것이 아니라, 너무 공격적인 학습 부분만 늦추어 로봇의 마음을 개방적이고 다양하게 유지합니다.

결과

팀은 STEER 를 여섯 가지 다른 수학 벤치마크와 세 가지 코딩 챌린지에서 테스트했습니다.

  • 결과: STEER 는 훈련 내내 로봇의 '마음'을 다양하고 탐험적으로 유지했습니다.
  • 점수: 다른 모든 최상위 방법들을 꾸준히 능가하여 더 많은 수학 문제를 풀고 더 나은 코드를 작성했습니다.
  • 범용성: 다양한 크기의 로봇 (작은 모델부터 큰 모델까지) 과 다양한 유형의 훈련 알고리즘에서도 잘 작동했습니다.

요약

이 논문은 AI 에게 더 나은 추론 능력을 가르치기 위해서는 창의성을 유지하는 방법을 단순히 추측해서는 안 된다고 주장합니다. 우리는 AI 가 어떻게 창의성을 잃는지에 대한 정확한 수학을 이해해야 합니다. 이러한 변화의 정밀한 지도를 구축함으로써 그들은 STEER를 만들었습니다. 이는 AI 가 경직된 고리에 갇히는 대신 호기심 있고 탐험적인 상태를 유지하도록 보장하는 정밀하게 조정된 조절기 역할을 하는 방법입니다. 이는 더 똑똑하고 능력 있는 AI 모델을 만들어 냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →