← 최신 논문
💻 computer science

Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models

이 논문은 성공적인 궤적에 대해서는 완전한 그래디언트 신호를 보존하면서 음의 어드밴티지(negative-advantage) 롤아웃에는 엔트로피 기반 할인을 비대칭적으로 적용함으로써, 표준 GRPO에 비해 학습을 크게 안정화하고 수학적 추론 벤치마크에서 성능을 향상시키는 강화 학습 알고리즘인 Selective-Advantage Entropy-Adaptive Horizon GRPO (SA-AH-GRPO)를 소개한다.

원저자: Chirag Chawla, Rohan Charudatt Salvi, Madhav S. Baidya

게시일 2026-06-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chirag Chawla, Rohan Charudatt Salvi, Madhav S. Baidya

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 학생(AI 언어 모델)에게 수학 문제를 푸는 법을 가르치고 있다고 상상해 보세요. 이 학생은 연습하고, 피드백을 받고, 자신의 학습 습방을 조정하며 배우려고 노력 중입니다. 이 논문은 더 나은 방식의 피드백을 제공하여 학습 과정을 더 빠르고, 안정적이며, 덜 혼란스럽게 만드는 방법을 소개합니다.

다음은 이 논문의 아이디어들을 쉬운 비유를 사용하여 정리한 내용입니다.

문제점: "일률적인" 튜터

현재 이러한 AI 모델을 가르치는 표준 방식은 GRPO라고 불립니다. GRPO를 학생이 쓰는 모든 단어를 똑같은 방식으로 대하는 엄격한 튜터라고 생각해 보세요.

  • 문제점: 만약 학생이 자신감 있게 명확하고 올바른 문장을 쓴다면, 튜터는 하이파이브를 해줍니다. 하지만 학생이 혼란스러워하거나, 말을 더듬거나, 무작정 추측하고 있다면(높은 "엔트로피" 또는 불확실성), 튜터는 똑같은 양의 주의를 기울입니다. 때로는 확신을 가지고 틀렸을 때와 마찬가지로 똑같이 엄하게 처벌하기도 합니다.
  • 결과: 이는 학생을 혼란스럽게 합니다. 학생이 이미 추측하고 있는 상황에서 가혹한 벌을 받으면, 당황하여 잘못된 것을 배울 수 있습니다. 반대로, 학생이 문제를 맞혔더라도 그 과정에서 몇 번의 불안정한 추측이 있었다면, 튜터는 실수로 그 불안정한 추측들을 처벌하여 "이 경로가 정답으로 이어진다"라는 교훈을 약화시킬 수 있습니다.

해결책: 두 가지 새로운 교수 전략

저자들은 이 튜터링 시스템에 AH-GRPOSA-AH-GRPO라고 불리는 두 가지 업그레이드를 제안합니다.

1. "불확실성 할인" (AH-GRPO)

튜터가 특별한 규칙을 가지고 있다고 상상해 보세요: "학생이 명확히 혼란스러워한다면, 피드백의 볼륨을 줄인다."

  • 작동 방식: 튜터는 매 단어마다 학생이 얼마나 불확실한지 확인합니다. 만약 학생이 무작정 추측하고 있다면(높은 엔트로피), 튜터는 "알았어, 이 부분은 엉망이니까, 너에게 아주 크게 책임을 묻지는 않을게"라고 말합니다.
  • 이점: 이는 학생이 어려움을 겪을 때 노이즈(소음) 때문에 압도당하는 것을 방지합니다. 이는 "학습 지평(learning horizon)"을 단축하여, 답변 중 명확한 부분에만 집중하게 합니다.

2. "선택적 이득" 규칙 (SA-AH-GRPO) — 주인공

이것은 위 규칙에 결정적인 반전을 더한 이 논문의 핵심 혁신입니다: "학생이 전체 답을 틀렸을 때만 볼륨을 줄인다."

  • 시나리오 A: 학생이 정답을 맞혔을 때 (긍정적 이득)
    설령 학생이 도중에 비틀거리거나 몇 단어를 추측했더라도, 결국 문제를 올바르게 해결했다면 튜터는 이렇게 말합니다: "잘했어! 네가 쓴 모든 단어, 심지어 그 불안정했던 단어들까지도 정답에 도령했어. 우리는 그것들을 모두 카운트할 거야!"

    • 이유: 최종 결과가 성공적이었기 때문입니다. 우리는 승리로 이끈 전체 경로를 강화하고 싶습니다.
  • 시나리오 B: 학생이 오답을 냈을 때 (부정적 이득)
    만약 학생이 문제를 해결하지 못했다면, 튜터는 이렇게 말합니다: "틀렸어. 이제 네가 어디서 혼란스러워했는지 보자. 네가 그냥 무작정 추측했던 부분들은 무시할 거야. 그래야 네가 그 추측들로부터 잘못된 교훈을 얻지 않도록 할 수 있으니까. 우리는 명확한 실수에만 집중할 거야."

    • 이유: 틀렸는데 동시에 혼란스러운 상태라면, 그 추측들은 그저 노이즈일 뿐입니다. 노이즈를 너무 강하게 처벌하면 학습 신호가 혼란스러워집니다.

결과: 더 부드러운 여정

저자들은 이 새로운 방법을 두 가지 크기의 AI 모델(작은 1.5B 모델과 큰 3B 모델)을 사용하여 수학 문제에 테스트했습니다.

  • 더 큰 모델 (3B)의 경우: 새로운 방법이 기존 방법보다 모델을 더 똑똑하게 만들지는 않았지만(이미 충분히 똑똑했기 때문), 학습을 훨씬 더 안정적으로 만들었습니다. 자동차 운전에 비유하자면, 기존 방법은 차가 왼쪽 오른쪽으로 휘청거리는 울퉁불퉁한 도로를 달리는 것과 같았습니다. 새로운 방법은 도로를 평탄하게 만들었습니다. "휘청거림(분산)"이 3.6배 감소했습니다. 차는 같은 목적지에 도착했지만, 훨씬 더 부드러운 승차감을 제공했습니다.
  • 더 작은 모델 (1.5B)의 경우: 새로운 방법은 실제로 모델이 더 잘 배우도록 도왔습니다. 처음부터 시작했을 때보다 점수를 거의 5%포인트 향상시켰습니다. 작은 모델은 효과적으로 발을 내디디기 위해 그 추가적인 안정성이 필요했던 것으로 보입니다.

"비법": 왜 작동하는가

이 논문은 이 접근 방식이 **탐색(exploration)**과 **활용(exploitation)**의 차이를 존중한다고 주장합니다.

  • 모델이 탐색 중일 때(추측할 때), 불확실한 것은 괜찮습니다.
  • 모델이 성공했을 때, 우리는 불확식한 부분을 포함한 전체 여정을 보상해야 합니다.
  • 모델이 실패했을 때, 불확실성의 "노이즈"를 너무 가혹하게 처벌하여 학습 신호를 혼란스럽게 만들지 않도록 주의해야 합니다.

요약

SA-AH-GRPO를 엄격할 때와 관대할 때를 아는 현명한 코치라고 생각하세요.

  • 게임에서 이기면, 코치는 네가 했던 모든 움직이, 심지어 위험했던 움직임까지도 칭찬합니다.
  • 게임에서 지면, 코치는 네가 그냥 추측했던 순간들은 무시하고 명확한 실수에만 집중하여, 네가 낙담하거나 혼란에 빠지지 않게 합니다.

피드백의 가중치를 조절하는 이 간단한 변화는 AI 학습 과정을 더 빠르고, 안정적이며, 효과적으로 만듭니다. 특히 스스로 자리를 잡는 데 도움이 필요한 작은 모델들에게 더욱 그렇습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →