← 최신 논문
🤖 machine learning

Sharpness-Guided Group Relative Policy Optimization via Probability Shaping

본 논문은 검증 가능한 보상을 갖는 강화학습에서 일반화를 개선하기 위해 큰 기울기를 유발하는 토큰의 가중치를 낮춰 날카로움을 줄이고 훈련을 안정화하는 토큰 가중 변형인 Sharpness-Guided GRPO(GRPO-SG)를 제안한다.

원저자: Tue Le, Linh Ngo Van, Trung Le

게시일 2026-05-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tue Le, Linh Ngo Van, Trung Le

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑한 학생(대규모 언어 모델)에게 수학 문제나 논리 퍼즐과 같은 어려운 퍼즐을 푸는 법을 가르친다고 상상해 보세요. 각 단계마다 채점해 줄 선생님을 주는 대신, 마지막에 '체크리스트'를 하나만 줍니다. 최종 답이 맞으면 금별(보상)을 받고, 틀리면 아무것도 받지 못합니다. 이를 **검증 가능한 보상을 통한 강화 학습 (RLVR)**이라고 합니다.

현재 이 학생을 가르치는 가장 인기 있는 방법은 GRPO라는 방법입니다. GRPO 를 다음과 같이 상상해 보세요: "좋아, 이 문제를 해결하는 5 가지 다른 방법을 시도해 보자. 금별을 받은 것들은 좋고, 실패한 것들은 나쁘다. 학생의 뇌를 승리한 것들과 더 비슷하게, 패배한 것들과는 덜 비슷하게 조정해 보자"라고 말하는 코치와 같습니다.

문제: "과도하게 흥분한" 학생

이 논문은 GRPO 가 잘 작동하지만 때로는 너무 공격적일 수 있다고 주장합니다. 학생이 학습을 시도한다고 상상해 보세요. 특정 단어나 단계에서 실수를 하면, 코치가 그들을 바로잡기 위해 매우 크게 소리를 지를 수 있습니다. 수학적으로 말하면, 이는 학생의 뇌에 거대하고 충격적인 변화를 주는 "날카로운" 업데이트를 생성합니다.

이것이 즉각적인 실수를 고칠 수는 있지만, 학생을 불안정하게 만들 수 있습니다. 이전에 알았던 비슷한 문제를 푸는 법을 잊어버리거나, 중요하지 않은 사소한 세부 사항에 대해 과잉 반응할 수 있습니다. 논문의 용어로 말하자면, 이는 **높은 날카로움 (high sharpness)**이라고 하며, 이는 새로운, 보지 못한 문제를 처리하는 능력인 열악한 **일반화 (generalization)**로 이어집니다.

해결책: "신뢰도 게이지" (GRPO-SG)

저자들은 GRPO-SG(날카로움 유도 GRPO)라는 새로운 방법을 제안합니다.

간단한 비유는 다음과 같습니다:
학생이 이야기를 쓰고 있다고 상상해 보세요.

  • 높은 신뢰도 단어: 학생이 100% 확신하는 단어들입니다. 예를 들어 "the"나 "and"와 같은 단어, 또는 "+"나 "="와 같은 중요한 수학 기호입니다. 학생은 이러한 것들이 문장이 의미를 갖는 데 필수적임을 알고 있습니다.
  • 낮은 신뢰도 단어: 학생이 추측하는 단어들입니다. 예를 들어 화려한 형용사나 확신이 없는 특정 숫자입니다.

이전 방법 (GRPO) 에서는, 학생이 낮은 신뢰도 단어를 추측했다가 틀렸을 때, 코치가 "아니야! 너의 뇌 전체를 바꿔!"라고 크게 소리쳤습니다. 이는 다른 것들을 망칠 수 있는 거대하고 "날카로운" 업데이트를 초래했습니다.

GRPO-SG는 소리치기 전에 학생의 "신뢰도 게이지"를 살펴보는 현명한 코치처럼 행동합니다.

  • 학생이 불확실한(낮은 신뢰도) 상태에서 실수를 하면, 코치는 "좋아, 다음에는 조금 더 조심해 보자"라고 속삭이지만, 거대한 변화를 주지는 않습니다. 이는 학생이 당황하고 과잉 수정하는 것을 방지합니다.
  • 학생이 확신하는(높은 신뢰도) 상태에서 맞히면, 코치는 그 좋은 습관을 강화하기 위해 강하고 긍정적인 밀어붙임을 줍니다.

작동 원리 ("확률 변형")

이 논문은 **확률 변형 (Probability Shaping)**이라는 수학적 트릭을 사용합니다.

  1. 시스템은 모델이 방금 선택한 단어에 대해 얼마나 확신하는지 확인합니다 (단어가 얼마나 그럴듯한지에 대한 점수인 "logit"에 기반합니다).
  2. 점수가 낮으면 (모델이 추측 중임), 시스템은 그 교훈을 **약화 (downweights)**시킵니다. "이 하나의 실수가 너의 전체 기반을 흔들게 하지 마라"라고 말합니다.
  3. 점수가 높으면 (모델이 확신함), 시스템은 그 교훈을 **강화 (upweights)**시킵니다. "이것은 확실한 움직임이니, 계속하도록 해 보자"라고 말합니다.

결과: 더 부드러운 주행

이 논문은 이 새로운 방법을 세 가지 유형의 도전 과제에서 테스트했습니다.

  1. 수학: 올림피아드 수준의 수학 문제 해결.
  2. 논리: "기사 (Knights) 와 불량배 (Knaves)" 퍼즐 해결 (어떤 사람들은 항상 거짓말을 하고 어떤 사람들은 항상 진실을 말함).
  3. 도구 사용: AI 에게 답을 찾기 위해 검색 엔진을 사용하도록 요청.

무슨 일이 일어났나요?

  • 더 나은 점수: 새로운 방법 (GRPO-SG) 은 모든 테스트에서 기존 방법 (GRPO) 보다 일관되게 더 높은 점수를 받았습니다. 예를 들어, 논리 퍼즐에서는 성공률이 크게 상승했습니다.
  • 더 부드러운 학습: "기울기 노름 (gradient norm, 학생의 뇌가 얼마나 격렬하게 변하는지에 대한 측정치)"을 관찰했다면, 새로운 방법은 훨씬 더 부드러웠습니다. 과잉 수정의 격렬한 급등이 없었습니다. 그것은 정상으로 가는 안정적이고 차분한 주행이었습니다.

요약

이 논문은 AI 에게 낮은 신뢰도 추측의 "공황"을 무시하고 높은 신뢰도 움직임을 강화하는 데 집중하도록 함으로써, 더 똑똑하고 안정적이며 일반화 가능한 추론 모델을 훈련할 수 있다고 주장합니다. 이는 학생이 아는 것에 대해 자신의 직감을 신뢰하고, 아직 추측 중인 것들에 대해 당황하지 않도록 가르치는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →