← 최신 논문
🤖 machine learning

Noise-corrected GRPO: From Noisy Rewards to Unbiased Gradients

본 논문은 보상 오염을 베르누이 노이즈로 모델링하고 교정 전략을 적용하여 증명 가능하게 편향되지 않은 기울기를 도출함으로써 현실적인 노이즈가 있는 보상 조건에서 수학 및 코드 작업의 정확도를 크게 향상시키는 노이즈에 강건한 그룹 상대적 정책 최적화 (GRPO) 프레임워크를 소개합니다.

원저자: Omar El Mansouri, Fathinah Asma Izzati, Mohamed El Amine Seddik, Salem Lahlou

게시일 2026-05-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Omar El Mansouri, Fathinah Asma Izzati, Mohamed El Amine Seddik, Salem Lahlou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 수학 문제를 풀거나 컴퓨터 코드를 작성하도록 가르친다고 상상해 보세요. 이를 가르치기 위해 로봇의 답변을 보고 "잘했어!" (보상: 1) 또는 "다시 시도해 봐!" (보상: 0) 라고 말하는 "선생님" (보상 모델) 이 필요합니다.

실제 세계에서는 이 선생님이 완벽하지 않습니다. 때로는 선생님이 산만해지거나, 답변을 잘못 읽거나, 화려한 문구에 속아 넘어가기도 합니다. 그들은 틀린 답변에 대해 "잘했어!" (거짓 긍정) 라고 하거나, 올바른 답변에 대해 "다시 시도해 봐!" (거짓 부정) 라고 할 수도 있습니다. 이것이 바로 해당 논문이 말하는 노이즈입니다.

해당 논문은 만약 이 노이즈가 있는 선생님을 맹목적으로 신뢰한다면, 로봇이 잘못된 교훈을 배우고 도달할 수 있었을 지능 수준보다 낮은 단계에 머무르게 될 것이라고 주장합니다.

다음은 그들의 해결책인 노이즈 보정 GRPO에 대한 간단한 비유를 활용한 설명입니다:

1. 문제: "고장 난 나침반"

이러한 로봇을 훈련시키는 표준적인 방법은 GRPO라고 불립니다. GRPO 를 함께 시험을 보는 학생들의 그룹으로 상상해 보세요. 그들은 완벽한 교과서와 비교하는 대신, 그룹의 평균 점수와 비교합니다.

  • 문제점: 선생님 (보상 모델) 이 통과 여부를 결정하기 위해 동전을 던진다면, "평균 점수"는 고장 난 나침반이 됩니다. 학생들은 실제로는 선생님의 실수에 반응하고 있을 뿐인데, 개선되고 있다고 생각하며 빙글빙글 돌게 됩니다.
  • 논문의 발견: 저자들은 수학적으로 증명했습니다. 이 노이즈는 단순히 속도를 늦추는 것이 아니라, 로봇이 최상의 가능한 솔루션보다 엄격하게 열등한 "충분히 좋은" 솔루션에 안주하도록 적극적으로 밀어붙인다는 것입니다.

2. 해결책: "노이즈 탐정"

저자들은 이 고장 난 나침반을 수정하기 위한 새로운 방법을 고안했습니다. 그들은 노이즈가 있는 선생님의 피드백을 손상된 신호로 간주하고 "노이즈 제거" 필터를 적용합니다.

다음과 같이 생각해 보세요:

  • 1 단계: 감사. 주요 훈련이 시작되기 전에, 연구자들은 정답을 알고 있는 소규모의 통제된 질문 세트를 가져옵니다. 그리고 선생님에게 이를 채점하도록 요청합니다.
  • 2 단계: 오류 계산. 그들이 선생님이 얼마나 자주 거짓말하는지 계산합니다.
    • "정답이 실제로 틀렸을 때 '좋음'이라고 말한 횟수는 얼마나 됩니까?" (거짓 긍정률).
    • "정답이 실제로 맞았을 때 '나쁨'이라고 말한 횟수는 얼마나 됩니까?" (거짓 부정률).
  • 3 단계: 보정. 이제 실제 훈련 중에는 이러한 오류율을 사용하여 수학적으로 선생님의 실수를 "되돌립니다".
    • 선생님이 "좋음"이라고 말하지만 그들이 20% 의 확률로 거짓말을 한다는 것을 알고 있다면, 알고리즘은 그 "좋음"의 가치를 약간 낮게 조정합니다.
    • 선생님이 "나쁨"이라고 말하지만 그들이 올바른 답변의 30% 를 놓친다는 것을 알고 있다면, 알고리즘은 그 불확실성을 반영하기 위해 그 "나쁨"의 가치를 높입니다.

3. 반전: 평균만 중요한 것이 아닙니다

논문은 교묘한 세부 사항을 강조합니다. 표준 GRPO 방법에서 로봇은 점수 자체뿐만 아니라 그룹 내 점수의 변동 정도도 살펴봅니다.

  • 비유: 달리기 선수들의 그룹을 상상해 보세요. 선생님이 노이즈가 많다면, 점수의 "분포"가 이상하게 넓거나 좁게 보입니다.
  • 수정: 저자들은 단순히 평균 점수 (평균) 를 수정하는 것만으로는 충분하지 않다는 것을 깨달았습니다. "분포" (분산) 도 수정해야 합니다. 그들의 새로운 알고리즘은 로봇이 완벽한 선생님이 있는 것처럼 정확히 학습하도록 점수와 분포 모두를 조정합니다.

4. 결과: "괜찮음"에서 "훌륭함"으로

연구자들은 수학 문제 (방정식 풀이 등) 와 코딩 작업에서 이를 테스트했습니다.

  • 수학: 노이즈가 있는 선생님을 사용했을 때, 로봇의 정확도가 크게 떨어졌습니다. 그들의 "노이즈 탐정" 보정을 적용한 후, 로봇의 정확도는 다시 급상승하여 때로는 합성 테스트에서 "완벽한" 선생님과 훈련된 로봇의 성능까지 능가하기도 했습니다. 정확도 향상 폭은 최대 6.7 퍼센트 포인트에 달했습니다.
  • 코딩: 코딩은 미세한 버그를 놓치기 쉽기 때문에 완벽하게 채점하기가 더 어렵습니다. 여기에서도 보정이 도움이 되어 정확도를 약 1.5 퍼센트 포인트 높였습니다.

요약

이 논문은 본질적으로 다음과 같이 말합니다: "결함이 있는 선생님이 학생의 잠재력을 망치지 못하게 하세요."

선생님이 어떻게 실수를 하는지 수학적으로 모델링한 후, 학습 과정에서 이러한 실수를 적극적으로 보정함으로써, 피드백이 혼란스럽고 신뢰할 수 없더라도 더 정확하고 견고한 AI 모델을 훈련시킬 수 있습니다. 그들은 "노이즈가 있는" 학습 환경을 명확하고 편향되지 않은 환경으로 바꿨습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →