SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation
이 논문은 쉬운 프롬프트에 대한 가중치 발산을 방지하기 위해 z-score 정규화를 온도 조절된 소프트맥스 어드밴티지로 대체하여, 그래디언트 예산을 더 효과적으로 재할당함으로써 표준 GRPO 대비 DeepMath 및 Poetry와 같은 작업에서 추론 성능을 크게 향상시키는 강화 학습 방법인 SoftmaxGRPO를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 퍼즐을 푸는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇에게 문제 뭉치를 줍니다. 그리고 로봇이 문제를 풀 때마다 매번 "예" 또는 "아니오"라는 간단한 성적을 받습니다. 만약 로봇이 정답을 맞히면 하이파이브를 받고, 틀리면 "다시 해봐"라는 부드러운 격려를 받습니다. 이것이 바로 인공지능이 시행착오를 통해 배우는 **강화 학습(Reinforcement Learning)**의 세계입니다. 하지만 여기서 까다로운 점이 있습니다. 어떤 시도가 학습에 가장 중요한지를 로봇에게 어떻게 알려줄 수 있을까요?
과거에 연구자들은 GRPO(Group Relative Policy Optimization)라고 불리는 방법을 사용했습니다. GRPO를 열 명의 학생이 낸 답을 살펴보는 선생님이라고 생각해 보세요. 만약 아홉 명의 학생이 문제를 맞히고 한 명이 틀렸다면, 선생님은 틀린 학생에게 집중합니다. 하지만 열 명 모두가 문제를 맞혔다면(쉬운 문제인 경우), 선생님는 혼란에 빠집니다. GRPO에서 사용하는 수학 방식은 '평균'의 차이를 찾으려고 하기 때문에, 이미 학생들이 알고 있는 문제에 대해 오히려 가장 크게 소리를 지르는 실수를 범합니다. 이는 마치 코치가 스타 플레이어가 쉬운 레이업 슛을 놓쳤다고 소리치며 야단치는 반면, 드리블조차 힘겨워하는 초보자는 무시하는 것과 같습니다. 이는 로봇의 뇌 에너지를 이미 알고 있는 것에 낭비하게 만들어, 새로운 것을 배워야 할 때 정작 배울 수 없게 만듭니다.
이 논문은 SoftmaxGRPO라는 새로운 방법을 소개합니다. 단순히 혼란스러운 "평균" 수학을 사용하는 대신, 저자들은 "온도 조절된 소프트맥스(temperature-scaled softmax)" 접근 방식을 제안합니다. 주의력을 끌어당기는 '열 지도(heat map)'를 상상해 보세요. 질문이 쉽고 로봇이 정답을 맞히면, 이 방식은 "잘했어, 하지만 이걸 너무 열심히 공부할 필요는 없어"라고 말합니다. 반대로 질문이 어렵고 로봇이 고전한다면, "이것이 우리가 집중해야 할 부분이야!"라고 말합니다. 이는 로봇의 주의력을 쉬운 문제로부터 자연스럽게 멀어지게 하여, 실제로 배울 수 있는 어려운 문제로 옮겨주는 스마트한 필터 역할을 합니다. 연구진은 이를 수학 문제, 창의적 글쓰기, 회의 요약 작업에 테스트했으며, 그 결과 새로운 방식이 기존 방식보다 더 빠르고 더 잘 학습한다는 것을 발견했습니다. 심지어 '성적'이 완벽한 점수가 아닌 대략적인 추정치일 때도 마찬가지였습니다.
문제점: 스타 플레이어에게 소리치는 선생님
AI와 그 스승의 이야기를 깊이 파헤쳐 봅시다. AI의 세계에서는 **그룹 기반 강화 학습(Group-Based Reinforcement Learning)**이라는 기술을 자주 사용합니다. 예를 들어, AI에게 수학 문제를 풀라고 시킨다고 가정해 봅시다. 단 한 번만 시도하는 대신, 열 가지 다른 방법(이를 "롤아웃(rollouts)"이라 부릅니다)으로 시도하게 합니다. 그런 다음 열 가지 답변을 함께 살펴봅니다.
기존 방식인 GRPO는 그룹의 "평균" 성과를 계산하는 선생님처럼 작동합니다. AI가 질문에 답을 맞히면 보상을 주고, 틀리면 낮은 보상을 줍니다. 문제는 쉬운 질문에서 발생합니다. 만약 AI가 특정 유형의 수학 문제에 이미 매우 능숙하다면, 열 번의 시도 중 거의 모두를 맞힐 것입니다. 기존 GRPO의 수학에서는 이로 인해 기묘한 상황이 발생합니다. "평균"이 매우 높기 때문에, "완벽한" 답변과 "거의 완벽한" 답변 사이의 아주 미세한 차이가 증폭됩니다. 이 수학은 AI가 이미 마스터한 질문에 대해 행동을 수정하라고 소리를 지르게 됩니다. 이는 마치 코치가 프로 농구 선수가 자유투를 아주 약간 빗나갔다고 소리치며 야단치는 반면, 공을 잡는 것조차 힘들어하는 초보자는 무시하는 것과 같습니다. AI는 고칠 필요가 없는 것을 고치려다 에너지를 낭비하고, 결국 어려운 것을 배울 에너지가 남아나지 않게 됩니다.
해결책: 더 똑똑한 열 지도
라이스 대학교(Rice University)의 저자들은 SoftmaxGRPO라는 해결책을 제안했습니다. 그들은 "z-score"(숫자가 평균에서 얼마나 떨어져 있는지 측정하는 값)를 사용하는 대신, 소프트맥스(softmax) 함수를 사용해야 한다는 것을 깨달았습니다.
소프트맥스를 주의력을 위한 "열 지도"라고 생각하세요. 이는 보상(성적)을 받아 "온도()" 설정이 포함된 특수한 공식을 사용하여 가중치로 변환합니다.
- 높은 온도: 열 지도가 평평합니다. 모든 시도가 거의 동일한 주의를 받습니다. 이는 AI가 느리고 무작위로 학습하는 기존의 REINFORCE 방식과 같습니다.
- 낮은 온도: 열 지도가 매우 날카로워집니다. AI는 최고의 시도에 강렬하게 집중하고 나머지는 무시합니다. 이는 최고의 답 하나를 찾는 데는 뛰어나지만 불안정할 수 있는 MaxRL 방식과 같습니다.
SoftmaxGRPO는 그 중간에 위치합니다. 이 방식은 온도를 사용하여 부드러운 곡선을 만듭니다. AI가 쉬운 질문을 맞히면 열 지도는 차갑게 유지되어, AI에게 "잘했어, 이제 넘어가도 돼"라고 말합니다. 만약 AI가 어려운 질문을 틀리면 열 지도는 따뜻하게 유지되어, "이게 중요해, 공부해!"라고 말합니다.
핵심은 이 방식이 가중치를 제한(bounded)한다는 점입니다. 질문이 아무리 쉽더라도 "비명"이 무한대가 되지는 않습니다. 이는 AI가 쉬운 프롬프트에 뇌 에너지를 낭비하는 것을 방지합니다.
결과: 증명된 성과
저자들은 단순히 추측만 한 것이 아니라, 수학적으로 증명하고 테스트를 수행했습니다.
1. 수학적 견고함 (이진 보상의 경우)
단순히 "맞음" 또는 "틀림"의 답을 가진 질문(이진 보상)에 대해, 그들은 SoftmaxGR포가 완벽하고 매끄러운 목적 함수를 생성함을 증명했습니다. 온도가 낮아질수록 이 방식은 자연스럽게 MaxRL(최선의 결과를 찾는 데 집중하는 방식)로 변하고, 그룹의 크기가 매우 커지면 최대 가능도(Maximum Likelihood)(학습의 표준 모델)처럼 동작함을 보여주었습니다. 결정적으로, SoftmaxGRPO는 쉬운 질문에서도 값이 폭발하지 않는다는 것을 증명했습니다.
2. 마법의 한계
그들은 또한 한계점도 찾아냈습니다. 보상이 단순히 "맞음/틀림"이 아니라 여러 단계(예: 1점에서 100점 사이의 다양한 점수)를 가진 경우, 수학적 구조가 복잡해집니다. 그들은 보상 단계가 세 개 이상인 그룹의 경우, 모든 그룹 크기에 적용되는 단 하나의 완벽한 "스칼라 목적 함수(scalar objective)"를 항상 찾을 수는 없다는 것을 보여주었습니다. 즉, 이 방식은 단순한 "맞음/틀림" 시나리오에서 이론적으로 가장 완벽하지만, 더 복잡한 점수 체계에서도 여전히 실용적으로 잘 작동합니다.
3. 실제 세계의 결과
연구진은 15억 개의 파라미터를 가진 모델(중형 규모의 AI)을 사용하여 여러 작업에서 테스트했습니다.
- 수학 (GSM8K, Countdown, DeepMath): 컴퓨터가 정답을 정확히 확인하는 완벽한 "검증기(verifier)" 보상을 사용할 때, SoftmaxGRPO는 DeepMath에서 **51.8%**의 정확도에 도달하여 기존 GRPO를 앞질렀습니다. Countdown에서는 **58.1%**를 기록했습니다.
- 창의적 글쓰기 (시/Poetry): 이 부분이 매우 흥-미로웠습니다. 시에는 "정답"이 없습니다. 오직 "유사도 점수"(시가 좋은 예시와 얼마나 닮았는지)만을 사용할 수 있습니다. 이는 "약하고" 노이즈가 많은 보상입니다. 기존 GRPO는 여기서 어려움을 겪었습니다. 그러나 SoftmaxGRPO는 **35.0%**에서 시작한 모델을 **68.0%**까지 끌어올렸습니다. 이는 엄청난 도약이며, 이 방식이 완벽하지 않은 '선생님' 밑에서도 작동함을 입증합니다.
- 요약 (MeetingBank): 요약 점수를 **35%**에서 **70%**로 향상시켰습니다.
4. 주의력이 어디로 향하는가
가장 결정적인 증거는 AI가 자신의 "그래디언트 예산(gradient budget, 학습 에너지)"을 어디에 썼는지 살펴보는 데서 나왔습니다.
- 기존 GRPO: "거의 해결된" 프롬프트(AI가 이미 90% 이상의 확률로 맞힐 수 있는 질문)에 에너지의 **36.4%**를 썼습니다. 쉬운 문제에 시간을 낭비하고 있었던 것입니다.
- SoftmaxGRPO: 이러한 쉬운 프롬프트에는 단 **10.0%**의 에너지만 사용했습니다. 대신 그 에너지를 AI가 고전하고 있는 더 어려운 질문들(20%~90% 구간)로 전환했습니다.
결론
이 논문은 우리가 "중요도"를 계산하는 방식을 표준 평균에서 온도 조절된 소프트맥스로 바꾸는 것만으로도, AI 학습의 주요 결함을 해결할 수 있음을 시사합니다. 이는 AI가 이미 알고 있는 것에 집착하는 것을 막고, 실제로 자신을 더 똑똑하게 만들 수 있는 도전 과제에 집중하도록 강제합니다.
수학적으로는 단순한 "맞음/틀림" 보상에서 가장 엄밀하지만, 실험 결과 시를 쓰거나 회의를 요약할 때 사용하는 모호하고 약한 보상에서도 놀라운 효과를 보였습니다. 이는 코드의 작은 변화만으로도 AI가 추론하는 방식을 크게 개선할 수 있는 "드롭인(drop-in)" 교체 가능한 방식입니다. 저자들은 이 방법이 학습 신호를 재배분하는 강력한 방법이며, AI가 가장 중요한 곳에 시간을 쓰도록 보장한다고 결론지었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.