← 최신 논문
💬 NLP

All-Quadrant Bounded Clipping GRPO: Closing the Unbounded Blind Spot for Stable and Generalizable Training

이 논문은 표준 GRPO의 음의 이득(negative-advantage) 사분면에서 발생하는 구조적 무제한성을 해결하기 위해 무조건적 클리핑을 적용하여 안정적인 고엔트로피 훈련과 수학 및 코딩 벤치마크에서의 우수한 일반화 성능을 보장하는 새로운 강화 학습 알고리즘인 All-Quadrant Bounded Clipping GRPO (ABC-GRPO)를 소개한다.

원저자: Chi Liu, Xin Chen

게시일 2026-08-07
📖 5 분 읽기🧠 심층 분석

원저자: Chi Liu, Xin Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 똑똑하지만 약간은 혼란스러운 로봇에게 수학 문제를 푸는 법을 가르치고 있다고 상상해 보세요. 당신은 단순히 정답을 알려주는 것이 아니라, 로봇이 '생각하는 법'을 배우길 원합니다. 이것이 바로 강화 학습(Reinforcement Learning)의 세계입니다. 강화 학습은 무언가를 시도하고, 점수를 얻고, 다음번에 더 높은 점수를 얻기 위해 자신의 행동을 조정하며 배우는 과정입니다. 현재 이 분야의 주인공은 GRPO(Group Relative Policy Optimization)라고 불리는 방법입니다. GRPO를 학생의 에세이 전체(단어의 시퀀스)를 보고 전체에 대해 하나의 성적을 매기는 엄격한 코치라고 생각해보세요. 만약 에세이가 좋은 성적을 받으면 코치는 "잘했어, 네가 했던 방식대로 계속해!"라고 말합니다. 만약 나쁜 성적을 받으면 "잘못됐어, 네가 했던 모든 것을 되돌려!"라고 말합니다.

문제는 이 "에세이 전체" 방식이 다소 불공평할 수 있다는 점입니다. 때때로 학생은 엉망인 에세이 중간에 완벽한 문장 하나를 쓸 수도 있습니다. 기존의 규칙 아래에서는 그 완벽한 문장조차 나쁜 에세이와 함께 처벌받거나, 반대로 엉터리 문장이 좋은 에세이 속에서 공짜로 통과될 수도 있습니다. 이는 AI가 혼란을 느끼게 하여 새로운 아이디어를 시도하는 것을 멈추고, 결국 정체되어 창의성을 잊어버리게 만드는 사각지대를 만듭니다. 이 논문은 바로 이 특정한 혼란을 다루며, AI의 학습을 안정적으로 유지하고 그 상상력을 살려내기 위한 새로운 규칙 세트를 제안합니다.


불공평한 코치와 네 개의 실수 구석(Four Corners of Mistakes)

PayPal.AI의 Chi Liu와 Xin Chen은 이 논문의 저자들이 GRPO가 AI 모델을 어떻게 훈련시키는지에 숨겨진 결함을 발견했습니다. 이들의 해결책을 이해하기 위해, AI의 학습 과정을 거대한 지도 위에서 벌어지는 게임이라고 상상해 보세요. 이 지도는 네 개의 구석(사분면)으로 나뉘어 있습니다. 한 축은 AI가 자신의 생각을 얼마나 바꿨는지(어떤 단어를 더 가능성 있게 만들었는지 혹은 덜 가능성 있게 만들었는지?)를 추적하고, 다른 축은 코치가 그 움직임에 대해 좋았는지 나빴는지를 추적합니다.

세 개의 구석에서는 규칙이 잘 작동합니다. 하지만 특정 구석 하나—이를 "위험 구역(Danger Zone)"이라고 부릅시다—에서는 기존의 규칙이 완전히 무너집니다. 이는 AI가 어떤 단어를 더 가능성 있게 만들었지만(자신감을 가졌지만), 코치가 전체 에세이에 대해 나쁜 점수를 줄 때 발생합니다. 기존 시스템에서는 AI가 그 단어에 대해 매우 확신하고 있었다면, 그 처벌은 무한대가 될 수 있었습니다. 이는 마치 선생님이 학생에게 "네 답이 맞다고 99% 확신했지만, 에세이가 실패했으므로 그 단어를 완전히 잊어버려야 해!"라고 말하는 것과 같습니다. 즉, 그 단어가 실제로 옳았더라도 말이죠.

이 "무제한적인(unbounded)" 처벌은 위험합니다. 이는 AI를 공황 상태에 빠뜨립니다. 문제를 해결하기 위해 다양한 방법을 탐색하는 대신, AI는 뇌의 아주 작고 안전한 구석으로 붕괴하여 똑같은 패턴만을 반복하게 됩니다. 저자들은 이를 "엔트로피 붕괴(entropy collapse)"라고 부르는데, 이는 AI가 창의성을 잃고 지루하고 경직된 로봇이 되는 현상을 뜻하는 멋진 표현입니다. 그들은 이 특정 "위험 구역"이 AI 모델이 쉬운 문제는 잘 풀면서도 어려운 수학 문제를 해결하는 능력이 시간이 지남에 따라 왜 저하되는지의 주요 원인임을 발견했습니다.

새로운 규칙서: ABC-GRPO

이를 해결하기 위해 팀은 ABC-GRPO(All-Quadrant Bounded Clipping GRPO)라는 새로운 방법을 발명했습니다. 이것을 더 공정해진 새로운 규칙서를 주는 것이라고 생각해보세요.

기존 시스템에서는 코치가 어떤 상황에서는 처벌을 제한할 수 있었지만, "위험 구역"에서는 얼마나 강하게 때릴지에 대한 제한이 없었습니다. ABC-GRPO는 지도의 네 구석 모두에 "속도 제한"을 둡니다. 코치가 AI에게 점수를 적용하기 전에 다음과 같이 확인합니다: "이 처벌이 너무 큰가?" 만약 AI가 위험 구역에 있고 처벌이 너무 크다면, 새로운 규칙은 "멈춰! 여기까지만 해."라고 말합니다.

결정적으로, 이 새로운 규칙은 변화에 대해 "바닥(floor)"과 "천장(ceiling)"을 적용합니다. 이는 설령 AI가 나쁜 에세이 속에서 실수를 하더라도, 그 내용이 완전히 지워지지 않도록 보장합니다. 이는 AI의 자신감이 급격하게 요동치는 것을 막아줍니다. 저자들은 이것을 AI를 즉시 똑똑하게 만드는 마법 같은 기술이 아니라, 자전거가 넘어지지 않도록 도와주는 보조 바퀴와 같은 "안정화 메커니즘"이라고 설명합니다.

그들이 발견한 것: 추론 능력의 보존

팀은 이 새로운 방법을 강력한 수학 해결 AI인 Qwen3에 테스트했습니다. 그들은 ABC-GRPO를 기존의 GRPO 및 여러 인기 있는 방법들과 비교했습니다. 결과는 놀라웠습니다.

기존의 GRPO를 사용할 때, AI가 다양한 해결책을 찾아내는 능력(그의 "추론 경계")은 훈련이 진행됨에 따라 실제로 악화되었습니다. AI는 창의적인 경로를 포기하기 시작했습니다. 하지만 ABC-GRло와 함께라면, AI는 단순히 정답을 맞히는 데 그치지 않고 탐색 능력을 유지했습니다.

어려운 수학 챌린지(AIME 2024 등)에 대한 테스트에서, ABC-GRPO는 정확도와 다양성 모두에서 가장 높은 점수를 기록했습니다. 예를 들어, 40억 파라미터 모델에서 ABC-GRPO는 평균적으로 약 **38.3%**의 문제를 정확히 풀었으나, 표준 GRPO는 **34.5%**였습니다. 더 중요한 것은, 64번의 시도 중 하나의 정답이라도 찾아내는 능력(Pass@64)을 보았을 때, ABC-GRPO는 **70.3%**를 기록한 반면 표준 GRPO는 **59.4%**로 떨어졌습니다.

저자들은 또한 이 기술이 AI가 본 적 없는 것들, 예를 들어 코딩 퍼즐(HumanEval)이나 더 어려운 수학 세트(MATH-500)에서도 작동하는지 확인했습니다. 결과는 견고했습니다. ABC-GRPO로 훈련된 AI는 이러한 새로운 과제에서도 더 뛰어난 성능을 보였으며, 이는 이 해결책이 특정 테스트를 위한 운 좋은 추측이 아님을 증명합니다.

"위험 구역"이 진짜 범인이었다

연구에서 가장 흥ло로운 부분 중 하나는 문제에 대한 "해부"였습니다. 연구진은 질문했습니다: "전체 새로운 규칙서가 문제를 해결하는 것인가, 아니면 무제한 처벌을 막는 부분만이 해결하는 것인가?"

그들은 "위험 구역"(제4사분면)만 수정하고 나머지 구석은 그대로 둔 채 실험을 진행했습니다. 그들은 제4사분면만 고쳤을 뿐인데도 전체 개선 사항의 약 **72%**를 회복했다는 것을 발견했습니다. 이는 그들의 이론을 확인시켜 주었습니다: 즉, 그 특정 구석에서의 무제한적인 처벌이 AI를 붕괴시킨 주요 원인이었습니다. 다른 구석들도 약간의 도움이 필요했지만, "위험 구역"이야말로 배를 침몰시키는 데 있었던 커다란 구멍이었습니다.

이것이 왜 중요한가

저자들은 자신들이 "완벽한" AI 추론의 문제를 해결한 것은 아니라고 조심스럽게 언급합니다. 그들은 AI가 쓰는 모든 단어에 대해 완벽한 점수를 주는 법을 알아낸 것이 아닙니다. 대신, 그들은 안전망을 구축했습니다. 처벌에 상한선을 둠으로써, AI가 겁을 먹고 자신의 창의성을 포기하는 것을 방지한 것입니다.

이 논문은 AI가 자신감 있는 상황에서 실수를 할 때 가해지는 처벌에 "속도 제한"을 두는 것만으로도, AI의 마음을 열려 있고, 다양하며, 안정적으로 유지할 수 있음을 보여줍니다. 이는 때때로 초지능 로봇을 가르치는 가장 좋은 방법은 더 강하게 밀어붙이는 것이 아니라, 새로운 것을 시도할 때 사고가 나지 않도록 보장하는 것임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →