ReCo: Reweighting GRPO Against Distributional Concentration
이 논문은 응답 기여도를 정규화하고 중요도 비율을 분산 기반 스케일링으로 대체함으로써 GRPO가 고확률 응답과 토큰에 집중되는 경향을 완화하여, 작은 k에 대한 정확도를 희생하지 않으면서 수학적 추론 벤치마크에서 Pass@k 성능을 향상시키는 재가중치 방법인 ReCo를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 단순히 대화하는 것을 넘어, 수학 문제나 코딩 과제와 같은 복잡한 퍼즐을 실제로 '생각'하며 풀 수 있는 세상을 상상해 보세요. 이것이 인공지능의 최전선이며, 특히 '강화 학습(Reinforcement Learning)'이라 불리는 분야입니다. 이것은 마치 강아지를 훈련시키는 것과 같습니다. 단순히 강아지에게 무엇을 하라고 말하는 것이 아니라, 강아지가 직접 시도하게 하고, 만약 앉으면 간식을 주는 방식입니다. 만약 소파 위로 뛰어오르면 간식을 주지 않습니다. 시간이 흐르면서 강아지는 간식을 얻기 위해 앉는 법을 배웁니다. AI의 세계에서도 컴퓨터가 문제를 올바르게 해결하면 '보상(reward)'을 줍니다.
이 이러한 AI '강아지'들을 훈련하는 한 가지 인기 있는 방법은 '그룹 상대 정책 최적화(Group Relative Policy Optimization)', 즉 GRPO라고 불립니다. 예를 들어, AI에게 수학 문제를 열 번 풀어보라고 요청한다고 가정해 봅시다. AI는 열 개의 서로 다른 답을 생성합니다. GRPO는 이 열 개를 모두 살펴보고, 어떤 것들이 '간식'(정답)을 얻었는지 확인한 뒤, AI가 성공한 것들과 더 비슷해지도록 유도합니다. 이는 AI가 추론 능력을 향상시키는 데 매우 영리한 기술입니다. 하지만 여기에는 함정이 있습니다. 때때로 AI는 간식을 얻으려는 욕심에 너무 자신만만해져서 새로운 시도를 멈춰버리곤 합니다. AI는 똑같이 잘 작동할 수도 있는 다른 기발한 해결 방법들을 무시한 채, 자신이 아는 몇 가지 기술만을 반복해서 사용하기 시작합니다.
이것이 바로 서울대학교 연구진이 해결하고자 했던 퍼즐입니다. 연구진은 GRPO가 AI를 문제를 빠르게 푸는 데는 똑똑하게 만들지만, 여러 번의 기회를 주었을 때 오히려 AI를 덜 창의적으로 만들고 정답을 찾을 가능성을 낮춘다는 점을 발견했습니다. 그들은 이 문제를 '분포 집중(distributional concentration)'이라고 불렀습니다. 이는 AI가 이미 안전하다고 알고 있는 경로만을 탐색하느라 정체되어 버리는 현상을 뜻하는 멋진 표현입니다.
이를 해결하기 위해 연구진은 ReCo(Reweighting GRPO Against Distributional Concentration)라는 새로운 방법을 발명했습니다. 이 방법이 어떻게 작동하는지 간단한 비유를 통해 설명해 보겠습니다.
당신이 똑같은 까다로운 수학 문제를 풀고 있는 학생들을 채점하는 선생님이라고 상상해 보세요.
- 기존 방식 (GRPO): 당신은 반 학생들에게 답을 적으라고 합니다. 만약 다섯 명의 학생이 모두 똑같은 풀이 과정을 적었다면(그것이 가장 대중적인 방법이기 때문에), 당신은 그 풀이에 엄청난 주목을 줍니다. 그리고 학급 전체에 이렇게 말합니다. "보세요! 다섯 명이나 이렇게 했습니다! 모두 이렇게 하세요!" 이때, 독특하고 창의적인 방법을 시도하여 정답을 맞힌 단 한 명의 학생은, 그 학생이 유일했기 때문에 무시됩니다. 결국 학 class는 새로운 시도를 멈추고 인기 있는 답을 그대로 베끼게 됩니다.
- 새로운 방식 (ReCo): 선생님(ReCo)은 이러한 편향을 알아차립니다. 먼저, 선생님은 만약 다섯 명의 학생이 같은 답을 적었다면, 그것은 그 답이 반드시 유일하게 좋은 답이라서가 아니라 단지 찾기 쉬웠기 때문일 것이라고 판단합니다. 그래서 선생님은 그 인기 있는 답의 중요도를 낮춥니다. 선생님은 이렇게 말합니다. "좋아요, 여러분 중 다섯 명이 이 답을 썼지만, 워낙 흔한 답이었기 때문에 독특한 해결책만큼의 가치는 없습니다." 이는 학급이 맹목적으로 군중을 따라가는 것을 막아줍니다.
- 두 번째 기술: 선생님은 또한 학생들이 '어떻게' 생각하고 있는지도 살펴봅니다. 만약 어떤 학생이 특정 단계에서 99% 확신하고 있다면, 선생님은 이렇게 말합니다. "좋아요, 자신감은 좋지만 너무 자만하지 마세요! 여전히 아주 작은 확률로 틀릴 수도 있으니, 다른 가능성에도 마음을 열어두세요." 하지만 만약 학생이 갈림길에서 어느 길로 가야 할지 몰라 망설이고 있다면, 선생님은 그 불확실성을 탐색하도록 큰 격려를 보냅니다. 이는 학생들이 너무 일찍 하나의 경직된 사고방식에 갇히는 것을 방지합니다.
이 두 가지 기술을 사용하여 ReCo는 AI가 학습하는 방식을 바꿉니다. ReCo는 AI가 단순히 '안전한' 답을 암기하는 것을 막고, 다양한 경로를 계속 탐색하도록 강제합니다.
연구진은 이 새로운 방법을 AIME(미국 수학 초청 시험)나 올림피아드 문제와 같은 매우 어려운 수학 경시 대회에서 테스트했습니다. 그들은 Qwen이나 Llama를 기반으로 한 다양한 AI 모델을 사용했습니다. 결과는 유망했습니다. AI에게 단 몇 번의 기회만 주었을 때는 ReCo가 기존 방식만큼 잘 수행했습니다. 하지만 AI에게 많은 시도 기회(예를 들어 64개의 서로 다른 답을 생성하고 그중 최고를 고르는 것)를 주었을 때, ReCo는 진가를 발휘했습니다. ReCo는 기존 방식이 완전히 놓쳤던 정답들을 찾아냈습니다.
실제로 가장 어려운 테스트들에서, 기존 방식(GRPO)은 많은 시도가 주어졌을 때 오히려 훈련받지 않은 원래의 AI보다 성능이 떨어졌는데, 이는 AI가 너무 편협해졌기 때문입니다. 그러나 ReCo는 AI의 '마음'을 열린 상태로 유지했습니다. ReCo는 다양한 해결책을 찾아내는 능력을 보존하여, 설령 처음 몇 번의 시도가 실패하더라도 AI가 사용할 수 있는 다양한 전략의 도구 상자를 갖추도록 보장했습니다.
연구진은 또한 왜 이런 일이 일날지 살펴보았습니다. 그들은 기존 방식 아래에서 AI의 '사고 과정'이 마치 고장 난 레코드판이 같은 노래를 반복하는 것처럼 매우 반복적으로 변한다는 것을 확인했습니다. ReCo 아래에서 AI는 동일한 문제를 풀 때조차 독특하고 다양한 접근 방식을 계속 생성했습니다. 그것은 마치 교과서를 베끼는 대신, 도표를 그리고, 다양한 공식을 사용하며, 심지어 개념을 이해하기 위해 물리적인 모델까지 만드는 학생을 보는 것과 같았습니다.
요약하자면, ReCo는 AI를 진정으로 똑똑하게 만들기 위해서는 단순히 정답을 빠르게 맞히는 것에 보상하는 것만으로는 부족하다는 것을 시사합니다. 우리는 AI가 정체되지 않도록 하는 것에도 보상해야 합니다. 다양성과 불확실성의 가치를 부여함으로써, 연구진은 AI가 호기심을 갖고 창의적이며, 우리가 예상치 못한 방식으로 문제를 해결할 수 있도록 유지하는 방법을 찾아냈습니다. 이는 때때로 가장 좋은 학습 방법은 자신의 선택지를 열어두는 것임을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.