← 최신 논문
💻 computer science

Mitigating Think-Answer Mismatch in Large Language Model Reasoning Through Noise-Aware Advantage Reweighting

이 논문은 노이즈가 있는 보상 조건에서 표준 GRPO보다 우수한 강건성과 성능을 달성하기 위해 노이즈 인지형 어드밴티지 가중치를 도출함으로써, 대규모 추론 모델의 "사고-답변 불일치(Think-Answer Mismatch)"를 완화하는 새로운 방법인 Stable Group-Relative Policy Optimization (S-GRPO)을 소개한다.

원저자: Danhao Zhu, Peijun Shen, Si Shen

게시일 2026-08-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Danhao Zhu, Peijun Shen, Si Shen

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 까다로운 수학 퍼즐을 푸는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇의 사고 과정 하나하나를 일일이 채점하며 옆에 앉아 있고 싶지 않습니다. 대신, 그저 최종 정답만을 확인합니다. 로봇이 정답을 맞히면 하이파이브(보상)를 해주고, 틀리면 부드럽게 "다시 시도해 봐"라고 말합니다. 이것이 바로 많은 현대 AI 모델들이 추론을 학습하는 방식입니다. 즉, 여러 가지 다양한 시도를 생성하게 하고, 그중 어떤 것이 목표에 도달했는지 확인한 뒤, 승리한 방식을 복제하도록 배우는 것입니다. 이 방법은 '그룹 상대 정책 최적화(Group-Relative Policy Optimization)', 줄여서 GRPO라고 불립니다. 이는 선생님이 지저지는 연습장 대신 오직 최종 시험 점수만을 채점하는 교실과 같습니다.

하지만 여기 함정이 있습니다. 때때로 학생이 잘못된 이유로 정답을 맞힐 때가 있습니다. 아마도 찍었거나, 혹은 첫 번째 단계에서 실수를 했지만 세 번째 단계에서 우연히 이를 바로잡았을 수도 있습니다. AI 세계에서는 이를 '사고-정답 불일치(Think-Answer Mismatch)'라고 부릅니다. 로봇은 보상을 받았기 때문에 자신이 천재라고 착각하지만, 사실은 운이 좋았던 것뿐입니다. 만약 선생님(AI 트레이너)이 이러한 운 좋은 추측을 알아차리지 못한다면, 로봇은 잘못된 교훈을 배우게 됩니다. 이 논문은 선생님이 이러한 운 좋은 추측들 때문에 혼란스러워질 때 어떤 일이 발생하는지, 그리고 피드백이 다소 노이즈가 섞여 있더라도 로봇이 '올바른' 방식으로 생각하도록 학습을 어떻게 수정할 수 있는지에 대해 질문을 던집니다.

이 연구를 진행한 연구진인 단하오 주(Danhao Zhu), 페이준 션(Peijun Shen), 시 션(Si Shen)은 이 로봇들을 훈련시키는 표준적인 방식(GRPO)에 비밀스러운 약점이 있다는 것을 발견했습니다. 그들은 로봇의 시도 그룹이 매우 불균형할 때—예를 들어, 일곱 개의 오답과 단 하나의 정답만 있을 때—그 단 하나의 '운 좋은' 정답이 시스템을 속여 엄청난 성공인 것처럼 착각하게 만들 수 있다는 것을 발견했습니다. 이는 마치 동전을 여덟 번 던졌는데 일곱 번은 뒷면이 나오고 한 번만 앞면이 나온 상황과 같습니다. 그 한 번의 앞면은 기적처럼 보일 수 있지만, 실제로는 단순한 요행일 뿐입니다. 불균형한 그룹 내에서 이러한 요행은 학습 신호를 너무 심하게 왜곡하여, 특히 '운 좋은 추측'이 자주 발생할 경우 로봇이 효과적으로 학습하는 것을 방해합니다.

이를 해결하기 위해 연구팀은 **안정적 그룹 상대 정책 최적화(Stable Group-Relative Policy Optimization, S-GRPO)**라는 새로운 방법을 발명했습니다. S-GRPO를 점수만 보는 것이 아니라 학급 전체의 '분위기'까지 살피는 아주 똑똑한 선생님이라고 생각해 보세요. 만약 반 학생들이 대부분 낙제하고 단 한 명의 학생만 정답을 맞혔다면, 선생님은 의구심을 갖습니다. "이 학생이 정말 똑똑한 걸까, 아니면 그냥 찍은 걸까?" S-GRPO는 특수한 수학적 기법을 사용하여 교실 안에 얼마나 많은 노이즈나 혼란이 있는지 계산합니다. 그룹이 불균형할 경우, 이 방식은 그 단 하나의 '승자'가 다른 모든 사람의 목소리를 덮어버리지 않도록 자동으로 그 목소리의 볼륨을 낮춥니다. 이는 본질적으로 "그룹의 상태가 수상쩍으므로, 이 보상을 덜 신뢰하겠다"라고 말하는 것과 같습니다.

연구진은 '정답' 중 20%가 실제로 운 좋은 추측(노이즈)이었던 상황을 시뮬레이션하여 이 아이디어를 테스트했습니다. 이 혼란스러운 환경에서 기존의 GRPO 방식은 완전히 무너졌으며, 로봇들은 학습을 멈추고 혼란에 빠졌습니다. 그러나 S-GR포(S-GRPO)는 침착함을 유지했습니다. S-GRPO는 노이즈가 섞인 신호를 무시하고 로봇들이 올바른 궤도를 유지하도록 했습니다. 다양한 로봇 두뇌(Qwen 및 Llama 모델 등)를 사용하여 실제 수학 문제로 테스트했을 때, S-GRPO는 일관되게 기존 방식들을 압도했습니다. S-GRPO는 전반적으로 로봇의 수학 점수를 약 2.2%에서 2.5% 정도 향상시켰습니다.

아마도 가장 흥고한 발견은 학습이 얼마나 안정적으로 변했는가 하는 점일 것입니다. 기존 방식이 피드백이 엉망일 때 허우적거렸던 반면, S-GRPO는 학습 과정을 매끄럽게 만들었습니다. 로봇들은 단순히 수학을 더 잘하게 된 것이 아니라, 자신감의 급격한 변화 없이 더 안정적으로 생각하는 법을 배웠습니다. 이 논문은 '운 좋은 추측'이 존재한다는 사실을 인정하고 이를 고려하도록 수학을 조정하는 것만으로도, 훨씬 더 신뢰할 수 있는 AI 사고 능력을 구축할 수 있음을 시사합니다. 이는 단순한 미세 조정이 아닙니다. 이는 답이 항상 완벽하지 않고 운이 작용하는 실제 세상에서도 AI 훈련이 견고하게 작동할 수 있도록 만드는 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →