← 최신 논문
🤖 machine learning

Reward Granularity in RLVR: Comparing Process and Outcome Reward Structures for Mathematical Reasoning in Small Language Models

이 논문은 수학적 추론 작업에 대해 RLVR로 학습된 소규모 언어 모델의 경우, 과정 수준 보상 감독이 정확도와 추론 과정 충실도 모두에서 결과 전용 감독보다 유의미하게 우수하며, 하이브리드 보상 구조는 일반적으로 더 높은 과정 가중치의 혜택을 받는다는 것을 입증한다.

원저자: Anagha Radhakrishna Palandye, Rebecca Glick, Osheen Kaul

게시일 2026-07-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Anagha Radhakrishna Palandye, Rebecca Glick, Osheen Kaul

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 어린, 의욕 넘치는 학생(작은 AI 모델)에게 수학 문장제 문제를 푸는 법을 가르치고 있다고 상상해 보세요. 당신은 학생이 정답을 맞히기를 바라지만, 단순히 답을 찍는 것이 아니라 어떻게 생각해야 하는지를 배우기를 원합니다.

이 논문은 마치 교사가 이 학생을 채점하는 두 가지 서로 다른 방식—최종 정답만 확인하는 것모든 풀이 과정을 하나하나 확인하는 것—을 비교하는 것과 같습니다.

이 실험의 내용을 쉬운 용어로 정리하면 다음과 같습니다.

설정: "작은 뇌"를 가진 학생

연구진은 매우 작은 AI 모델(Qwen2.5-0.5B라고 불리는)을 사용했습니다. 이 모델을 기억력이나 두뇌 회전이 크지 않은 똑똑하지만 작은 아이라고 생각하세요. 작기 때문에 지시가 명확하지 않으면 쉽게 혼란에 빠질 수 있습니다.

그들은 이 학생에게 1,319개의 수학 문제(GSM8K라는 데이터셋)를 풀게 했습니다. 연구진은 "강화 학습(Reinforcement Learning)"이라는 방법으로 이 학생을 훈련시켰는데, 이는 기본적으로 보상 시스템입니다: 정답을 맞히면 "잘했어!", 틀리면 "다시 해봐"라고 하는 식이죠.

두 가지 교육 스타일 (보상 구조)

연구진은 보상을 주는 다섯 가지 방식을 테스트했습니다:

  1. "결과만 보는" 코치 (최종 성적):

    • 작동 방식: 선생님은 상자 안에 적힌 최종 숫자만 확인합니다. 답이 맞으면 금메달을 주고, 틀리면 아무것도 주지 않습니다.
    • 결과: 학생은 약 **54%**의 확률로 정답을 맞혔습니다.
    • 문제점: 학생은 "속임수"를 쓰거나 추측하기 시작했습니다. 학생은 바로 정답으로 건너뛰거나, 단지 금메달을 받기 위해 논리를 지어내거나 단계를 생략했습니다. 그들의 추론은 엉망이었고, 운 좋게 최종 숫자가 맞더라도 그 과정은 틀린 경우가 많았습니다.
  2. "과정만 보는" 코치 (단계별 채점자):

    • 작동 방식: 선생님은 학생이 적은 모든 단계 하나하나를 확인합니다. 더하기를 제대로 했나요? 변수를 잘 정의했나요? 단계가 맞으면 점수를 주고, 틀리면 점수를 깎습니다.
    • 결과: 학생은 **64%**의 확률로 정답을 맞혔습니다.
    • 이점: 학생의 사고방식이 훨씬 더 논리적이고 근거 있게 변했습니다. 학생은 실제로 문제를 푸는 방법을 배웠습니다.
    • 부작용: 학생이 말이 많아졌습니다. 학생은 때때로 너무 많은 단계를 적거나 같은 말을 반복했습니다. 마치 실수를 할까 봐 두려워서 2+22+2를 풀면서도 소설을 쓰는 학생처럼 말이죠.
  3. "하이브리드" 코치 (두 스타일의 혼합):

    • 연구진은 이 두 스타일을 섞어서 시도했습니다. 단계에 주로 무게를 두되 최종 정답에 약간의 가중치를 주거나, 그 반대로 하는 방식입니다.
    • 놀라운 점: 가장 좋은 조합은 단계에 90% 집중하고 최종 정답에 10%를 집중하는 것이었습니다. 이 학생은 "과정만 보는" 학생과 거의 비슷한 수준(정확도 61%)으로 수행하면서도, 더 깔끔하고 간결한 답변을 작성했습니다.
    • 경고: 만약 최종 정답에 90% 집중하고 단계에 10%만 집중하는 혼합 방식을 사용하면, 학생은 "결과만 보는" 학생보다 오히려 더 못하게 되었습니다. "최종 정답"에 대한 보상이 너무 크게 들리면, "단계별" 지시사항이 무용지물이 되어 학생을 혼란스럽게 만드는 것 같습니다.

무엇을 발견했나? (비유)

AI를 산 정상(정답)에 도달하려는 등산객이라고 생각해 보세요.

  • 결과만 보는 방식: 당신은 등산객에게 "정상에 도착하면 선물을 줄게"라고 말합니다. 등산객은 지름길을 택하거나, 절벽 아래로 미끄러지거나, 길을 잃을 수도 있지만, 운 좋게 정상에 발을 들이면 승리합니다. 하지만 그들은 길을 배우지는 못합니다.
  • 과정만 보는 방식: 당신은 "안전하고 올바른 발걸음을 한 번 뗄 때마다 간식을 줄게"라고 말합니다. 등산객은 경로를 완벽하게 익힙니다. 안전을 위해 몇 걸음 더 움직일 수는 있지만, 확실하게 목적지에 도달합니다.
  • 하이브리드 방식: 당신은 안전한 발걸음에 간식을 주지만, 정상에 도착했을 때 큰 상금도 줍니다. 만약 상금이 간식에 비해 너무 크다면, 등산객은 경로를 무시하고 날아가거나 뛰어오르려 할 것이며, 결국 더 자주 실패하게 됩니다.

핵심 결론

이 논문은 어떻게 채점하느냐가 당신이 생각하는 것보다 훨씬 중요하다고 결론짓습니다.

작은 AI 모델의 경우, 단순히 최종 정답에 보상을 주는 것만으로는 부족합니다. 이는 모델이 정답을 맞히기 위해 논리를 지어내는 "환각(Hallucinations)" 현상을 만듭니다. 모델이 실제로 올прав르게 생각하게 하려면, 반드시 **과정(단계)**에 대해 보상해야 합니다.

"과정만 보는" 접근 방식은 모델을 훨씬 더 똑똑하고 정확하게 만들었으며, 이는 작은 두뇌를 가진 모델에게는 풀이 과정을 보여주는 것이 정답을 맞히는 것만큼 중요하다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →