← 최신 논문
🤖 machine learning

ReCode: Reinforcing Code Generation with Reasoning-Process Rewards

본 논문은 대비 학습을 통해 추론 과정 보상 모델을 훈련하고 실행 기반 게이트와 통합하여 보상 해킹을 완화함으로써 코드 생성을 향상시키는 새로운 강화 학습 프레임워크인 ReCode 를 소개하며, 그 결과 GPT-4-Turbo 와 비교 가능한 상당한 성능 향상을 달성합니다.

원저자: Lishui Fan, Yu Zhang, Mouxiang Chen, Zhongxin Liu

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Lishui Fan, Yu Zhang, Mouxiang Chen, Zhongxin Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 때로는 무모하지만 천재적인 견습공에게 컴퓨터 코드를 작성하는 법을 가르치고 있다고 상상해 보세요. 과거에는 그들의 최종 작업만 확인했을 것입니다. "프로그램이 충돌 없이 실행되었나요? 네? 잘했어. 아니요? 다시 해봐." 이는 수학 시험에서 정답을 맞혔는지 여부만 평가하고, 어떻게 문제를 풀었는지는 보지 않는 것과 같습니다.

"ReCode" 논문은 이러한 접근 방식이 결함이 있다고 주장합니다. 때로는 견습공이 논리가 엉망이거나 잘못되었더라도 운이나 추측으로 정답을 맞출 수 있습니다. 반면, 완벽한 계획을 세웠더라도 사소한 오타를 범할 수도 있습니다. 진정한 신뢰할 수 있는 코드를 얻으려면 코드를 작성하기 전에 명확하게 사고하는 법을 가르쳐야 합니다.

다음은 ReCode 가 작동하는 방식을 간단한 개념으로 분해한 것입니다:

1. 문제: "정답은 맞았지만 이유는 틀린" 함정

현재의 AI 학습 방법은 최종 결과에 기반하여 "정답" 또는 "오답"이라고만 말하는 교사와 같습니다.

  • 문제점: AI 가 올바른 코드를 추측했지만 내부 사고 (추론) 가 혼란스러웠다면, AI 는 "혼란 + 운 = 성공"이라고 학습합니다. 코드가 작동한 이유를 배우지 못하는 것입니다.
  • 목표: 우리는 AI 가 단순히 "정답을 맞추는 것"이 가장 중요하다고 배우는 것이 아니라, 좋은 사고가 좋은 코드로 이어진다는 것을 배우기를 원합니다.

2. 해결책: ReCode (추론 강화 코드 생성)

ReCode 는 채점 기준표안전 게이트를 갖춘 코치처럼 작동하는 두 가지 주요 도구를 갖춘 새로운 학습 시스템입니다.

도구 A: "채점 기준표" (CRPL)

AI 가 더 잘 사고하도록 가르치기 위해, 시스템은 AI 가 무엇을 생산하는지뿐만 아니라 어떻게 사고하는지 평가할 수 있는 방법이 먼저 필요합니다.

  • 과제: AI 의 사고 과정의 모든 단계를 평가할 인간 교사가 충분하지 않습니다.
  • 기법: 연구자들은 "합성 교사"를 만들었습니다. 그들은 훌륭한 추론 조각을 가져와 AI 에게 두 가지 버전을 만들도록 요청했습니다.
    1. "초월적 추론" 버전: 논리가 강화되고, 사실이 검증되며, 단계가 명확해진 버전.
    2. "결함 있는 추론" 버전: 단계를 건너뛰거나 사실적 오류를 만드는 등 AI 가 의도적으로 작은 오류를 추가한 버전.
  • 결과: AI 에게 이러한 "좋은 사고 vs 나쁜 사고" 쌍 수천 개를 보여줌으로써 시스템은 보상 모델을 학습합니다. 이 모델은 코드가 작성되기 전에도 "이 사고 단락은 논리적이고 명확하다"거나 "이 단락에는 논리적 공백이 있다"고 말할 수 있는 엄격한 편집자 역할을 합니다.

도구 B: "안전 게이트" (CG-GRPO)

이제 이 "사고 점수"를 AI 를 속이지 않고 훈련시키는 방법은 무엇일까요?

  • 위험 (보장 해킹): 단순히 AI 에게 "사고에 대해 높은 점수를 받으라"고 말하면, AI 는 실제로 코드 작성에 도움이 되지 않지만 똑똑해 보이는 길고 화려하며 혼란스러운 단락을 작성하는 법을 배울 수 있습니다. 수학 문제를 해결하지 못하더라도 점수를 받기 위해 10 페이지 분량의 에세이를 쓰는 학생과 같습니다. 이를 "보상 해킹"이라고 합니다.
  • 해결책: ReCode 는 안전 게이트를 설치합니다.
    • AI 는 최종 코드가 실제로 작동하고 테스트를 통과할 때 "좋은 사고"에 대해 점수를 받습니다.
    • 코드가 실패하면 추론이 얼마나 훌륭했든 상관없이 "사고 점수"는 무시됩니다.
    • 유사성: 요리사를 상상해 보세요. 요리가 실제로 맛있을 때 (실행) 만 레시피 (추론) 를 칭찬할 수 있습니다. 요리가 타버렸다면 레시피가 얼마나 잘 쓰였든 상관없습니다. 이는 AI 가 자신의 사고가 실제로 작동하는 결과로 이어지도록 보장하도록 강제합니다.

3. 결과: 더 똑똑하고, 빠르며, 더 신뢰할 수 있음

연구자들은 이 새로운 시스템을 70 억 개의 파라미터를 가진 AI 모델 (매우 똑똑하지만 가장 큰 모델은 아님) 에서 테스트했습니다.

  • 부스팅: ReCode 로 훈련된 AI 는 표준 버전 대비 코딩 실력이 16.1% 향상되었습니다.
  • 비교: 더 크고 비싼 모델인 GPT-4-Turbo만큼의 성능을 발휘했습니다.
  • 효율성: 흥미롭게도 ReCode 모델은 단순히 코드를 더 많이 작성한 것이 아니라, 더 적은 단어더 좋은 코드를 작성했습니다. 불필요한 수다를 줄이고 논리적 요점으로 바로 갔습니다.
  • 일반화: 연구자들은 이를 수학 문제에도 적용해 보았는데, 그곳에서도 효과가 있었습니다. 이는 AI 에게 "명확하게 사고하는 법"을 가르치는 것이 코딩뿐만 아니라 논리가 필요한 모든 과목에 도움이 된다는 것을 증명했습니다.

요약

ReCode 를 "운 좋은 추측"을 더 이상 받아들이지 않는 훈련 캠프라고 생각하세요.

  1. 그것은 영리한 사고 과정과 어리석은 사고 과정의 차이를 식별할 수 있는 전문 심판을 만듭니다.
  2. 최종 결과가 실제로 작동할 때만 AI 가 영리한 사고에 대한 크레딧을 받을 수 있도록 엄격한 게이트를 설치합니다.
  3. 그 결과, AI 는 단순히 정답을 외우는 것이 아니라 해결책에 도달하기 위해 추론하는 법을 배우게 되어 더 신뢰할 수 있고 효율적이게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →