← 최신 논문
💬 NLP

Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards

이 논문은 검증 가능한 보상을 갖는 강화학습에서 희소한 보상을 극복하기 위해 실패한 궤적을 자기지도식 수정 신호로 변환하는 새로운 방법인 수정 지향 정책 최적화 (CIPO) 를 제안하며, 이를 통해 수학 및 코딩 벤치마크 전반에 걸쳐 대규모 언어 모델의 추론 및 오류 수정 능력을 크게 향상시킵니다.

원저자: Mengjie Ren, Jie Lou, Boxi Cao, Xueru Wen, Hongyu Lin, Xianpei Han, Le Sun, Xing Yu, Yaojie Lu

게시일 2026-05-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mengjie Ren, Jie Lou, Boxi Cao, Xueru Wen, Hongyu Lin, Xianpei Han, Le Sun, Xing Yu, Yaojie Lu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신은 재능은 있지만 고집이 센 학생에게 복잡한 수학 문제를 풀거나 컴퓨터 코드를 작성하는 법을 가르치고 있습니다. 당신은 그들에게 문제를 주고, 그들이 해결하려고 시도하게 한 다음, 정답을 확인합니다.

기존 방식 (표준 RLVR):
현재의 표준 방법 (RLVR 라고 함) 에서는, 학생이 정답을 맞추면 금색 스타를 줍니다. 틀리면 단순히 "아니오, 틀렸습니다"라고 말하고 넘어갑니다.

문제는 "아니오"라는 말이 별로 도움이 되지 않는다는 점입니다.

  • 마지막 단계에서 아주 작은 계산 실수를 했을까요?
  • 첫 문장을 오해했을까요?
  • 올바른 논리를 사용했지만 잘못된 도구를 선택했을까요?

기존 방법은 이러한 다양한 실수들을 모두 정확히 동일한 것, 즉 실패로 취급합니다. 단순히 학생에게 "그런 행동을 줄여라"라고 말할 뿐입니다. 실수 속에 숨겨진 귀중한 교훈을 버려버리는 것입니다. 이는 코치가 운동선수에게 "슛을 놓쳤다"고 말만 하고 다음을 위해 어떻게 조준을 수정해야 하는지 설명하지 않는 것과 같습니다.

새로운 방식 (CIPO):
이 논문은 CIPO(Correction-Oriented Policy Optimization, 교정 지향 정책 최적화) 라는 새로운 방법을 소개합니다. 단순히 "틀렸다"고 말하는 대신, CIPO 는 실수를 두 번째 기회로 바꿉니다.

창의적인 비유를 사용하여 작동 방식을 설명해 보겠습니다:

1. "다시 하기" 전략

상상해 보세요. 학생이 실수를 했습니다. 그 시도를 폐기하는 대신, 교사는 말합니다:

"좋아, 너는 이 문제를 풀려고 시도했고 3 단계에서 막혔구나. 이제 너 자신의 틀린 답을 보고, 그것을 수정하여 올바른 결과를 얻어봐."

학생은 자신의 실수를 바라보고, 어디가 잘못되었는지 이해하며, 수정된 솔루션을 생성하도록 강요받습니다.

  • 이것이 도움이 되는 이유: 학생이 거의 맞았다면 ("간신히 놓친 경우"), 쉽게 수정할 수 있습니다. 이는 그 특정 유형의 실수를 어떻게 수정해야 하는지 정확히 가르쳐 줍니다. 완전히 길을 잃었다면 여전히 실패할 수 있지만, 시스템은 이 특정 경로가 막다른 길임을 학습합니다.
  • 결과: 학생은 문제를 푸는 법뿐만 아니라 자신의 사고를 디버깅하고 수정하는 법도 배우게 됩니다.

2. "스마트 재생목록" (적응형 재생)

학생에게 매일 가장 어렵고 혼란스러운 실수만 연습하게 한다면, 그들은 좌절감을 느끼고 이미 알고 있던 쉬운 것들을 잊어버릴 수 있습니다.

CIPO 는 스마트 재생목록을 사용합니다:

  • "어려운" 실패 시도와 "쉬운" 성공 시도를 섞습니다.
  • 학생의 수행을 관찰합니다. 쉬운 것들을 잊기 시작하면 재생목록이 자동으로 더 많은 "성공" 예시를 재생하여 자신감을 유지시킵니다.
  • 그들이 훌륭하게 해내고 있다면, 더 많은 "실패" 예시를 재생하여 더 나아가도록 밀어붙입니다.
  • 목표: 새로운 것을 배우는 것과 이미 알고 있는 것을 잃지 않는 것 사이의 균형을 맞춥니다.

3. "안전망" (위험 회피형 형성)

때로는 학생이 실수를 수정하려고 시도할 때, 실수로 상황을 더 악화시키거나 이전에 알던 규칙을 잊어버릴 수 있습니다.

CIPO 에는 안전망이 있습니다:

  • 학생이 올바른 아이디어로 시작하지만 수정 과정에서 엉망이 되면, 시스템은 "이중 페널티"를 부여합니다.
  • 이는 학생에게 "실수만 고치지 말고, 이미 작동하던 부분들을 망치지 않도록 하라"고 가르칩니다. 이를 통해 학생들이 "과도하게 수정"되어 원래의 기술을 잃는 것을 방지합니다.

4. "골디락스" 구역 (난이도 선호)

시스템은 어떤 실수를 연습할지 지능적으로 결정합니다.

  • 너무 쉬운 문제 (학생이 이미 알고 있는 문제) 는 무시합니다.
  • 불가능할 정도로 어려운 문제 (학생이 아직 배울 수 없는 문제) 도 무시합니다.
  • **"골디락스 구역"**에 집중합니다: 약간만 도와주면 해결 가능할 정도로 충분히 어려운 문제들입니다. 여기서 가장 많은 학습이 일어납니다.

결과

연구자들은 이 방법을 어려운 수학 경시대회와 코딩 작업을 포함한 11 가지 다른 도전 과제에서 테스트했습니다.

  • 더 나은 추론: CIPO 로 훈련된 모델들은 처음부터 문제를 해결하는 능력이 크게 향상되었습니다.
  • 더 나은 수정: 그들은 또한 틀린 답을 받아 올바른 답으로 바꾸는 능력 (이를 "수정"이라고 함) 에서 훨씬 더 나아졌습니다.
  • 실제 개선: 이 논문은 이것이 단순히 모델이 답을 외우는 것이 아니라, 실제로 모델의 사고와 추론 능력을 내부적으로 향상시켰음을 보여줍니다.

요약하자면:
CIPO 는 AI 가 실패로부터 학습하는 방식을 바꿉니다. 단순히 실수를 처벌하는 대신, 실수를 AI 가 자신의 실수를 발견하고 수정하는 법을 가르치는 훈련장으로 활용하며, 동시에 이미 알고 있는 것을 잊지 않도록 주의 깊게 지켜봅니다. 이는 "실패"를 상세한 단계별 수업 계획으로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →