← 최신 논문
💬 NLP

CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization

본 논문은 올바른 생성과 거부된 생성을 모두 활용하여 대비적 보상 신호를 생성함으로써 결정적인 추론 단계를 정밀하게 식별하고 정보 누출을 방지하며 다중 모달 수학 추론 벤치마크에서 GRPO 와 같은 기존 베이스라인을 능가하는 새로운 RLVR 자기 증류 방법인 대비적 증거 정책 최적화 (CEPO) 를 소개합니다.

원저자: Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed, Rania Elbadry, Omar Fetouh, Fahad Shahbaz Khan, Salman Khan

게시일 2026-05-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed, Rania Elbadry, Omar Fetouh, Fahad Shahbaz Khan, Salman Khan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡한 수학 문제를 해결하도록 로봇을 가르친다고 상상해 보세요. 로봇이 문제를 풀게 하고, 정답을 맞히면 금색 별을 주고, 틀리면 "다시 시도해 보라"는 신호를 줍니다.

이것이 현재 AI 학습 방식 (RLVR) 입니다. 하지만 이 접근법에는 큰 문제가 있습니다: 로봇이 입력한 모든 단어에 대해 동일한 금색 별을 받습니다. 어떤 단어는 brilliant 통찰력일지라도, 다른 단어는 단순히 "음", "그래서", "따라서" 같은 말일지라도 말입니다.

이는 마치 학생이 한 문장만 훌륭하게 썼을 뿐 나머지는 채우기용 내용으로만 구성한 에세이에 대해, 교사가 그 학생에게 A+ 를 주는 것과 같습니다. 로봇은 어떤 특정 단어가 실제로 문제를 해결했는지 알지 못하므로, 학습이 느려지고 혼란에 빠집니다.

구식 해결책 (그리고 왜 실패했는지)

과학자들은 "좋아, 로봇이 쓰기 전에 정답을 알려주고, 그걸로 다르게 썼을지 보자"라고 말하며 이 문제를 해결하려 했습니다.

그러나 이는 **"정보 누출"**이라는 새로운 문제를 만들어냈습니다.

  • 비유: 시험을 치르는 학생이 부정행위를 한다고 상상해 보세요. 학생이 쓰면서 정답지를 알려주면, 학생은 수학을 배우는 대신 정답지를 외우게 됩니다. 그들은 실제로 의미가 없는 정답지처럼 보이는 것들을 쓰기 시작합니다. 해당 논문은 이전 방법들이 정확히 이렇게 했다고 밝혔습니다: AI 는 추론을 배우는 대신 정답을 외우며 "부정행위"를 하기 시작했습니다.

새로운 해결책: CEPO

저자들은 CEPO(Contrastive Evidence Policy Optimization)라는 새로운 방법을 제안합니다. 간단한 비유를 통해 작동 방식을 설명해 보겠습니다:

"선한 경찰, 나쁜 경찰" 심문
로봇에게 단순히 "정답을 맞혔나요?"라고 묻는 대신, CEPO 는 더 날카로운 질문을 합니다: "이 특정 단어가 정답을 얻는 데 도움이 되었나요, 그리고 틀린 답을 얻을 확률을 줄이는 데 도움이 되었나요?"

  1. 선한 교사 (정답): AI 는 정답을 보고 "정답이 맞다는 걸 알았다면 이 단어를 썼을까?"라고 묻습니다.
  2. 나쁜 교사 (오답): AI 는 이미 시도했지만 틀린 실패 사례를 보고 "틀린 답을 얻으려 했다면 이 단어를 썼을까?"라고 묻습니다.

마법 같은 비교:

  • "채우기" 단어: 만약 단어가 단순히 "따라서"나 "the"라면, 선한 교사와 나쁜 교사 모두 어차피 썼을 것입니다. 양측이 동의하므로 그 단어는 중립 점수를 받습니다. 추가 점수는 받지 못합니다.
  • 결정적인 단어: 만약 단어가 중요한 수학 단계 (예: "2 로 나누기") 라면, 선한 교사는 "네, 그게 필요해!"라고 말하지만 나쁜 교사는 "아니, 그렇게 하지 않을 거야!"라고 말합니다. 그들이 이견을 보이면 AI 는 깨닫습니다: "아하! 이 단어가 문제를 해결하는 열쇠야!" 이 단어는 막대한 점수 보상을 받습니다.

이것이 더 나은 이유

  • 부정행위 없음: AI 가 동일한 시도 묶음에서 "옳은" 경로와 "틀린" 경로를 비교하기 때문에, 정답이 학습 과정에 누출되지 않습니다. 안전을 유지하며 실제 논리를 학습합니다.
  • 정밀도: "the"나 "and"를 쓴 것에 대해 로봇을 칭찬하는 시간 낭비를 멈춥니다. 모든 칭찬을 실제로 퍼즐을 해결한 특정 단계에 집중합니다.

결과

이 논문은 기하학과 논리가 포함된 수학 문제를 사용하여 두 가지 크기의 AI 모델 (20 억 및 40 억 파라미터) 에서 이를 테스트했습니다.

  • 승자: CEPO 는 이전 최선 방법들을 일관되게 능가했습니다.
  • 패자: 정답을 누출하며 "부정행위"를 하려 했던 구식 방법들 (OPSD 와 SDPO) 은 실제로 학습되지 않은 로봇보다 더 나쁜 성능을 보였습니다. 이는 저자들의 이론이 옳았음을 증명했습니다: AI 가 정답을 외우지 못하도록 막지 않으면, 오히려 더 바보가 됩니다.

요약

CEPO 를 스마트 스포트라이트로 생각하세요. 전체 무대 (전체 문장) 에 밝은 빛을 비추는 대신, 실제로 펀치라인을 전달하는 배우에게만 초점을 맞춥니다. 배경 소음과 채우기 내용을 무시하여, AI 가 정답지를 실수로 외우는 것 없이 무엇이 해결책을 작동하게 했는지 정확히 학습하도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →