← 최신 논문
💬 NLP

Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States

본 논문은 정책 모델의 내부 상태에 대해 훈련된 경량 프로브를 활용하여 거의 비용 없이 가치 기준을 추정함으로써 별도의 비평가나 여러 번의 롤아웃에 따른 계산 오버헤드 없이 안정적이고 효율적인 정책 최적화를 달성하는 강화 학습 방법인 POISE를 소개합니다.

원저자: Yunho Choi, Jongwon Lim, Woojin Ahn, Minjae Oh, Jeonghoon Shim, Yohan Jo

게시일 2026-05-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yunho Choi, Jongwon Lim, Woojin Ahn, Minjae Oh, Jeonghoon Shim, Yohan Jo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신은 매우 똑똑하지만 비용이 매우 많이 드는 학생 (대규모 언어 모델) 에게 복잡한 수학 문제를 푸는 법을 가르치고 있습니다. 당신이 그들을 더 잘 성장시키고 싶기 때문에 **강화 학습 (Reinforcement Learning)**이라는 방법을 사용합니다. 이 방법에서 학생은 문제를 풀고, 정답을 맞추면 점수 (보상) 를 받습니다.

그들을 효과적으로 가르치기 위해서는 그들이 무엇을 맞췄는지뿐만 아니라, 평소의 성과에 비해 얼마나 더 잘했는지도 알려주어야 합니다. 이 '차이'를 **어드밴티지 (advantage)**라고 합니다. 이를 계산하려면 **기준선 (baseline)**이 필요한데, 이는 학생이 그 특정 문제에서 일반적으로 얻을 점수에 대한 추측입니다.

문제: 추측의 비용

현재 이 기준선을 얻는 두 가지 주요 방법이 있으며, 둘 다 비용이 많이 듭니다:

  1. "거대한 튜터" 방법 (PPO): 비평가 역할을 하기 위해 두 번째로 크고 비싼 AI 모델을 고용합니다. 이 비평가는 학생의 작업을 지켜보며 점수를 추측합니다. 이는 두 개의 거대한 모델을 동시에 실행하기 때문에 컴퓨팅 비용을 두 배로 늘립니다.
  2. "그룹 평균" 방법 (GRPO): 학생에게 같은 문제를 8 번 연속으로 풀게 합니다. 그런 다음 그 8 개의 점수를 평균내어 기준선을 얻습니다. 이는 기준선을 얻기 위해 7 개의 추가 답변을 생성하기 때문에 시간과 돈을 많이 낭비하며, 새로운 문제를 시도할 여지를 줄입니다.

해결책: POISE (학생 자신의 직관)

이 논문의 저자들은 POISE(Policy Optimization with Internal State Value Estimation, 내부 상태 가치 추정을 통한 정책 최적화) 라는 새로운 방법을 제안합니다.

핵심 아이디어는 다음과 같습니다: 학생은 문제를 풀기 시작하기 전에 이미 그 문제의 난이도를 알고 있습니다.

대규모 AI 모델이 생각할 때, 질문에서 답으로 이동하는 과정에서 "내부 생각 (hidden states)"이라는 흔적을 생성합니다. 이 논문은 이러한 내부 생각들이 성공할 가능성에 대한 숨겨진 신호를 포함하고 있다고 주장합니다. 마치 학생이 직감을 갖는 것과 같습니다: "이 단계는 어렵네; 아마도 맞출 수 없을 거야" 또는 "이건 쉬워 보이네; 자신 있어."

POISE 는 다음과 같이 작동합니다:

  1. 경량 프로브 (Lightweight Probe): 두 번째 거대한 AI 를 고용하는 대신, 학생의 뇌에 작고 저렴한 "프로브 (probe)" (간단한 계산기 같은 것) 를 연결합니다.
  2. 신호 읽기: 이 프로브는 학생이 생각하는 동안의 내부 생각 (hidden states) 과 "불확실성 (entropy)"을 살펴봅니다.
  3. 예측: 프로브는 이러한 내부 신호를 기반으로 점수를 예측합니다.
  4. 공정성 트릭 (Cross-Rollout): 학생이 점수를 추측하기 위해 자신의 답변을 훔쳐보는 것을 방지하기 위해 시스템은 교묘한 트릭을 사용합니다. 학생에게 문제를 두 번 풀게 합니다. 첫 번째 시도를 채점할 때, 프로브는 두 번째 시도의 내부 생각을 보고, 그 반대의 경우도 마찬가지입니다. 이렇게 하면 기준선이 공정하고 편향되지 않도록 보장합니다.

이것이 중요한 이유

  • 더 저렴합니다: 두 번째 거대한 AI 모델이 필요 없습니다. 학생이 이미 생성하고 있는 신호에 작은 프로브만 사용하면 됩니다.
  • 더 빠릅니다: 기준선을 얻기 위해 8 개의 답변을 생성할 필요가 없습니다. 하나를 풀고, 하나를 채점 보조로 사용하는 2 개만 필요합니다. 이렇게 하면 컴퓨터 예산을 다른 많은 문제를 시도하는 데 사용할 수 있어 학생이 더 빠르게 학습할 수 있습니다.
  • 안정적입니다: 더 다양한 문제를 시도할 수 있기 때문에 학습 과정이 덜 "노이즈"가 많고 더 안정적입니다.

결과

연구자들은 수학 추론 작업 (올림피아드 수학 등) 에서 이를 테스트했습니다. 그 결과 다음과 같은 사실을 발견했습니다:

  • POISE 는 비싼 비평가나 대규모 답변 그룹을 사용하는 최첨단 방법 (DAPO 등) 과 동일한 성능을 발휘했습니다.
  • 컴퓨팅 파워를 덜 사용했고 훈련이 더 빨리 완료되었습니다.
  • "직감"은 정확했습니다: 작은 프로브는 전체 크기의 AI 비평가 모델과 거의 동일한 수준으로 성공률을 예측했습니다.
  • 다른 곳에서도 작동합니다: 코딩 및 도구 사용 작업에서도 이를 테스트하여 잘 작동함을 확인했으며, 이는 학생의 내부 신호가 성공의 보편적 지표임을 증명했습니다.

요약

POISE 는 학생이 자신의 수행 정도를 알려주기 위해 두 번째 교사가 필요하지 않다는 것을 깨닫는 것과 같습니다. 단순히 그들의 내부 "사고 과정"을 경청함으로써, 그들이 올바른 길에 있는지 즉시 알 수 있습니다. 이는 비용을 절감하고 시간을 절약하며, 성능을 희생하지 않으면서 학습 과정을 더 매끄럽게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →