← 최신 논문
💬 NLP

Future-KL Regularized GRPO: Process-Level Credit Assignment from ff-Divergence Regularization

본 논문은 ff-발산에서 유도된 인과적 미래 정규화 귀환값을 통합하여 GRPO 의 토큰 수준 KL 정규화를 보정하는 비평가 없는 방법인 Future-KL 정규화 정책 최적화 (FRPO) 를 소개하며, 이를 통해 수학적 추론 성능을 향상시키면서 더 높은 엔트로피와 더 낮은 정책 편향을 유지한다.

원저자: Jiarui Yao, Ruida Wang, Hao Bai, Tong Zhang

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiarui Yao, Ruida Wang, Hao Bai, Tong Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Future-KL Regularized GRPO" 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 풀어냅니다.

큰 그림: 로봇에게 사고하는 법을 가르치기

로봇(인공지능)에게 수학 문제를 풀도록 가르친다고 상상해 보세요. 문제를 주고, 로봇이 단계별로 긴 해결책을 작성하도록 합니다. 로봇이 무작위로 추측하거나 엉뚱한 방향으로 나가지 않도록 하기 위해, 한 명의 "선생님"(참조 모델) 을 두어 로봇의 작업을 점검하게 합니다.

이 논문은 GRPO(Group Relative Policy Optimization) 라는 특정 학습 방법에 초점을 맞춥니다. GRPO 를 교실 환경으로 생각해 보세요:

  1. 로봇은 동일한 수학 문제에 대해 여러 개의 답안 (한 "그룹") 을 생성합니다.
  2. 검증자가 이를 확인합니다: "최종 숫자가 맞나요?" (예/아니오).
  3. 로봇은 자신의 답안을 다른 친구들의 답안과 비교하며 학습합니다. 만약 한 답안이 다른 것들보다 더 좋다면, 로봇은 "하이파이브"(보상) 를 받습니다. 만약 더 나쁘다면 "엄지척"을 당합니다.

문제: "국소적" 벌칙 vs "미래" 비용

기존 학습에서는 로봇이 자신의 성격을 너무 많이 바꾸지 못하게 하는 규칙이 있습니다. 이를 KL 정규화라고 합니다. 이는 "자신의 차선 안에 있으라"는 규칙과 같습니다. 로봇이 원래 선생님과는 매우 다른 내용을 쓰기 시작하면 벌칙을 받습니다.

옛 방식 (실수):
현재 대부분의 시스템은 이 벌칙을 문장 끝에서 단순한 "과태료"처럼 **토큰 단위 **(단어 단위)로 적용합니다.

  • 비유: 운전자가 긴 도로 여행을 한다고 상상해 보세요. 옛 시스템은 운전자가 경찰차 앞을 지나는 그 순간에만 과속 여부를 확인합니다. 만약 운전자가 10 마일 전에 잘못된 방향으로 틀었다면, 지금은 이미 10 마일이나 길을 벗어났다는 사실을 무시합니다. 이 시스템은 모든 마일을 고립된 사건으로 취급합니다.

논문의 통찰:
저자들은 긴 추론 과정 (수학 증명 등) 에서 작성하는 모든 단어가 그 다음에 올 모든 단어의 경로를 바꾼다는 사실을 깨달았습니다.

  • "미래" 비용: 로봇이 문장 초반에 약간의 이탈을 보이면, 그 다음에 올 모든 단어도 그 잘못된 경로를 따라가야 의미 있게 만들기 위해 이탈하게 됩니다. 그 초기 실수의 "비용"은 실수 그 자체뿐만 아니라, 그 잘못된 경로를 따라가야 하는 모든 미래 단어들의 누적 비용입니다.
  • 누락된 신호: 옛 시스템은 이 "미래 비용"을 무시합니다. 현재 단어만 처벌할 뿐, 그것이 만들어내는 파급 효과는 처벌하지 않습니다.

복잡성: 왜 단순히 섞을 수 없는가

이 논문은 GRPO 가 작동하는 방식에 얽힌 까다로운 수학 문제도 지적합니다.

  • 비선형 점수: GRPO 는 단순히 원점수 (0 또는 1) 만 보지 않습니다. 그룹 내에서 점수를 정규화합니다 (예: 학급 내 학생 순위 매기기). 이로 인해 점수와 보상 사이에는 기묘하고 곡선적인 관계가 생깁니다.
  • 충돌: 만약 "자신의 차선 안에 있으라"는 벌칙을 학생들을 순위 매기기 전에 점수에 직접 섞으려 한다면, 수학이 깨집니다. 이는 학생들의 학급 순위를 계산하기 전에 학생의 점수에 "지각 벌점"을 더해보려는 것과 같습니다. 이는 순위 시스템을 왜곡하고 학습 신호를 망가뜨립니다.

해결책: FRPO(Future-KL Regularized Policy Optimization)

저자들은 FRPO라는 새로운 방법을 제안합니다. 작동 방식은 다음과 같습니다:

  1. 단계 1: 답안 순위 매기기 (이점). 먼저 최종 수학 답안에만 기반하여 보상을 계산합니다. 어떤 답안이 좋고 어떤 답안이 나쁜지 보기 위해 답안 그룹의 순위를 매깁니다. 이것이 "그룹 이점"입니다.
  2. 단계 2: 미래 벌칙 추가 (수정). 순위 매기기가 끝난 , 승자와 패자의 답안에 있는 모든 단어를 다시 살펴봅니다.
    • 각 단어에 대해 단순히 그 자체의 벌칙뿐만 아니라, 그 뒤에 오는 모든 단어들의 벌칙 합계를 계산합니다.
    • 비유: 릴레이 경주를 상상해 보세요. 옛 시스템은 배턴을 떨어뜨린 주자만 처벌했습니다. 새로운 시스템은 배턴을 떨어뜨린 주자를 처벌하는 동시에, 그 다음 세 주자가 따라잡기 위해 더 느리게 뛰어야 한다는 사실도 함께 처벌합니다. 이는 현재 단어가 시작시킨 전체 미래 여정에 따라 크레딧 (또는 비난) 을 부여합니다.
  3. 단계 3: 업데이트. "그룹 순위"와 이 새로운 "미래 벌칙"을 결합하여 로봇의 뇌를 업데이트합니다.

중요성 (결과)

이 논문은 고등학교 경시대회 수준의 어려운 수학 문제를 해결하는 대규모 언어 모델에서 이 방법을 테스트했습니다.

  • 더 나은 점수: 새로운 방법 (FRPO) 은 기존 방법들보다 더 많은 문제를 정확하게 해결했습니다.
  • 덜한 이탈: 로봇은 원래 "선생님"의 성격에 더 가깝게 머물렀습니다. 높은 점수를 얻기 위해 미친 듯이 행동하거나 헛소리를 지어내지 않았습니다.
  • 더 많은 창의성: 로봇은 사고의 다양성인 "엔트로피"를 건강한 수준으로 유지했습니다. 지루하고 반복적인 로봇이 되지도, 엉뚱한 방향으로 나가지도 않았습니다.

요약

이 논문은 AI 에게 추론을 가르칠 때, 지금 말하고 있는 단어 때문에만 처벌해서는 안 된다고 주장합니다. 그 단어가 만들어내는 미래 경로 때문에 처벌해야 합니다. 학습 과정에 "미래 비용" 계산을 추가함으로써, AI 는 더 일관성 있게 사고하고, 더 어려운 문제를 해결하며, 복잡한 "비평가" 모델을 감시자로 두지 않아도 안정적으로 유지할 수 있게 됩니다.

간단히 말해: 지금 과속한 운전자를 처벌하는 것뿐만 아니라, 제자리를 찾기 위해 과속하게 만든 10 마일 전에 한 잘못된 방향 전환으로 인해 처벌해야 합니다. 이것이 바로 "Future-KL"의 통찰입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →