← 최신 논문
🤖 machine learning

The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning

이 논문은 거대언어모델(LLM) 강화 학습에서의 훈련-추론 불일치를 불안정성의 결정적인 원인으로 식별하고, 훈련 시의 개선이 단조 최적화 목적 함수를 통해 추론 성능의 향상으로 직접 이어지도록 보장하는 단조 추론 정책 업데이트(MIPU)라는 새로운 프레임워크를 제안한다.

원저자: Jing Liang, Hongyao Tang, Yi Ma, Yancheng He, Weixun Wang, Xiaoyang Li, Ju Huang, Wenbo Su, Jinyi Liu, Yan Zheng, Jianye Hao, Bo Zheng

게시일 2026-06-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jing Liang, Hongyao Tang, Yi Ma, Yancheng He, Weixun Wang, Xiaoyang Li, Ju Huang, Wenbo Su, Jinyi Liu, Yan Zheng, Jianye Hao, Bo Zheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡한 수학 문제를 해결하도록 뛰어난 학생(AI 모델)을 훈련시키고 있다고 상상해 보십시오. 당신에게는 이 훈련을 위한 두 가지 서로 다른 환경이 있습니다.

  1. 교실 (훈련 엔진): 이곳은 학생이 연습하는 곳입니다. 조명이 완벽하고, 슈퍼 컴퓨터가 있으며, 학생의 모든 생각을 지켜볼 수 있는 선생님이 있는 첨단 실험실입니다.
  2. 시험장 (추론 엔진): 이곳은 학생이 실제 세상에서 실제로 시험을 치르는 곳입니다. 컴퓨터는 약간 더 느리고, 조명도 다릅니다.

문제: "두 세계"의 괴리

이 논문은 현대 AI 훈련에서 우리가 종종 이 두 세계를 동일한 것처럼 취급한다는 점을 지적합니다. 우리는 학생에게 "잘했어! 교실에서의 점수가 10% 향상되었구나!"라고 말하며, 그 결과가 시험장에서도 10% 더 높은 점수로 나타날 것이라고 가정합니다.

하지만 여기 함정이 있습니다. 교실과 시험장은 실제로 다릅니다.

기술적인 차이(예: 컴퓨터가 숫자를 처리하는 방식) 때문에, 학생은 똑같은 뇌(모델 파라미터)를 사용하더라도 교실에서와는 다르게 행동할 수 있습니다.

  • 교실에서 학생은 "정답에 대해 90% 확신합니다"라고 말할 수 있습니다.
  • 하지만 시험장에서는, 똑같은 학생이 실제로는 70%만 확신하거나, 실험실에서는 하지 않았던 미세한 계산 실수를 할 수도 있습니다.

논문은 이를 **"훈련-추론 불일치(Training-Inference Mismatch)"**라고 부릅니다.

위험한 점은 AI가 교실에서의 성과를 바탕으로 계속 업데이트를 받는다는 것입니다. 만약 이 업데이트가 시험장에서 제대로 구현되지 않는다면, 교실에서의 수치는 완벽해 보일지라도 AI는 실제 세계에서 점점 더 나쁜 결정을 내리기 시작할 수 있습니다. 이는 마치 조종사가 완벽한 시뮬레이터에서 연습했지만, 실제 비행 환경의 바람 조건이 달랐기 때문에 실제 비행기에서 추락하는 것과 같습니다.

해결책: "단조 추론 정책 개선" (Monotonic Inference Policy Improvement)

저자들은 새로운 훈련 규칙을 제안합니다. 단순히 "교실에서 학생이 향상되었는가?"라고 묻지 마십시오. 대신 **"학생이 실제로 시험에서 향상되었는가?"**라고 물으십시오.

이것이 MIPI(Monotonic Inference Policy Improvement)라고 불리는 원칙입니다. 이는 우리가 단지 교실에서의 성능을 높이는 것이 아니라, 실제 세계의 성능을 확실히 개선하는 경우에만 훈련 업데이트를 수용해야 함을 의미합니다.

어떻게 실행하는가: "MIPU" 2단계 프로세스

이를 실현하기 위해, 그들은 MIPU(Monotonic Inference Policy Update)라는 새로운 훈련 프레임워크를 구축했습니다. 이것을 학생의 새로운 지식에 대한 2단계 품질 관리 프로세스라고 생각하십시오.

1단계: "연습 게임" (샘플러 참조 업데이트)
선생님은 단순히 교실 규칙에 따라 학생에게 개선하라고 지시하는 대신, 먼저 이렇게 묻습니다. "만약 네가 지금 현재의 뇌를 사용하여 시험을 본다면, 결과가 어떻게 되겠니?"

  • 그들은 "교실"의 연습이 "시험장"의 현실과 더 잘 일치하도록 학생의 학습을 조정합니다.
  • 이를 통해 후보 업데이트(candidate update), 즉 더 나아질 것으로 기대되는 새로운 버전의 학생을 만들어냅니다.

2단계: "현실 점검" (추론 격차 인지 수용)
학생이 이 새로운 지식을 실제 세계로 가져가기 전에, 선생님은 빠른 테스트를 실행합니다.

  • 그들은 새로운 지식을 가진 학생이 시험을 치르는 상황을 시뮬레이션합니다.
  • 그 결과와 이전의 상태를 비교합니다.
  • 결정:
    • 만약 새로운 지식이 시험장 시뮬레이션에서 실제로 도움이 된다면? 수용합니다. 학생은 다음 단계로 넘어갑니다.
    • 만약 새로운 지식이 교실에서는 좋아 보이지만, 시험장 시뮬레이션에서 혼란이나 오류를 일으킨다면? 거부합니다. 학생은 이전 버전으로 되돌아갑니다.

이것이 왜 중요한가

논문은 저전밀도(low-precision) 설정(교실과 시험장의 차이를 매우 명확하게 만드는 설정, 마치 고장 난 버튼이 있는 계산기로 수학 문제를 푸는 것과 같은 상황)을 사용하여 수학 문제에 대해 이 방법을 테스트했습니다.

  • 기존 방식: AI는 교실에서의 높은 점수에 열광하며 업데이트를 적용하지만, 교실 점수가 "신기루"였기 때문에 실제 세계에서는 갑자기 성능이 떨어지거나 추락하게 됩니다.
  • MIPU 방식: AI는 안정적입니다. 나쁜 업데이트를 거부하기 때문에 학습 속도는 조금 느려질 수 있지만, 실제 과업에서 지속적으로 발전합니다. 이는 "추락"을 방지하고 계속해서 성장하게 합니다.

핵심 요약

이 논문은 우리가 잘못된 것을 최적화해 왔다고 주장합니다. 우리는 AI를 '훈련'시키는 데 집중해 왔지만, 사실은 '배포'하는 데 더 잘하도록 만들어야 했습니다.

(1단계)의 규칙을 실제 세계의 규칙과 정렬하고, (2단계)의 "현실 점검" 단계를 추가함으로써, AI는 더욱 신뢰할 수 있게 됩니다. AI는 가짜 환경에서의 높은 점수를 쫓는 것을 멈추고, 실제 세계를 위한 진정하고 안정적인 발전을 시작합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →