← 최신 논문
💬 NLP

Beyond Token-Level Policy Gradients for Complex Reasoning with Large Language Models

이 논문은 복잡한 추론 작업에서 토큰 단위의 정책 경사 최적화의 한계를 극복하기 위해, 연속된 토큰 시퀀스를 통합된 의미적 행동으로 간주하는 '멀티-토큰 정책 경사 최적화 (MPO)' 프레임워크를 제안하고 수학 및 코딩 벤치마크에서 기존 방법보다 우수한 성능을 입증했습니다.

원저자: Mufan Xu, Kehai Chen, Xuefeng Bai, Zhengyu Niu, Muyun Yang, Tiejun Zhao, Min Zhang

게시일 2026-02-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mufan Xu, Kehai Chen, Xuefeng Bai, Zhengyu Niu, Muyun Yang, Tiejun Zhao, Min Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🧩 1. 문제: "한 글자씩만 생각하면 안 되는 이유"

지금까지 인공지능이 글을 쓰거나 문제를 풀 때는 한 글자 (Token) 씩 순서대로 예측하며 학습했습니다. 마치 레고 블록을 하나씩 떼어내서 다시 붙이는 과정을 반복하는 것과 비슷하죠.

  • 기존 방식 (Token-Level): "다음 글자가 뭐지? 'A'일까, 'B'일까?"라고 매번 한 글자씩만 고민합니다.
  • 문제점: 하지만 복잡한 수학 문제나 코딩에서는 한 번의 '의사결정'이 여러 글자로 이루어져 있습니다.
    • 예: a = 5 라는 식을 정의할 때, a, =, 5 라는 세 글자는 **하나의 의미 있는 덩어리 (블록)**입니다.
    • 기존 AI 는 이 세 글자를 따로따로 평가해서 "이 글자는 맞았어, 저 글자는 틀렸어"라고 점수를 줍니다.
    • 비유: 마치 연필로 글을 쓸 때, 한 획씩 끊어서 "이 획은 잘 썼네, 저 획은 못 썼네"라고 평가하는 것과 같습니다. 하지만 실제로 중요한 건 한 마디의 문장이나 한 줄의 코드가 제대로 완성되었는지입니다.

이렇게 한 글자 단위의 평가와 **실제 의미 있는 생각의 단위 (블록)**가 맞지 않아서, AI 가 복잡한 논리를 펼칠 때 헷갈리거나 실수를 자주 하게 됩니다.


🚀 2. 해결책: "MPO (멀티-토큰 정책 경량 최적화)"

저자들은 이 문제를 해결하기 위해 MPO라는 새로운 방법을 만들었습니다.

  • 핵심 아이디어: 이제 AI 가 한 번에 여러 글자 (예: 5 개) 를 묶어서 하나의 '의미 있는 덩어리'로 간주하고 학습시킵니다.
  • 비유:
    • 이전: 레고 블록을 하나씩 떼어내며 "이게 맞나?"라고 고민하다가 조립합니다.
    • MPO 방식: **이미 다 만들어진 작은 레고 세트 (예: 바퀴 4 개 달린 차 한 대)**를 통째로 떼어내거나 붙입니다. "이 차가 제자리에 잘 붙었나?"라고 평가하는 거죠.
    • 효과: AI 는 이제 한 글자 하나하나의 미묘한 차이보다는, 문장이나 수식 전체의 흐름과 논리를 더 잘 이해하게 됩니다.

🛠️ 3. 어떻게 작동할까요? (간단한 원리)

  1. 예측 훈련 (워밍업): 먼저 AI 가 "다음 5 개 글자를 미리 예측해봐"라고 훈련시킵니다. (마치 연필로 글을 쓸 때, 다음 문장까지 미리 구상하는 훈련)
  2. 한 번에 평가: AI 가 문제를 풀 때, 한 번에 5 개 글자를 뚝딱뚝딱 만들어냅니다. 그리고 이 5 개 글자 묶음 전체가 맞았는지 틀렸는지 점수를 매깁니다.
  3. 균형 잡기: 너무 많은 글자를 한 번에 예측하면 AI 가 헷갈릴 수 있으니, 가장 가까운 글자 (1, 2 번째) 에는 더 큰 점수를 주고, 먼 글자 (3, 4, 5 번째) 에는 조금씩 점수를 낮게 줍니다. (이걸 '감쇠'라고 합니다.)

📊 4. 결과는 어땠나요?

저자들은 이 방법을 수학 문제 (GSM8K, MATH) 와 코딩 (HumanEval) 테스트에 적용해 보았습니다.

  • 결과: 기존의 유명한 방법들 (PPO, GRPO 등) 보다 더 높은 점수를 받았습니다.
  • 이유: AI 가 **논리의 흐름 (블록 단위)**을 더 잘 파악하게 되어, 중간에 헷갈려서 엉뚱한 답을 내는 실수가 줄어든 것입니다.
  • 특이점: 특히 어려운 문제일수록 이 방법의 효과가 더 컸습니다. 복잡한 논리가 필요한 일일수록, 한 글자씩 끊어보는 것보다 덩어리로 생각하는 것이 훨씬 유리하기 때문입니다.

💡 5. 요약: 왜 이것이 중요할까요?

이 논문은 **"인공지능이 더 똑똑해지려면, 글자 하나하나를 보는 눈을 버리고, 문장과 문장 사이의 '의미 덩어리'를 보는 눈을 키워야 한다"**는 것을 증명했습니다.

  • 기존: "이 단어 맞나? 다음 단어 맞나?" (조그만 블록 하나씩)
  • 새로운 방법 (MPO): "이 문장 (블록) 이 논리적으로 맞나?" (다 만든 레고 세트)

이처럼 더 큰 단위로 생각하게 만드는 것이 앞으로 인공지능이 복잡한 추론, 수학, 코딩을 더 잘하게 만드는 핵심 열쇠가 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →