← 최신 논문
💬 NLP

Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR

이 논문은 수학 및 멀티모달 추론 작업에서 최첨단 성능를 달める 위해, 그룹 시퀀스 정책 최적화(GSPO)의 길이 편향을 이론적으로 분석하고 교정하여 응답 길이 붕괴를 방지하는 새로운 알고리즘인 길이 불편 시퀀스 정책 최적화(LUSPO)를 소개한다.

원저자: Fanfan Liu, Youyang Yin, Peng Shi, Siqi Yang, Zhixiong Zeng, Haibo Qiu

게시일 2026-02-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Fanfan Liu, Youyang Yin, Peng Shi, Siqi Yang, Zhixiong Zeng, Haibo Qiu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡한 수학 및 논리 퍼즐을 풀 수 있도록 뛰어난 학생(AI 모델)을 훈련시키고 있다고 상상해 보세요. 학생의 학습을 돕기 위해, 당신은 **검증 가능한 보상을 활용한 강화 학습(RLVR)**이라는 방법을 사용합니다. 이것은 코치가 학생에게 문제를 주고, 스스로 풀어보게 한 뒤, 정답을 확인하는 과정과 같습니다. 만약 정답을 맞히면 금메달을 주고, 틀리면 "다시 시도해 봐"라고 부드럽게 격려하는 식입니다.

시간이 흐르면서 학생은 더 길고 깊게 생각하며 큰 문제를 작은 단계들로 나누는 법을 배웁니다. 이러한 "생각하며 말하기(thinking out loud)" 과정은 어려운 과제를 해결하는 데 매우 중요합니다.

하지만, 이 논문의 저자들은 현재의 코칭 방식(특히 GRPO 및 GSPO라고 불리는 알고리즘)이 학생들을 채점하는 방식에 숨겨진 결함이 있다는 것을 발견했습니다.

문제점: "짧은 답변"의 함정

코치가 시험을 채점하고 있다고 상상해 보세요.

  • 결함: 현재의 채점 시스템은 학생들이 길고 상세한 설명을 작성하더라도, 그 설명이 정답이라면 실수로 벌점을 주는 오류를 범하고 있습니다. 이는 마치 완벽한 5페이지 분량의 에세이를 쓴 학생보다 1페이지짜리 에세이를 쓴 학생에게 더 높은 점수를 주는 선생님과 같습니다. 왜냐하면 채점 공식의 수학적 구조가 짧은 글에 유리하게 설계되어 있기 때문입니다.
  • 결과: 학생들(AI 모델들)은 최고의 점수를 얻기 위해 깊이 생각하는 것을 멈추고, 짧고 빠르게 답변해야 한다는 사실을 빠르게 깨닫습니다.
  • 붕괴: 논문의 실험에서, 인기 있는 방법 중 하나인 GSPO는 AI의 응답을 "붕괴(collapse)"시켰습니다. AI는 매우 짧고 게으른 답변을 내놓기 시작했고, 복잡한 문제를 추론하는 능력을 상실했습니다. 이는 마치 마라톤 선수가 발걸음을 크게 내디딜 때마다 결승선이 점점 더 멀어지는 바람에, 결국 걷기로 결심해 버린 것과 같습니다.

해결책: LUSPO (공정한 코치)

저자들인 Fanfan Liu와 메투안(Meituan) 팀은 **길이 편향이 없는 시퀀스 정책 최적화(LUSPO)**라는 새로운 방법을 제안했습니다.

LUSPO는 채점 공식을 수정하여 문제를 해결하는 새로운, 더 공정한 코치라고 생각하면 됩니다.

  • 해결책: 새로운 코치는 이렇게 말합니다. "답변이 10단어든 1,000단어든 상관없다. 추론 과정이 정확하다면 만점을 주겠다." 그들은 답변의 길이가 점수를 부당하게 높이거나 낮추지 않도록 수학적 구조를 조정했습니다.
  • 비유: 이전의 방식이 얼마나 적은 단어를 사용했는지를 기준으로 연설을 심사하는 것이었다면, LUSPO는 5분을 말하든 30분을 말하든 자신의 아이디어를 얼마나 잘 전달했는지를 기준으로 심사하는 것과 같습니다.

이를 적용했을 때 어떤 일이 일어났을까요?

연구팀은 이 새로운 "공정한 코치"를 다양한 유형의 AI 모델(텍스트만 읽을 수 있는 모델과 차트나 그래프를 볼 수 있는 모델 모두)에 테스트했습니다.

  1. AI가 더 길게 생각하기 시작함: 모델들은 답변을 줄이는 대신, 더 길고 상세한 설명을 작성하기 시작했습니다. 그들은 문제를 해결하기 위해 기꺼이 시간을 들여 "생각"할 준비가 되었습니다.
  2. 더 높은 점수: 모델들이 더 깊이 생각하게 됨에 따라, 어려운 수학 및 논리 퍼즐을 푸는 능력이 향상되었습니다. 테스트에서 LUSPO로 훈련된 모델들은 기존 방식들보다 더 높은 점수를 기록했습니다.
    • 예를 들어, 까다로운 수학 테스트(AIME24)에서 새로운 방식은 한 모델에서는 최대 6.9%, 다른 모델에서는 **2.9%**의 점수 향상을 보였습니다.
    • 시각적 퍼즐(차트 및 그래프 보기)에서도 이전의 최고 방법들을 능가했습니다.
  3. 안정성: 훈련 과정이 훨씬 안정적이 되었습니다. 모델들은 혼란을 겪거나 게으른 답변을 내놓지 않았으며, 추론 능력을 일관되게 향상시켰습니다.

핵심 요약

이 논문은 우리가 AI가 "생각하도록" 훈련하는 현재의 방식에, AI를 게으르고 간결하게 만들려는 숨겨진 버그가 있음을 보여줍니다. LUSPO를 통해 이 버그를 수정함으로써, AI는 더욱 성실한 학생이 되어 복잡한 문제에 대해 길고 상세하며 정확한 솔루션을 기꺼이 작성하게 됩니다. 이는 수학적인 작은 변화가 훨씬 더 똑똑한 AI 행동으로 이어진다는 것을 보여주는 사례입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →