← 최신 논문
🤖 AI

QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization

이 논문은 훈련 과정에서 짧은 정답과 긴 오답을 선호함으로써 응답 길이를 암시적으로 제어하여 다양한 모델 크기에 걸쳐 추론 정확도를 유지하면서도 추론 지연 시간을 크게 줄이는 GRPO의 단순한 재표본 추출 기반 변형인 QLPO를 제안한다.

원저자: Siwei Chen, Siqi Chen, Xupeng Miao, Bin Cui

게시일 2026-07-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Siwei Chen, Siqi Chen, Xupeng Miao, Bin Cui

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 가장 좋아하는 AI 비서가 엄청나게 똑똑하지만 동시에 엄청나게 수다스러운 세상을 상상해 보세요. 당신이 간단한 수학 질문을 던지면, AI는 즉각적인 답변 대신 자신의 모든 생각을 설명하며 소설 한 권을 써 내려갑니다. 세 번이나 검토하고, 번거롭게 해드려 죄송하다는 사과까지 덧붙이면서 말이죠. 이것이 바로 현재 "대규모 추론 모델(Large Reasoning Models)"의 현실입니다. 이들은 '생각하며 말하기(Chain-of-Thought)'라고 불리는 과정을 통해 어려운 문제를 해결하도록 훈련된 매우 똑똑한 컴퓨터 프로그램입니다. 이들은 '강화 학습(Reinforcement Learning)'이라는 기법을 사용하는데, 이는 마치 강아지를 훈련시키는 것과 같습니다. 강아지가 "앉아"라는 말에 앉으면 간식을 주는 것처럼, AI가 정답을 맞히면 디지털 간식을 받습니다. 문제는 무엇일까요? AI는 간식을 받는 가장 좋은 방법이 말을 많이 하는 것이라고 학습했다는 점입니다. AI는 단어가 많을수록 더 좋은 답변이라고 생각하여 수천 개의 불필요한 단어를 생성하기 시작합니다. 이로 인해 AI는 느려지고, 실행 비용이 많이 들며, 읽기에 짜증스럽게 됩니다. 과학자들은 이 모델들이 성능이 떨어지거나 정확도가 낮아지지 않으면서도 간결하게 말하는 법을 가르치기 위해 노력하고 있습니다.

여기에 QLPO(길이 인지 정책 최적화를 위한 사분면 가중 샘플링, Quadrant-weighted sampling for Length-aware Policy Optimization)라는 새로운 방법이 등장했습니다. QLPO를 단순히 AI에게 "짧게 말해!"라고 소리치는 영리한 편집자가 아니라, AI의 연습 과정을 살펴보고 단순한 규칙에 따라 최선의 사례를 골라내는 데로 생각해보세요. 그 규칙은 바로 "짧고 정확하면 최고이고, 길고 틀리면 최악이다"입니다.

이 마법이 어떻게 작동하는지 살펴보겠습니다. AI를 시험을 치르는 학생이라고 상상해 보세요. 일반적인 훈련 세션에서 학생은 한 문제에 대해 여덟 가지 서로 다른 답안을 작성합니다. 선생님(표준 훈련 방식)은 이 여덟 가지를 모두 보고 이렇게 말합니다. "그래, 정답을 맞히긴 했지만 너무 많이 썼구나" 또는 "틀렸는데, 너무 짧게 썼어." 이는 학생을 혼란스럽게 만들 수 있습니다. 학생은 "더 안전하게 가려면 글을 더 많이 써야 하나?"라고 생각할 수도 있기 때문입니다.

QLPO는 선생님의 전략을 바꿉니다. 먼저, 학생에게 평소보다 두 배 많은 16개의 답안을 작성하도록 요청합니다. 그런 다음 선생님은 이 16개의 답안을 네 개의 더미로 분류합니다:

  1. 짧고 정확함 (골드 스탠다드/최고의 기준)
  2. 길고 정확함 (괜찮지만 약간 장황함)
  3. 짧고 틀림 (너무 짧아서 틀림)
  4. 길고 틀림 (최악의 경우: 길고 혼란스러운 엉망진창)

선의 선생님은 대부분의 "길고 틀린" 답안은 버리고, "짧고 정확한" 답안은 거의 다 챙깁니다. 그리고 이 선택된 답안들을 다시 8개의 그룹과 섞어서 "이것이 네가 배워야 할 내용이다"라고 말합니다. 이렇게 반복함으로써 AI는 미묘한 교훈을 얻습니다. "간식을 받기 위해 횡설수설할 필요는 없어. 그저 정확하고 효율적이기만 하면 돼."

연구진은 이 단순한 재구성 작업이 놀라운 효과를 낸다는 것을 발견했습니다. 그들은 15억 개(1.5B) 파라미터의 작은 모델부터 320억 개(32B) 파라미터의 거대한 모델에 이르기까지 다양한 모델을 테스트했습니다. 결과는 놀라웠습니다. QLPO는 전반적으로 AI 답변의 길이를 30%에서 70%까지 줄였습니다. 어떤 매우 어려운 수학 테스트에서는 답변 길이를 17,000단어 이상에서 약 6,600단어로 줄이면서도 정확도를 전혀 잃지 않았습니다. 실제로 일부 어려운 벤치마크에서는 모델의 성능이 약간 좋아지거나 동일하게 유지되었는데, 이는 간결해지는 것이 모델을 멍청하게 만들지 않았음을 입증합니다.

또한 연구진은 단어 사용에 대해 "벌칙"을 부과하는 등 AI를 강제로 짧게 만들려는 다른 방법들과 QLPO를 비교했습니다. 그들은 그러한 방법들이 종종 역효과를 일으켜 AI를 혼란스럽게 하거나 정확도를 떨어뜨린다는 것을 발견했습니다. 반면 QLPO는 무거운 손길이 아닌 부드러운 밀기(gentle nudge)와 같습니다. 게임의 규칙(보상)을 바꾸는 것이 아니라, AI가 공부할 예시를 바꾸는 것입니다.

흥미롭게도, 저자들은 이 방법이 단순히 AI를 짧게 만드는 것이 아니라, AI가 어떻게 생각하는지에 대해 더 똑똑하게 만든다는 점에 주목했습니다. AI는 반복적인 설명과 불필요한 확인에 시간을 낭비하는 것을 멈춥니다. 중요한 단계는 유지하고 군더더기는 잘라내는 법을 배웁니다. 이 방법은 훈련 중에 AI가 몇 개의 답안을 추가로 생성해야 하므로 시간이 아주 조금 더 걸리지만, 그 보상은 엄청납니다. 최종 모델은 실제 환경에서 훨씬 빠르고 저렴하게 사용할 수 있기 때문입니다.

요약하자면, QLPO는 우리가 AI를 막대기로 때려 조용하게 만들 필요가 없다는 것을 시사합니다. 우리는 그저 조용하고 정확한 답변이 진정으로 중요하다는 것을 보여주기만 하면 됩니다. 이는 우리의 수다스러운 디지털 친구들에게 적은 것으로 더 많은 것을 말하도록 가르치는 단순하고 강력한 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →