← 최신 논문
🤖 machine learning

HMPO: Hybrid Median-length Policy Optimization for Chain-of-Thought Compression

HMPO는 기존 방식들의 수동 튜닝 및 다단계 학습의 한계를 극복하여, 다양한 작업과 모델 규모에 걸쳐 정확도 손실을 거의 없이 사고 사슬(chain-of-thought) 추론을 19%~46%까지 효율적으로 압축하는 비용 효율적인 단일 단계 강화 학습 프레임워크입니다.

원저자: Minghui Zheng, Hongxu Chen, Huimin Ren, Hongsheng Xin, Xiaoyang Qu, Ze Wang, Shuling Yang, Ziyu Peng, Kaike Zhang, Pan Zhou, Kun Zhan

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Minghui Zheng, Hongxu Chen, Huimin Ren, Hongsheng Xin, Xiaoyang Qu, Ze Wang, Shuling Yang, Ziyu Peng, Kaike Zhang, Pan Zhou, Kun Zhan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 천재적이지만 말이 너무 많은 학생이 있다고 상상해 보세요. 당신이 수학 문제를 내면, 그 학생은 단순히 정답만 말하는 것이 아니라, 머릿속을 스쳐 지나간 모든 생각, 즉 잘못된 길로 빠졌던 순간, "만약에"라는 가정, 그리고 장황한 설명들을 담은 50페이지짜리 소설을 써 내려갑니다. 이 "사고 과정"(Chain-of-Thought)은 정답을 맞히는 데 도움이 되지만, 매우 느리고, 비용이 많이 들며, 엄청난 에너지를 낭비합니다.

이 논문은 이 학생에게 지능을 잃지 않으면서도 간결하게 말하는 법을 가르치는 새로운 방법인 HMPO(Hybrid Median-length Policy Optimization)를 소개합니다.

HMPO가 어떻게 작동하는지, 쉬운 비유를 통해 설명하겠습니다.

1. 문제점: "생각이 너무 많은" 학생

현재의 AI 모델들은 추론 능력이 뛰어나지만, "과잉 사고(overthinking)"를 합니다. 하나의 질문에 대해 수천 단어(토큰)를 생성하죠. 이는 마치 시간을 묻는 사람에게 시계의 역사에 대해 강의를 늘어놓는 것과 같습니다. 이는 많은 비용(컴퓨팅 파워)과 긴 시간을 소모합니다.

이를 해결하기 위한 기존 방식들은 투박합니다:

  • 경직된 규칙을 사용합니다 (예: "1,000단어 뒤에는 말을 멈춰라"). 이는 어려운 문제를 풀 때 필요한 설명을 중간에 끊어버릴 수 있습니다.
  • 비싼 다단계 훈련이 필요합니다 (마치 튜터, 코치, 매니저를 차례로 고용하는 것과 같아서, 시간이 오래 걸리고 비용이 엄청나게 듭니다).
  • 매우 크고 복적인 모델에 적용할 경우 제대로 작동하지 않는 경우가 많습니다.

2. 해결책: HMPO (스마트한 코치)

HMPO는 AI에게 간결하면서도 정확하게 말하도록 가르치는 효율적인 단일 훈련 세션입니다. 여기에는 세 가지 영리한 기술이 들어 있습니다.

A. "골디락스" 예산 (Adaptive Median)

고정된 단어 제한(예: "최대 500단어")을 두는 대신, HMPO는 최근의 성공적인 답변들을 살펴봅니다.

  • 비유: 코치가 러너 그룹을 지켜보고 있다고 상상해 보세요. 코치가 "정확히 10분 동안 달려"라고 말하는 대신, 실제로 경주를 성공적으로 마친 러너들의 중앙값(median) 시간을 관찰하는 것입니다.
  • 도움이 되는 이유: 문제가 어려우면 "성공적인" 답변은 자연스럽게 길어지므로 예산이 완화됩니다. 문제가 쉬우면 성공적인 답변이 짧아지므로 예산이 타이트해집니다. AI는 사람이 숫자를 추측할 필요 없이 스스로 "딱 적당한" 길이를 목표로 삼는 법을 배웁니다.

B. "부드러운 착륙" 보상 (Cosine Decay)

보통 AI에게 "짧게 말해"라고 하면, 보상을 받기 위해 짧지만 틀린 답을 내놓는 식으로 속임수를 쓸 수 있습니다. HMPO는 이를 방지합니다.

  • 비유: 비디오 게임에서 스테이지를 빨리 클리어하면 점수를 받는다고 가정해 봅시다. 하지만 만약 스테이지를 틀리게 클리어했다면, 아무리 빨랐더라도 점수는 0점입니다.
  • 도움이 되는 되는 이유: HMPO는 **"정확성이 가장 중요하다"**라고 말하는 특수한 수학 공식(곱셈 보상)을 사용합니다. 만약 틀렸다면, 길이에 상관없이 0점을 받습니다. 만약 맞았다면, 그때서야 간결함에 대한 추가 점수를 받습니다. 이는 AI가 게으르거나 틀린 답을 내놓으며 속임수를 쓰는 것을 막아줍니다.

C. "원스톱 숍" (Single-Stage Training)

기존 방식은 복잡한 과정을 거쳐야 했습니다: 먼저 AI에게 짧게 말하는 법을 가르치고(1단계), 그다음 맞게 말하는 법을 가르치고(2단계), 마지막으로 이를 혼합하는 식입니다.

  • 비유: 집을 3년에 걸쳐 벽돌을 하나씩 쌓아 올리는 대신, HMPO는 3D 프린터로 집 전체를 한 번에 뽑아내는 것과 같습니다.
  • 도움이 되는 이유: 이는 기존 방식보다 훈련 시간과 비용을 1.5배에서 2.5배까지 단축합니다.

3. 결과: 더 똑똑하고, 빠르고, 저렴하게

연구진은 90억(9B) 파라미터의 작은 모델부터 1,220억(122B) 파라미터의 거대 모델까지 테스트했습니다.

  • 마법 같은 효과: 연구진은 수학 문제만을 대상으로 AI를 훈련시켰습니다.
  • 놀라운 사실: 비록 수학을 통해 간결함을 배웠지만, AI는 코딩, 과학, 지시 이행에서도 간결해졌습니다. 이는 마치 학생에게 수학 에세이를 짧게 쓰는 법을 가르쳤더니, 갑자기 다른 과목의 이메일이나 코드를 짧고 명확하게 쓰기 시작한 것과 같습니다.
  • 수치: AI는 정확도를 거의 그대로 유지하면서도 "사고" 길이를 19%에서 46%까지 줄였습니다 (단어 수를 대폭 절감).
  • 비교: HMPO로 훈련된 압축된 1,220억 파라미터 모델은 훨씬 더 큰 미최적화 모델만큼의 성능을 보여주면서도, 훨씬 적은 단어와 적은 컴퓨팅 파워를 사용했습니다.

요약

HMPO는 AI가 "과잉 사고"를 하지 않도록 훈련하는 새로운 방법입니다. 이는 간결함과 정확성 사이의 완벽한 균형을 찾기 위해 스스로 조절되는 스마트한 시스템을 사용합니다. 훈련 비용이 저렴하고, 거대 모델에도 적용 가능하며, 놀랍게도 수학 연습만으로도 다양한 분야에서 간결하게 말하는 법을 배웁니다.

이 논문이 주장하지 않는 것:

  • 이 방법이 멀티 턴 대화(AI가 이전 대화 내용을 기억하며 이어가는 긴 채팅)에서 작동한다고 주장하지 않습니다.
  • 이 방법이 의료 진단이나 법률 자문에 바로 사용될 수 있다고 주장하지 않습니다.
  • 이 방법이 복잡한 루프를 사용하여 도구(웹 브라우징이나 계산기 사용 등)를 사용하는 AI 에이전트에게 작동한다고 주장하지 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →