← 최신 논문
🤖 machine learning

Variational Speculative Decoding: Rethinking Draft Training from Token Likelihood to Sequence Acceptance

이 논문은 드래프트 훈련을 타겟 모델의 시퀀스 수용을 극대화하기 위한 변분 추론으로 재구성하여, 적응형 가중치 및 정규화를 갖춘 기댓값 최대화 절차를 통해 훈련-디코딩 간의 불일치를 해결함으로써 기존 방식보다 상당한 추론 속도 향상을 달성하는 새로운 프레임워크인 변분 추측 디코딩(Variational Speculative Decoding, VSD)을 소개한다.

원저자: Xiandong Zou, Jianshu Li, Jing Huang, Pan Zhou

게시일 2026-08-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiandong Zou, Jianshu Li, Jing Huang, Pan Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초고성능 로봇에게 이야기를 쓰는 법을 가르치려 한다고 상상해 보세요. 이 로봇은 거대 언어 모델(LLM)로 알려져 있는데, 매우 유능하지만 동시에 엄청나게 느립니다. 이 로봇은 문장을 한 단어씩 써 내려가며, 다음 단어를 생각하기 위해 매 단어마다 멈춰 서서 고민하는 방식으로 작동합니다. 이 "멈춰서 생각하기" 과정은 안전하고 정확하지만, 이 때문에 로봇은 마치 당밀 속을 헤치며 나아가는 것처럼 느껴지게 만듭니다.

이 속도를 높이기 위해, 과학자들은 "추측 디코딩(speculative decoding)"이라는 영리한 기술을 발명했습니다. 이것을 두 명의 팀으로 생각해보세요. 빠르고 활기찬 주니어 조수("초안 모델", draft model)와 현명하고 느린 감독관("타겟 모델", target model)입니다. 주니어 조수는 이야기의 다음 몇 단어를 매우 빠르게 추측하려고 노력합니다. 그러면 감독관이 이 추측들을 검토합니다. 만약 추측이 맞다면, 로봇은 그 모든 단어를 한꺼번에 받아들여 느리게 "생각하는" 시간을 건너뜁니다. 만약 추측이 틀렸다면, 감독관이 이를 수정하고 다시 시도합니다. 목표는 주니어 조수가 길고 정확한 단어의 사슬을 추측하게 하여, 감독관이 이를 큰 묶음으로 승인할 수 있게 함으로써 전체 과정을 비약적으로 빠르게 만드는 것입니다.

하지만 여기에는 함정이 있습니다. 주니어 조수는 보통 "완벽한" 정답을 보여주고 그 단 하나의 경로를 암기하도록 훈련받습니다. 하지만 실제 게임에서 감독관은 단 하나의 경로만을 보는 것이 아니라, 가능한 수많은 선택지들로 이루어진 하나의 나무(tree)를 보며 그중 최선의 것들을 골라냅니다. 주니어 조수를 단 하나의 직선 경로만을 따르도록 훈련시키는 것은, 감독관이 실제로 거대한 숲의 옵션들을 살펴보고 있을 때 그 모델을 아주 형편없게 만든다는 사실이 밝혀졌습니다. 조수가 훈련받는 방식과 실제로 게임을 수행하는 방식 사이의 이러한 불일치는 이 AI 로봇들의 속도를 저해해 왔습니다.


논문의 핵심 아이디어: 조수를 훈련하는 새로운 방법

이 논문에서 연구자들은 **변분 추측 디코딩(Variational Speculative Decoding, VSD)**이라는 새로운 훈련 방법을 제안합니다. 연구자들은 기존의 초안 모델 훈련 방식이, 마치 레이싱 카 드라이버에게 복잡하고 구불구불한 코스를 주행하는 실제 경주를 가르치는 대신, 오직 하나의 곧은 트랙에서만 운전하도록 가르치는 것과 같다는 점을 깨달았습니다.

기존 방식의 문제점
저자들은 현재의 방식들이 초안 모델을 "탐욕스럽게(greedy)" 훈련시킨다고 설명합니다. 즉, 이 모델은 항상 가장 가능성이 높은 다음 단어 하나를 선택하도록 교육되어, 하나의 직선적인 텍스트 경로를 만들어냅니다. 하지만 실제 게임 중에 시스템은 단 하나의 선만을 체크하는 것이 아니라, 다양한 단어 조합으로 이루어진 "트리(tree)"를 생성한 뒤 그중 최선의 것들을 선택합니다. 논문은 이것이 불일치를 만든다는 것을 보여줍니다. 즉, 모델은 특정 경로 하나에 대해서는 완벽하도록 훈련받지만, 실제 게임은 수많은 경로에 대해 능숙할 것을 요구한다는 것입니다. 실제로 실험 결과, 모델이 훈련받은 "완벽한" 경로가 게임 도중 버려지는 경우가 약 30%에 달했습니다. 이는 그 경로가 여러 옵션 중에서 실제로 최선의 선택이 아니었기 때문입니다.

새로운 해결책: 숲 전체로부터 배우기
VSD는 훈련의 규칙을 바꿉니다. 단순히 하나의 직선 경로를 암기하는 대신, 새로운 방법은 초안 모델을 "변분 추 inference(variational inference)" 문제로 취급합니다. 쉽게 말해, 이 모델은 단 하나의 나무가 아니라 전체 숲의 가능성을 이해하도록 학습됩니다. 모델은 단순히 단 하나의 "최선"의 단어를 추측하는 것이 아니라, 감독관에 의해 승인될 가능성이 높은 일련의 경로들을 추측하는 법을 배웁니다.

이를 위해 연구자들은 영리한 2단계 프로세스(Expectation-Maximization 절차라고 불림)를 사용합니다:

  1. 추측 단계 (E-step): 모델은 많은 다양한 가능한 이야기 경로들을 생성합니다. 특별한 "오라클(oracle, 똑똑한 필터)"이 이 경로들을 검사하여, 감독관의 테스트를 통과할 것처럼 보이는 경로들은 남겨두고 좋지 않은 것들은 버립니다.
  2. 학습 단계 (M-step): 모델은 이렇게 "남겨진" 경로들로부터 학습합니다. 하지만 여기서 반전이 있습니다. 연구자들은 학습을 안정적이고 스마트하게 만들기 위해 두 가지 특별한 도구를 추가했습니다.
    • 적응형 거부 가중치 (Adaptive Rejection Weighting, ARW): 이것은 학생이 어려움을 겪고 있는지 아는 코치 역할을 합니다. 모델이 많은 잘못된 추측을 하고 있다면, 코치는 노이즈를 무시하고 소수의 좋은 추측에 집중합니다. 모델이 잘하고 있다면, 코치는 모델이 더 빨리 개선될 수 있도록 실수를 주목합니다.
    • 신뢰도 인지 정규화 (Confidence-Aware Regularization, CAR): 이것은 모델이 "과도한 자신감"을 갖지 않도록 방지합니다. 만약 모델이 틀린 추측에 대해 99% 확신한다면, 이 도구는 큰 벌점을 부여합니다. 이는 모델에게 겸손함을 가르치고, 잘못된 생각에 고집스럽게 매달리는 대신 다른 옵션들을 탐색하도록 가르칩니다.

연구 결과
연구자들은 LLaMA와 같은 텍스트 전용 모델부터 LLaVA와 같이 이미지를 볼 수 있는 모델에 이르기까지 여러 가지 AI 모델에 대해 이 새로운 방법을 테스트했습니다. 그들은 VSD가 모델을 멍청하게 만들지 않으면서도 일관되게 AI를 더 빠르게 만든다는 것을 발견했습니다.

  • 속도: 텍스트 모델의 경우, VSD는 기존의 최고 방식인 EAGLE-3보다 최대 9.6% 더 빠르게 만들었습니다.
  • 승인율: "조수"는 한 번에 더 많은 단어를 승인받을 수 있었습니다. 평균적으로, 기존 방식이 56개의 토큰(텍text 덩어리)을 승인받았던 것에 비해, VSD는 한 번에 **67개**의 토큰을 승인받았습니다.
  • 멀티모달의 마법: 이미지와 텍스트 모델에서도 동일하게 잘 작동하여, 해당 모델들을 위한 기존 최고의 방식인 ViSpec보다 속도를 7.9% 향상시켰습니다.

이것이 중요한 이유
이 논문은 조수에게 단 하나의 움직임이 아닌 전체 게임을 생각하는 법을 가르침으로써 어떻게 AI의 속도를 크게 높일 수 있는지를 증명합니다. 저자들은 자신들의 방법이 "기대 승인 길이(expected acceptance length, 한 번에 승인되는 단어 수)"를 개선한다는 것을 수학적으로 보장한다는 것을 보여주었습니다. 그들은 단순히 추측한 것이 아니라, 코딩, 수학 문제 풀이, 이미지에 대한 질문 답변 등 다양한 과업에 걸쳐 이를 측정했습니다.

요약하자면, VSD는 초안 모델이 단 하나의 움직임이 아닌 전체 게임을 고려하도록 훈련함으로써 훈련의 불일치를 해결하며, 이를 통해 모델이 추측을 할 때 감독관이 실제로 승인할 가능성이 높은 추측을 하도록 보장합니다. 이는 AI가 마치 당밀 속을 헤매는 것이 아니라, 전력 질주하는 것처럼 느끼게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →