← 최신 논문
💬 NLP

PACER: Blockwise Pre-verification for Speculative Decoding with Adaptive Length

본 논문은 경량화된 학습 가능한 사전 검증 레이어를 사용하여 드래프트 토큰 길이를 블록 단위로 동적으로 조정함으로써 LLM 추론을 크게 가속화하고 표준 고정 길이 방식보다 우수한 성능을 보이는 새로운 투기적 디코딩 프레임워크인 PACER를 소개한다.

원저자: Situo Zhang, Yifan Zhang, Zichen Zhu, Hankun Wang, Da Ma, Danyang Zhang, Lu Chen, Kai Yu

게시일 2026-02-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Situo Zhang, Yifan Zhang, Zichen Zhu, Hankun Wang, Da Ma, Danyang Zhang, Lu Chen, Kai Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 긴 이야기를 쓰려고 하는데, 매우 엄격한 편집자와 함께 작업하고 있다고 상상해 보세요. 거대 언어 모델(LLM)의 세계에서 이 '편집자'는 바로 **타겟 모델(Target Model)**입니다. 이 모델은 매우 똑똑하고 정확하지만, 실행하는 데 시간이 오래 걸리고 비용이 많이 듭니다. 당신이 단어 하나를 쓸 때마다 이를 확인하는 데 오랜 시간이 걸립니다.

이를 빠르게 만들기 위해, 우리는 보통 **드래프트 모델(Draft Model)**을 사용합니다. 이것은 다음에 올 단어를 잘 추측하지만 완벽하지는 않은, 빠르고 에너지가 넘치는 인턴이라고 생각하면 됩니다.

기존 방식: "고정된 추측" 게임

표준적인 추측 디코딩(Speculative Decoding) 방식은 다음과 같이 작동합니다:

  1. **인턴(드래프트 모델)**이 빠르게 정해진 개수의 단어(예: 5개)를 연속해서 써 내려갑니다.
  2. 그러면 **편집자(타겟 모델)**가 그 5개의 단어를 한꺼번에 읽고 그것들이 맞는지 확인합니다.
  3. 문제점: 편집자는 까다롭습니다.
    • 만약 인턴이 너무 많은 단어(예: 9개)를 추측하면, 편집자가 6번째 단어에서 거절할 수 있습니다. 이는 인턴이 쓴 7, 8, 9번째 단어가 모두 시간 낭비였음을 의미합니다.
    • 만 만약 인턴이 너무 적은 단어(예: 2개)를 추측하면, 편집자가 너무 자주 확인을 위해 멈춰야 하므로, 병목 현상이 발생하는 편집자 때문에 전체 속도가 느려집니다.

이 논문은 추측해야 할 "완벽한" 단어의 개수가 끊임없이 변한다는 점을 지적합니다. 때로는 인턴이 기세를 타서 10개의 단어를 정확히 맞출 수도 있고, 때로는 단 1개 만에 막힐 수도 있습니다. 고정된 숫자(예: 항상 5개)를 사용하는 것은 마치 둥근 구멍에 사각 블록을 끼워 넣으려는 것과 같으며, 이는 비효로적입니다.

새로운 솔루션: PACER ("스마트 블록 검사기")

저자들은 PACER라고 불리는 새로운 시스템을 제안합니다. 인턴에게 고정된 개수의 단어를 추측하게 하는 대신, PACER는 **사전 검증 계층(Pre-verification Layer)**을 추가합니다. 이것은 인턴과 편집자 사이에 서 있는 **팀장(Team Lead)**이라고 생각하면 됩니다.

PACER의 작동 단계는 다음과 같습니다:

  1. 인턴은 작은 덩어리(블록) 단위로 작성합니다: 5개의 단어를 한꺼번에 쓰는 대신, 인턴은 3개의 단어로 구성된 작은 블록을 씁니다.
  2. 팀장이 블록을 검사합니다: 이 3개의 단어를 느린 편집자에게 보내기 전에, 팀장(아주 작고 빠른 AI)이 빠르게 검사합니다.
    • 팀장은 자문합니다: "이 3개의 단어가 편집자의 테스트를 통과할 것처럼 보이는가?"
  3. 결정:
    • 만약 팀장이 "예"라고 답하면: 인턴은 즉시 다음 3개 단어 블록을 작성합니다. 팀장은 그 블록도 검사합니다. 이 과정이 반복되면서, 길고 정확한 단어의 사슬이 매우 빠르게 구축됩니다.
    • 만 if 팀장이 "아니오"라고 답하면: 인턴은 즉시 멈춥니다. 팀장은 승인된 단어들만 모아서 최종 공식 확인을 위해 편집자에게 보냅니다. 인턴은 아마도 거절당했을 것이 분명한 나머지 블록을 작성하며 시간을 낭비하지 않습니다.

왜 이것이 더 나은가요?

이 논문은 교통 흐름의 비유를 사용하여 설명합니다.

  • 기존 방식: 당신은 일정한 속도로 운전합니다. 가끔 도로가 비어 있어서 더 빨리 갈 수 있을 때도 있지만, 가끔은 빨간불이 켜져 있는데도 계속 운전하여 연료를 낭비하기도 합니다.
  • PACER: 당신에게는 스마트한 내비게이터가 있습니다. 앞길이 뚫려 있다면 속도를 높여 더 멀리 운전합니다. 만약 내비게이터가 빨간불이 다가오는 것을 감지하면, 충돌하기 전에 미리 멈춰서 연료와 시간을 아낍니다.

결과

논문은 코딩, 수학 문제 풀이, 뉴스 요약 등 다양한 작업에서 이를 테스트했습니다.

  • 속도: PACER는 기존 방식보다 최대 2.66배 더 빠르게 시스템을 실행했습니다.
  • 결합: PACER를 "Ouroboros"라는 또 다른 속도 향상 기술과 결합했을 때, 시스템은 3.09배 더 빨라졌습니다.
  • 효율성: 이는 느린 편집자가 작업해야 하는 횟수를 성공적으로 줄이는 동시에, 빠른 인턴이 단순히 열심히 하는 것이 아니라 더 똑똑하게 일하도록 만들었습니다.

요약

PACER는 빠른 AI 인턴에게 스마트한 관리자를 붙여주는 것과 같습니다. 단어를 정해진 양만큼 추측하고 결과가 좋기를 바라는 대신, 관리자가 실시간으로 작은 배치(batch)를 검사합니다. 작업이 좋아 보이면 계속 진행하고, 위험해 보이면 즉시 멈춥니다. 이는 헛된 노력을 방지하고 사용자에게 최종 결과를 훨씬 더 빠르게 전달합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →