← 최신 논문
🤖 AI

xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding

이 논문은 xPress를 제안하는데, 이는 병렬 정제를 통해 블록 확산 드래프터(block-diffusion drafter)에서 누락된 의존성을 복구하는 경량 인과적 정제기(causal refiner)로서, dFlash와 같은 기존 방식들과 비교하여 투기적 디코딩(speculative decoding)에서의 수용 길이(acceptance length)와 종단 간 처리량(end-to-end throughput)을 크게 향상시킨다.

원저자: Zheng Wang, Davis Wertheimer, Yu Chin Fabian Lim, Mudhakar Srivatsa, Raghu K. Ganti, Minjia Zhang, Naigang Wang

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zheng Wang, Davis Wertheimer, Yu Chin Fabian Lim, Mudhakar Srivatsa, Raghu K. Ganti, Minjia Zhang, Naigang Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

더 빠르게 말하기를 향한 경주: AI에 더 나은 초안 작성 시스템이 필요한 이유

당신이 이야기를 쓰려고 하는데, 엄격한 규칙이 하나 있다고 상상해 보세요. 당신은 한 번에 단 한 단어씩만 쓸 수 있고, 다음 단어를 쓰기 전에 반드시 아주 똑똑한 편집자가 그 단어를 검토할 때까지 기다려야 합니다. 이것이 오늘날 대부분의 강력한 AI 언어 모델이 작동하는 방식입니다. 이 모델들은 믿을 수 없을 정도로 정확하지만, 단어를 하나하나씩 확인해야 하기 때문에 매우 느립니다. 이를 가속화하기 위해 과학자들은 "추측 디코딩(speculative decoding)"이라는 기술을 발명했습니다. 이것은 마치 당신을 위해 다음 몇 단어를 대신 추측해 주는, 조금 덜 신중하지만 빠른 조수와 같습니다. 만약 똑똑한 편집자가 조수의 추측에 동의한다면, 당신은 기다리는 시간을 건너뛰고 그 단어들을 한꺼번에 쓸 수 있습니다.

문제는 조수가 보통 너무 의욕이 앞선다는 점입니다. 조수는 단독으로는 괜찮게 들리지만 문장 속에서 서로 잘 어울리지 않는 단어들을 추측하곤 합니다. 마치 맛있는 재료를 고르긴 하지만 그것들이 서로 맛이 어울리는지는 확인하지 않는 요리사와 같습니다. 최근에는 "디퓨전 드래프터(diffusion drafter)"라는 새로운 유형의 조수가 만들어졌습니다. 이 조수는 단어를 하나씩 차례대로 추측하는 대신, 마치 테이블 위에 퍼즐 조각 한 움큼을 던지듯 단어 덩어리 전체를 한꺼번에 추측하려고 시 합니다. 이는 매우 빠르지만, 모든 것을 한꺼번에 던지기 때문에 조각들이 제대로 연결되지 않는 경우가 많습니다. 똑똑한 편집자는 대부분의 조각을 거절하게 되고, 이는 다시 속도를 늦추는 원인이 됩니다. 연구자들이 던지는 핵심 질문은 이것입니다: "한꺼번에 추측하는 방식의 속도는 유지하면서, 편집자가 실제로 그 단어들을 수용할 수 있도록 실수를 바로잡을 수 있을까?"

xPress의 등장: 퍼즐을 해결하는 "병렬 정제기"

이 논문은 xPress라고 불리는 영리한 해결책을 소개합니다. Qwen3-8B와 같은 모델을 활용하여 연구한 저자들은, 빠른 "디퓨전 드래프터"가 단어 덩어리를 추측하는 데는 뛰어나지만, 단어들이 서로 의존한다는 결정적인 규칙(인과성, causality)을 놓친다는 점을 깨달았습니다. 예를 들어, 첫 단어가 "she"라면 다음 단어는 "are"가 되어서는 안 됩니다. 비록 "are"가 단독으로는 흔히 쓰이는 단어일지라도 말입니다. 디퓨전 드래프터는 모든 것을 동시에 추측하기 때문에 이러한 인과성을 알지 못합니다.

이를 해결하기 위해 xPress는 경량화된 인과적 정제기(lightweight causal refiner) 역할을 합니다. 디퓨전 드래프터가 테이블 위에 퍼즐 조각 한 움큼을 던진다고 상상해 보세요. xPress는 그 전체 더미를 한눈에 보면서, 조각들을 하나씩 분해하지 않고도 올바른 순서로 밀어 넣어 정렬하는 빠르고 똑똑한 손과 같습니다. xPress는 **야코비 디코딩(Jacobi decoding)**이라는 기술을 사용하여 이를 수행합니다. 퍼즐 조각을 하나씩 고치는 대신(이는 느린 방식입니다), xPress는 전체 그림을 보고 모든 조각을 동시에 빠르게 조정하며, 조각들이 완벽하게 맞물릴 때까지 이 "보고 밀어 넣기" 과정을 몇 번 반복합니다(보통 약 4~6회).

결과는 인상적입니다. xPress를 사용하면 기존의 빠른 드래프터와 비교했을 때 평균적으로 추측된 단어의 약 30%를 더 많이 수용할 수 있습니다. 수학 문제를 푸는 것과 같은 특정 테스트에서는 속도 향상이 무려 **56%**에 달했습니다. AI가 말하는 전체 속도를 측정했을 때, xPress는 기존 방식보다 평균적으로 1.3배, 최상의 경우 최대 1.7배 더 빠르게 만들었습니다.

이 논문은 사람들이 이 문제를 해결하기 위해 시도했던 두 가지 다른 방식에 대해 명시적으로 반론을 제기합니다. 한 가지 방법은 추측의 거대한 "트리(tree)" 구조를 만드는 것인데, 이는 복잡하고 실행 비용이 많이 듭니다. 다른 방법은 "마르코프 헤드(Markov head)"를 사용하여 단어들을 엄격한 선형 순서대로 하나씩 고치는 것인데, 이는 정확하지만 한꺼번에 추측하는 속도의 이점을 잃어버리기 때문에 느립니다. 저자들은 xPress가 이 두 가지 모두를 능가함을 보여줍니다. 즉, 단계별로 고치는 방식보다는 빠르고, 복잡한 트리 방식보다는 단순합니다.

본 연구는 xPress가 속도를 늦추지 않으면서도 "인과적 정보"(단어가 이전 단어에 의존한다는 규칙)를 빠른 시스템에 다시 주입함으로써 작동함을 확인했습니다. 연구진은 수학, 코딩, 채팅 벤치마크에서 테스트를 진행했으며, xPress가 경쟁 모델들을 일관되게 압도한다는 것을 발견했습니다. 이 논문은 이러한 접근 방식이 AI가 빠르면서도 정확할 수 있게 해주는 견고하고 절제된 개선책임을 입증하며, 올바른 정제 방법만 있다면 속도를 위해 품질을 희생할 필요가 없다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →