← 최신 논문
💬 NLP

Unlocking Parallelism in Autoregressive Language Models via Speculative Decoding with Progressive Tree Drafting

이 논문은 별도의 보조 모듈 없이도 최대 2배의 디코딩 속도 향상을 달성하기 위해 타겟 LLM 내에서 구조화되고 유도된 병렬 전략을 활용하는, 훈련이 필요 없고 모델에 구애받지 않는 투기적 디코딩 방법인 Progressive Tree Drafting (PTD)를 소개한다.

원저자: Zipeng Gao, Zhi Zheng, Qingrong Xia, Junda Lin, Ziwei Zhao, Tong Xu, Zhefeng Wang, Enhong Chen

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zipeng Gao, Zhi Zheng, Qingrong Xia, Junda Lin, Ziwei Zhao, Tong Xu, Zhefeng Wang, Enhong Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑한 로봇 친구와 함께 이야기를 쓰려고 한다고 상상해 보세요. 보통 이 로봇은 매우 신중하지만 매우 느립니다. 단어 하나를 쓰고, 생각을 멈추고, 자신의 작업을 확인한 다음, 그다음 단어를 쓰는 식이죠. 이 "하나씩" 진행되는 과정은 마치 일방통행 도로와 같아서, 로봇이 매 단어를 다 쓸 때까지 기다려야 하므로 교통 체증이 쉽게 발생합니다.

한동안 사람들은 이 속도를 높이기 위해 더 작고 빠른 로봇인 "초안 작성 보조자(drafting assistant)"를 고용하려고 노력했습니다. 이 보조자는 다음 몇 단어를 미리 추측하는 역할을 합니다. 하지만 이는 새로운 문제를 낳았습니다. 당신은 보조자에게 비용을 지불해야 하고, 보조자가 큰 로봇처럼 말하도록 훈련시켜야 하며, 그들 사이에서 끊임없이 메모를 전달해야 했습니다. 이는 마치 메신저를 고용했는데, 그 메신저가 왔다 갔다 하느라 오히려 모두의 속도를 늦추는 것과 같았습니다.

그 후, 몇몇 영리한 연구자들은 다른 트릭을 시도했습니다. 바로 큰 로봇에게 별도의 도움 없이 스스로의 미래 단어들을 예측하게 하는 것이었습니다. 그들은 로봇이 한 번에 여러 가지 서로 다른 이야기 경로를 생각하도록 만들려 했습니다. 하지만 이 논문은 초기 "자기 추측(self-guessing)" 방식들이 다소 무질서했다고 주장합니다. 로봇이 거의 똑같은 문장을 두세 개씩 써내면서, 중복된 아이디어에 뇌력을 낭비하는 경우가 많았기 때문입니다. 이는 마치 요리사에게 세 가지 다른 식사를 요리하라고 시켰는데, 결국 세 가지 모두 똑같은 수프가 되어버린 상황과 같습니다.

이 논문의 핵심 아이디어: "트리(Tree)" 트릭

COLM 2026에서 채택된 이 논문의 저자들은 **점진적 트리 초안 작성(Progressive Tree Drafting, PTD)**이라 불리는, 로봇의 사고를 조직하는 새로운 방법을 제안합니다. 로봇이 무작위로 분리된 경로를 헤매게 하는 대신, 아이디어의 "나무(tree)"를 키우도록 유도하는 것입니다.

작동 방식은 다음과 같이 재미있게 설명할 수 있습니다:

  1. 가지치기(The Branching): 로봇이 하나의 문장에서 시작한다고 상상해 보세요. 단순히 다음 단어를 추측하는 대신, 나무처럼 가지를 뻗어 동시에 몇 가지 다른 결말을 시도합니다 (예: "하와이는 즐거운 곳이다" vs "하와이는 유명한 곳이다").
  2. 전정(The Pruning): 이것이 마법 같은 부분입니다. 만약 나무의 두 가지가 너무 비슷해 보이기 시작하면 (마치 두 가지가 정확히 같은 방향으로 자라는 것처럼), 로봇은 불필요한 것들을 "전정(pruning)"합니다. 에너지를 아끼기 위해 중복된 것들을 잘라내는 것이죠.
  3. 성장(The Growth): 로봇은 단계별로 이 나무를 계속 키워나가지만, 가지들이 실제로 서로 다르고 말이 되는지 끊임없이 확인합니다. 이는 식물이 야생 상태로 자라게 두되, 식물이 건강하고 다양성을 유지할 수 있도록 죽거나 동일한 잔가지들을 다듬는 정원사와 같습니다.

그들이 발견한 것

연구진은 이 아이디어를 LLaMA나 Qwen과 같은 몇몇 유명한 로봇 두뇌(모델)에 테스트하였고, 흥미로운 결과를 얻었습니다:

  • 속도: 이 트리 방식을 사용함으로써, 로봇은 수학 문제에서 최대 2.30배, 코딩 작업에서 2.08배 더 빠르게 글을 쓸 수 있었습니다. 일반적인 대화 작업에서는 약 1.67배 더 빨랐습니다.
  • 추가 도움 불필요: 가장 좋은 점은 이 방식이 추가적인 "보조" 로봇이나 특별한 훈련을 필요로 하지 않는다는 것입니다. 기존의 로봇을 그대로 사용하여 즉시 작동합니다.
  • 더 나은 품질: 로봇이 단순히 똑같은 추측을 반복하는 대신 다양한 경로(트리 가지)를 탐색하도록 강제되기 때문에, 로봇이 수용하는 단어들은 더 길고 서로 더 잘 어울립니다.

그들이 배제한 것

이 논문은 그들의 새로운 방법만큼 효과적이지 않은 것들에 대해 매우 명확하게 밝히고 있습니다. 그들은 단순히 로봇이 여러 개의 선형 경로(추측의 직선 형태)를 예측하게 하는 것만으로는 충분하지 않다고 주장합니다. 그들의 분석에 따르면, "트리" 구조와 중복 제거(pruning) 없이는 로록이 80% 이상 동일한 아이디어를 생각하는 데 시간의 절반 이상을 낭비한다는 것을 보여주었습니다. 또한, 외부 "초안 작성 모듈"(보조 로봇)을 추가하는 것은 너무 많은 통신 노이즈를 생성하고 너무 많은 훈련을 요구하기 때문에, 그들의 자기 유도형 트리 방식보다 효율성이 떨어진다는 것을 보여주었습니다.

얼마나 확신하는가?

저자들은 실제 하드웨어(NVIDIA L20 GPU)에서 실제 실험을 수행했기 때문에 이 수치들에 대해 상당히 확신하고 있습니다. 그들은 단순히 아이디어를 시뮬레이션한 것이 아니라, "초당 토큰 수(tokens per second)"로 속도를 측정했으며, 그들의 방식이 Lookahead Decoding이나 Self-Draft와 같은 다른 인기 있는 "훈련 없는(no-training)" 방식들을 지속적으로 앞질렀음을 발견했습니다. 예를 들어, GSM-8k 수학 벤치마크에서 그들의 방식은 2.30배의 속도 향상을 달មាន 반면, 그다음으로 좋은 방식은 1.90배에 그쳤습니다.

요약하자면, 이 논문은 만약 당신이 추가적인 도움 없이 AI를 더 빠르게 말하게 하고 싶다면, 로봇을 직선으로 헤매게 두지 말고 스마트하게 다듬어진 아이디어의 나무를 키우도록 유도해야 한다고 제안합니다. 이는 로봇이 똑같은 것을 두 번 생각하는 데 시간을 낭비하지 않도록 함으로써 로봇의 두뇌를 최대한 활용하는 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →