← 최신 논문
💻 computer science

Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding

본 논문은 병렬 백본과 경량 정제 헤드 및 베이스 고정 학습 커리큘럼을 결합하여 인과적 의존성 모델링과 자기회귀식 초안을 분리하는 추측적 디코딩 프레임워크인 Domino 를 제안하며, 이를 통해 Qwen3 모델에서 최대 5.8 배의 처리량 속도 향상을 달성합니다.

원저자: Jianuo Huang, Yaojie Zhang, Qituan Zhang, Hao Lin, Hanlin Xu, Linfeng Zhang

게시일 2026-05-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jianuo Huang, Yaojie Zhang, Qituan Zhang, Hao Lin, Hanlin Xu, Linfeng Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이야기의 다음 단어를 추측해 보라고 상상해 보세요. 하지만 매우 엄격하고 느린 규칙으로 수행합니다. 하나의 단어를 생각해 내고, 그것을 적어 보고, 그것이 맞는지 확인한 다음, 그리고 나서 다음 단어를 생각해야 합니다. 이것이 현재 대규모 AI 모델 (LLM) 이 일반적으로 작동하는 방식입니다. 정확하지만, 초고속으로 달릴 준비가 된 팀이 있음에도 불구하고 혼잡한 방을 한 걸음씩 걸어가는 것과 같습니다.

이 논문은 이 과정을 훨씬 더 빠르게 만들기 위해 Domino라는 새로운 방법을 소개합니다. 간단한 비유를 들어 작동 방식을 설명해 보겠습니다:

문제: "속도 대 정확성"의 함정

속도를 높이기 위해 연구자들은 Speculative Decoding(추측적 디코딩) 이라는 트릭을 사용합니다. 이는 "대본 팀"(더 작고 빠른 AI) 이 다음 몇 단어를 추측하여 "주요 보스"(크고 느린 AI) 가 확인하게 하는 것과 같습니다.

  • 기존 방식 (자기회귀적): 대본 팀이 한 단어를 추측한 다음, 그 다음 단어를, 그 다음 단어를 순서대로 하나씩 추측합니다. 이전 단어를 보고 다음 단어를 추측할 수 있으므로 매우 정확합니다. 하지만 각 단계를 기다려야 하므로 여전히 느립니다.
  • "병렬" 방식: 대본 팀이 다음 단어들을 한 번에 모두 추측합니다. 마치 한 줌의 카드를 테이블 위에 던지는 것과 같습니다. 이는 매우 빠르지만, 서로를 먼저 살펴보지 않았기 때문에 추측이 종종 엉망이거나 틀립니다.

이 논문은 이렇게 말합니다: "한 줌의 카드"의 속도와 "하나씩" 방식의 정확성을 모두 가질 수는 없을까요?

해결책: Domino 프레임워크

저자들은 양쪽 세계의 장점을 모두 얻기 위해 작업을 두 부분으로 나누는 Domino를 개발했습니다.

1. 병렬 백본 (대략적인 초안)

먼저 Domino 는 빠른 병렬 엔진을 사용하여 다음 몇 단어를 한 번에 "대략적인 초안"으로 내뱉습니다.

  • 비유: 요리사가 아직 다듬지 않은 채로 여러 재료를 빠르게 도마 위에 던지는 것을 상상해 보세요. 빠르지만 재료들이 올바른 순서나 모양으로 정리되어 있지 않습니다.

2. Domino 헤드 (가벼운 정제기)

이 부분이 마법과 같습니다. 전체 조리 과정을 다시 수행하는 대신 (이는 느립니다), Domino 는 Domino Head라는 작고 전문화된 도구를 추가합니다.

  • 비유: 부주방장이 재료 더미를 빠르게 살펴보는 것을 상상해 보세요. 그들은 전체 요리를 다시 만들지 않습니다. 대신 이전 내용에 기반하여 재료의 순서와 모양을 미세하고 정확하게 조정합니다.
  • 작동 방식: Domino Head 는 "인과적"입니다. 즉, 단어 B 가 단어 A 에 의존한다는 것을 이해합니다. 이 도구는 대략적인 초안을 받아 단어들이 논리적으로 흐르도록 약간의 "수정"을 가하며, 느리고 단계별인 과정을 기다릴 필요 없이 이를 수행합니다.

훈련 트릭: "Teacher Forcing"

이 시스템을 가르치기 위해 저자들은 교묘한 훈련 방법을 사용했습니다.

  • 문제: AI 가 자신의 실수를 추측하며 연습하게 하면 혼란을 겪고 나쁜 습관을 배우게 됩니다.
  • 해결책: 그들은 "Teacher Forcing"을 사용했습니다. 학생이 수정 작업을 연습하는 동안 교사가 올바른 카드를 들어 보여준다고 상상해 보세요. 이렇게 하면 AI 가 자신의 실수가 아닌 올바른 맥락에 기반하여 초안을 수정하는 법을 배우게 됩니다.
  • 커리큘럼: 그들은 또한 AI 를 단계별로 가르쳤습니다. 먼저 "대략적인 초안"(병렬 백본) 이 강력하도록 보장한 다음, 서서히 "정제기"(Domino Head) 가 미세 조정을 담당하도록 했습니다. 이는 AI 가 정제기에 지나치게 의존하여 처음부터 좋은 대략적인 초안을 만드는 방법을 잊어버리는 것을 방지했습니다.

결과: 품질을 잃지 않고 속도 향상

이 논문은 강력한 AI 모델 (Qwen3) 에서 이를 테스트한 결과 다음과 같은 사실을 발견했습니다:

  • 속도: 이전 방법보다 훨씬 빠릅니다. 일부 작업에서는 표준 방식보다 거의 8 배 더 빨랐습니다.
  • 효율성: "수용률"(주요 보스가 대본 팀의 추측을 대부분 동의함) 을 높게 유지하면서 대본 비용을 낮게 유지합니다.
  • 비교: DFlash 와 같은 다른 빠른 방법과 EAGLE 와 같은 다른 정확한 방법들의 장점을 결합하여 이들을 능가합니다.

요약

Domino는 이야기의 다음 몇 단어를 한 번에 추측하기 위해 빠른 팀을 고용한 다음, 최종 보스가 확인하기 전에 논리와 흐름을 빠르게 수정하는 작고 똑똑한 편집자를 추가하는 것과 같습니다. 이를 통해 AI 는 신중한 보행의 정확성을 유지하면서 질주하는 속도로 실행될 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →