← 최신 논문
💬 NLP

DBLAST: Dependent Block Drafting for Stochastic Speculative Decoding

이 논문은 확률적 추측 디코딩(stochastic speculative decoding)에서 독립적 블록 샘플링의 한계를 극복하여, 특히 고엔트로피 영역에서 수락된 초안 길이를 크게 향상시키는 수락 지향적 학습 목적 함수를 가진 종속 블록 초안 작성기인 DBLAST를 소개한다.

원저자: Amirmohammad Karimi, Chao Gao, Negar Hassanpour

게시일 2026-08-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Amirmohammad Karimi, Chao Gao, Negar Hassanpour

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

친구가 들려주는 이야기의 다음 단어를 추측하려고 한다고 상상해 보세요. 만약 단순히 무작위로 추측한다면 맞출 수도 있겠지만, 모든 가능성을 확인하는 데 시간이 너무 오래 걸립니다. 이제, 한 번에 문장 전체를 추측하며 외칠 수 있는 아주 빠르고 작은 조수(assistant)가 있다고 상상해 보세요. 그러면 친구(메인 브레인)는 그 추측들이 말이 되는지 빠르게 확인합니다. 만약 말이 된다면, 다음 단계로 건너뜁니다. 그렇지 않다면 다시 시도합니다. 이것이 거대한 AI 뇌를 더 빠르게 생각하게 만드는 마법 같은 기술인 "추측적 디코딩(speculative decoding)"입니다. 보통, 이 조수는 단어들을 하나씩 추측하거나, 단어들이 서로 의존하지 않는다고 가정하고 단어 뭉치(block)를 통째로 추측합니다. 하지만 여기에는 함정이 있습니다. 이야기가 창의적이거나, 무질서하거나, 예측 불가능해질 때(예를 들어 시를 쓰거나 모험 이야기를 쓸 때), 이러한 "독립적인" 추측들은 자주 무너집니다. 왜냐하면 단어들은 서로 의존하기 때문입니다. 조수가 첫 단어에 어울리는 단어를 추측하더라도, 그 다음에 추측한 단어가 첫 번째 단어와 어울리지 않으면 전체 뭉치가 거절당하게 됩니다. 이 논문은 왜 이런 현상이 발생하는지 파헤치고, 조수가 예측 불가능한 창의적인 이야기를 다룰 때도 속도가 느려지지 않도록 이를 해결하는 방법을 다룹니다.

화웨이(Huawei)에서 연구하는 이 논문의 저자들은 현재 이러한 AI 조수들이 작동하는 방식에 특정 문제가 있음을 발견했습니다. 그들은 메인 AI가 창의적이 되도록 요청받을 때(즉, 다양성을 위해 "확률적(stochastic)"이거나 무작위적인 샘플링을 사용할 때), 기존의 방식인 블록 단위 추측이 실패한다는 것을 발견했습니다. 이는 마치 사람들이 비밀 코드를 맞추기 위해 각자 독립적으로 숫자를 외치는 것과 같습니다. 만약 코드가 특정 패턴(예: "모든 숫자는 짝수여야 함")을 따라야 한다면, 독립적인 추측들은 서로 소통하지 않기 때문에 거의 항상 실패할 것입니다. 이 논문은 타겟 AI가 더 예측 불가능해질수록(엔트로피가 높아질수록), "독립적인" 블록 초안 작성자들이 단어들 사이의 숨겨진 연결 고리를 포착하지 못하기 때문에 수락되는 추측의 수가 급격히 감소한다는 것을 보여줍니다.

이 문제를 해결하기 위해 연구팀은 DBLast(Dependent Block Drafting, 의존적 블록 초안 작성)라는 새로운 방법을 도입했습니다. 단어 뭉치를 서로 관련 없는 것처럼 추측하는 대신, DBLast는 영리한 "잠재 혼합(latent mixture)" 시스템을 사용합니다. 이렇게 생각해 보세요. 조수가 단어 뭉치를 추측하기 전에, 작은 메뉴(예: "미스터리", "코미디", 또는 "슬픔")에서 비밀스럽게 "테마"나 "모드"를 선택합니다. 일단 그 테마가 선택되면, 블록 안의 모든 단어는 그 특정 테마에 맞춰 생성됩니다. 이는 단어들이 여전히 단일하고 빠른 패스로 생성됨에도 불구하고, 블록 내부에 일관된 이야기를 만들어냅니다. 이는 사람들이 무작위로 단어를 외치는 것과, 그룹이 먼저 장르를 합의한 뒤 함께 즉흥 연기를 하는 것의 차이와 같습니다.

또한 연구팀은 조수를 훈련시키는 방식도 변경했습니다. 단순히 "정답"을 맞추는 것(다음 단어의 확률을 맞추는 것)을 가르치는 대신, "수락되도록" 가르쳤습니다. 그들은 조수가 추측한 블록이 메인 AI에 의해 유지될 가능성이 높도록 보상하는 새로운 훈련 목표를 만들었습니다. 이는 농구 선수에게 단순히 공을 던지는 법을 가르치는 것이 아니라, 심판이 득점으로 인정할 만한 방식으로 슛을 쏘는 법을 가르치는 것과 같습니다. 이 "테마 기반" 추측과 "수락 중심" 훈련을 결합함으로써, 새로운 DBLast 방식은 기존의 독립적인 방식들을 지속적으로 능가합니다.

실험에서 연구진은 Qwen3-4B 및 Qwen3-8B 모델을 대상으로 수학, 코딩, 창의적 글쓰기 등 다양한 작업을 테스트했습니다. 그들은 DBLast가 특히 AI가 창의적일 때 수락되는 토큰 수를 일관되게 개선한다는 것을 발견했습니다. 가장 예측 불가능한 고엔트로피 환경에서, 새로운 방식은 더 큰 모델에서 평균 **12.1%**의 수락 길이를 향상시켰습니다. 이 논문은 이러한 접근 방식이 AI가 창의적이어야 할 때 더 빠르고 효율적으로 만들기 위한 핵심적인 누락 요소임을 시사하며, 말을 하기 전에 팀이 먼저 테마에 동의하는 것이 각자 독립적인 아이디어를 외치는 것보다 훨씬 낫다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →