← 최신 논문
💬 NLP

DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding

DFlare는 더 깊고 유능한 초안 모델을 가능하게 하는 경량 계층별 융합 메커니즘을 통해 기존 블록 확산 방식의 표현력 한계를 극복함으로써 LLM 추론을 가속화하며, 다양한 벤치마크에서 상당한 속도 향상을 달성합니다.

원저자: Jiebin Zhang, Zhenghan Yu, Song Liu, Eugene J. Yu, Zheng Li, Dawei Zhu, Jiangshan Duo, Weimin Xiong, Yifan Song, Guanghua Yu, Jianchen Zhu, Sujian Li

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiebin Zhang, Zhenghan Yu, Song Liu, Eugene J. Yu, Zheng Li, Dawei Zhu, Jiangshan Duo, Weimin Xiong, Yifan Song, Guanghua Yu, Jianchen Zhu, Sujian Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 아주 긴 이야기를 쓰려고 노력 중인 숙련된 작가라고 상상해 보세요. 하지만 당신은 매우 느리고 완벽주의적인 작가(타겟 모델)입니다. 다음 단어를 쓸 때마다 당신은 아주 깊이 고민하고, 문법을 확인하며, 그것이 완벽하게 들어맞는지 확인해야 합니다. 이 과정에는 많은 시간이 걸립니다.

이 속도를 높이기 위해, 당신은 빠르고 에너지가 넘치는 조수(드래프트 모델)를 고용했습니다. 조수는 당신을 대신해 다음 몇 단어를 추측하려고 노력합니다. 만약 조수가 맞히면, 당신은 그저 "그래, 계속해봐!"라고 말하며 빠르게 앞으로 나아갑니다. 만약 조수가 틀리면, 당신은 멈춰서서 조수를 교정하고 처음부터 다시 시작해야 합니다. 이것을 **스펙큘레이티브 디코딩(Speculative Decoding)**이라고 부릅니다.

문제점: "하나의 사이즈로 모두 해결하려는" 조수

최근에 DFlash라는 새로운 방식이 조수를 더 똑똑하게 만들려고 시도했습니다. DFlash의 조수는 단어 하나씩 추측하는 대신, 단어 한 덩어리(블록)를 통째로(예를 들어 다음 문장 전체를 한 번에) 추측하려고 합니다.

하지만 DFlash에는 큰 결함이 있었습니다. DFlash의 조수에게는 메인 작가의 뇌에서 추출한 단 하나의 범용적인 '치트 시트(요약 노트)'가 주어졌습니다.

  • 결함: 조수에게 7개의 사고 층(건물의 7개 층과 같은 개념)이 있다고 상상해 보세요. DFlash는 1층, 4층, 7층 모두에게 똑같은 치트 시트를 주었습니다.
  • 결과: 조수는 혼란에 빠졌습니다. 낮은 층에는 간단한 문법 규칙이 필요했고, 높은 층에는 복잡한 스토리 아이디어가 필요했습니다. 모든 층이 똑같이 일반적인 정보만 받게 되자, 조수는 층을 더 쌓아도 더 똑똑해질 수 없었습니다. 즉, 층을 늘려도 성능이 향상되지 않는 '천장'에 부딪힌 것입니다.

해결책: DFLARE

연구진은 DFLARE를 개발했습니다. DFLARE는 조수의 훈련 시스템을 업그레이드하여, 건물의 모든 층이 각자에게 맞춤화된 치트 시트를 받도록 만드는 것입니다.

DFLARE가 작동하는 방식은 다음과 같은 쉬운 비유를 통해 설명할 수 있습니다.

1. 맞춤형 치트 시트 (계층별 퓨전 - Layer-wise Fusion)

DFLARE에서는 모든 층에 동일한 범용 치트 시트를 주는 대신, 각 층을 위한 고유한 정보의 조합을 생성합니다.

  • 비유: 메인 작가(타겟 모델)에게는 도서관이 있다고 상상해 보세요.
    • DFlash는 도서관에서 페이지 한 장을 가져와 7번 복사한 뒤, 모든 층에 똑같이 나누어 주었습니다.
    • DFLARE는 도서관을 살펴보며 이렇게 말합니다: "1층에는 문법에 관한 페이지가 필요하고, 4층에는 반전에 관한 페이지가 필요하며, 7층에는 캐릭터의 감정에 관한 페이지가 필요해." 그리고 여러 페이지를 섞어서 각 특정 층에 딱 맞는 고유하고 완벽한 가이드를 만들어냅니다.
  • 이점: 모든 층이 전문화된 가이드를 갖게 되었기 때문에, 조수는 층을 더 쌓음으로써 실제로 더 똑똑해질 수 있습니다. 이 '천장'이 깨진 것입니다.

2. 별도의 노트 (이종 KV 프로젝션 - Heterogeneous KV Projections)

조수는 두 가지 유형의 메모를 저장해야 합니다: 자신의 추측과 메인 작가의 정보입니다.

  • 비유: 기존 시스템에서 조수는 자신의 추측과 메인 작가의 노트를 같은 노트에 적으려고 했습니다. 그러다 보니 잉크가 서로 섞여 읽기가 매우 어려웠습니다.
  • DFLARE의 해결책: DFLARE는 조수에게 두 개의 별도 노트를 줍니다. 하나는 자신의 거친 추측을 위한 것이고, 다른 하나는 엄격하게 메인 작가의 노트만을 위한 것입니다. 이를 통해 정보를 깨끗하고 사용하기 쉽게 유지합니다.

3. 단계별 학습 (점진적 손실 - Progressive Loss)

조수가 학습할 때는 이야기의 가장 어려운 부분부터 바로 마스터하려고 해서는 안 됩니다.

  • 비유: 선생님이 학생을 채점한다고 상상해 보세요.
    • 기존 방식: 선생님은 첫날부터 쉬운 문장과 어려운 문장을 똑같은 중요도로 채점했습니다. 학생은 압도당했습니다.
    • DFLARE의 방식: 선생님은 먼저 자신감을 키울 수 있도록 초반의 쉬во운 문장들에만 집중합니다. 학생이 실력이 좋아짐에 따라, 선생님은 점차 블록의 끝에 있는 더 어려운 문장들을 채점하기 시작합니다. 이러한 "워밍업" 접근 방식은 조수가 더 빠르고 효과적으로 학습하도록 돕습니다.

결과: 얼마나 더 빠른가?

연구진은 이 새로운 시스템을 세 가지 서로 다른 "메인 작가"(AI 모델)에게 테스트했으며, DFLARE가 이전의 최고 방식인 DFlash보다 훨씬 빠르다는 것을 발견했습니다.

  • 중형 규모의 작가 (Qwen3-4B) 기준: 5.52배 더 빠릅니다.
  • 대형 규모의 작가 (Qwen3-8B) 기준: 5.46배 더 빠릅니다.
  • 초대형 규모의 작가 (GPT-OSS-20B) 기준: 3.91배 더 빠릅니다.

단순히 말해서, 기존 방식이 한 단락을 쓰는 데 10초가 걸렸다면, DFLARE는 동일한 고품질의 이야기를 쓰면서도 약 2초 만에 끝낼 수 있습니다.

요약

DFLARE는 조수에게 일반적인 가이드 대신 전문화된 맞춤형 가이드를 제공함으로써 조수를 업그레이드하는 것과 같습니다. 이를 통해 조수는 더 커지고 더 똑똑해질 수 있으며, 결과적으로 AI가 텍스트, 코드 또는 수학 문제를 작성하는 속도를 획기적으로 높일 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →