← 최신 논문
🤖 machine learning

Trees from Marginals: Autoregressive drafting with factorized priors

이 논문은 효율적인 트리 기반 투기적 디코딩을 가능하게 하기 위해 인수 분해된 초안 주변 한계(draft marginals)로부터 조건부 의존성을 재구성하는 경량 자기회귀 어댑터인 Weaver를 소개하며, 새로운 롤백 없는 검증 알고리즘과 최적화된 CUDA 커널을 통해 표준 자기회귀 디코딩 대비 4.37배의 속도 향상을 달성한다.

원저자: Yuma Oda, Ryan Mathieu, Roman Knyazhitskiy, Artur Chakhvadze

게시일 2026-07-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yuma Oda, Ryan Mathieu, Roman Knyazhitskiy, Artur Chakhvadze

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 똑똑하지만 속도는 느린 사서(AI 모델)와 함께 이야기를 쓰려고 한다고 상상해 보세요. 당신이 이야기의 다음 단어를 물을 때마다, 사서는 멈춰서서 열심히 생각하고, 자신의 거대한 도서관에 있는 모든 책을 확인한 뒤에야 다음 단어를 당신에게 속삭여야 합니다. 이것이 현재 AI가 작동하는 방식입니다: 한 번에 한 단어씩, 한 단계씩. 정확하긴 하지만, 느립니다.

이 논문은 정확도를 잃지 않으면서 이 사서를 훨씬 더 빠르게 만드는 새로운 방법을 소개합니다. 그들은 이 방법을 "Marginals로부터의 트리(Trees from Marginals)"(또-는 DFlash-TfM)라고 부릅니다. 이 방식이 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.

문제점: "추측 게임"의 한계

속도를 높이기 위해 연구자들은 **추측 디코딩(Speculative Decoding)**이라는 기술을 발명했습니다.

  • 기존 방식: 빠르고 주니어급인 조수(‘드래프터’)가 다음 몇 단어를 추측합니다. 그러면 느린 사서(‘검증기’)가 그 추측들이 맞는지 확인합니다. 만약 맞다면, 사서는 그 단어들을 한꺼번에 수락합니다. 만약 틀렸다면, 사서는 실수를 바로잡고 처음부터 다시 시작합니다.
  • "팩터화된(Factorized)" 드래프터의 문제: 어떤 조수들은 다음 단어들이 서로 어떻게 연결되는지 무시하고 다음 단어들을 한꺼번에 추측하기 때문에 매우 빠릅니다. 이는 마치 요리사가 이전 재료들을 맛보지도 않고 다음 세 가지 재료를 한꺼번에 추측하는 것과 같습니다.
    • 함정: 추측하는 목록이 길어질수록, 요리사는 그 순서를 맞추는 데 점점 서툴러집니다. 첫 번째 추측은 맞을지 몰라도, 첫 두 개를 고려하지 않았기 때문에 세 번째 추측은 대개 틀리게 됩니다. 이는 한 번에 수락할 수 있는 단어의 수를 제한합니다.

해결책: "위버(Weaver)" 조수

저자들은 빠른 요리사의 속도와 신중한 편집자의 논리를 결합한 새로운 시스템을 만들었습니다. 그들은 이 새로운 편집자를 **위버(Weaver)**라고 부릅니다.

  1. "Top-K" 쇼트리스트: 먼저, 빠른 조수(DFlash)가 빠르게 대략적인 추측을 하고 다음 자리에 올 가능성이 높은 상위 512개의 단어 목록(쇼트리스트)을 제공합니다. 이는 요리사가 "다음 재료는 아마 이 512가지 향신료 중 하나일 거야"라고 말하는 것과 같습니다.
  2. 위버의 역할: 무턱대고 추측하는 대신, 위버 (작고 가벼운 AI)는 이 쇼트리스트를 살펴봅니다. 위버는 마치 똑똑한 편집자처럼 행동하며 이렇게 말합니다: "좋아, 만약 첫 번째 단어가 '소금'이었다면, 다음 단어는 거의 확실히 '설탕'이 아니라 '후추'겠군."
  3. 트리(Tree) 구축: 위버는 단순히 일직선의 추측을 만드는 것이 아니라, 트리를 구축합니다.
    • 가족 계보를 상상해 보세요. 뿌리는 현재의 문장입니다.
    • 위버는 가지를 뻗어 이야기의 다양한 가능한 경로를 만듭니다 (예: "고양이가 매트 위에 앉았다" vs "고양이가 바닥 위에 앉았다").
    • 위버는 작고 빠른 조수가 제공한 쇼트리스트만을 보기 때문에, 이 가능성의 트리를 구축하는 속도가 믿을 수 없을 정도로 빠릅니다.

검증: 트리 확인하기

이제 느린 사서가 이 추측 트리를 확인해야 합니다.

  • 기존의 문제: 만약 사서가 표준적인 "재귀적(recurrent)" 메모리 시스템(현대 AI의 Gated Delta Net 레이어와 같은 방식)을 사용한다면, 트리를 확인하는 것은 보통 악몽과 같습니다. 이는 마치 실제 경로가 무엇인지 확인하기 위해 나무의 모든 가지를 하나하나 따라 걸어 내려가야 하는 것과 같습니다. 매우 느립니다.
  • 새로운 기술: 저자들은 특별한 수학적 지름길( "롤백이 없는(rollback-free)" 알고리즘)을 발명했습니다.
    • 모든 가지를 일일이 따라가는 대신, 그들은 **마스크드 삼각 솔브(masked triangular solve)**를 사용합니다. 이는 사서가 복잡한 지도에서 모든 막다른 길을 운전해서 가보지 않고도, 전체 트리 구조를 한눈에 보고 어떤 경로가 올바른 경로인지 즉시 알 수 있게 해주는 마법의 지도와 같습니다.

결과: 속도와 효율성

이 아이디어들을 결합함으로써, 이 시스템은 두 가지 주요 성과를 달성합니다.

  1. 더 많은 단어 수락: 위버가 빠른 조수의 논리적 오류를 바로잡아주기 때문에, 사서는 더 긴 단어 체인을 수락합니다 (이전 최고 방식보다 최대 77% 더 많이).
  2. 엄청난 속도 향age: 이 전체 과정은 매우 효율적이어서, AI가 텍스트를 생성하는 속도가 표준적인 느린 방식보다 4.37배 더 빠릅니다. 또한 기존의 "가장 빠른" 방식보다 약 25% 더 뛰어난 성능을 보입니다.

요약 비유

  • 표준 AI: 한 글자씩 사전과 대조하며 이야기를 쓰는 달팽이.
  • 기존의 빠른 방식: 다음 문단을 통째로 추측하는 속독가이지만, 앞부분을 신경 쓰지 않았기 때문에 문단 중간 부분을 자주 틀리는 사람.
  • 이 새로운 방식 (위버): 적절할 것 같은 상위 500개의 단어를 빠르게 고른 뒤, 작고 아주 똑똑한 편집자(위버)가 그 단어들을 가장 논리적인 문장들의 가지 모양 트리로 즉시 배열하는 속독가. 그리고 특별한 "마법 지도"(새로운 커널)가 전체 트리를 즉시 확인하여 어떤 경로가 진짜인지 찾아냅니다.

그 결과, 이 AI는 신중한 편집자의 정확도를 가진 채로 속독가처럼 빠르게 글을 써 내려가며, 훨씬 더 즉각적이고 반응성이 좋은 상호작용을 만들어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →