← 최신 논문
🤖 machine learning

DARTree: Speculative Diffusion Decoding with Autoregressive Draft Trees

DARTree는 자기회귀적 교정을 선형 체인에서 고정 너비 후보 트리로 확장하여, 토큰 수용을 극대화하기 위해 AR 헤드 추론을 순차적 연산으로부터 분리함으로써 상태 최고 수준의 무손실 속도 향상을 달성하는 훈련이 필요 없는 투기적 디코딩 방법이다.

원저자: Tianyi Li, Yaxin Luo, Xinyi Shang, Zhiqiang Shen

게시일 2026-08-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tianyi Li, Yaxin Luo, Xinyi Shang, Zhiqiang Shen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 매우 똑똑하지만 믿을 수 없을 정도로 느린 로봇 친구와 함께 이야기를 쓰려고 한다고 상상해 보세요. 이 로봇은 세상을 이해하고 멋진 문장을 쓸 수 있는 천재이지만, 엄격한 규칙이 하나 있습니다. 바로 한 번에 단 한 단어씩만 써야 한다는 것입니다. 다음 단어를 쓰기 전, 로봇은 지금까지 쓴 모든 내용을 다시 생각하고, 그 후 가장 적절한 단 하나를 신중하게 골라야 합니다. 이는 마치 요리사가 수프에 넣을 재료를 한 번에 하나씩 맛본 후에 다음에 무엇을 넣을지 결정하는 것과 같습니다. 이 방식은 수프의 맛을 완벽하게 만들어 주지만, 큰 요리를 만드는 데는 엄청난 시간이 걸립니다. 인공지능의 세계에서 이 '한 번에 한 단어씩' 생성하는 과정은 **자기회귀 생성(autoregressive generation)**이라고 불리며, 이것이 강력한 AI 챗봇들이 때때로 느리게 느껴지는 주요 원인입니다.

품질을 해치지 않으면서 속도를 높이기 위해, 과학자들은 **추측 디코딩(Speculative Decoding)**이라는 기술을 발명했습니다. 이것은 느린 로봇을 대신해 다음 몇 단어를 추측하는 빠르고 에너지가 넘치는 인턴을 고용하는 것과 같습니다. 인턴은 문장 전체를 외치고, 느린 로봇은 인턴이 맞았는지 빠르게 확인합니다. 만약 인턴이 올바르게 추측했다면, 로봇은 문장 전체를 즉시 받아들이고 다음 단계로 넘어갑니다. 만약 인턴이 실수를 했다면, 로봇은 그 단어 하나만 수정하고 다시 시작합니다. 마법은 인턴이 여러 단어를 연속으로 올바르게 추측할 때 일어납니다. 이때 느린 로봇은 어려운 생각 과정을 건너뛰고 텍스트 한 덩어리에 대해 그저 "그래, 맞아!"라고 말하며 넘어갈 수 있습니다.

최근 연구자들은 더 빠른 인턴을 만들기 위해 **확산 모델(Diffusion Model)**이라는 다른 종류의 뇌를 사용했습니다. 이 인턴은 단어를 하나씩 추측하는 대신, 마치 화가가 단 한 번의 붓질로 캔버스를 채우듯 다음 문장 전체를 한꺼번에 상상합니다. 이것은 매우 빠르지만 결함이 있습니다. 인턴이 문장 전체를 한꺼번에 추측하기 때문에, 첫 번째 단어가 두 번째 단어에 어떻게 영향을 미치는지, 혹은 두 번째가 세 번째에 어떻게 영향을 미치는지 제대로 알지 못한다는 점입니다. 이는 마치 중간 장면을 보지 않고 영화의 결말을 추측하는 것과 같습니다. 이를 해결하기 위해 다른 연구자들이 "교정" 단계를 추가했지만, 그 방식은 여전히 느리고 투박하여 로봇이 인턴의 작업을 단어별로 확인하게 만들었고, 결국 속도를 높이려던 목적을 무색하게 만들었습니다.

여기서 MBZUAI의 VILA 랩에서 나온 새로운 논문인 DARTree가 등장합니다. 연구자들은 기존의 인턴 작업 확인 방식이 도서관을 정리할 때 책 한 권을 집어 들고, 선반을 확인하고, 다시 제자리에 둔 뒤, 다음 책을 집어 드는 식의 너무 많은 움직임이 필요한 방식이라는 것을 깨달았습니다. 대신 DARTree는 다양한 가능성의 "나무"를 구축하는 새로운 방법을 제안합니다. 인턴이 단 하나의 단어 경로만을 추측하는 것이 아니라, 다양한 이야기의 가능성을 담은 울창한 나무를 그린다고 상상해 보세요. 그러면 느린 로봇은 이 전체 나무를 한꺼번에 보되, 특별한 방식을 사용합니다. 바로 나무의 "가지"들을 하나씩이 아니라 큰 묶음(배치) 단위로 확인하는 것입니다.

핵심 혁신은 "추측"과 "확인"을 분리하는 데 있습니다. 먼저, 가능한 많은 이야기 경로를 담은 넓고 일시적인 나무를 한꺼번에 구축합니다. 그다음, 유망해 보이지 않는 가지들을 쳐내는 스마트한 가지치기 도구를 사용하여, 느린 로봇에게 보여줄 가장 좋은 나무만을 남깁니다. 이 과정에서 많은 이야기 경로를 배치 단위로 확인함으로써, 모든 것을 지연시켰던 기존의 단계별 확인 과정을 피할 수 있었습니다. 논문에 따르면 이 방법은 큰 성공을 거두었습니다. 수학 문제, 코딩 작업, 채팅 대화 등 다양한 테스트에서 DARTree는 한 번의 확인 단계당 최대 12.97 토큰(단어 또는 단어의 일부)을 수용할 수 있었습니다. 이는 이전 방식들에 비해 엄청난 도약이며, 최고의 경쟁자 중 하나인 DFlash보다 98.6% 더 뛰어났고, Domino보다 27.9% 더 우수했습니다.

그 결과, 이 시스템은 놀라울 정도로 빠르면서도 완벽하게 정확합니다. 연구자들은 이 새로운 방식이 표준적인 작성 방식보다 9.73배 더 빠르면서도 품질을 떨어뜨리거나 가짜 정보를 만들어내지 않는다는 것을 측정했습니다. 이들은 다양한 유형의 AI 모델로 테스트를 진행했으며, AI가 매우 엄격하고 논리적일 때(수학처럼)나 창의적이고 자유로울 때(채팅처럼) 모두 잘 작동한다는 것을 발견했습니다. 이 논문은 여러 경로를 병렬로 확인한 뒤 최종적인 절단을 수행하는 이 "나무" 접근 방식이 이러한 똑똑한 로봇들의 속도를 높이는 최선의 방법이라고 주장합니다. 이는 구조만 제대로 갖춰져 있다면 속도와 지능 사이에서 하나를 포기할 필요 없이 둘 다 가질 수 있음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →