← 최신 논문
🤖 machine learning

Bastion: Budget-Aware Speculative Decoding with Tree-structured Block Diffusion Drafting

BASTION은 하드웨어 제약과 드래프트 품질 간의 균형을 맞추기 위해 적응형 최선 우선 확장을 통해 쿼리 의존적 트리 구조를 동적으로 구성하는 훈련 불필요 및 예산 인식 예측 디코딩 프레임워크로, 기존 블록 확산 기반 모델보다 우수한 성능을 보이면서 표준 자기회귀 디코딩 대비 최대 6.61 배의 속도 향상을 달성합니다.

원저자: Soowon Oh, Nam Cao, Yujin Kim, Hojung Jung, Huzama Ahmad, Sangmin Bae, Se-Young Yun

게시일 2026-05-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Soowon Oh, Nam Cao, Yujin Kim, Hojung Jung, Huzama Ahmad, Sangmin Bae, Se-Young Yun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 지혜롭지만 놀라울 정도로 느린 편집자 (타겟 모델) 와 함께 이야기를 쓰려고 상상해 보세요. 단 한 단어를 쓸 때마다 편집자가 그 단어를 읽고, 생각한 뒤 다음 단어를 쓸 수 있도록 승인 (녹색 신호) 을 줄 때까지 기다려야 합니다. 이것이 현재 AI 채팅봇이 작동하는 방식입니다. 매 단계마다 '확인'을 기다리며 한 번에 한 단어씩 작성하는 것이죠. 정확하지만 극도로 느립니다.

이를 가속화하기 위해 연구자들은 편집자가 확인하기 전에 다음 몇 단어를 추측할 수 있도록 더 빠르고 덜 지혜로운 조수 (초안 작성 모델) 를 사용합니다. 편집자가 추측에 동의하면 기다리는 시간을 건너뛰고 여러 단어를 한 번에 쓸 수 있습니다.

그러나 최신이자 가장 빠른 초안 작성기 (블록 확산) 에는 함정이 있습니다. 문장을 한 단어씩 추측하는 대신, 한 번에 단어 덩어리 전체를 외쳐냅니다. 문제는 모두 한꺼번에 외치기 때문에 단어들이 논리적 순서로 어떻게 연결되는지 항상 확신할 수 없다는 점입니다. 마치 요리사가 재료를 한 번에 여러 개 카운터에 던져놓는 것과 같습니다. 개별적으로는 좋아 보이지만, 맨 위에 있는 것을 집어만 든다면 기이하고 터무니없는 요리를 만들어낼 수 있습니다.

BASTION은 이 혼란을 해결하고 전체 과정을 번개처럼 빠르게 만들도록 설계된 새로운 시스템입니다. 간단한 비유를 들어 작동 원리를 설명하겠습니다.

1. "가능성의 나무" (단일 경로 대신)

기존 방법은 초안 작성자의 외침을 받아 '가장 좋은' 단어를 하나 선택한 다음, 그다음 '가장 좋은' 단어를 선택하며 운을 시험했습니다. 만약 그 경로가 틀렸다면 편집자는 전체를 거부해야 했고, 시간 낭비가 발생했습니다.

BASTION은 다릅니다. 초안 작성자가 단순히 하나의 경로만 제공하는 것이 아니라, 가능성의 가족 나무를 제공한다고 상상해 보세요.

  • 첫 단계에서 "다음 단어가 '고양이'일 가능성 (80%) 이나 '개'일 가능성 (20%) 이 있습니다"라고 말합니다.
  • '고양이'만 선택하는 대신, BASTION 은 '고양이'를 위한 가지 하나와 '개'를 위한 가지 하나를 가진 작은 나무를 만듭니다.
  • 그다음 다음 단어에 대해 '고양이'와 '개' 양쪽에서 다시 가지가 뻗어나갑니다.
  • 갑자기 같은 시작점에서 자라는 잠재적 문장들의 작은 숲이 생깁니다.

2. "스마트 정원사" (예산 인식 제어기)

여기가 까다로운 부분입니다. 무한한 숲을 키울 수는 없습니다. 편집자 (타겟 모델) 는 한 번에 확인할 수 있는 가지 수에 제한이 있습니다. 나무가 너무 넓거나 깊게 자라면, 나무를 확인하는 데 걸리는 시간이 단어를 한 단어씩 쓰는 것보다 더 길어집니다.

여기서 BASTION 의 **"스마트 정원사"**가 등장합니다.

  • 예산: 정원사는 편집자가 가진 시간 (예산) 을 정확히 알고 있습니다.
  • 전략: 나무를 고정된 크기 (예: 항상 10 개의 가지) 로 키우는 대신, 정원사는 각 가지의 확신을 살펴봅니다.
    • 가지가 매우 유망해 보이면 (높은 확신), 정원사는 그 가지를 더 깊게 키웁니다.
    • 가지가 약해 보이면 그곳에서 성장을 멈춥니다.
  • 정지 신호: 정원사는 끊임없이 묻습니다. "가지 하나를 더 추가하는 것이 속도를 높여줄까요, 아니면 막다른 골목 확인으로 시간을 낭비할까요?" 새로운 가지를 확인하는 비용이 이득을 초과하는 순간, 정원사는 성장을 멈추고 나무를 편집자에게 보냅니다.

3. "스피드미터" (하드웨어 인식)

다른 컴퓨터 (GPU) 는 다른 자동차와 같습니다. 스포츠카 (고성능 GPU) 는 거대한 나무를 매우 빠르게 확인할 수 있지만, 소형차 (약한 GPU) 는 같은 나무를 처리하는 데 어려움을 겪을 수 있습니다.

BASTION 에는 스피드미터가 내장되어 있어 귀하의 특정 컴퓨터가 얼마나 빠른지 정확히 알고 있습니다. 단순히 추측하는 것이 아니라, 해당 기계에서 특정 크기의 나무를 확인하는 데 걸리는 시간을 측정합니다. 이 실시간 데이터를 사용하여 귀하의 특정 설정에 맞춰 나무의 크기를 정확히 결정함으로써, 컴퓨터를 과부하시키지 않으면서 최대한의 속도를 보장합니다.

결과

이러한 아이디어들을 결합하여 BASTION 은 논문에서 말하는 6.61 배의 속도 향상을 달성합니다.

  • 표준 AI: 1 단어 작성, 대기, 1 단어 작성, 대기. (속도: 1 배)
  • 기존 빠른 방법: 몇 단어를 추측하지만, 종종 잘못된 경로에 갇힙니다. (속도: 약 2~3 배)
  • BASTION: 지능적이고 맞춤형 크기의 추측 나무를 키우고, 가장 유망한 경로를 확인하며, 가장 효율적인 시점에 정확히 멈춥니다. (속도: 약 6.6 배)

간단히 말해, BASTION 은 AI 작문을 위한 스마트 프로젝트 관리자와 같습니다. 맹목적으로 추측하거나 경직된 구조를 구축하는 대신, 컴퓨터의 속도에 완벽하게 맞춰진 유연한 "옵션의 나무"를 동적으로 구축하여 AI 가 실수 없이 최대한 빠르게 작성하도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →