← 최신 논문
💬 NLP

VIA-SD: Verification via Intra-Model Routing for Speculative Decoding

본 논문은 중간 정도의 신뢰도를 가진 초안 토큰을 검증하기 위해 모델 내부 라우팅을 활용하여 슬림한 하위 모델을 배치함으로써, 별도의 학습 수정 없이도 기존 방식보다 거부율을 낮추고 상당한 추론 속도 향상을 달성하는 다계층 투기적 디코딩 프레임워크인 VIA-SD를 제안한다.

원저자: Yuchen Xian, Yang He, Yunqiu Xu, Yi Yang

게시일 2026-06-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuchen Xian, Yang He, Yunqiu Xu, Yi Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 길고 복잡한 이야기를 쓰려고 하는데, 두 명의 편집자를 두었다고 상상해 보십시오. 바로 **'빠른 인턴(Speedy Intern)'**과 **'마스터 편집자(Master Editor)'**입니다.

대규모 언어 모델(LLM)의 세계에서 '마스터 편집자'는 고품질의 텍스트를 생성하지만 매우 느리고 비용이 많이 드는 거대하고 똑똑한 모델입니다. '빠른 인턴'은 작고 빠르며 다음에 올 단어를 빠르게 추측할 수 있지만 실수를 저지르기도 하는 작은 모델입니다.

기존 방식: "전부 아니면 전무(All-or-Nothing)" 식의 검사

전통적으로 인턴이 문장을 추측하면 마스터 편집자가 이를 확인해야 했습니다.

  • 만약 마스터 편집자가 동의한다면, 아주 좋습니다! 인턴의 추측은 그대로 수용됩니다.
  • 만 만약 마파 편집자가 동의하지 않는다면, 인턴의 추측은 버려지고 마스터 편집자가 문장 전체를 처음부터 다시 써야 합니다.

이것은 마치 엄격한 상사가 "100% 완벽하지 않다면, 내가 직접 처음부터 끝까지 다 하겠다"라고 말하는 것과 같습니다. 마스터 편집자가 실제로 '거의 맞았던' 작업조차도 다시 하게 만들기 때문에 많은 시간을 낭비하게 됩니다.

새로운 아이디어: "중간 관리자(Middle Manager)"

이 논문은 VIA-SD라고 불리는 새로운 시스템을 소개합니다. 이 시스템은 인턴의 추측이 형편없는 것이 아니라, 단지 "괜찮거나" 혹은 "꽤 괜찮은" 수준이라는 점을 깨달았습니다. 이런 경우에는 마스터 편집자의 모든 능력을 동원해 수정할 필요가 없습니다.

따라서 VIA-SD는 인턴과 마스터 편집자 사이에 **'중간 관리자(Middle Manager)'**를 추가합니다. 이 중간 관리자는 '슬림 검증기(slim-verifier)'라고 불리며, 거대 모델 자체의 일부를 '라우팅(routing, 특정 부분을 선택)'하여 만들어졌기에 더 가볍고 빠릅니다.

이 세 단계의 새로운 프로세스는 다음과 같이 작동합니다.

  1. 쉬운 승리(The Easy Wins): 인턴이 단어를 추측합니다. 만약 그것이 명백히 옳다면, 시스템은 즉시 이를 수용합니다. 아무도 확인할 필요가 없습니다.
  2. "적당히 괜찮은" 구역(The "Good Enough" Zone): 인턴의 추측이 약간 불안정하다면, 중간 관리자가 개입합니다. 중간 관리자는 마스터 편집자에게 요청하여 처음부터 다시 쓰게 하는 대신, 스스로 그 단어를 빠르게 수정하거나 다시 씁니다. 이는 마치 선임 팀원이 CEO의 승인을 받을 필요 없이 초안을 살짝 수정하는 것과 같습니다.
  3. 어려운 사례(The Hard Cases): 중간 관리자조차 정말로 혼란스러워할 때만, 시스템은 비로소 무거운 짐을 짊어질 마스터 편집자를 호출합니다.

"라우터(Router)" 기법

이들은 어떻게 이 중간 관리자를 만들었을까요? 이들은 완전히 새로운 모델을 처음부터 학습시키지 않습니다. 대신, 거대한 마스터 편집자를 가져와서 내부 레이어(layer) 중 일부를 끄거나 건너뛰는 방식을 사용해 '슬림한' 버전을 만듭니다.

마스터 편집자를 50개의 조립 라인이 있는 거대한 공장이라고 생각해 보십시오. 중간 관리자는 동일한 설계도와 도구를 사용하지만, 조립 라인을 25개만 가동하는 동일한 공장입니다. 따라서 더 빠르면서도, 원래의 설계도를 바탕으로 구축되었기에 작업 내용을 완벽하게 이해합니다. 이 논문은 최적의 속도와 정확성 사이의 균형을 찾기 위해 어떤 25개의 라인을 유지할지 결정하는 스마트한 탐색 방법(DIMR)을 사용합니다.

이것이 왜 중요한가

이 논문은 중간 관리자를 추가함으로써 다음과 같은 효과를 얻었다고 주장합니다.

  • 거절 감소: 시스템이 추측을 덜 거절하게 됩니다. "괜찮은" 작업을 버리는 대신, 빠르게 수정합니다.
  • 속도 향상: 거대한 마스터 편집자를 호출하는 횟수가 줄어들기 때문에, 전체 과정이 이전 방식보다 10%에서 20% 더 빨라지며, 표준 디코딩 방식보다는 최대 3배 더 빠릅니다.
  • 추가 학습 불필 사용: 이 시스템은 기존 모델을 새로 학습시킬 필요 없이 기존 모델과 함께 작동합니다. 단지 사용 중에 답변을 검증하는 방식만 바꿀 뿐입니다.

요약하자면, VIA-SD는 모든 실수를 재앙으로 취급하지 않습니다. "통과냐 실패냐"라는 이분법적인 시스템 대신, "적당히 맞으면" 빠르게 수정하고, "정말로 망가진 부분"에 대해서만 거대 모델의 온전한 주의를 기울이는 계층적 시스템을 구축한 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →