← 최신 논문
💬 NLP

D-cut: Adaptive Verification Depth Pruning for Batched Speculative Decoding

D-Cut은 초안 신뢰도와 런타임 비용 모델에 따라 동시 요청 간의 검증 예산을 동적으로 할당함으로써, 높은 동시성 환경에서 계산 낭비를 방지하는 동시에 추론 속도를 크게 향상시키는 배치형 투기적 디코딩을 위한 적응형 검증 깊이 프루닝 기법이다.

원저자: Tianyu Liu, Yuhao Shen, Rui Cen, Junhan Shi, Jiebin Zhang, Guangshuo Qin, Hong Liu, Song Liu, Guanghua Yu, Jianchen Zhu

게시일 2026-07-17
📖 5 분 읽기🧠 심층 분석

원저자: Tianyu Liu, Yuhao Shen, Rui Cen, Junhan Shi, Jiebin Zhang, Guangshuo Qin, Hong Liu, Song Liu, Guanghua Yu, Jianchen Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수천 명의 사람들에게 동시에 질문에 답하는 거대하고 빠른 도서관을 운영하고 있다고 상상해 보세요. 이 도서관에는 믿기지 않을 정도로 똑똑한 사서(AI) 한 명이 있습니다. 하지만 이 사서는 매우 특정한 방식으로 일합니다. 단 한 번에 한 단어씩만 적을 수 있습니다. 복잡한 질문에 답하기 위해, 사서는 생각하고, 한 단어를 적고, 다시 멈추고, 생각하고, 다음 단어를 적는 과정을 반복해야 합니다. 이 "한 번에 한 단어씩"이라는 규칙이 도서관이 정체되는 주요 원인입니다. 사서는 다음 단어를 선반에서 가져오기 위해 대부분의 시간을 기다리며 보냅니다.

이를 빠르게 하기 위해, 엔지니어들은 '추측 디코딩(speculative decoding)'이라는 영리한 기술을 발명했습니다. 사서가 한 번에 한 단어씩 쓰는 대신, 약간 덜 똑똑하지만 빠른 조수(초안 작성자, drafter)를 고용하여 몇 단어를 한꺼번에 추측하게 하는 것입니다. 사서는 이 추측들을 빠르게 확인합니다. 만약 추측이 맞다면, 사서는 그 단어들을 한꺼번에 수락하여 '생각-멈춤-쓰기'의 주기를 건너뜁니다. 이것은 조수가 "다음 세 단어는 'The', 'quick', 'and', 'brown'일 거예요!"라고 외치면, 사서가 "맞아요, 당신 말이 맞습니다!"라고 말하며 바로 넘어가는 것과 같습니다. 이 방식은 도서관이 한산할 때 아주 잘 작동합니다. 하지만 도서관에 64명의 사람이 동시에 질문을 던지며 북적거릴 때는 어떻게 될까요? 조수는 모든 사람을 위해 긴 추측 목록을 외칠 수 있지만, 사서는 그 모든 것을 확인하느라 과부하가 걸립니다. 만약 추측이 틀리면, 사서는 버려질 단어들을 확인하는 데 귀중한 시간을 낭비하게 되어 도서관 전체의 속도를 늦추게 됩니다. 이것이 바로 이 논문이 다루는 퍼즐입니다: 인파가 엄청나게 몰릴 때도 어떻게 속도 향상을 유지할 것인가 하는 문제입니다.


문제점: 너무 많은 추측, 부족한 시간

Tencent Hunyuan의 연구원들은 시스템의 결함을 발견했습니다. 최근에 나온 새로운 조수들(DFlash와 같은 모델)은 예를 들어 한 번에 15단어씩 긴 추측 목록을 외치는 데 매우 능숙해졌습니다. 도서관이 비어 있을 때, 이것은 초능력이었습니다. 사서는 대부분의 추측을 수락했고, 도서관은 질문들을 매우 빠르게 처리했습니다.

하지만 인파가 늘어나면(즉, "배치 크기" 또는 동시 요청 수가 증가하면), 시스템은 무너지기 시작했습니다. 조수는 계속해서 긴 목록을 외쳤지만, 이제 여유가 없어진 사서는 그 모든 것을 빠르게 확인할 수 없었습니다. 더 나은 문제는, 그 긴 목록 중 상당수가 틀렸다는 점입니다. 사서는 결국 거절될 쓰레기 같은 단어들을 확인하는 데 모든 에너지를 낭비했습니다. 이는 마치 혼잡한 콘서트장에서 보안 요원이 줄 서 있는 15명의 신분증을 일일이 확인했는데, 알고 보니 10명이 가짜여서 진짜 팬들을 들여보내는 데 쓸 수 있었던 시간을 허비한 것과 같았습니다. 연구원들은 인파가 몰리는 높은 부하 상황에서는 이 "긴 추측" 방식이 단순히 사서가 혼자서 한 단어씩 일하는 것보다 오히려 더 느려진다는 사실을 발견했습니다.

해결책: D-cut (스마트한 문지기)

이 문제를 해결하기 위해 팀은 D-cut이라는 새로운 전략을 제안했습니다. D-cut을 조수와 사서 사이에 서 있는 매우 똑똑한 문지기라고 생각해보세요.

조수가 모든 사람을 위해 긴 추측 목록을 외치고 사서가 그것을 모두 확인하게 두는 대신, D-cut은 실시간으로 인파와 추측을 살펴봅니다. D-cut은 두 가지 간단한 질문을 던집니다:

  1. 조수의 확신도는 어느 정도인가? 조수가 높은 확신을 가지고 외친다면, 문지기는 그 추측들을 통과시킵니다. 만약 조수가 우물쭈물하거나 불확실하다면, 문지기는 목록을 짧게 자릅니다.
  2. 사서는 얼마나 지쳤는가? 문지기는 사서의 현재 작업량을 확인합니다. 사서가 과부하 상태라면(예: 바쁜 GPU 칩 위에서), 문지기는 더 엄격해져서 더 많은 추측을 잘라냅니다. 만약 사서가 신선하고 강력한 상태라면(예: 더 빠른 다른 칩 위에서), 문지기는 더 많은 추측을 통과시킵니다.

D-cut은 단 한 사람만을 위해 목록을 자르는 것이 아니라, 전체 요청 배치를 살펴봅니다. D-cut은 어떤 사람에게는 조수가 천재처럼 굴지만, 다른 사람에게는 조수가 엉뚱한 추측을 하고 있다는 것을 깨닫습니다. 따라서 D-cut은 "검증 예산"(사서가 확인해야 하는 시간)을 파악하여, 성공 가능성이 가장 높은 사람들에게 집중적으로 배분합니다. 불확실한 요청에서 확신이 낮은 긴 꼬리 부분의 추측들을 쳐내고(pruning), 사서의 에너지를 확신이 높은 부분에 집중시킵니다.

실제 환경에서의 작동 방식

연구진은 작은 모델부터 거대한 모델까지, 그리고 다양한 유형의 컴퓨터 칩에서 이 아이디어를 테스트했습니다. 그 결과 D-cut은 바쁜 시기에 게임 체인저라는 것을 입증했습니다:

  • 높은 인파 속에서도 구원 투수 역할: 요청 수가 많을 때(예: 64명이 동시에 접속), 기존 방식(DFlash)은 종종 너무 느려져서 표준적인 "한 단어씩 처리" 방식보다 오히려 더 느려졌습니다. D-cut은 이를 해결했습니다. 인파가 몰려도 속도 향상을 유지했습니다.
  • 수치적 성과: 테스트에서 D-cut은 높은 부하 상황에서 평균 속도를 표준 방식 대비 1.26배에서 1.65배로 높였습니다. 일부 특정 대규모 모델에서는 무려 3.0배의 속도에 도달하기도 했습니다.
  • 하드웨어 적응성: D-cut의 가장 멋진 기능 중 하나는 인파가 몰리기 전에 사서가 얼마나 빠른지 미리 파악한다는 것입니다. D-cut은 컴퓨터 칩(H20 또는 H800 GPU 등)을 프로파일링하여 단어를 확인하는 비용이 얼마나 드는지 확인합니다. 단어를 확인하는 비용이 비싸면(느린 칩의 경우), D-cut은 더 공격적으로 자릅니다. 비용이 저렴하면 덜 자릅니다. 즉, 새로운 컴퓨터마다 사람이 일일이 조정할 필요 없이 스스로 알아서 판단합니다.

하지 않는 것 (그리고 배제하는 것)

D-cut이 무엇이 아닌지 아는 것도 중요합니다. D-cut은 조수를 더 똑똑하게 만들거나 사서가 생각하는 방식을 바꾸려 하지 않습니다. 또한 AI가 내놓는 최종 답변을 바꾸지도 않습니다. 출력값은 사서가 모든 것을 직접 확인했을 때와 정확히 동일하지만, 훨씬 더 빠르게 도달할 뿐입니다.

이 논문은 "길수록 항상 좋다"는 생각에 명시적으로 반박합니다. 그들은 인파가 많을 때 (DFlash처럼) 무작정 긴 추측 목록을 생성하는 것이 나쁜 아이디어임을 보여주었습니다. 모든 사람에게 동일한 수의 추측을 확인하는 "원 사이즈 피츠 올(one size fits all)" 방식은 실패합니다. 왜냐하면 모든 사람에게 동일한 양의 확인이 필요하지 않기 때문입니다. D-cut은 포괄적인 확인보다 선택적인 확인이 더 낫다는 것을 증명합니다.

핵심 요약

연구진은 단순히 이것이 작동할 것이라고 제안한 것이 아니라, 실제로 측정했습니다. 그들은 수천 개의 요청이 있는 실제 서버에서 시뮬레이션과 실세계 테스트를 수행했습니다. 결과는 명확했습니다. 확신이 낮은 추측은 자르고 확신이 높은 것에 집중하는 스마트하고 적응력 있는 문지기가 됨으로써, D-cut은 도서관 문이 터져 나갈 듯이 붐빌 때도 AI 도서관을 빠르게 돌아가도록 유지했습니다. 이는 효율적인 시스템이 될 수 있었던 시스템을, 선택적인 확인이 때로는 가장 빠르게 가는 방법임을 증명하며 효율성을 유지하는 법을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →