← 최신 논문
💬 NLP

AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding

AngelSpec은 서로 다른 초안 작성 구조(채팅을 위한 MTP 및 코드/수식을 위한 블록 디퓨전)를 공동 전문화하고 추론 검증 리소스를 동적으로 최적화함으로써, 다양한 실제 워크로드에 걸쳐 상당한 처리량 향상과 더 높은 수락률을 달성하는 통합 훈련 프레임워크를 도입합니다.

원저자: Hong Liu, Rui Cen, Junhan Shi, Guangshuo Qin, Jiebin Zhang, Tianyu Liu, Runzhi Fan, Guoliang Zhao, Ruobing Xie, Kai Zhang, Song Liu, Guanghua Yu, Jianchen Zhu

게시일 2026-07-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hong Liu, Rui Cen, Junhan Shi, Guangshuo Qin, Jiebin Zhang, Tianyu Liu, Runzhi Fan, Guoliang Zhao, Ruobing Xie, Kai Zhang, Song Liu, Guanghua Yu, Jianchen Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초지능형 로봇에게 이야기를 쓰거나, 수학 문제를 풀거나, 컴퓨터 코드를 작성하는 법을 가르치려 한다고 상상해 보세요. 이 로봇은 거대 언어 모델(LLM)로 불리며 매우 유능하지만, 아주 특정한 버릇이 있습니다. 바로 한 번에 단어 하나씩만 생각한다는 점입니다. 문장을 쓰기 위해 로봇은 첫 번째 단어를 생성한 뒤 멈춰서 생각하고, 그다음 두 번째 단어를 생각하기 위해 다시 멈춰야 합니다. 이는 마치 요리사가 채소를 딱 하나만 썰고 나서, 다음 채소를 썰기 전에 주방 전체가 식을 때까지 기다려야 하는 것과 같습니다. 로봇이 더 똑똑해지고 요청이 복잡해질수록, 이 "하나씩" 처리하는 과정은 마치 슬로 모션으로 페인트가 마르는 것을 지켜보는 것처럼 고통스러울 정도로 느려집니다.

이 속도를 높이기 위해 과학자들은 "추측 디코딩(speculative decoding)"이라는 기술을 발명했습니다. 이것을 팀워크라고 생각해 보세요. 당신에게는 문장의 다음 몇 단어를 추측하는 작고 빠른 "초안 작성용" 로봇이 있고, 거대하고 느린 "대상" 로봇이 그 추측이 맞는지 확인합니다. 만약 큰 로봇이 그 추측에 동의한다면, 팀은 한 번에 한 단어가 아니라 여러 단어를 동시에 쓸 수 있습니다. 이는 마치 빠른 달리기가 무거운 보행자의 앞길을 예측해 주는 것과 같습니다. 만약 그 예측이 맞다면, 둘은 함께 앞으로 나아가 엄청난 시간을 절약할 수 있습니다. 하지만 여기에는 함정이 있습니다. 빠른 달리기가 항상 옳은 것은 아닙니다. 만약 너무 많은 단어를 틀리게 추측하면, 큰 로봇은 그것을 수정하는 데 시간을 낭비해야 하며, 이로 인해 전체 과정이 오히려 느려집니다. 과학자들의 핵심 과제는 어떻게 하면 이 빠른 달리기가 더 잘 추측하게 만들 것인지, 그리고 시간을 낭비하지 않기 위해 언제 추측을 멈춰야 할지를 아는 것입니다.

여기서 AngelSpec이라는 새로운 프로젝트가 등장합니다. 텐센트(Tencent)의 연구진은 하나의 "빠른 달리기" 전략이 모든 상황에 적합하지 않다는 점을 깨달았습니다. 단거리 경주에는 뛰지만 마라톤에는 서툰 스프린터처럼, 서로 다른 유형의 텍스트에는 서로 다른 추측 전략이 필요합니다. 예를 들어, 일상적인 채팅 메시지는 혼란스럽고 놀라움으로 가득 차 있지만(높은 엔트로피), 수학 증명이나 컴퓨터 프로그램은 매우 구조적이고 예측 가능합니다. 연구진은 모든 것에 사용되는 "범용" 추측 로봇을 만드는 것이 실수라고 주장합니다. 대신, 그들은 작업에 따라 두 가지 다른 유형의 추측기를 사용하는 시스템을 구축했으며, 시스템이 얼마나 바쁜지에 따라 추측을 확인하는 데 정확히 얼마만큼의 시간을 쓸지 결정하는 스마트한 관리자를 도입했습니다.

연구팀은 코딩이나 수학 같은 구조적인 작업을 위해 DFly라는 새로운 방법을 소개했습니다. DFly를 단서를 하나씩 추측하는 것이 아니라, 전체 퍼즐을 한꺼번에 보고 패턴을 파악하는 탐정 팀이라고 상상해 보세요. 이들은 큰 그림을 본 다음 바로 앞의 맥락에 따라 추측을 미세하게 조정하는 특별한 "하이브리드" 두뇌를 사용합니다. 이를 통해 긴 코드 체인이나 수학 단계를 높은 정확도로 예측할 수 있습니다. 반면, 복잡하고 창의적인 채팅 작업의 경우, 그들은 빠르고 간결한 대화형 폭발에 적합한 MTP(Multi-Token Prediction)라는 더 단순하고 빠른 방법을 고수합니다.

훌륭한 추측기를 갖는 것만으로는 충분하지 않습니다. 스마트한 관리자도 필요합니다. 이 논문은 교통 관제사 역할을 하는 D-cut이라는 기능을 소개합니다. 서버가 바쁠 때 때때로 "확인" 과정이 정체될 수 있습니다. D-cut은 실시간으로 추측의 신뢰도를 살펴봅니다. 만약 추측이 불안정해 보이면, D-cut은 시간을 아끼기 위해 이를 조기에 차단합니다. 만약 시스템이 원활하게 돌아가고 추측이 확실해 보인다면, 팀이 더 오래 지속할 수 있도록 허용합니다. 이는 마치 음악이 쉬울 때는 오케스트라의 속도를 높이고, 음표가 까다로워지면 속도를 늦추어 전체 공연이 무너지지 않고 빠르게 유지되도록 하는 지휘자와 같습니다.

이 접근 방식의 결과는 인상적입니다. 연구진이 Hy3-A21B 모델로 테스트했을 때, 기존의 "한 번에 한 단어씩" 방식보다 훨씬 빠르게 텍스트를 처리할 수 있음을 발견했습니다. 구체적으로, 이 시스템은 기존 방식보다 1.98배에서 2.40배 더 빠른 속도를 달성했습니다. 더욱이, 이전의 최고 방법론인 DFlash보다 10.5%에서 11.8% 더 빨랐습니다. 연구진은 텍스트의 유형(채팅 vs 코드)에 따라 추측 전략을 맞춤화하고, 스마트 관리자를 사용하여 작업량에 따라 조절함으로써 컴퓨팅 자원을 최대한 활용할 수 있음을 보여주었습니다. 그들은 자신들의 툴킷인 AngelSpec 전체를 공개하여 다른 과학자들이 자신들의 AI 모델을 더 빠르고 효율적으로 만들 수 있도록 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →