← 최신 논문
🤖 machine learning

Approximate Speculative Decoding

이 논문은 새로운 초안 모델을 요구하거나 미세 조정을 할 필요 없이, 후회 예산(regret budget)에 기반하여 초안 토큰의 불일치를 선택적으로 수용함으로써 유효한 접미사를 재사용하여 처리량을 향상시키는, 자기회귀 생성 속도를 가속화하는 훈련 불필요 방식인 근사적 추측 디코딩(Approximate Speculative Decoding, ASD)을 소개한다.

원저자: Yuannuo Feng, Zegang Peng, Yuxin Xie, Yubing Ye, Yizhe Chen, Wenshuai Yao, Wenyong Zhou, Wang Kang

게시일 2026-08-05
📖 5 분 읽기🧠 심층 분석

원저자: Yuannuo Feng, Zegang Peng, Yuxin Xie, Yubing Ye, Yizhe Chen, Wenshuai Yao, Wenyong Zhou, Wang Kang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 똑똑하지만 믿을 수 없을 정도로 느린 친구와 함께 이야기를 쓰려고 한다고 상상해 보세요. 당신이 이야기에 새로운 단어를 하나 추가하려고 할 때마다, 당신은 친구가 열심히 생각하고, 자신의 지식 도서관 전체를 확인한 뒤, 다음에 올 단어가 무엇인지 정확히 알려줄 때까지 기다려야 합니다. 이것이 현대의 AI 언어 모델이 작동하는 방식입니다. 그들은 한 번에 한 단어씩 텍다를 생성하며, "생각하는" 부분이 대부분의 시간을 차지하여 마치 페인트가 마르는 것을 지켜보는 것처럼 느껴지게 만듭니다. 이를 가속화하기 위해 과학자들은 "추측적 디코딩(speculative decoding)"이라는 기술을 발명했습니다. 이것은 마치 당신을 위해 다음 몇 단어를 미리 추측해 주는 빠르고 유능한 보조원을 두는 것과 같습니다. 그런 다음 당신은 느리지만 전문적인 친구에게 그 추측들이 맞는지 빠르게 확인해 달라고 요청합니다. 만약 전문가가 그 추측들에 동의한다면, 당신은 단 한 단어가 아니라 여러 단어를 한꺼번에 쓸 수 있게 되어 엄청난 시간을 절약할 수 있습니다.

하지만 여기에는 함정이 있습니다. 전문가 친구는 규칙에 매우 엄격합니다. 만약 보조원이 전문가가 선택했을 절대적인 완벽한 단어가 아닌 단 하나라도 잘못 추측한다면, 전문가는 즉시 전체 과정을 중단합니다. 그들은 그 차례에 보조원이 추측했던 나머지 모든 단어를 버립니다. 설령 그 단어들 대부분이 실제로 완벽했더라도 말이죠. 이는 마치 시험지를 채점하는 선생님이 단 하나의 오답을 보자마자 읽기를 멈추고 나머지 종이를 모두 쓰레기통에 던져버리는 것과 같습니다. 이 "전부 아니면 전무(all-or-nothing)" 규칙은 이야기를 완벽하게 유지해주지만, 보조원의 노력을 낭비하게 만들고 속도를 늦춥니다.

이 논문은 더 똑똑하고 유연한 선생님처럼 행동하는 **근사적 추측적 디코딩(Approximate Speculative Decoding, ASD)**이라는 새로운 방법을 소개합니다. 기존의 방식처럼 실수 하나 때문에 시험지 전체를 버리는 대신, ASD는 다음과 같이 묻습니다: "이 실수가 아주 미미한가? 그리고 보조원이 그 다음 몇 단어는 제대로 맞혔는가?" 만약 대답이 "예"라면, ASD는 그 작은 실수를 수용하고, 그 뒤에 따라오는 좋은 단어들을 유지하며 계속 진행합니다. 이는 마치 선생님이 "너 'because'의 철자는 틀렸지만, 그다음 열 단어는 완벽하게 썼으니, 그 단어 하나만 고치고 계속 가자"라고 말하는 것과 같습니다. 연구진은 사소한 오류에 대해 조금 더 관대해짐으로써, 이야기의 품질을 망치지 않으면서도 AI를 훨씬 더 빠르게 작성할 수 있다는 것을 발견했습니다.

"예산이 정해진" 보조사의 이야기

ASD의 핵심 아이디어는 모든 실수를 재앙으로 취급하지 않는 것입니다. 기존 방식에서는 보조원이 최선의 선택이 아닌 단어를 추측하면 시스템이 즉시 중단되었습니다. 하지만 저자들은 때때로 보생의 "틀린" 추측이 실제로는 정답과 매우 유사하며, 그 뒤에 오는 단어들은 여전히 완벽하다는 사실을 깨달았습니다.

이를 해결하기 위해 팀은 **예산(budget)**이 있는 시스템을 만들었습니다. 상상해 보세요, 당신에게는 "실수 토큰"이 담긴 항아리가 있습니다. 당신은 몇 번의 작은 실수를 할 수 있지만, 그 대가는 항아리에서 지불해야 합니다.

  1. 로컬 게이트(The Local Gate): 실수를 수용하기 전에, 시스템은 그 실수가 얼마나 "나쁜지"를 확인합니다. 만약 보조원의 추측이 완벽한 단어보다 아주 약간 덜 유력한 정도라면, 그것은 저렴한 실수입니다. 만약 엄청난 오류라면, 그것은 너무 많은 토큰을 소모하므로 시스템은 "안 된다"라고 말합니다.
  2. 블록 캡(The Block Cap): 한 번의 추측 묶음(batch) 내에서 너무 많은 실수를 할 수는 없습니다. 이는 보조원이 한꺼번에 너무 부정확해지는 것을 방지합니다.
  3. 요청 예산(The Request Budget): 이것은 전체 대화 동안 사용할 수 있는 총 토큰 항아리입니다. 일단 토ken을 다 쓰면, 당신은 다시 완벽해져야 합니다(기존의 엄격한 규칙을 따라야 합니다).

마법은 시스템이 작은 실수를 수용할 때 일어납로. 보조의 다음 몇 가지 추측이 실제로 완벽했기 때문에(즉, 전문가가 선택했을 것과 일치했기 때문에), 시스템은 그것들을 "재사용"할 수 있습니다. 시스템은 그것들을 다시 확인하기 위해 느린 전문가에게 요청할 필요가 없습니다. 그냥 그것들을 수용하고 앞으로 나아갑니다. 이는 "중단하고 버리는" 순간을 "수정하고 계속 가는" 순간으로 바꿉니다.

연구 결과

연구진은 수학 문제 풀이부터 코드 작성까지 다양한 작업에 대해 매우 인기 있는 AI 모델들(Qwen3, DeepSeek 등)을 사용하여 이 아이디어를 테스트했습니다. 그들은 모델을 새로 학습시키거나 보조원에게 새로운 것을 가르칠 필요가 없었습니다. 단지 "선생님"(검증기)이 채점하는 방식만을 바꾸었을 뿐입니다.

결과는 꽤 유망했습니다. 이 예산 기반 접근 방식을 사용함으로써, 시스템은 추가 학습 없이도 더 빨라졌습니다.

  • 7가지의 서로 다른 작업 세트에서, 시스템은 엄격한 기존 방식에 비해 평균적으로 7.78% 더 빨라졌습니다.
  • MATH-500 데이터셋과 같은 최상의 경우, 속도는 11.73% 향상되었습니다.
  • DeepSeek-V4-Flash라는 거대 모델을 테스트했을 때, 수용률(시스템이 유지한 추측의 비율)이 약 10%에서 16% 정도 상승하는 것을 확인했습니다.

논문은 이 방법이 모든 것을 완벽하게 만드는 마법의 지팡이는 아니라는 점을 주의 깊게 명시하고 있습니다. 저자들은 이 방법이 AI가 답에 도달하는 경로를 변경한다는 점을 분명히 밝힙니다. 때때로 이야기가 약간 달라질 수 있고, 최종 답은 맞더라도 "해시"(텍text의 디지털 지문)가 변할 수 있습니다. 예를 들어, 일부 코딩 테스트에서는 정확도가 약간(1.5 퍼센트 포인트 미만) 떨어졌지만, 다른 많은 작업에서는 정확도가 동일하게 유지되거나 오히려 약간 향상되었습니다.

이것이 중요한 이유

이 논문의 묘미는 더 빠르고 새로운 AI를 구축하거나 새로운 보조원을 훈련할 필요가 없다는 데 있습니다. 단지 이미 가지고 있는 게임의 규칙을 바꾸는 것뿐입니다. 이는 마치 엄격한 교통 경찰이 모든 사소한 위반에 대해 차를 세우느라 도시 전체의 흐름을 늦추고 있을 때, 더 유연한 접근 방식이 아주 작고 관리 가능한 위험만을 감수하며 교통 흐름을 원활하게 유지할 수 있다는 것을 깨닫는 것과 같습니다.

저자들은 이 방법이 현재의 AI 시스템에서 더 많은 속도를 뽑아낼 수 있는 좋은 방법이라고 제안합니다. 그들은 속도 향상이 실질적이고 측정 가능하다는 점(일부 사례에서 최대 15.26%)을 강조하면서도, 사용자가 엄격한 완벽함을 아주 조금 양보하는 대신 속도를 얻는다는 점을 인지해야 한다고 강조합니다. 이것은 계산된 절충안입니다. 당신은 이야기를 훨씬 더 빨리 완성할 수 있으며, 대부분의 사람들에게는 미세한 표현의 차이가 전혀 중요하지 않을 것입니다. 논문은 이 "예산 기반" 접근 방식이 품질이 충분히 좋은지 확인하는 조건 하에, AI 생성을 더 빠르게 만드는 실용적인 학습 불필요(training-free) 방법이라고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →