← 최신 논문
💬 NLP

EntMTP: Accelerating LLM Inference with Entropy Guided Multi Token Prediction

EntMTP는 출력 품질을 유지하면서 추론 처리량을 극대화하기 위해 로컬 생성 엔트로피에 따라 멀티 토큰 예측 깊이를 동적으로 조정하는 학습이 필요 없는 스케줄러로, 기존 베이스라인 대비 최대 1.36배의 속도 향상을 달성한다.

원저자: Carrie Chen

게시일 2026-06-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Carrie Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 이야기를 쓰려고 하는데, 아주 엄격한 규칙이 하나 있다고 상상해 보세요. 당신은 오직 한 번에 한 단어씩만 쓸 수 있고, 매 단어를 쓸 때마다 전체 작업물을 다시 확인하여 그 단어가 완벽한지 점검한 후에야 다음 단계로 넘어갈 수 있습니다. 이것이 현재 거대언어모델(LLM)이 작동하는 방식입니다. 매우 정확하지만, 계속해서 작업을 멈추고 확인해야 하기 때문에 고통스러울 정도로 느립니다.

이를 가속화하기 위해 연구자들은 **멀티 토큰 예측(Multi-Token Prediction, MTP)**이라는 기술을 발명했습니다. 한 단어를 쓰고 확인하는 대신, 모델은 마치 초안을 잡듯 다음 세 개 또는 네 개의 단어를 한꺼번에 추측합니다. 그런 다음, 자신의 추측 중 몇 개가 맞았는지 한 번에 크게 "확인"합니다. 만약 세 단어를 모두 맞혔다면, 많은 시간을 절약할 수 있습니다.

하지만 EntMTP라는 논문은 이 기술이 현재 어떻게 사용되고 있는지에 대한 결점을 지적합니다.

문제점: "일률적인(One-Size-Fits-All)" 실수

현재 모델들은 **정적(static)**인 전략을 사용합니다. 당신이 자동차를 운전하고 있다고 상상해 보세요. 현재의 방식은 다음과 같이 말합니다: "매끄러운 고속도로를 달리든 울퉁불퉁한 비포장도로를 달리든, 당신은 항상 가속 페달을 똑같은 속도로 밟고 정확히 100피트 앞을 바라봐야 합니다."

  • 매끄러운 고속도로 (낮은 엔트로피): 길을 예측할 수 있습니다. 당신은 안전하게 100피트 앞을 내다보며 다음 몇 번의 회전을 완벽하게 예측할 수 있습니다.
  • 울퉁불퉁한 비포장도로 (높은 엔트로피): 길이 혼란스럽습니다. 100피트 앞을 내다보는 것은 시간 낭비입니다. 구덩이에 빠지거나 사슴과 충돌할 수도 있기 때문입니다. 당신은 몇 피트 앞만 내다보며 조심스럽게 운전해야 합니다.

기존 모델들(Hydra나 Medusa 등)은 시작하기 전에 하나의 "앞을 내다보는 거리"(특정한 트리 형태)를 선택하고, 그것을 끝까지 고수합니다. 이는 비효율적입니다. 때로는 너무 멀리 내다보느라 에너지를 낭비하기도 하고, 때로는 너무 적게 내다보느라 속도를 낼 기회를 놓치기도 합니다.

해결책: EntMTP (스마트한 부조종사)

연구자들은 EntMTP(엔트로피 유도 멀티 토큰 예측)를 제안합니다. 이것을 도로 상황을 끊임없이 확인하여 운전자에게 얼마나 멀리 내다볼지를 알려주는 스마트한 부조립사라고 생각하세요.

  1. "엔트로피" 읽기 (도로 상황):
    모델은 다음 단어들이 얼마나 "놀라운지(의외성)"를 끊임없이 측정합니다.

    • 낮은 엔트로피 (예측 가능): 텍스트가 매끄럽게 흐르고 있습니다 (예: "태양은 동쪽에서..."). 부조종사가 말합니다, "쉬워요! 다음 4단어를 한꺼번에 예측합시다!"
    • 높은 엔트로피 (혼란스러움): 텍스트가 까다롭거나 복잡합니다 (예: 어려운 수학 문제나 갑작스러운 반전). 부조종사가 말합니다, "와, 이건 위험해요. 안전하게 다음 1단어만 예측합시다."
  2. "트리 뱅크" (도구 모음):
    모델이 글을 쓰기 전, 연구자들은 다양한 추측 전략(트리)들을 담은 작은 "뱅크"를 준비합니다. 어떤 트리는 크고 공격적이며(많은 단어를 예측), 어떤 트리는 작고 보수적입니다(적은 단어를 예측).

    • 결정적으로, 모델은 하나만 선택하는 것이 아니라, 다양한 상황에 맞는 최선의 옵션들을 메뉴처럼 만들어 둡니다.
  3. 전환 (기어 변속):
    글을 쓰는 과정 동안 EntMTP는 기어 변속기 역할을 합니다.

    • 텍스트가 쉬우면, 모델은 고단 기어(큰 트리)로 변속하여 앞으로 빠르게 나아갑니다.
    • 텍스트가 어려워지면, 모델은 즉시 저단 기어(작은 트리)로 변속하여 충돌을 피합니다.
    • 핵식: 기어를 바꾸는 데는 시간이 거의 걸리지 않습니다. 이는 컴퓨터 메모리 상의 빠른 포인터 교체일 뿐, 무거운 재구축 작업이 아닙니다.

결과: 품질 저하 없는 속도 향상

이 논문은 이 새로운 "스마트 부조종사"를 세 가지 매우 다른 유형의 작업에 테스트했습니다:

  • 코딩 (HumanEval): 컴퓨터 프로그램 작성.
  • 수학 (GSM8K): 초등 수준의 수학 문제 풀이.
  • 채팅 (ShareGPT): 대화 나누기.

결과:

  • 속도: EntMTP는 기존의 최고 방법(Hydra)보다 일관되게 9%에서 15% 더 빨랐습니다. 어떤 경우에는 기존 방식보다 36% 더 빨랐습니다.
  • 품질: 모델이 여전히 자신의 작업을 완벽하게 점검하기 때문에, 글의 품질은 전혀 떨어지지 않았습니다. 이는 마치 더 빠르게 운전하면서도 정확히 같은 목적지에 같은 안전함으로 도착하는 것과 같습니다.
  • 효效率: 이 속도 향상은 컴퓨터를 더 강력하게 만든 것이 아니라, 언제 멀리 예측하고 언제 조심해야 할지를 컴퓨터가 더 똑똑하게 판단하게 함으로써 달성되었습니다.

핵심 요약

기존의 방식이 평탄한 길인지 장애물이 가득한 길인지 상관없이 100미터를 전력 질주하고, 신발 끈을 묶기 위해 멈추고, 다시 100미터를 전력 질주하는 러너라면,

EntMTP는 트랙을 살피는 러너입니다. 트랙이 평탄하면 전력 질주합니다. 장애물이 보이면 넘어지지 않을 만큼만 속도를 줄인 뒤, 즉시 다시 전력 질주합니다. 이를 통해 장애물에 걸려 넘어지지 않고 훨씬 더 빠르게 경주를 마칠 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →