← Últimos artículos
💬 NLP

EntMTP: Accelerating LLM Inference with Entropy Guided Multi Token Prediction

EntMTP es un programador libre de entrenamiento que ajusta dinámicamente la profundidad de la predicción de múltiples tokens basada en la entropía de generación local para maximizar el rendimiento de la inferencia manteniendo la calidad de la salida, logrando una aceleración de hasta 1.36x sobre las líneas base existentes.

Autores originales: Carrie Chen

Publicado 2026-06-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Carrie Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando escribir una historia, pero tienes una regla muy estricta: solo puedes escribir una palabra a la vez, y después de cada palabra, tienes que detenerte, revisar toda la obra de tu vida para asegurarte de que esa palabra sea perfecta, y luego continuar. Así es como suelen funcionar los Grandes Modelos de Lenguaje (LLM) actuales. Es increíblemente preciso, pero es dolorosamente lento porque te detienes constantemente a revisar tu trabajo.

Para acelerar esto, los investigadores inventaron un truco llamado Predicción de Múltiples Tokens (MTP). En lugar de escribir una palabra y revisarla, el modelo intenta adivinar las próximas tres o cuatro palabras de una sola vez, como un borrador. Luego, realiza un gran "chequeo" para ver cuántos de esos aciertos fueron correctos. Si adivinó tres palabras correctamente, ahorra mucho tiempo.

Sin embargo, el artículo EntMTP señala un fallo en cómo se utiliza este truco actualmente.

El Problema: El error de "Talla Única"

Actualmente, los modelos utilizan una estrategia estática. Imagina que estás conduciendo un coche. El método actual dice: "No importa si vas por una autopista suave o por un camino de tierra accidentado, siempre debes mantener el pie en el acelerador a la misma velocidad exacta y mirar exactamente 100 pies hacia adelante".

  • En una autopista suave (baja entropía): El camino es predecible. Podrías mirar 100 pies hacia adelante de forma segura y adivinar las próximas curvas perfectamente.
  • En un camino de tierra accidentado (alta entropía): El camino es caótico. Mirar 100 pies hacia adelante es una pérdida de tiempo porque podrías chocar con un bache o un ciervo. Deberías mirar solo unos pocos pies hacia adelante y conducir con cautela.

Los modelos existentes (como Hydra y Medusa) eligen un "avance de mirada" (una estructura de árbol específica) antes de comenzar y se mantienen con él para siempre. Esto es ineficiente. A veces intentan adivinar demasiado lejos y desperdician energía; otras veces, adivinan demasiado poco y pierden la oportunidad de acelerar.

La Solución: EntMTP (El Copiloto Inteligente)

Los autores proponen EntMTP (Entropy-guided Multi-Token Prediction o Predicción de Múltiples Tokens guiada por Entropía). Piensa en esto como un copiloto inteligente que comprueba constantemente las condiciones de la carretera y le dice al conductor qué tan lejos debe mirar hacia adelante.

  1. Leyendo la "Entropía" (Las condiciones de la carretera):
    El modelo mide constantemente qué tan "sorprendentes" son las siguientes palabras.

    • Baja Entropía (Predecible): El texto fluye suavemente (ej. "El sol sale en el..."). El copiloto dice: "¡Fácil! ¡Adivinemos las próximas 4 palabras!".
    • Alta Entropía (Caótico): El texto es difícil o complejo (ej. un problema matemático difícil o un giro repentino en la trama). El copiloto dice: "¡Vaya, esto es arriesgado. Solo adivinemos la siguiente palabra para estar seguros!".
  2. El "Banco de Árboles" (El conjunto de herramientas):
    Antes de que el modelo comience a escribir, los investigadores preparan un pequeño "banco" de diferentes estrategias de adivinación (árboles). Algunos son grandes y agresivos (adivinando muchas palabras), y otros son pequeños y conservadores (adivinando pocas palabras).

    • Crucialmente, no eligen solo uno. Crean un menú de las mejores opciones para diferentes situaciones.
  3. El Cambio (El cambio de marcha):
    Durante el proceso de escritura, EntMTP actúa como un cambiador de marchas.

    • Si el texto es fácil, cambia a Marcha Alta (el árbol grande) para avanzar rápidamente.
    • Si el texto se vuelve difícil, cambia instantáneamente a Marcha Baja (el árbol pequeño) para evitar un accidente.
    • La Magia: Cambiar de marcha casi no toma tiempo. Es solo un rápido intercambio de punteros en la memoria del ordenador, no una reconstrucción pesada.

Los Resultados: Más rápido sin perder calidad

El artículo probó este nuevo "Copiloto Inteligente" en tres tipos de tareas muy diferentes:

  • Programación (HumanEval): Escribir programas informáticos.
  • Matemáticas (GSM8K): Resolver problemas matemáticos de escuela primaria.
  • Chat (ShareGPT): Tener una conversación.

El Resultado:

  • Velocidad: EntMTP fue consistentemente de un 9% a un 15% más rápido que los métodos anteriores más destacados (Hydra). En algunos casos, fue un 36% más rápido que los métodos antiguos.
  • Calidad: Debido a que el modelo sigue revisando su trabajo perfectamente, la calidad de la escritura no disminuyó en absoluto. Es como conducir más rápido pero llegar exactamente al mismo destino con la misma seguridad.
  • Eficiencia: Logró esta aceleración no haciendo que el ordenador fuera más fuerte, sino haciendo que el ordenador fuera más inteligente sobre cuándo adivinar muy por delante y cuándo ser cuidadoso.

La Conclusión

Piensa en la forma antigua como un corredor que corre a máxima velocidad durante 100 metros, se detiene a atarse los cordones, corre otros 100 metros, se detiene de nuevo, independientemente de si la pista es plana o llena de obstáculos.

EntMTP es el corredor que observa la pista. Si la pista es plana, corre con fuerza. Si ve un obstáculo acercándose, reduce la velocidad lo justo para pasar por encima de forma segura, y luego vuelve a correr de inmediato. Esto le permite terminar la carrera mucho más rápido sin tropezar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →