← Últimos artículos
💬 NLP

FlexDraft: Flexible Speculative Decoding via Attention Tuning and Bonus-Guided Calibration

FlexDraft es un marco de decodificación especulativa sin pérdida que acelera la inferencia de LLM en tamaños de lote variables combinando el ajuste de atención para el borrado de bloques de difusión de alta calidad, la calibración guiada por bonificaciones para resolver discrepancias en la verificación de borradores y un mecanismo de conmutación dinámica que optimiza entre los modos de ejecución paralela y secuencial.

Autores originales: Yaojie Zhang, Jianuo Huang, Junlong Ke, Yuhang Han, Yongji Long, Tianchen Zhao, Biqing Qi, Linfeng Zhang

Publicado 2026-05-20
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yaojie Zhang, Jianuo Huang, Junlong Ke, Yuhang Han, Yongji Long, Tianchen Zhao, Biqing Qi, Linfeng Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando escribir una historia larga, pero tienes un editor muy estricto (el Modelo Objetivo) que es increíblemente inteligente pero se mueve muy lentamente porque tiene que verificar cada palabra individual antes de escribir la siguiente. Esto hace que escribir la historia tome una eternidad.

Para acelerar las cosas, contratas a un asistente rápido y enérgico (el Borrador) para que adivine las siguientes palabras por ti. El asistente escribe un párrafo completo con antelación, y luego el editor lento verifica rápidamente si esas conjeturas fueron correctas. Si son correctas, puedes saltarte el tiempo de pensamiento lento del editor para esas palabras. Esto se llama Decodificación Especulativa.

Sin embargo, la forma antigua de hacer esto tenía dos grandes problemas:

  1. El Juego de la Espera: El asistente escribiría una conjetura, luego esperaría a que el editor terminara de verificarla antes de escribir la siguiente conjetura. Se turnaban, lo cual desperdiciaba tiempo.
  2. La Confusión del "¿Qué pasaría si?": En métodos más nuevos y rápidos, el asistente intenta escribir múltiples párrafos futuros diferentes a la vez, con la esperanza de cubrir todas las posibilidades. Pero el asistente no sabe qué párrafo aprobará realmente el editor. Esto lleva a que el asistente desperdicie energía escribiendo párrafos que son descartados, y el editor tenga que verificar demasiadas opciones, lo que vuelve a ralentizar todo cuando tienes que escribir muchas historias a la vez (tamaños de lote grandes).

Presentamos FlexDraft: El Asistente Inteligente y Flexible

El artículo presenta FlexDraft, un nuevo sistema que soluciona estos problemas para que puedas escribir más rápido sin perder calidad. Así es como funciona, usando analogías simples:

1. Los "Gafas Especializadas" (Afinación de la Atención)

Por lo general, para hacer que el asistente sea mejor adivinando, tienes que reentrenar todo su cerebro, lo cual es costoso y arriesgado (podría hacer que olviden cómo hablar correctamente).

FlexDraft es diferente. Se pone un par de "gafas especializadas" solo en los ojos del asistente para los últimos pasos muy cortos del pensamiento.

  • Cómo funciona: El asistente mantiene todo su conocimiento original (el cerebro congelado) pero aprende a usar estas nuevas gafas para mirar "espacios en blanco" (tokens enmascarados) y rellenarlos todos a la vez.
  • El Beneficio: El asistente se convierte en un adivinador rápido y paralelo sin necesidad de un trasplante de cerebro completo. Se mantiene fiel al estilo del editor, por lo que las conjeturas son de alta calidad y seguras.

2. La "Nota Mágica" (Calibración Guiada por Bono)

Aquí está la parte complicada: Cuando el editor verifica las conjeturas del asistente, a veces el editor dice: "No, esa palabra está mal, pero aquí está la palabra correcta para empezar en su lugar". Esta palabra correcta se llama el Token Bono.

En los antiguos métodos "rápidos", el asistente tenía que adivinar el siguiente párrafo antes de ver esta Nota Mágica. Así, el asistente podría adivinar una historia sobre un pirata, mientras que el editor quería una historia sobre un chef. La conjetura del asistente estaba mal porque no tenía la nota.

FlexDraft añade un sistema de Nota Mágica:

  • Cómo funciona: Una vez que el editor revela el Token Bono, FlexDraft utiliza una calculadora pequeña y rápida para ajustar instantáneamente las conjeturas anteriores del asistente para que coincidan con esa nueva dirección.
  • El Beneficio: Incluso si el asistente adivinó a ciegas al principio, el sistema "dirige" rápidamente la conjetura para que se alinee con la corrección del editor. Esto significa que menos conjeturas son rechazadas.

3. El "Agente de Tráfico" (Decodificación Flexible)

El mayor problema de los antiguos métodos "rápidos" era que intentaban escribir cada historia futura posible a la vez. Si solo tienes una historia que escribir (lote pequeño), esto está bien. Pero si tienes 16 historias que escribir a la vez (lote grande), el asistente se abruma intentando escribir 16 futuros diferentes para cada historia individual, y el editor se atasca verificándolos todos.

FlexDraft actúa como un Agente de Tráfico inteligente:

  • Tráfico Ligero (Lote Pequeño): Cuando hay pocas historias, el agente dice: "¡Adelante! ¡Escriban todos los futuros posibles al mismo tiempo!". Esto solapa la escritura y la verificación para ahorrar tiempo.
  • Tráfico Pesado (Lote Grande): Cuando hay muchas historias, el agente dice: "¡Alto! No escriban todas las posibilidades. Solo escriban la que es más probable que sea aprobada".
  • El Beneficio: Cambia de estrategia automáticamente. Evita la "energía desperdiciada" de escribir demasiadas opciones cuando el sistema está ocupado, evitando que la velocidad se desplome.

El Resultado

Al combinar estos tres trucos, FlexDraft permite que el editor lento procese texto mucho más rápido.

  • Sin Pérdida de Calidad: La historia final es exactamente la misma que si el editor lento la hubiera escrito palabra por palabra.
  • Gran Aceleración: En pruebas con un modelo de IA popular (Qwen3-8B), FlexDraft hizo que el sistema fuera 4.59 veces más rápido que el método lento estándar.
  • Escalabilidad: Funciona bien ya sea que estés escribiendo una historia o gestionando una multitud enorme de historias, a diferencia de los métodos anteriores que se volvían lentos y torpes cuando la multitud crecía.

En resumen, FlexDraft es una manera flexible y sin pérdida de permitir que un asistente rápido ayude a un editor lento, asegurando que trabajen juntos sin problemas sin desperdiciar tiempo ni cometer errores.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →