Approximate Speculative Decoding
Este artículo presenta la Decodificación Especulativa Aproximada (ASD, por sus siglas en inglés), un método que no requiere entrenamiento que acelera la generación autorregresiva mediante la aceptación selectiva de discrepancias en los tokens de borrador basándose en un presupuesto de arrepentimiento para reutilizar sufijos válidos, mejorando así el rendimiento sin requerir nuevos modelos de borrador ni ajuste fino.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando escribir una historia con un amigo muy inteligente, pero increíblemente lento. Cada vez que quieres añadir una nueva palabra a tu historia, tienes que esperar a que tu amigo piense intensamente, revise toda su biblioteca de conocimientos y te diga exactamente qué palabra viene a continuación. Así es como funcionan los modelos de lenguaje de IA modernos: generan texto palabra por palabra, y la parte de "pensar" es lo que consume la mayor parte del tiempo, haciendo que el proceso se sienta como ver la pintura secarse. Para acelerar esto, los científicos inventaron un truco llamado "decodificación especulativa". Piensa en ello como si tuvieras un asistente junior rápido que adivina las siguientes palabras por ti. Luego le pides a tu amigo experto y lento que compruebe rápidamente si esas suposiciones son correctas. Si el experto está de acuerdo, puedes escribir varias palabras a la vez en lugar de solo una, ahorrando una cantidad masiva de tiempo.
Sin embargo, hay una trampa. El amigo experto es un estricto de las reglas. Si el asistente adivina incluso una palabra que no es la elección absolutamente perfecta que el experto habría elegido, el experto detiene todo el proceso inmediatamente. Tira todas las otras palabras que el asistente adivinó para ese turno, incluso si la mayoría fueron perfectas. Es como un profesor calificando un examen que deja de leer en el momento en que ve una sola respuesta incorrecta, tirando el resto del papel a la basura. Esta regla de "todo o nada" mantiene la historia perfecta, pero desperdicia mucho del trabajo duro del asistente y ralentiza el proceso.
Este artículo presenta un nuevo método llamado Decodificación Especulativa Aproximada (ASD), que actúa como un profesor más inteligente y flexible. En lugar de tirar todo el examen solo porque hay un pequeño error, el ASD pregunta: "¿Es este error insignificante? ¿Y el asistente acertó las siguientes palabras de todos modos?". Si la respuesta es sí, el ASD acepta el pequeño error, mantiene las palabras buenas que le siguieron y continúa. Es como un profesor que dice: "Escribiste mal la palabra 'porque', pero escribiste las siguientes diez palabras perfectamente, así que vamos a corregir solo esa palabra y a seguir adelante". Los investigadores descubrieron que, al ser ligeramente más permisivos con los errores diminutos, podían hacer que la IA escribiera significativamente más rápido sin arruinar la calidad de la historia.
La historia del asistente "con presupuesto"
La idea central detrás de ASD es dejar de tratar cada error como un desastre. En la forma antigua, si tu asistente adivinaba una palabra que no era la opción principal, el sistema se detenía inmediatamente. Pero los autores se dieron cuenta de que, a veces, la suposición "incorrecta" del asistente es en realidad muy cercana a la correcta, y las palabras que la siguen son perfectas.
Para solucionar esto, el equipo creó un sistema con un presupuesto. Imagina que tienes un frasco de "tokens de error". Se te permite cometer algunos errores pequeños, pero tienes que pagarlos de tu frasco.
- La Puerta Local: Antes de aceptar un error, el sistema verifica qué tan "malo" es. Si la suposición del asistente es solo un poco menos probable que la palabra perfecta, es un error barato. Si es un error enorme, cuesta demasiados tokens, y el sistema dice "no".
- El Límite de Bloque: No puedes cometer demasiados errores en un solo lote de suposiciones. Esto evita que el asistente se vuelva demasiado inexacto de una sola vez.
- El Presupuesto de la Solicitud: Este es el frasco total de tokens para toda la conversación. Una vez que te quedas sin tokens, tienes que volver a ser perfecto (siguiendo estrictamente las reglas antiguas) durante el resto de la historia.
La magia ocurre cuando el sistema acepta un pequeño error. Debido a que las siguientes suposiciones del asistente fueron en realidad perfectas (coincidieron con lo que el experto habría elegido), el sistema puede "reutilizarlas". No necesita pedirle al experto lento que las compruebe de nuevo. Simplemente las acepta y sigue adelante. Esto convierte un momento de "detener y tirar" en un momento de "corregir y seguir adelante".
Lo que encontraron
Los investigadores probaron esta idea utilizando modelos de IA muy populares (como Qwen3 y DeepSeek) en una variedad de tareas, desde resolver problemas matemáticos hasta escribir código. No necesitaron reentrenar los modelos ni enseñar nada nuevo al asistente; simplemente cambiaron la forma en que el "profesor" (el verificador) califica el trabajo.
Los resultados fueron bastante prometedores. Al usar este enfoque presupuestado, el sistema se volvió significativamente más rápido sin necesidad de entrenamiento adicional.
- En un conjunto de siete tareas diferentes, el sistema fue un 7,78% más rápido en promedio en comparación con el método antiguo y estricto.
- En los mejores casos, como en el conjunto de datos MATH-500, la velocidad aumentó un 11,73%.
- Cuando lo probaron en un modelo masivo llamado DeepSeek-V4-Flash, vieron que las tasas de aceptación (cuántas suposiciones mantiene el sistema) aumentaron aproximadamente entre un 10% y un 16%.
El artículo advierte cuidadosamente que esto no es una varita mágica que lo hace todo perfecto. Los autores declaran explícitamente que este método cambia el camino que toma la IA para llegar a la respuesta. A veces, la historia puede ser ligeramente diferente, o el "hash" (una huella digital del texto) puede cambiar, incluso si la respuesta final es correcta. Por ejemplo, en algunas pruebas de programación, la precisión bajó ligeramente (menos de 1,5 puntos porcentuales), pero en muchas otras tareas, la precisión se mantuvo exactamente igual o incluso mejoró ligeramente.
Por qué esto es importante
La belleza de este artículo es que no requiere construir una nueva IA más rápida o entrenar a un nuevo asistente. Solo cambia las reglas del juego para el que ya tienes. Es como darse cuenta de que un policía de tráfico estricto está ralentizando toda la ciudad porque detiene el coche por cada infracción menor, cuando un enfoque más flexible mantendría el tráfico fluyendo suavemente con solo riesgos mínimos y manejables.
Los autores sugieren que este método es una excelente manera de exprimir más velocidad de los sistemas de IA actuales. Enfatizan que, si bien las ganancias de velocidad son reales y medibles (hasta un 15,26% en algunos casos), los usuarios deben ser conscientes de que están intercambiando una pizca de perfección estricta por mucha velocidad. Es un intercambio calculado: obtienes tu historia escrita mucho más rápido y, para la mayoría de las personas, las pequeñas diferencias en la redacción no importarán en absoluto. El artículo concluye que este enfoque "presupuestado" es una forma práctica y sin necesidad de entrenamiento para hacer que la generación de IA sea más rápida, siempre que se comprueben los resultados para asegurarse de que la calidad sigue siendo lo suficientemente buena para sus necesidades.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.