← Últimos artículos
🤖 machine learning

TreeFlash: Parallel AR-Approximation for Faster Speculative Decoding

TreeFlash es un novedoso método de decodificación especulativa en paralelo que mejora los redactores de bloques de un solo paso mediante la incorporación de una capa MLP para aproximar las distribuciones autorregresivas, mejorando así significativamente la eficiencia de bloque y la aceleración mientras mantiene una complejidad de tiempo de decodificación constante.

Autores originales: Peer Rheinboldt, Frédéric Berdoz, Roger Wattenhofer

Publicado 2026-06-03
📖 4 min de lectura☕ Lectura para el café

Autores originales: Peer Rheinboldt, Frédéric Berdoz, Roger Wattenhofer

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando predecir la siguiente palabra en una oración, como si estuvieras terminando la historia de un amigo.

La forma antigua (Autorregresiva)
Normalmente, los grandes modelos de IA (como los que escriben este artículo) son muy cuidadosos pero lentos. Escriben una palabra, la comprueban, luego escriben la siguiente palabra basándose en esa, y así sucesivamente. Es como una sola persona escribiendo una oración letra por letra. No pueden acelerar porque tienen que esperar a la letra anterior antes de escribir la siguiente.

El atajo "Especulativo"
Para acelerar las cosas, los investigadores inventaron un sistema de "borrador". Una IA pequeña y rápida (el Redactor) adivina un bloque entero de palabras a la vez. Luego, la IA grande y lenta (el Verificador) las comprueba todas de una sola vez. Si los aciertos son correctos, la IA grande los acepta todos instantáneamente, ahorrando una tonelada de tiempo.

El problema del borrador de "un solo paso" (One-Shot)
Recientemente, se introdujo un método llamado DFlash. En lugar de adivinar las palabras una por una, el Redactor intenta escupir el bloque entero de palabras en un solo instante ("one-shot").

  • La analogía: Imagina a un chef intentando adivinar los próximos 10 ingredientes para una sopa, todo a la vez, sin probar los primeros 9.
  • El fallo: Debido a que el chef no probó los ingredientes anteriores, su suposición para el décimo ingrediente se basa solo en la receta original, no en el hecho de que acaba de añadir "sal" o "pimienta". A medida que la lista de suposiciones se alarga, las suposiciones del chef comienzan a alejarse de lo que la receta real (el Verificador) realmente quiere.
  • El problema del Árbol: Los métodos más nuevos intentan adivinar múltiples caminos diferentes a la vez (como un árbol con muchas ramas). Pero si las ramas comparten un inicio común, se ven obligadas a usar la misma suposición para el siguiente paso, incluso si una rama tenía "sal" y la otra tenía "azúcar". Esto hace que el árbol sea desordenado y menos preciso.

La Solución: TreeFlash
Los autores de este artículo crearon TreeFlash. Se dieron cuenta de que el chef necesita un poco de ayuda para recordar lo que acaba de "probar".

  • El truco de magia: Añadieron una capa muy pequeña y ligera (un AR-Aproximador) al Redactor.
  • Cómo funciona: Aunque el Redactor sigue adivinando todo el bloque a la vez (manteniéndose súper rápido), este ayudante mira la palabra inmediatamente anterior en el borrador y susurra: "Oye, ya que dijimos 'sal', la siguiente palabra debería ser probablemente 'pimienta', no 'azúcar'".
  • El resultado: El Redactor ahora puede hacer suposiciones que dependen de las palabras justo anteriores a ellas, tal como lo haría un humano normal, pero sigue haciéndolo todo en un solo instante.

Por qué es algo importante
El artículo afirma que, al añadir este pequeño ayudante:

  1. Se mantiene rápido: No ralentiza el proceso porque el ayudante es muy pequeño y el cálculo se hace en paralelo.
  2. Es más preciso: Las suposiciones se mantienen mucho más cerca de lo que la gran IA realmente quiere, especialmente para las palabras posteriores en el bloque.
  3. Construye mejores árboles: Cuando adivina múltiples caminos a la vez, TreeFlash puede manejar las diferentes ramas correctamente (por ejemplo, una rama recibe "sal", la otra recibe "azúcar", y las siguientes palabras se ajustan en consecuencia).

Los Resultados
Cuando probaron TreeFlash en diversas tareas (como problemas matemáticos, programación y conversación general) utilizando diferentes tamaños de modelos de IA, superó consistentemente a los mejores métodos anteriores.

  • Aceptó más palabras correctas por cada suposición (mayor eficiencia).
  • Hizo que todo el proceso fuera más rápido (mayor aceleración).
  • La mejora fue aún mayor cuando pidieron a la IA que adivinara listas de palabras más largas.

En pocas palabras
TreeFlash es como darle a un robot de lectura rápida una pequeña memoria USB. Le permite adivinar un párrafo entero en un segundo, pero en lugar de adivinar a ciegas, recuerda la última palabra que adivinó para que la siguiente suposición sea más inteligente. Esto hace que la IA escriba mucho más rápido sin perder calidad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →