← Últimos artículos
🤖 machine learning

DARTree: Speculative Diffusion Decoding with Autoregressive Draft Trees

DARTree es un método de decodificación especulativa sin entrenamiento que extiende la corrección autorregresiva de cadenas lineales a árboles de candidatos de ancho fijo, logtando aceleraciones sin pérdidas de vanguardia al desacoplar la inferencia del cabezal AR de las operaciones secuenciales para maximizar la aceptación de tokens.

Autores originales: Tianyi Li, Yaxin Luo, Xinyi Shang, Zhiqiang Shen

Publicado 2026-08-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tianyi Li, Yaxin Luo, Xinyi Shang, Zhiqiang Shen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando escribir una historia con un amigo robot que es muy inteligente, pero increíblemente lento. Este robot es brillante comprendiendo el mundo y puede escribir frases asombrosas, pero tiene una regla estricta: solo puede escribir una palabra a la vez. Antes de escribir la siguiente palabra, debe detenerse, pensar en todo lo que ha escrito hasta el momento y luego elegir cuidadosamente la única mejor palabra para añadir. Es como un chef que solo puede probar un ingrediente a la vez antes de decidir qué poner en la sopa. Aunque esto asegura que la sopa sepa perfecta, toma una eternidad cocinar una comida grande. En el mundo de la inteligencia artificial, este proceso de "una palabra a la vez" se llama generación autorregresiva, y es la razón principal por la cual los chatbots de IA potentes a veces se sienten lentos.

Para acelerar las cosas sin arruinar la calidad, los científicos inventaron un truco llamado Decodificación Especulativa. Piensa en esto como contratar a un pasante rápido y enérgico para que adivine las siguientes palabras para el robot lento. El pasante grita una oración completa y el robot lento verifica rápidamente si el pasante tuvo razón. Si el pasante adivinó correctamente, el robot acepta toda la oración instantáneamente y continúa. Si el pasante cometió un error, el robot simplemente corrige esa palabra y comienza de nuevo. La magia ocurre cuando el pasante es lo suficientemente bueno como para adivinar muchas palabras correctamente en una fila, permitiendo que el robot lento se salte la parte del pensamiento difícil y solo diga "¡Sí, eso es correcto!" a un bloque entero de texto a la vez.

Recientemente, los investigadores intentaron hacer al pasante aún más rápido usando un tipo de cerebro diferente llamado Modelo de Difusión. En lugar de adivinar las palabras una por una, el pasante intenta imaginar la siguiente oración completa de una vez, como un pintor llenando todo un lienzo en un solo trazo. Esto es súper rápido, pero tiene un defecto: debido a que el pasante adivina la oración completa de golpe, realmente no sabe cómo la primera palabra afecta a la segunda, o cómo la segunda afecta a la tercera. Es como adivinar el final de una película sin ver las escenas intermedias. Para solucionar esto, otros investigadores añadieron un paso de "corrección", pero lo hicieron de una manera que seguía siendo lenta y torpe, obligando al robot a revisar el trabajo del pasante palabra por palabra, lo que anulaba el propósito de ser rápido.

Aquí es donde entra un nuevo artículo del Laboratorio VILA en MBZUAI con una solución ingeniosa llamada DARTree. Los investigadores se dieron cuenta de que la forma antigua de revisar el trabajo del pasante era como intentar organizar una biblioteca recogiendo un libro, revisando su estante, devolviéndolo, recogiendo el siguiente, y así sucesivamente. Era caminar demasiado. En su lugar, DARTree sugiere una nueva forma de construir un "árbol" de posibilidades. Imagina que el pasante no solo dibuja un camino de palabras, sino que dibuja todo un árbol frondoso de diferentes caminos de la historia. El robot lento entonces mira todo el árbol a la vez, pero con un giro especial: revisa las "ramas" del árbol en grandes grupos (lotes) en lugar de una por una.

La innovación clave es que DARTree separa el "adivinar" del "revisar". Primero, construye un árbol ancho y temporal de muchos caminos de la historia posibles a la vez. Luego, utiliza una herramienta de poda inteligente para cortar las ramas que no parecen prometedoras, dejando solo el mejor árbol para mostrárselo al robot lento. Al realizar el trabajo pesado de revisar los caminos de la historia en grandes lotes, evitan el lento proceso de paso a paso que solía frenarlo todo. El artículo muestra que este método es un gran éxito. En una variedad de pruebas que involucran problemas matemáticos, tareas de programación y conversaciones de chat, DARTree logró aceptar hasta 12.97 tokens (palabras o partes de palabras) por ronda de revisión. Este es un salto masivo comparado con métodos anteriores; fue un 98.6% mejor que un competidor principal llamado DFlash y un 27.9% mejor que otro llamado Domino.

El resultado es un sistema que es increíblemente rápido pero sigue siendo perfectamente preciso. Los investigadores midieron que este nuevo método puede hacer que la IA sea 9.73 veces más rápida que la forma estándar de escribir, sin perder nada de la calidad o inventar hechos falsos. Probaron esto en diferentes tipos de modelos de IA y encontraron que funcionaba de maravilla, ya fuera que la IA estuviera siendo muy estricta y lógica (como en matemáticas) o siendo creativa y aleatoria (como en un chat). El artículo argumenta que este enfoque de "árbol", que revisa muchos caminos en paralelo antes de hacer un corte final, es la mejor manera de acelerar estos robots inteligentes. Demuestra que no tienes que elegir entre velocidad e inteligencia; con la estructura adecuada, puedes tener ambas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →