← Últimos artículos
💬 NLP

DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding

DFlare acelera la inferencia de LLM al superar las limitaciones de expresividad de los métodos previos de difusión por bloques mediante un mecanismo de fusión ligero por capas que permite modelos de borrador más profundos y capaces, logrando aceleraciones significativas en diversos benchmarks.

Autores originales: Jiebin Zhang, Zhenghan Yu, Song Liu, Eugene J. Yu, Zheng Li, Dawei Zhu, Jiangshan Duo, Weimin Xiong, Yifan Song, Guanghua Yu, Jianchen Zhu, Sujian Li

Publicado 2026-06-02
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jiebin Zhang, Zhenghan Yu, Song Liu, Eugene J. Yu, Zheng Li, Dawei Zhu, Jiangshan Duo, Weimin Xiong, Yifan Song, Guanghua Yu, Jianchen Zhu, Sujian Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando escribir una historia larga, pero eres un escritor muy lento y perfeccionista (el Modelo Objetivo). Cada vez que quieres escribir la siguiente palabra, tienes que pensar muy duro, revisar tu gramática y asegurarte de que encaje perfectamente. Esto toma mucho tiempo.

Para acelerar esto, contratas a un asistente rápido y enérgico (el Modelo de Borrador). El asistente intenta adivinar las siguientes palabras por ti. Si el asistente acierta, simplemente dices "¡Sí, sigue así!" y avanzas rápidamente. Si el asistente se equivoca, tienes que detenerte, corregirlo y empezar de nuevo. Esto se llama Decodificación Especulativa.

El Problema: El Asistente de "Talla Única"

Recientemente, un nuevo método llamado DFlash intentó hacer al asistente aún mejor. En lugar de adivinar una palabra a la vez, el asistente de DFlash intenta adivinar un bloque entero de palabras de una sola vez (como adivinar la siguiente oración de un solo golpe).

Sin embargo, DFlash tenía un fallo importante. Le dio al asistente una "hoja de trucos" única y genérica derivada del cerebro del escritor principal.

  • El Fallo: Imagina que el asistente tiene 7 capas de pensamiento (como 7 pisos en un edificio). DFlash le dio la misma hoja de trucos exacta al 1er piso, al 4º piso y al 7º piso.
  • El Resultado: El asistente se confundió. Los pisos inferiores necesitaban reglas gramaticales simples, mientras que los pisos superiores necesitaban ideas complejas para la historia. Debido a que todos recibieron la misma información genérica, el asistente no pudo volverse más inteligente al añadir más pisos. Golpeó un "techo" donde añadir más capas no ayudaba.

La Solución: DFLARE

Los autores de este artículo crearon DFLARE. Piensa en DFLARE como una actualización al sistema de entrenamiento del asistente para que cada piso del edificio reciba una hoja de trucos personalizada.

Así es como funciona DFLARE, usando analogías simples:

1. Las Hojas de Trucos Personalizadas (Fusión por Capas)

En DFLARE, en lugar de dar a cada piso la misma hoja de trucos genérica, el sistema crea una mezcla única de información para cada piso.

  • La Analogía: Imagina que el escritor principal (Modelo Objetivo) tiene una biblioteca de libros.
    • DFlash tomó una página de la biblioteca, la fotocopió 7 veces y le dio una copia a cada piso.
    • DFLARE mira la biblioteca y dice: "El Piso 1 necesita una página sobre gramática, el Piso 4 necesita una página sobre giros en la trama y el Piso 7 necesita una página sobre emociones de personajes". Mezcla diferentes páginas de la biblioteca para crear una guía única y perfecta para cada piso específico.
  • El Beneficio: Debido a que cada piso tiene una guía especializada, el asistente puede de hecho volverse más inteligente al añadir más pisos. El "techo" se rompe.

2. Cuadernos Separados (Proyecciones KV Heterogéneas)

El asistente necesita almacenar dos tipos de notas: sus propios cálculos y la información del escritor principal.

  • La Analogía: En el sistema antiguo, el asistente intentaba escribir sus propios cálculos y las notas del escritor principal en el mismo cuaderno. La tinta se mezclaba y era difícil de leer.
  • La Solución de DFLARE: Le da al asistente dos cuadernos separados. Uno es para sus propios cálculos salvajes, y el otro es estrictamente para las notas del escritor principal. Esto mantiene la información limpia y fácil de usar.

3. Aprendizaje por Etapas (Pérdida Progresiva)

Cuando el asistente aprende, no debería intentar dominar las partes más difíciles de la historia de inmediato.

  • La Analogía: Imagina a un profesor calificando a un estudiante.
    • Forma Antigua: El profesor calificaba la primera oración fácil y la última oración difícil con la misma importancia desde el primer día. El estudiante se abrumaba.
    • La Forma de DFLARE: El profesor comienza enfocándose solo en las primeras oraciones fáciles para generar confianza. A medida que el estudiante mejora, el profesor comienza a calificar lentamente las oraciones más difíciles al final del bloque. Este enfoque de "calentamiento" ayuda al asistente a aprender de manera más rápida y efectiva.

Los Resultados: ¿Qué tan rápido es?

El artículo probó este nuevo sistema en tres "escritores principales" (modelos de IA) y encontró que DFLARE es significativamente más rápido que el método anterior más avanzado (DFlash).

  • En un escritor de tamaño medio (Qwen3-4B): Es 5.52 veces más rápido.
  • En un escritor grande (Qwen3-8B): Es 5.46 veces más rápido.
  • En un escritor muy grande (GPT-OSS-20B): Es 3.91 veces más rápido.

En términos simples, si el método antiguo tardaba 10 segundos en escribir un párrafo, DFLARE puede hacerlo en aproximadamente 2 segundos, manteniendo la misma historia de alta calidad.

Resumen

DFLARE es como mejorar a un asistente rápido dándole a cada parte de su cerebro una guía especializada y hecha a medida en lugar de una genérica. Esto permite que el asistente crezca más grande y más inteligente, lo que conduce a aumentos masivos de velocidad en la rapidez con la que la IA puede escribir texto, código o resolver problemas matemáticos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →