← Últimos artículos
💬 NLP

D-cut: Adaptive Verification Depth Pruning for Batched Speculative Decoding

D-Cut es un método de poda de profundidad de verificación adaptativo para la decodificación especulativa por lotes que asigna dinámicamente presupuestos de verificación entre solicitudes concurrentes basándose en la confianza del borrador y modelos de costo en tiempo de ejecución, mejorando significativamente la aceleración de la inferencia bajo alta concurrencia mientras evita el desperdicio de computación en tokens rechazados.

Autores originales: Tianyu Liu, Yuhao Shen, Rui Cen, Junhan Shi, Jiebin Zhang, Guangshuo Qin, Hong Liu, Song Liu, Guanghua Yu, Jianchen Zhu

Publicado 2026-07-17
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Tianyu Liu, Yuhao Shen, Rui Cen, Junhan Shi, Jiebin Zhang, Guangshuo Qin, Hong Liu, Song Liu, Guanghua Yu, Jianchen Zhu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que diriges una biblioteca masiva de alta velocidad donde un único bibliotecario increíblemente inteligente (la IA) responde preguntas de miles de personas a la vez. Este bibliotecario es brillante pero trabaja de una manera muy específica: solo puede escribir una palabra a la vez. Para responder a una pregunta compleja, tiene que hacer una pausa, pensar, escribir una palabra, hacer otra pausa, pensar, escribir la siguiente palabra, y así sucesivamente. Esta regla de "una palabra a la vez" es la razón principal por la que la biblioteca se congestiona; el bibliotecario pasa la mayor parte del tiempo simplemente esperando a coger la siguiente palabra de los estantes.

Para acelerar las cosas, los ingenieros inventaron un truco ingenioso llamado "decodificación especulativa". En lugar de dejar que el bibliotecario escriba una palabra a la vez, contratan a un asistente ligeramente menos inteligente (el "redactor") para que adivine las siguientes palabras en un estallido. El bibliotecario luego verifica rápidamente estas conjetas. Si las conjetas son correctas, acepta todas a la vez, saltándose el ciclo lento de "pensar-pausa-escribir" para esas palabras. Es como si el asistente gritara: "¡Apuesto a que las próximas tres palabras son 'El', 'rápido' y 'marrón'!" y el bibliotecario dijera: "¡Sí, tienes razón!", y así continúa. Esto funciona de maravilla cuando la biblioteca está tranquila. Pero, ¿qué pasa cuando la biblioteca está abarrotada con 64 personas gritando preguntas al mismo tiempo? El asistente podría gritar una larga lista de conjetas para todos, pero el bibliotecario se ve abrumado intentando verificarlas todas. Si las conjetas son erróneas, el bibliotecario pierde un tiempo precioso verificando palabras que luego se desechan, ralentizando toda la biblioteca. Este es el rompecabezas que este artículo aborda: cómo mantener la mejora de velocidad cuando la multitud es enorme.


El Problema: Demasiadas Conjetas, No Suficiente Tiempo

Los investigadores de Tencent Hunyuan notaron un fallo en el sistema. Recientemente, los nuevos asistentes (como uno llamado DFlash) se volvieron muy buenos gritando largas listas de conjetas—por ejemplo, 15 palabras a la vez. Cuando la biblioteca estaba vacía, esto era un superpoder; el bibliotecario aceptaba la mayoría de ellas y la biblioteca avanzaba volando a través de las preguntas.

Pero a medida que la multitud crecía (cuando el "tamaño del lote" o número de solicitudes simultáneas aumentaba), el sistema empezaba a colapsar. El asistente seguía gritando largas listas, pero el bibliotecario, ahora estirado al máximo, no podía verificarlas todas lo suficientemente rápido. Peor aún, muchas de esas largas listas eran erróneas. El bibliotecario gastaba toda su energía verificando palabras que resultaban ser basura, solo para rechazarlas. Era como un guardia de seguridad en un concierto concurrido revisando las identificaciones de 15 personas en una fila, solo para darse cuenta de que 10 de ellas eran falsas, perdiendo tiempo que podría haber pasado dejando entrar a los fans reales. Los investigadores descubrieron que, con multitudes altas, este método de "conjetas largas" era en realidad más lento que dejar que el bibliotecario trabajara solo, una palabra a la vez.

La Solución: D-cut (El Portero Inteligente)

Para solucionar esto, el equipo propuso una nueva estrategia llamada D-cut. Piensa en D-cut como un portero súper inteligente que se interpone entre el asistente y el bibliotecario.

En lugar de dejar que el asistente grite una larga lista fija de conjetas para todos y que el bibliotecario las verifique todas, D-cut observa a la multitud y las conjetas en tiempo real. Hace dos preguntas simples:

  1. ¿Qué tan seguro está el asistente? Si el asistente grita con alta confianza, el portero deja pasar esas conjetas. Si el asistente balbucea o no está seguro, el portero acorta la lista.
  2. ¿Qué tan cansado está el bibliotecario? El portero comprueba la carga de trabajo actual del bibliotecario. Si el bibliotecario está saturado (como en un chip GPU ocupado), el portero se vuelve más estricto y recorta más conjetas. Si el bibliotecario está fresco y es potente (como en un chip diferente y más rápido), el portero deja pasar más conjetas.

D-cut no solo recorta la lista para una persona; observa el lote completo de solicitudes. Se da cuenta de que para algunas personas, el asistente es un genio, pero para otras, el asistente está adivinando salvajemente. Así, D-cut toma el "presupuesto de verificación" (el tiempo que el bibliotecario tiene para verificar) y se lo entrega a las personas que tienen más probabilidades de estar en lo cierto. Podas (recorta) las colas largas y de baja confianza de las conjetas de las solicitudes inseguras y enfoca la energía del bibliotecario en las partes de alta confianza.

Cómo Funciona en el Mundo Real

Los investigadores probaron esta idea en una variedad de modelos de IA, desde pequeños hasta masivos, y en diferentes tipos de chips informáticos. Descubrieron que D-cut era un cambio radical para los momentos de mucha actividad:

  • Salvando el día en las altas multitudes: Cuando el número de solicitudes era alto (como 64 personas a la vez), el método antiguo (DFlash) a menudo se ralentizaba tanto que era en realidad más lento que el método estándar de "una palabra a la vez". D-cut solucionó esto. Mantuvo la aceleración viva incluso cuando la biblioteca estaba repleta.
  • Los Números: En sus pruebas, D-cut aumentó la velocidad promedio de 1.26 veces más rápido a 1.65 veces más rápido en comparación con el método estándar bajo carga alta. En algunos modelos específicos y muy grandes, incluso alcanzó hasta 3.0 veces la velocidad.
  • Adaptándose al Hardware: Una de las características más geniales es que D-cut aprende qué tan rápido es el bibliotecario antes de que llegue la multitud. Perfila el chip informático (como un GPU H20 o H800) para ver qué tan costoso es verificar una palabra. Si verificar una palabra es costoso (como en un chip más lento), D-cut recorta de forma más agresiva. Si es barato, recorta menos. Esto significa que no necesita que un humano lo ajuste para cada nuevo ordenador; lo descubre automáticamente.

Lo Que No Hace (Y Lo Que Descarta)

Es importante saber qué no es D-cut. No intenta hacer al asistente más inteligente ni cambia cómo piensa el bibliotecario. No cambia las respuestas finales que da la IA; el resultado es exactamente el mismo que si el bibliotecario hubiera verificado todo, solo que se llega a él mucho más rápido.

El artículo argumenta explícitamente en contra de la idea de que "más largo siempre es mejor". Demostraron que generar ciegamente largas listas de conjetas (como los bloques de 15 palabras en DFlash) es una mala idea cuando la multitud es grande. El enfoque de "talla única" de verificar el mismo número de conjetas para todos falla porque no todos necesitan la misma cantidad de verificación. D-cut demuestra que ser selectivo es mejor que ser exhaustivo.

La Conclusión

Los investigadores no solo sugirieron que esto podría funcionar; lo midieron. Ejecutaron simulaciones y pruebas del mundo real en servidores reales con miles de solicitudes. Los resultados mostraron que, al ser un portero inteligente y adaptativo que recorta las conjetas de baja confianza y se enfoca en las de alta confianza, D-cut mantiene la biblioteca de IA funcionando rápido incluso cuando las puertas están a punto de reventar. Convierte un sistema que de otro modo se ralentizaría hasta casi detenerse en uno que se mantiene eficiente, demostando que, a veces, la mejor manera de ir rápido es dejar de verificar las cosas que sabes que están mal.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →