← Últimos artículos
💬 NLP

LiLiCorr: Lightweight Likelihood Correlation of Parallel Drafts for Speculative Decoding

LiLiCorr es un método ligero que mejora la decodificación especulativa al correlacionar eficientemente las distribuciones marginales por posición de un redactor para capturar la coherencia conjunta de los tokens, aumentando así significativamente las longitudes de aceptación y el rendimiento general con una sobrecarga de latencia mínima.

Autores originales: Matan Rusanovsky, Yoav Miron, Roy Uziel, Omer Belhasin, Ran Zilberstein, Maor Ashkenazi, Michael Elad

Publicado 2026-08-24
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Matan Rusanovsky, Yoav Miron, Roy Uziel, Omer Belhasin, Ran Zilberstein, Maor Ashkenazi, Michael Elad

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde leer un libro es instantáneo, no porque las palabras aparezcan más rápido, sino porque tu mente puede anticipar párrafos enteros antes de que siquiera pases la página. Esta es la promesa de una técnica llamada decodificación especulativa, un método diseñado para hacer que la inteligencia artificial hable y escriba con una velocidad sin precedentes. En su esencia, el proceso se basa en una simple división del trabajo: un modelo pequeño y rápido actúa como un bocetista, adivinando lo que viene después, mientras que un modelo más grande y potente actúa como un juez, verificando esas conjeturas. Si el juez está de acuerdo con la predicción del bocetista, el sistema acepta la conjetura y avanza, saltándose el lento trabajo paso a paso de generar cada palabra desde cero. Cuanto más se pueda confiar en que el bocetista acierte una larga cadena de palabras, más rápido fluirá toda la conversación. Sin embargo, un problema persistente ha frenado esta tecnología: el bocetista a menudo acierta las palabras individuales pero no logra que encajen entre sí en una oración coherente. Es como un músico que toca cada nota perfectamente de forma aislada, pero crea una melodía discordante y sin sentido cuando las notas se tocan en secuencia.

Investigadores de NVIDIA han introducido un nuevo método llamado LiLiCorr para resolver este problema específico de coherencia sin sacrificar la velocidad. El sistema se basa en un modelo de bocetaje conocido como DFlash, que es capaz de predecir un bloque completo de palabras futuras en un único y rápido estallido. Aunque DFlash es increíblemente rápido, trata cada posición de palabra como un evento independiente, lo que significa que podría sugerir "El perro" para la primera posición y "maúlla" para la segunda, pero no darse cuenta de que "El gato" habría sido una mejor opción para el contexto de la oración completa. El nuevo enfoque no intenta reentrenar al bocetista para que sea perfecto; en su lugar, añade una capa ligera de lógica que actúa como un editor rápido. Este editor observa los pocos candidatos principales que el bocetista propuso para cada posición y comprueba qué tan bien se vinculan entre sí. Asigna un par de señales direccionales a cada palabra candidata, una que indica qué tan bien encaja con la palabra anterior, y otra que indica qué tan bien prepara la palabra siguiente. Al comparar estas señales, el sistema puede identificar instantáneamente qué secuencia de palabras forma un camino suave y lógico, descartando las combinaciones discordantes que habrían causado que el modelo más grande las rechazara.

La brillantez de este diseño reside en su eficiencia. En lugar de comprobar cada palabra una por una en una cadena secuencial lenta, el sistema evalúa todas las conexiones posibles entre las palabras candidatas simultáneamente, utilizando un único cálculo masivo que ocurre en paralelo. Esto permite que el sistema encuentre la secuencia más coherente casi instantáneamente, dejando solo un paso final sencillo para consolidar las elecciones. Los investigadores descubrieron que, al entrenar a este editor para que trabaje de la mano con el bocetista, ambos modelos aprendieron a cooperar, logrando que el bocetista eventualmente propusiera candidatos que fueran más fáciles de vincular en cadenas largas y aceptadas por el editor. En pruebas realizadas en nueve bancos de pruebas diferentes, que van desde la resolución de problemas matemáticos hasta la escritura de código y la mantención de conversaciones, este nuevo método superó consistentemente a los enfoques anteriores. Aumentó el número de palabras aceptadas entre un nueve y un diecinueve por ciento en comparación con el bocetista sin editar, y entregó la mayor velocidad general en setenta de los setenta y dos escenarios de prueba. Incluso cuando se le pidió al sistema que manejara entradas diez veces más largas que los datos para los que fue entrenado, mantuvo su liderazgo, demostrando que este método de vincular candidatos es robusto y escalable.

Los resultados sugieren que el cuello de botella para acelerar la IA no es solo hacer al bocetista más rápido, sino hacer que sus conjeturas sean más fáciles de verificar. Al corregir la coherencia de las conjeturas antes de que sean enviadas al juez, el sistema evita el tiempo perdido de rechazo y regeneración. Este enfoque no requiere la enorme potencia de cálculo del modelo principal para realizar el trabajo pesado de correlación; en su lugar, utiliza una red pequeña y especializada que añade una cantidad insignificante de tiempo al proceso, representando solo alrededor del 2.8 por ciento del tiempo total por bloque de texto. Los investigadores demostraron que esta pequeña adición genera un retorno masivo, permitiendo que el sistema procese la información significativamente más rápido que antes. Mientras que otros métodos han intentado resolver esto ejecutando comprobaciones complejas en cada palabra o pidiendo al modelo principal que realice trabajo adicional, LiLiCorr logra sus resultados organizando la información que el bocetista ya proporciona en una estructura que es fácil de navegar. Los hallazgos indican que, para el futuro de la IA de alta velocidad, la clave puede no estar en construir modelos más grandes, sino en construir formas más inteligentes y eficientes de conectar los puntos entre las palabras que generan.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →