← Últimos artículos
💬 NLP

AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs

AsymSpec es un marco de decodificación especulativa asimétrica que permite que un redactor ligero acceda al contexto completo de la entrada mientras un verificador grande opera sobre una vista comprimida, equilibrando eficazmente la velocidad de inferencia y la precisión para LLMs agénticos al lograr un rendimiento cercano al contexto completo con costos computacionales significativamente reducidos.

Autores originales: Sheng Liang, Yongyue Zhang, Nathanael Brian, Hang Lv, Hao Wang, Chen Zhang, Yong Liu

Publicado 2026-08-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Sheng Liang, Yongyue Zhang, Nathanael Brian, Hang Lv, Hao Wang, Chen Zhang, Yong Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los sistemas modernos de inteligencia artificial actúan cada vez más como agentes autónomos, capaces de recuperar documentos, utilizar herramientas de software y mantener conversaciones de múltiples turnos para resolver problemas complejos. A medida que estos agentes trabajan, acumulan un historial creciente de información: resultados de búsqueda, salidas de herramientas y mensajes pasados. Para que estos sistemas sean lo suficientemente rápidos para su uso en el mundo real, los ingenieros suelen comprimir este historial, resumiendo documentos largos en frases cortas o eliminando imágenes detalladas para ahorrar tiempo. Sin embargo, esta compresión tiene un precio elevado: la IA pierde los detalles de grano fino necesarios para un razonamiento preciso, lo que obliga a una difícil elección entre velocidad e inteligencia. Una técnica estándar llamada decodificación especulativa, que utiliza un modelo pequeño y rápido para adivinar lo que dirá un modelo grande y lento, ha sido la solución predilecta para acelerar la IA. No obstante, este método tradicional choca con un muro en entornos agénticos porque requiere que tanto el pequeño que adivina como el grande que verifica vean exactamente la misma información. Si la información se comprime para ahorrar tiempo, el que adivina pierde los mismos detalles críticos que el verificador, lo que significa que la aceleración no puede recuperar la precisión perdida.

Investigadores de Huawei Technologies y la Universidad de Ciencia y Tecnología de China han propuesto un nuevo enfoque llamado ASYMSPEC que rompe este estancamiento al permitir que los dos modelos vean versiones diferentes de la misma historia. En su sistema, el modelo grande y potente que toma la decisión final opera únicamente sobre la versión comprimida y rápida de la entrada para mantener baja la latencia. Mientras tanto, un modelo mucho más pequeño y ligero lee el historial completo y sin comprimir en segundo plano. Este pequeño modelo actúa como un guía, identificando exactamente qué información se perdió durante la compresión y guiando sutilmente las predicciones del modelo grande para incluir esos detalles faltantes. Los investigadores descubrieron que esta configuración asimétrica permite al sistema retener casi toda la precisión de un análisis de contexto completo mientras opera a la velocidad de uno comprimido. En pruebas realizadas en cuatro capacidades agénticas diferentes, incluyendo preguntas complejas de múltiples pasos y el uso de herramientas, el método recuperó aproximadamente el 90 por ciento de la precisión de contexto completo utilizando solo el 20 o 30 por ciento del costo computacional.

La innovación central reside en cómo se comunican los dos modelos. En lugar de simplemente dejar que el modelo pequeño adivine y esperar que el modelo grande esté de acuerdo, el sistema compara la reacción del modelo pequeño al texto completo frente a su reacción al texto comprimido. La diferencia entre estas dos reacciones revela exactamente lo que la compresión eliminó. El sistema utiliza entonces esta señal específica para ajustar la salida del modelo grande, llenando eficazmente los vacíos sin requerir que el modelo grande procese los datos pesados de longitud completa en sí mismo. Un mecanismo de portero inteligente asegura que esta guía se aplifique solo cuando es necesario, evitando que el sistema se confunda cuando la compresión es leve. Este enfoque funciona incluso cuando la entrada involucra diferentes tipos de medios; por ejemplo, un modelo pequeño puede observar una imagen pura mientras el modelo grande solo ve una descripción textual, con el modelo pequeño dirigiendo al grande para comprender los detalles visuales que este último no puede ver.

Los investigadores probaron este método en tareas de agentes del mundo real, como responder preguntas que requieren buscar a través de múltiples documentos, seguir instrucciones de múltiples turnos y usar herramientas de software. Compararon su sistema contra métodos estándar que o bien procesan todo lentamente o comprimen todo rápidamente. Los resultados mostraron que la decodificación especulativa tradicional no podía recuperar la precisión perdida debido a la compresión; simplemente aceleraba el proceso con pérdida de información. En contraste, el nuevo método asimétrico logró cerrar la brecha, entregando un rendimiento cercano al ideal de contexto completo pero en una fracción del tiempo. En evaluaciones específicas que involucran documentos largos, el sistema logró aceleraciones de 1.3 a 1.7 veces en comparación con la línea base sin comprimir, mientras reducía la potencia de cómputo requerida a aproximadamente una quinta parte. El estudio sugiere que esta técnica es particularmente valiosa cuando la compresión es severa, ya que la capacidad del sistema para recuperar la información perdida escala directamente con cuánto detalle se eliminó inicialmente.

Este trabajo demuestra que el compromiso entre velocidad y precisión en los agentes de IA no tiene por qué ser rígido. Al desacoplar lo que el modelo rápido ve de lo que el modelo lento ve, y al utilizar un guía ligero para transferir conocimientos críticos, es posible tener tanto eficiencia como razonamiento de alta calidad. Los hallazgos indican que para tareas donde el contexto es pesado y los detalles se pierden fácilmente, un modelo pequeño que lee la imagen completa puede dirigir eficazmente a un modelo grande que trabaja con un resumen. Este enfoque ofrece un camino práctico para desplegar agentes de IA sofisticados en entornos de producción, donde la latencia y el costo son restricciones críticas, sin sacrificar la fiabilidad necesaria para la toma de decisiones complejas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →