← Últimos artículos
💬 NLP

LazyAttention: Efficient Retrieval-Augmented Generation with Deferred Positional Encoding

LazyAttention introduce un novedoso mecanismo de atención que kerneliza el codificación posicional diferida para permitir la reutilización de cachés KV sin copia y agnóstica a la posición, mejorando significamente el rendimiento de la inferencia y el tiempo hasta el primer token en aplicaciones de contexto largo como RAG sin comprometer la calidad del resultado.

Autores originales: Haocheng Xia, Mihir Pamnani, Hanxi Fang, Supawit Chockchowwat, Yongjoo Park

Publicado 2026-06-04
📖 4 min de lectura☕ Lectura para el café

Autores originales: Haocheng Xia, Mihir Pamnani, Hanxi Fang, Supawit Chockchowwat, Yongjoo Park

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un chef dirigiendo un restaurante con mucho movimiento (el modelo de IA) donde los clientes (usuarios) piden platos basados en un menú de ingredientes (documentos) que tienes en tu despensa.

El Problema: El Libro de Recetas "Pegajoso"

En una cocina estándar, cuando preparas un plato usando un ingrediente específico, escribes los pasos en un cuaderno (el KV Cache) para no tener que empezar desde cero la próxima vez.

Sin embargo, el método actual de escribir estas notas tiene una regla extraña: las notas están pegadas a un número de página específico.

  • Si usas "Tomates" en la Página 1 de tu cuaderno, solo puedes reutilizar esas notas si el siguiente cliente pide "Tomates" en la Página 1.
  • Si el siguiente cliente quiere "Tomates" en la Página 50, las notas antiguas son inútiles. Tienes que tirar las notas, escribir un nuevo conjunto de notas para la Página 50 y empezar a cocinar desde cero.

Esto es un gran desperdicio. En un restaurante real (como un sistema RAG), los mismos ingredientes populares se usan una y otra vez, pero aparecen en diferentes lugares en el orden. La cocina se congestiona con cuadernos duplicados y el chef pasa más tiempo escribiendo notas que cocinando.

La Solución: LazyAttention (La "Superposición Mágica")

Los autores de este artículo, LazyAttention, proponen una nueva y brillante forma de gestionar la cocina. En lugar de escribir el número de página dentro de las notas, mantienen las notas independientes de la página (no les importa dónde estén).

Así es como funciona:

  1. Las Notas: Escribes el sabor puro de los "Tomates" sin mencionar el número de página. Guardas esa nota única y universal en tu despensa.
  2. La Superposición Mágica: Cuando un cliente pide "Tomates" para la Página 50, no reescribes las notas. En su lugar, deslizas una superposición transparente y mágica sobre la nota. Esta superposición le dice instantáneamente al chef: "Oye, trata estos tomates como si estuvieran en la Página 50".
  3. El Resultado: Reutilizas exactamente la misma nota física para la Página 1, la Página 50 o la Página 100. Nunca tienes que reescribir las notas ni copiar el estante de la despensa.

Por qué esto es algo importante

El artículo afirma que este simple truco resuelve dos grandes dolores de cabeza:

  • Velocidad (Tiempo hasta el primer token): Debido a que el chef no tiene que reescribir notas ni buscar nuevos ingredientes cada vez, el primer bocado del plato sale mucho más rápido. El artículo muestra que esto es 1.37 veces más rápido que el mejor método actual.
  • Espacio (Memoria): Como no estás almacenando 20 copias de la nota de "Tomate" (una para cada posible página), ahorras una enorme cantidad de espacio en los estantes. Esto permite que la cocina guarde más ingredientes únicos. El artículo muestra que esto mejora la "tasa de acierto" (qué tan seguido encuentras lo que necesitas) en 7.5 veces en comparación con métodos anteriores.

La parte "Lazy" (Perezosa)

Podrías preguntarte: "¿Acaso deslizar esa superposición no toma tiempo extra?".
Los autores dicen que no, porque hicieron que la superposición sea super eficiente.

  • Forma Antigua: Reescribir toda la nota, luego moverla. (Lento y costoso).
  • Forma de LazyAttention: Solo aplicar un pequeño e instantáneo ajuste matemático mientras ya estás cocinando. Es como añadir una pizca de sal en el momento exacto en que revuelves la olla, en lugar de premezclar un lote nuevo de sal.

La Conclusión

LazyAttention es una nueva forma para que la IA recuerde cosas. Evita que la IA desperdicie memoria almacenando la misma información múltiples veces solo porque aparece en un lugar diferente. En su lugar, almacena la información una vez y ajusta "perezosamente" el contexto solo cuando se está utilizando realmente.

Los Resultados:

  • Respuestas más rápidas: Los clientes reciben su comida 1.37x más rápido.
  • Más capacidad: La cocina puede atender a 1.40x más clientes al mismo tiempo.
  • Mismo Sabor: La comida sabe exactamente igual (la calidad de la respuesta no disminuye).

El artículo probó esto en tareas estándar de respuesta a preguntas (como leer una historia y responder preguntas) y encontró que funciona perfectamente, haciendo que las conversaciones largas y las búsquedas complejas sean mucho más fluidas y económicas de ejecutar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →