← Últimos artículos
🤖 machine learning

Cache-Aware Prompt Compression:A Two-Tier Cost Model for LLM API Caching

Este artículo presenta la Compresión de Prompts Consciente de la Caché (CAPC, por sus siglas en inglés), una estrategia que combina la compresión agnóstica a la consulta con un control de caché explícito y límites de preservación de niveles para superar las limitaciones de los métodos conscientes de la consulta, logrando reducciones de costos significativas (hasta un 90 %) al tiempo que mantiene la calidad en diversas cargas de trabajo de LLM de producción.

Autores originales: Yan Song

Publicado 2026-07-20
📖 3 min de lectura☕ Lectura para el café

Autores originales: Yan Song

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que diriges una biblioteca masiva y superinteligente donde un bibliotecario muy caro (una IA) te ayuda a encontrar respuestas. Para ahorrar dinero, la biblioteca tiene dos trucos especiales. Primero, hay un "Salón VIP" (caché): si le preguntas al bibliotecario sobre el mismo capítulo de un libro una y otra vez, no tiene que volver a leer todo el libro desde los estantes de la biblioteca; simplemente echa un vistazo a sus notas, lo cual es mucho más barato. Segundo, hay un "Resumidor" (compresión): en lugar de entregarle al bibliotecario una novela de 500 páginas, le das un resumen de 50 páginas, lo cual también es más barato de procesar.

Durante mucho tiempo, la gente pensó que estos dos trucos debían usarse por separado. O bien usabas el Salón VIP para libros grandes y aburridos, o usabas el Resumidor para preguntas cortas y complicadas. Pero aquí está el problema: el Resumidor suele cambiar la historia ligeramente cada vez que haces una nueva pregunta para que encaje mejor. El problema es que el Salón VIP es un estricto cumplidor de las reglas. Si la historia cambia aunque sea un poquito, el bibliotecario dice: "Lo siento, ¡ese es un libro nuevo!" y tira sus notas, obligándote a pagar el precio completo para leer todo el libro de nuevo. Este artículo plantea una pregunta sencilla: ¿Podemos usar ambos trucos al mismo tiempo sin romper las reglas?

Los investigadores de PayPal decidieron probar esto en un sistema de IA del mundo real llamado Sonnet 4.6. Descubrieron que el Salón VIP no es tan perfecto como todos pensaban. Tiene una "zona caliente" para notas cortas y una "zona persistente" para las largas, y si te vuelves demasiado astuto con tus resúmenes, accidentalmente expulsas tus notas de la zona caliente y cara. Descubrieron que la forma antigua de hacer las cosas —cambiar el resumen para cada pregunta— en realidad desperdicia dinero porque impide que el bibliotecario use las notas baratas.

Para solucionar esto, inventaron una nueva estrategia llamada CAPC (Compresión de Prompts Consciente de la Caché). Piensa en esto como si, en lugar de reescribir la historia para cada pregunta, crearas un resumen comprimido perfecto de las partes aburridas una sola vez y lo bloquearas en el Salón VIP. Luego, para cada nueva pregunta, simplemente añades la pregunta específica a ese resumen bloqueado sin cambiar el resumen en sí. Es como tener un guion preescrito que nunca cambia, de modo que el bibliotecario puede reutilizar sus notas baratas cada vez.

Los resultados fueron sorprendentes. En pruebas con 16 tipos diferentes de documentos, este nuevo método fue la opción más barata en cada ocasión, ahorrando aproximadamente un 49% comparado con solo usar el Salón VIP y un 64% comparado con el antiguo método de "cambiar el resumen". También lo probaron en trabajos del mundo real, como un robot que usa herramientas para arreglar código de computadora y un sistema que busca a través de enormes grafos de conocimiento. En un caso, ahorraron más del 50% en costos sin perder calidad. En otro, demostraron que el antiguo método de "cambiar el resumen" en realidad costaba un 40% más que no hacer nada en absoluto porque seguía rompiendo la caché. El artículo concluye que, siendo inteligentes sobre cuándo comprimir y qué guardar en caché, podemos hacer que la IA sea mucho más barata de usar sin hacerla más tonta.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →