Don't Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks
Este artículo presenta una evaluación exhaustiva del almacenamiento en caché de prompts (prompt caching) a través de tres de los principales proveedores de LLM para tareas agénticas de largo horizonte, demostrando que las técnicas estratégicas de almacenamiento en caché —como la exclusión de resultados de herramientas dinámicas y la gestión de la estructura del prompt— pueden reducir los costos de API entre un 41 y un 80 % y mejorar el tiempo hasta el primer token entre un 13 y un 31 % en comparación con el almacenamiento en caché ingenuo de contexto completo.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás contratando a un brillante pero costoso asistente de investigación para resolver un misterio complejo. Este asistente necesita leer un manual de instrucciones masivo (el "system prompt") antes de empezar a trabajar. Mientras trabaja, realiza docenas de llamadas telefónicas a diferentes fuentes, obtiene respuestas y las anota en un cuaderno.
Cada vez que hace una nueva llamada telefónica, tiene que volver a leer todo el manual de instrucciones desde la primera página para recordar qué debe hacer. Esto toma mucho tiempo y cuesta mucho dinero porque el asistente cobra por cada página que lee.
"Prompt Caching" (Almacenamiento en caché de prompts) es como darle a ese asistente un resaltador mágico. Si el manual de instrucciones no ha cambiado, el asistente puede saltarse la relectura del primer 90% del libro y saltar directamente a la parte nueva donde están los resultados de las llamadas telefónicas. Esto ahorra tiempo y dinero.
Sin embargo, este artículo plantea una pregunta truculenta: ¿Funciona siempre este resaltador mágico, o podemos arruinarlo?
Los investigadores probaron esto con tres de las principales empresas de "asistentes" (OpenAI, Anthropic y Google), utilizando un benchmark llamado DeepResearch Bench, donde los agentes realizan búsquedas web largas y de múltiples pasos para responder preguntas difíciles. Probaron tres formas diferentes de usar el resaltador:
- El enfoque "Ingenuo" (Contexto Completo): Resaltar todo, incluyendo los nuevos resultados de las llamadas telefónicas.
- El enfoque "Nota Adhesiva" (Solo el System Prompt): Resaltar únicamente el manual de instrucciones, pero dejando los nuevos resultados de las llamadas telefónicas sin resaltar.
- El enfoque "Corte Limpio" (Excluir Resultados de Herramientas): Resaltar el manual y las llamadas telefónicas, pero colocando una señal de "pare" especial después de cada nuevo resultado para que el resaltador no agarre accidentalmente las notas desordenadas de la siguiente persona.
Lo que encontraron
1. Ahorra mucho dinero (La victoria de la "Billetera")
Sin importar qué método usaran, el mágico resaltador ahorró una enorme cantidad de dinero. Dependiendo de la empresa, ahorraron entre el 41% y el 80% en la factura.
- Analogía: Es como darse cuenta de que no necesitas comprar una nueva tarjeta de la biblioteca cada vez que entras en ella; simplemente usas la que ya tienes.
2. La velocidad es complicada (El problema del "Tráfico")
Aunque ahorrar dinero fue fácil, ahorrar tiempo fue más difícil.
- La sorpresa: A veces, resaltar todo (el enfoque Ingenuo) de hecho hizo que el asistente fuera más lento.
- Analogía: Imagina a un repartidor que intenta memorizar la dirección de cada uno de los paquetes que entrega. Si intenta memorizar un paquete que se entregará una sola vez y nunca más, pierde tiempo memorizándolo. Cuando llega el siguiente paquete, tiene que "des-memorizar" el anterior para hacer espacio al nuevo. Este proceso de "escribir en la memoria" los ralentiza.
- El artículo encontró que si solo resaltas las partes estables (el manual de instrucciones) y dejas las partes desordenadas y cambiantes (los resultados de las llamadas) sin resaltar, el asistente se mantiene rápido.
3. La regla de "No rompas el caché"
La lección más importante es sobre dónde trazas la línea.
- Si incluyes información dinámica y cambiante (como "Hora actual: 2:00 PM" o "ID de usuario: 123") dentro del manual de instrucciones, el mágico resaltador se rompe. El sistema piensa que el manual ha cambiado, por lo que deja de resaltar y comienza a leer desde cero.
- La solución: Mantén el manual de instrucciones puro y estático. Si debes incluir información cambiante, ponla al final del manual, como una nota adhesiva en la última página. De esta manera, el primer 99% del manual sigue resaltado y es reutilizable.
La conclusión final
Para las empresas que construyen agentes de IA que realizan tareas largas y complejas:
- Sí, usa el almacenamiento en caché de prompts (prompt caching). Reducirá drásticamente tus costos.
- Pero, sé inteligente al respecto. No lo actives simplemente para todo.
- La mejor estrategia: Solo almacena en caché la parte estable (el "manual de instrucciones" o System Prompt). Deja que las partes cambiantes (resultados de herramientas) fluyan libremente sin ser almacenadas en caché. Esto te dará la mejor combinación de bajo costo y alta velocidad.
Si intentas almacenar en caché las partes cambiantes, podrías terminar pagando por la "escritura" del caché sin obtener los beneficios de la "lectura", lo que de hecho puede ralentizar tu sistema.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.