← Últimos artículos
💬 NLP

Total Recall at What Cost? Benchmarking the Serving Cost of Agentic Memory Systems

Este artículo evalúa los costos de servicio y la precisión de tres sistemas de memoria agéntica frente a estrategias estándar, revelando que los costos son impulsados por los comportamientos internos del sistema en lugar de solo por la longitud de la conversación, varían significativamente entre diferentes modelos base y sistemas, e implican un compromiso donde ninguna solución optimiza tanto el costo como la precisión.

Autores originales: Natchanon Pollertlam, Witchayut Kornsuwannawit

Publicado 2026-08-13
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Natchanon Pollertlam, Witchayut Kornsuwannawit

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás hablando con un amigo robot muy inteligente, pero un poco olvidadizo. Han estado charlando durante semanas, compartiendo historias, planes y secretos. Ahora, quieres preguntar: "¿Recuerdas ese lugar de pizza del que hablamos hace tres semanas?". Si el robot no tiene memoria, tienes que volver a contarle toda la historia de su amistad desde el primer día cada vez que haces una pregunta. Esto es como enviar una mochila enorme y pesada llena de cada palabra que le has dicho al robot solo para hacer una pregunta sencilla. Funciona, pero se vuelve pesada, lenta y costosa muy rápidamente.

Para solucionar esto, los ingenieros construyeron "sistemas de memoria" para estos robots. En lugar de cargar con toda la mochila, el robot escribe notas diminutas, hechos o resúmenes en un cuaderno especial. Cuando haces una pregunta, simplemente pasa la página correcta y lee la nota. Esto suena perfecto: más ligero, más rápido y más barato. Pero aquí está el truco: escribir las notas, organizarlas y encontrar la página adecuada también requiere trabajo. La gran pregunta es: ¿el robot ahorra dinero usando el cuaderno, o el costo de gestionar el cuaderno hace que todo sea más caro que simplemente cargar con la pesada mochila? Este artículo profundiza en ese misterio exacto, midiendo el precio real de estos trucos de memoria para ver si realmente valen la pena el costo.


El Gran Duelo de Costos de Memoria

En este estudio, los investigadores organizaron una carrera masiva para ver cuánto cuesta realmente mantener viva la memoria de un chatbot. No solo supusieron; realizaron un experimento controlado con tres "sistemas de memoria" diferentes (piensa en ellos como tres formas distintas de organizar ese cuaderno): Mem0, Hindsight y Mastra Observational Memory.

Para asegurar que la prueba fuera justa, compararon estos sistemas de memoria contra dos estrategias extremas:

  1. La "Ventana Rodante" (La Línea Base Barata): Esto es como recordar solo las últimas 10 cosas que dijiste. Es súper barato pero lo olvida todo lo demás.
  2. La "Transcripción Completa" (La Línea Base Cara): Este es el método de la "mochila pesada". Cada vez que haces una pregunta, el robot vuelve a leer todo el historial de tu conversación desde la primera palabra.

Pasaron estos sistemas por conversaciones de hasta 400 turnos (eso es 400 mensajes de ida y vuelta) y los probaron con 665 preguntas específicas para ver si el robot realmente recordaba las cosas correctas. También probaron dos "cerebros" diferentes (modelos de base) para el robot para ver si el tipo de cerebro cambiaba el costo.

La Gran Sorpresa: No Puedes Predecir el Precio

El primer gran descubrimiento es que no puedes simplemente mirar qué tan larga es la conversación o qué tan grandes son los mensajes para adivinar el costo. Los investigadores intentaron construir una fórmula matemática simple para predecir el costo basándose en la longitud de la conversación y el tamaño de los mensajes.

  • Para las estrategias de "Transcripción Completa" y "Ventana Rodante", las matemáticas funcionaron perfectamente. Si sabes cuántas palabras enviaste, sabes exactamente cuánto cuesta.
  • Para los Sistemas de Memoria, las matemáticas fallaron estrepitosamente. La fórmula erró por un 18% a 69% el costo real.

¿Por qué? Porque el costo de un sistema de memoria no es solo sobre cuánto hablas; es sobre lo que el sistema está haciendo internamente mientras hablas. A veces el sistema decide escribir un resumen largo, otras veces solo toma un dato rápido. A veces reorganiza todo su cuaderno. Estas decisiones internas son impulsadas por el contenido de la conversación, no solo por la longitud. Es como intentar predecir el costo de un viaje por carretera solo mirando el mapa, sin saber si el conductor va a parar a comer un almuerzo elegante o solo tomará una barra de granola. El "almuerzo" (procesamiento interno) varía enormemente, haciendo que la factura total sea impredecible.

El "Punto de Equilibrio": ¿Cuándo Vale la Pena el Cuaderno?

Los investigadores se hicieron una pregunta crucial: ¿En qué punto usar un sistema de memoria resulta más barato que simplemente volver a leer todo el historial?

La respuesta es: Depende enteramente del sistema y del cerebro del robot.

  • Mastra Observational Memory fue el velocista. En algunos casos, fue más barato que el método de "Transcripción Completa" desde el primer turno (Turno 0).
  • Mem0 tardó un poco más, generalmente alcanzando el equilibrio alrededor del Turno 82, pero solo si los mensajes eran razonablemente largos.
  • Hindsight fue el más lento. En muchos casos, no llegó a ser más barato que el método de "Transcripción Completa" incluso después de 400 turnos. De hecho, para algunas configuraciones, seguía siendo más caro al final de la prueba.

Esto significa que, si tienes una conversación corta, usar un sistema de memoria complejo podría costar más dinero que simplemente reenviar todo el historial del chat. Tienes que hablar durante cierto tiempo (el "punto de equilibrio") antes de que el sistema de memoria te empiece a ahorrar dinero.

Precisión vs. Costo: No hay Almuerzo Gratis

El estudio también comprobó si los sistemas de memoria eran realmente buenos respondiendo preguntas. Los resultados mostraron un amplio rango de desempeño:

  • La precisión varió entre un 21% y un 54%.
  • Mem0 tuvo las oscilaciones de precisión más grandes, funcionando bien con algunos cerebros de robot y mal con otros.
  • Hindsight fue generalmente el más preciso (a menudo por encima del 50%), pero también fue el más caro de ejecutar.
  • Mastra fue un performer de punto medio, pero a menudo fue el más rentable cuando se factorizó cuántas respuestas correctas daba.

Los investigadores encontraron que la elección del "cerebro" del robot (el modelo de base) importaba tanto como la elección del sistema de memoria. Un sistema de memoria que era barato en un cerebro de robot podía ser caro en otro.

El Veredicto Final

El artículo concluye que no existe un único "mejor" sistema de memoria.

  • Si quieres la opción más barata por respuesta correcta en un cerebro de robot específico, Mastra en el cerebro gpt-oss-20b fue el ganador (costando aproximadamente $0.028 por respuesta correcta a los 100 turnos).
  • Si usas un cerebro de robot diferente (Gemma 4 26B A4B), Mem0 se convierte en la opción más barata.
  • Hindsight, aunque preciso, suele ser demasiado caro para que valga la pena a menos que la conversación sea muy larga.

La principal conclusión es que no puedes elegir un sistema de memoria solo porque suene genial. Tienes que mirar tu situación específica: ¿Qué tan larga será la conversación? ¿Qué tan grandes son los mensajes? Y ¿qué cerebro de robot estás usando? Solo entonces podrás saber si el sistema de memoria te ahorrará dinero o simplemente añadirá más a tu cuenta. La "Memoria Total" de un sistema de memoria tiene un costo, y ese costo es mucho más complejo que simplemente contar las palabras que escribes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →