← Últimos artículos
🤖 AI

The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation

Este artículo presenta AgentFootprint, un referente que revela que las huellas de almacenamiento persistente de los agentes de LLM varían drásticamente entre marcos de trabajo y configuraciones independientemente de la precisión de la tarea, al tiempo que demuestra que el almacenamiento basado en contenido puede reducir significamente esta sobrecarga sin comprometer la reconstruibilidad de los datos.

Autores originales: Chenglin Yu, Hongquan Gui, Ying Yu, Hongxia Yang, Ming Li

Publicado 2026-07-14
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Chenglin Yu, Hongquan Gui, Ying Yu, Hongxia Yang, Ming Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás viendo a un brillante robot detective resolver un misterio. Lee pistas, hace preguntas y escribe su respuesta final. Todo el mundo vitorea cuando el detective obtiene la respuesta correcta, y comprueban qué tan rápido pensó y cuánto costó ejecutarlo. Pero nadie está mirando el desorden que el detective deja en el suelo.

Este artículo, llamado The Hidden Footprint (La Huella Oculta), es como el informe de un conserje. Pregunta: "¿Cuando el detective termina, cuánta basura deja en la habitación?".

La gran sorpresa: El desorden es enorme

El hallazgo principal es impactante: Dos detectives pueden resolver exactamente el mismo misterio perfectamente, pero uno deja atrás una pila de basura 15.7 veces más grande que el otro.

Piénsalo de esta manera: Tú y tu amigo hornean el mismo pastel de chocolate perfecto. Tú entregas el pastel (el resultado). Pero mientras tú solo limpiaste la encimera, tu amigo dejó atrás 15 cuencos, 30 tazas de harina y una montaña de envoltorios pegajosos. El pastel se ve igual, pero la cocina de tu amigo es una zona de desastre.

En el mundo real, esta "basura" no es solo papel; son bytes digitales almacenados en un disco duro. Los investigadores descubrieron que, para una sola tarea, algunos marcos de trabajo (frameworks) dejan atrás 131 MB de datos, mientras que la respuesta real (el "pastel entregado") era de solo 2.6 MB. ¡Eso significa que el "residuo" del marco de trabajo era 24,033 veces más grande que el trabajo real que debía hacer!

El truco del "doble conteo invisible"

Aquí está la parte truculenta: Si simplemente cuentas los archivos en la computadora, podrías pensar que el desorden no es tan malo. El artículo argumenta que el conteo estándar es una trampa.

Imagina que escribes la palabra "Hola" en un papel. Luego, fotocopias ese papel, pero la fotocopiadora añade un pequeño sello de "tinta invisible" a cada copia. Si cuentas el papel, ves una hoja. Pero si miras la tinta, ves la palabra "Hola" escrita doce veces.

Los investigadores descubrieron que, debido a cómo las computadoras guardan los datos (usando cosas como páginas de "SQLite" y el escapado de "JSON"), la misma información se almacena una y otra vez, oculta dentro del sistema.

  • El conteo ingenuo decía: "Oh, hay poca duplicación".
  • El conteo inteligente del artículo decía: "En realidad, el mismo contenido se almacena 12.1 veces".

Demostraron que si no miras dentro de la "tinta invisible", te pierdes el tamaño real del desorden por un margen enorme.

El problema del "crecimiento"

El artículo también probó qué sucede cuando el detective tiene que revisar la misma pista 200 veces.

  • Algunos marcos de trabajo (como LangGraph y AutoGen) actan como una ardilla que nunca olvida nada. Cada vez que revisa la pista, vuelve a escribir todo el historial completo. Esto causa que el almacenamiento crezca de forma superlineal (cada vez más rápido). Después de 200 rondas, dejaron atrás 323 MB de datos solo para un pequeño archivo.
  • Otros marcos de trabajo (como OpenAI Agents) actúan como un tomador de notas inteligente. Solo escriben lo nuevo. Su almacenamiento creció lentamente, casi en una línea recta.

El artículo midió esta tasa de crecimiento (llamada α\alpha) y encontró que variaba desde 0.73 (¡se reduce!) hasta 1.95 (¡explota en tamaño!).

¿Un desorden más grande significa un detective más inteligente?

Podrías pensar: "¿Tal vez el detective desordenado es simplemente más cuidadoso, por lo que es más inteligente?".
El artículo dice: No.

Analizaron 108 envíos del mundo real de un famoso desafío de programación (SWE-bench). Encontraron que la cantidad de datos exportados por estos sistemas variaba en 1,617 veces (desde archivos diminutos hasta enormes). Pero aquí está el detalle: No hubo conexión entre el tamaño del desorden y qué tan bien el sistema resolvió el problema.

De hecho, la correlación era tan débil que era básicamente cero. Un sistema podía dejar tras de sí una montaña de datos y fallar, o dejar una huella diminuta y tener éxito. El artículo descarta explícitamente la idea de que "más almacenamiento = mejor rendimiento".

El "Borrador Mágico" (Pero no lo compres todavía)

Los investigadores no solo señalaron el problema; mostraron una forma de solucionarlo, pero advierten que esto es una prueba de concepto, no un producto terminado.

Construyeron un "almacén de contenido direccionable" (content-addressed store). Imagina una biblioteca donde, en lugar de poner cada libro en un estante, tomas una foto de la huella digital única del libro. Si dos libros son idénticos, solo guardas una foto y una nota que dice: "Este es el mismo que aquel".

Cuando aplicaron este "borrador mágico" a los marcos de trabajo desordenados:

  • Redujo el almacenamiento de 4.8 a 32.7 veces.
  • Crucialmente, demostraron que incluso con todos esos datos eliminados, aún se podía reconstruir perfectamente todo el historial de la conversación. La "puntuación" de la capacidad para reproducir los pensamientos del detective se mantuvo exactamente igual.

Lo que el artículo descarta

  • Descarta la idea de que simplemente debamos ignorar el almacenamiento porque "es barato". El artículo argumenta que el almacenamiento es una deuda persistente que se acumula con el tiempo, a diferencia del costo de ejecutar la IA, que desaparece cuando la tarea termina.
  • Descarta la idea de que los contadores de archivos estándar sean precisos. Mostraron que el conteo simple pierde la duplicación oculta dentro del código del sistema.
  • Descarta la idea de que las huellas de datos más grandes significan mejores resultados. Los datos no muestran ningún vínculo con el éxito.

¿Qué tan seguros están?

Los autores están muy seguros de las mediciones que realizaron. Ejecutaron 1,061 experimentos en entornos aislados y limpios (sandboxes) para asegurar que nada más interfiriera. Probaron 8 marcos de trabajo diferentes (como LangGraph, CrewAI y AutoGen) usando exactamente las mismas tareas y modelos.

No solo adivinaron; midieron. Encontraron que, bajo condiciones idénticas, la cantidad de datos dejados atrás variaba por 15.7 veces entre los mejores y los peores desempeños. También demostraron que esta diferencia no se debe a que un marco sea más "inteligente" al resolver tareas, sino a cómo están construidos para guardar datos.

La conclusión

El artículo concluye que necesitamos empezar a medir la "huella" de los agentes de IA tal como medimos su velocidad o costo. En este momento, estamos dejando que algunos sistemas dejen tras de sí montañas de basura digital mientras otros no dejan casi nada, y resulta que los desordenados no están haciendo un mejor trabajo.

Los autores sugieren que, si queremos ejecutar estos agentes a una escala masiva (como una flota de 10,000 robots al día), la diferencia entre un marco de trabajo "limpio" y uno "desordenado" podría significar la diferencia entre necesitar 3 GB de almacenamiento o 51 GB cada día. Es una diferencia enorme para un problema que, como demostraron, ni siquiera hace al robot más inteligente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →