The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation
Este artigo introduz o AgentFootprint, um benchmark que revela que as pegadas de armazenamento persistente de agentes de LLM variam drasticamente entre frameworks e configurações independentemente da precisão da tarefa, ao mesmo tempo em que demonstra que o armazenamento baseado em conteúdo pode reduzir significativamente esse overhead sem comprometer a reconstruibilidade dos dados.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está assistindo a um brilhante robô detetive resolver um mistério. Ele lê pistas, faz perguntas e escreve sua resposta final. Todos aplaudem quando o detetive acerta a resposta, e eles verificam o quão rápido ele pensou e quanto custou para rodar. Mas ninguém está olhando para a sujeira que o detetive deixa pelo chão.
Este artigo, chamado The Hidden Footprint (A Pegada Escondida), é como um relatório de um zelador. Ele pergunta: "Quando o detetive termina, quanta sujeira ele deixa na sala?"
A Grande Surpresa: A Sujeira é Enorme
A principal descoberta é chocante: Dois detetives podem resolver exatamente o mesmo mistério perfeitamente, mas um deixa para trás uma pilha de lixo 15,7 vezes maior que o outro.
Pense nisso como se fosse assim: Você e seu amigo assam o mesmo bolo de chocolate perfeito. Você entrega o bolo (o resultado). Mas, enquanto você apenas limpou o balcão, seu amigo deixou para trás 15 tigelas, 30 xícaras de farinha e uma montanha de embalagens pegajosas. O bolo parece o mesmo, mas a cozinha do seu amigo é uma zona de desastre.
No mundo real, essa "sujeira" não é apenas papel; são bytes digitais armazenados em um disco rígido. Os pesquisadores descobriram que, para uma única tarefa, alguns frameworks deixam para trás 131 MB de dados, enquanto a resposta real (o "bolo entregue") era de apenas 2,6 MB. Isso significa que o "resíduo" do framework foi 24.033 vezes maior do que o trabalho que ele deveria ter feito!
O Truque da "Contagem Invisível" de Dupla Contagem
Aqui está a parte complicada: Se você apenas contar os arquivos no computador, pode pensar que a sujeira não é tão ruim. O artigo argumenta que a contagem padrão é uma armadilha.
Imagine que você escreve a palavra "Olá" em um papel. Então, você fotocopia esse papel, mas a fotocopiadora adiciona um carimbo de "tinta invisível" minúsculo em cada cópia. Se você contar o papel, vê uma folha. Mas se olhar para a tinta, vê a palavra "Olá" escrita doze vezes.
Os pesquisadores descobriram que, devido à forma como os computadores salvam dados (usando coisas como páginas "SQLite" e escape de "JSON"), a mesma informação é armazenada repetidamente, escondida dentro do sistema.
- A contagem ingênua disse: "Oh, há apenas uma pequena duplicação."
- A contagem inteligente do artigo disse: "Na verdade, o mesmo conteúdo é armazenado 12,1 vezes!"
Eles provaram que, se você não olhar para dentro da "tinta invisível", perderá o tamanho real da sujeira por uma margem enorme.
O Problema do "Crescimento"
O artigo também testou o que acontece quando o detetive tem que verificar a mesma pista 200 vezes.
- Alguns frameworks (como LangGraph e AutoGen) agem como um esquilo que nunca esquece nada. Cada vez que verifica a pista, ele escreve o histórico inteiro novamente. Isso faz com que o armazenamento cresça de forma superlinear (cada vez mais rápido). Após 200 rodadas, eles deixaram para trás 323 MB de dados apenas para um arquivo minúsculo.
- Outros frameworks (como OpenAI Agents) agem como um anotador inteligente. Eles escrevem apenas as coisas novas. Seu armazenamento cresceu lentamente, quase em uma linha reta.
O artigo mediu essa taxa de crescimento (chamada de ) e descobriu que ela variou de 0,73 (diminuindo!) a 1,95 (explodindo em tamanho).
Uma Sujeira Maior Significa um Detetive Mais Inteligente?
Você pode pensar: "Talvez o detetive bagunceiro esteja sendo extra cuidadoso, então ele é mais inteligente?"
O artigo diz: Não.
Eles analisaram 108 submissões do mundo real de um famoso desafio de codificação (SWE-bench). Descobriram que a quantidade de dados exportados por esses sistemas variava 1.617 vezes (de arquivos minúsculos a enormes). Mas aqui está o detalhe: Não havia conexão entre o tamanho da sujeira e o quão bem o sistema resolveu o problema.
Na verdade, a correlação era tão fraca que era basicamente zero. Um sistema poderia deixar para trás uma montanha de dados e ainda assim falhar, ou deixar para trás uma pegada minúscula e ter sucesso. O artigo descarta explicitamente a ideia de que "mais armazenamento = melhor desempenho".
O "Borracha Mágica" (Mas Não Compre Ainda)
Os pesquisadores não apenas apontaram o problema; eles mostraram uma maneira de consertá-lo, mas são cuidadosos ao dizer que isso é uma prova de conceito, não um produto finalizado.
Eles construíram um "armazenamento baseado em conteúdo" (content-addressed store). Imagine uma biblioteca onde, em vez de colocar cada livro em uma prateleira, você tira uma foto da impressão digital única do livro. Se dois livros forem idênticos, você guarda apenas uma foto e uma nota dizendo "Este é o mesmo que aquele".
Quando aplicaram essa "borracha mágica" aos frameworks bagunceiros:
- Reduziu o armazenamento de 4,8 a 32,7 vezes.
- Crucialmente, eles provaram que, mesmo com todos esses dados removidos, você ainda poderia reconstruir perfeitamente todo o histórico da conversa. A "pontuação" para ser capaz de reproduzir os pensamentos do detetive permaneceu exatamente a mesma.
O Que o Artigo Descarta
- Ele descarta a ideia de que devemos apenas ignorar o armazenamento porque "é barato". O artigo argumenta que o armazenamento é uma dívida persistente que se acumula ao longo do tempo, ao contrário do custo de rodar a IA, que desaparece quando a tarefa termina.
- Ele descarta a ideia de que os contadores de arquivos padrão são precisos. Eles mostraram que a contagem simples perde a duplicação escondida dentro do código do sistema.
- Ele descarta a ideia de que trilhas de dados maiores significam melhores resultados. Os dados não mostram ligação entre tamanho e sucesso.
O Quão Certos Eles Estão?
Os autores estão muito seguros sobre as medições que realizaram. Eles executaram 1.061 experimentos em salas de computador isoladas e limpas (sandboxes) para garantir que nada mais interferisse. Eles testaram 8 frameworks diferentes (como LangGraph, CrewAI e AutoGen) usando exatamente as mesmas tarefas e modelos.
Eles não apenas adivinharam; eles mediram. Descobriram que, sob condições idênticas, a quantidade de dados deixados para trás variava 15,7 vezes entre os melhores e os piores desempenhos. Eles também mostraram que essa diferença não é porque um framework é "mais inteligente" na resolução de tarefas, mas devido à forma como eles são construídos para salvar dados.
A Conclusão
O artigo conclui que precisamos começar a medir a "pegada" dos agentes de IA da mesma forma que medimos sua velocidade ou custo. No momento, estamos permitindo que alguns sistemas deixem para trás montanhas de lixo digital enquanto outros deixam quase nada, e acontece que os bagunceiros não estão fazendo um trabalho melhor.
Os autores sugerem que, se quisermos rodar esses agentes em escala massiva (como uma frota de 10.000 robôs por dia), a diferença entre um framework "limpo" e um "bagunceiro" pode significar a diferença entre precisar de 3 GB de armazenamento ou 51 GB todos os dias. Essa é uma diferença enorme para um problema que, como demonstraram, nem sequer torna o robô mais inteligente.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.