Total Recall at What Cost? Benchmarking the Serving Cost of Agentic Memory Systems
Este artigo avalia o desempenho dos custos de serviço e da precisão de três sistemas de memória agêntica em comparação com estratégias padrão, revelando que os custos são impulsionados por comportamentos internos do sistema em vez de apenas pelo comprimento da conversa, variam significativamente entre diferentes backbones e sistemas, e envolvem um compromisso onde nenhuma solução única otimiza tanto o custo quanto a precisão.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está conversando com um amigo robô muito inteligente, mas um pouco esquecido. Vocês estão conversando há semanas, compartilhando histórias, planos e segredos. Agora, você quer perguntar: "Lembra daquele lugar de pizza de que falamos três semanas atrás?". Se o robô não tiver memória, você tem que recontar toda a história da sua amizade desde o primeiro dia toda vez que fizer uma pergunta. Isso é como enviar uma mochila enorme e pesada contendo cada palavra que você já disse ao robô apenas para fazer uma pergunta simples. Funciona, mas fica pesado, lento e caro muito rapidamente.
Para resolver isso, engenheiros construíram "sistemas de memória" para esses robôs. Em vez de carregar a mochila inteira, o rob em escreve notas minúsculas, fatos ou resumos em um caderno especial. Quando você faz uma pergunta, ele apenas folheia a página certa e lê a nota. Isso parece perfeito: mais leve, mais rápido e mais barato. Mas aqui está o detalhe: escrever as notas, organizá-las e encontrar a página certa também dá trabalho. A grande questão é: o robô economiza dinheiro usando o caderno ou o custo de gerenciar o caderno torna tudo mais caro do que simplesmente carregar a mochila pesada? Este artigo mergulha exatamente nesse mistério, medindo o preço real desses truques de memória para ver se eles realmente valem o custo.
O Grande Duelo de Custos de Memória
Neste estudo, os pesquisadores organizaram uma corrida massiva para ver quanto custa realmente manter viva a memória de um chatbot. Eles não apenas adivinharam; eles realizaram um experimento controlado com três diferentes "sistemas de memória" (pense neles como três formas diferentes de organizar esse caderno): Mem0, Hindsight e Mastra Observational Memory.
Para garantir que o teste fosse justo, eles compararam esses sistemas de memória contra duas estratégias extremas:
- A "Janela Deslizante" (A Linha de Base Barata): Isso é como lembrar apenas das últimas 10 coisas que você disse. É super barato, mas esquece todo o resto.
- O "Transcrito Completo" (A Linha de Base Cara): Este é o método da "mochila pesada". Cada vez que você faz uma pergunta, o robô relê todo o histórico da sua conversa desde a primeira palavra.
Eles passaram esses sistemas por conversas de até 400 turnos (isso é 400 mensagens de ida e volta) e os testaram em 665 perguntas específicas para ver se o robô realmente lembrava das coisas certas. Eles também testaram dois "cérebros" diferentes (modelos de base) para o robô para ver se o tipo de cérebro mudava o custo.
A Grande Surpresa: Você Não Pode Prever o Preço
A primeira grande descoberta é que você não pode apenas olhar para o comprimento da conversa ou o tamanho das mensagens para adivinhar o custo. Os pesquisadores tentaram construir uma fórmula matemática simples para prever o custo com base no comprimento da conversa e no tamanho da mensagem.
- Para as estratégias de "Transcrito Completo" e "Janela Deslizante", a matemática funcionou perfeitamente. Se você sabe quantas palavras enviou, sabe exatamente quanto custa.
- Para os Sistemas de Memória, a matemática falhou miseravelmente. A fórmula errou o custo real entre 18% e 69%.
Por quê? Porque o custo de um sistema de memória não é apenas sobre o quanto você fala; é sobre o que o sistema está fazendo internamente enquanto você fala. Às vezes o sistema decide escrever um resumo longo, outras vezes ele apenas pega um fato rápido. Às vezes ele reorganiza todo o seu caderno. Essas decisões internas são impulsionadas pelo conteúdo da conversa, não apenas pelo comprimento. É como tentar prever o custo de uma viagem de carro apenas olhando o mapa, sem saber se o motorista vai parar para um almoço sofisticado ou apenas pegar uma barra de cereais. O "almoço" (processamento interno) varia drasticamente, tornando a conta total imprevisível. É como tentar prever o custo de uma viagem de carro apenas olhando o mapa, sem saber se o motorista vai parar para um almoço sofisticado ou apenas pegar uma barra de cereais. O "almoço" (processamento interno) varia drasticamente, tornando a conta total imprevisível.
O "Ponto de Equilíbrio": Quando o Caderno Vale a Pena?
Os pesquisadores fizeram uma pergunta crucial: Em que ponto o uso de um sistema de memória torna-se mais barato do que apenas reler todo o histórico?
A resposta é: Depende inteiramente do sistema e do cérebro do robô.
- Mastra Observational Memory foi o velocista. Em alguns casos, foi mais barato que o método "Transcrito Completo" logo no primeiro turno (Turno 0).
- Mem0 demorou um pouco mais, geralmente atingindo o ponto de equilíbrio por volta do Turno 82, mas apenas se as mensagens fossem razoavelmente longas.
- Hindsight foi o mais lento. Em muitos casos, não se tornou mais barato que o método "Transcrito Completo" mesmo após 400 turnos. Na verdade, para algumas configurações, ainda era mais caro ao final do teste.
Isso significa que, se você tiver uma conversa curta, usar um sistema de memória complexo pode custar mais dinheiro do que apenas reenviar o histórico do chat. Você precisa conversar por um certo tempo (o "ponto de equilíbrio") antes que o sistema de memória comece a economizar dinheiro para você.
Precisão vs. Custo: Não Existe Almoço Grátis
O estudo também verificou se os sistemas de memória eram realmente bons em responder perguntas. Os resultados mostraram uma ampla gama de desempenho:
- A precisão variou de 21% a 54%.
- Mem0 teve as maiores oscilações de precisão, indo bem em alguns cérebros de robô e mal em outros.
- Hindsight foi geralmente o mais preciso (frequentemente acima de 50%), mas também foi o mais caro para rodar.
- Mastra foi um performer de meio-termo, mas frequentemente o mais econômico quando se considerava quantas respostas corretas ele dava.
Os pesquisadores descobriram que a escolha do "cérebro" do robô (modelo de base) importava tanto quanto a escolha do sistema de memória. Um sistema de memória que era barato em um cérebro de robô poderia ser caro em outro.
O Veredito Final
O artigo conclui que não existe um único "melhor" sistema de memória.
- Se você quer a opção mais barata por resposta correta em um cérebro de robô específico, o Mastra no cérebro gpt-oss-20b foi o vencedor (custando cerca de $0,028 por resposta correta em 100 turnos).
- Se você usar um cérebro de robô diferente (Gemma 4 26B A4B), o Mem0 torna-se a opção mais barata.
- Hindsight, embora preciso, é frequentemente caro demais para valer a pena, a menos que a conversa seja muito longa.
A principal lição é que você não pode simplesmente escolher um sistema de memória porque ele parece legal. Você tem que olhar para sua situação específica: Qual será a duração da conversa? Qual o tamanho das mensagens? E qual cérebro de robô você está usando? Só assim você poderá saber se o sistema de memória vai economizar dinheiro ou apenas adicionar à sua conta. A "Memória Total" de um sistema de memória tem um custo, e esse custo é muito mais complexo do que simplesmente contar as palavras que você digita.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.