← Últimos artigos
🤖 AI

Agent Memory: Characterization and System Implications of Stateful Long-Horizon Workloads

Este artigo apresenta a primeira caracterização de sistemas de memória de agentes ao introduzir uma nova taxonomia, um harness de perfilamento consciente de fase e uma avaliação de dez sistemas representativos para derivar dez recomendações acionáveis para otimizar cargas de trabalho de agentes de LLM de longo horizonte.

Autores originais: Yasmine Omri, Ziyu Gan, Zachary Broveak, Robin Geens, Zexue He, Alex Pentland, Marian Verhelst, Tsachy Weissman, Thierry Tambe

Publicado 2026-06-05
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Yasmine Omri, Ziyu Gan, Zachary Broveak, Robin Geens, Zexue He, Alex Pentland, Marian Verhelst, Tsachy Weissman, Thierry Tambe

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está contratando um assistente pessoal brilhante, mas muito esquecido (o Agente de IA) para ajudá-lo a gerenciar um projeto massivo de anos.

Se você apenas deixar esse assistente falar com você, ele tem uma "memória de curto prazo" (como um post-it) que retém apenas as últimas frases. Assim que a conversa fica longa demais, o assistente esquece tudo o que aconteceu três dias atrás.

Para resolver isso, damos ao assistente um Sistema de Memória. Isso é como um arquivo gigante, uma biblioteca e um secretário pessoal, tudo em um só. O papel que você compartilhou é uma "verificação de sistema" de dez tipos diferentes desses arquivos para ver quais funcionam melhor, quanto custam para operar e como se comportam sob pressão.

Aqui está a divisão das descobertas deles em termos simples:

1. O Probleo Central: O "Post-it" vs. A "Biblioteca"

O artigo explica que confiar na memória integrada da IA (o "post-it") é como tentar ler um livro de 1.000 páginas olhando apenas para a última página. É lento, caro e a IA frequentemente perde as partes do meio.

Em vez disso, esses Sistemas de Memória de Agentes atuam como uma biblioteca externa.

  • Caminho de Escrita (Construção): Quando a IA aprende algo novo, ela escreve isso na biblioteca.
  • Caminho de Leitura (Recuperação): Quando você faz uma pergunta, a IA pega rapidamente as páginas relevantes da biblioteca em vez de ler o livro inteiro novamente.

2. Os Quatro Tipos de Bibliotecários (Os Paradigmas)

Os pesquisadores testaram 10 sistemas diferentes e os agruparam em quatro "tipos de personalidade" ou Paradigmas:

  • Tipo A: O Acumulador de "Texto Bruto" (Contexto longo)
    • Como funciona: Ele simplesmente despeja todo o histórico da conversa no cérebro da IA toda vez.
    • A Analogia: Como tentar ler um romance inteiro toda vez que você faz uma pergunta. É lento e caro porque a IA tem que reler tudo novamente.
  • Tipo B: O Classificador de "Fichas de Índice" (RAG Plano)
    • Como funciona: Ele fatia a conversa em pequenos pedaços e os coloca em um índice simples (como um catálogo de fichas de biblioteca). Ele não usa a IA para pensar sobre o que escrever; ele apenas arquiva.
    • A Analogia: Um bibliotecário muito rápido e barato que apenas organiza livros por título. É rápido para retirar o livro, mas pode perder a "conexão" ou o "significado" entre os livros.
  • Tipo C: O Erudito "Sumarizador" (Estrutura aumentada)
    • Como funciona: Usa a IA para ler a conversa, extrair os fatos principais e escrevê-los em um banco de dados estruturado (como um gráfico ou uma lista de fatos atômicos).
    • A Analogia: Um bibliotecário inteligente que lê suas notas bagunçadas, escreve um resumo limpo e o arquiva. Isso exige muito tempo e esforço antecipadamente (escrevendo o resumo), mas torna encontrar respostas depois muito rápido e preciso.
  • Tipo D: O Gerente "Ativo" (Controle Agêntico)
    • Como funciona: A própria IA decide quando escrever, o que escrever e como organizar os arquivos. É um processo dinâmico.
    • A Analogia: Um bibliotecário que também é um detetive. Eles não apenas arquivam coisas; eles investigam ativamente, reescrevem notas antigas e decidem o que é importante em tempo real. Isso é poderoso, mas pode ser caótico e muito caro.

3. A Grande Surpresa: "Escrever" é Mais Caro do que "Ler"

A maior descoberta do artigo é sobre o custo.

  • O Mito: Todos pensam que a parte cara é fazer uma pergunta à IA (o "Ler").
  • A Realidade: A parte cara é construir a memória (o "Escrever").

A Analogia: Imagine um restaurante.

  • Ler é o cliente pedindo uma refeição (rápido).
  • Escrever é o chef picando vegetais, marinando a carne e preparando a cozinha (lento e consome muita energia).

Para os sistemas do "Erudito Inteligente" (Tipo C) e do "Gerente Ativo" (Tipo D), o "chef" (a IA) tem que fazer uma quantidade massiva de trabalho de preparação antes mesmo de o cliente chegar.

  • Alguns sistemas levam minutos para preparar a memória.
  • Outros levam horas (ou até meio dia) para processar o histórico de um único usuário.
  • Insight Chave: Se você rodar esses sistemas, você paga a maior parte da sua conta de eletricidade durante a fase de "preparação", não na fase de "servir".

4. As Trocas (Você Não Pode Ter Tudo)

O artigo descobriu que você precisa escolher suas batalhas. Você não pode ter um sistema que seja:

  1. Super barato para construir.
  2. Super rápido para responder.
  3. Super inteligente.
  • O Bibliotecário "Rápido e Barato" (Tipo B): É instantâneo para responder e barato para construir, mas pode perder a nuance da sua pergunta.
  • O Bibliotecário "Inteligente" (Tipo C/D): É muito preciso e entende conexões complexas, mas leva horas para configurar e custa uma fortuna em energia para manter.
  • O Bibliotecário "Bruto" (Tipo A): É o mais caro para rodar toda vez que você faz uma pergunta, porque ele relê todo o histórico.

5. O Problema do "Frescor" (Atualização)

O artigo também observou o que acontece em uma conversa contínua (como um projeto de vários dias).

  • O Problema: Se o "Erudito Inteligente" leva 10 minutos para escrever um resumo dos eventos de hoje, mas você faz uma pergunta 2 minutos depois, a IA está respondendo com base em informações obsoletas (desatualizadas) porque as novas notas ainda não foram arquivadas.
  • A Solução: Você tem que decidir: espera o arquivamento terminar (fazendo o usuário esperar) ou responde com informações antigas (tornando a resposta menos precisa)?

6. As "Dores do Crescimento" (Escalabilidade)

Conforme um usuário continua conversando por meses ou anos, a memória cresce.

  • Sistemas Simples: O custo para adicionar novas notas permanece constante.
  • Sistemas Complexos: O custo para adicionar novas notas explode. Isso ocorre porque a IA tem que verificar todo o arquivo crescente toda vez que adiciona uma nova nota para ver se há conflitos com as notas antigas, fazendo com que a conta fique cada vez mais alta conforme o usuário fala.

Resumo de Recomendações para Desenvolvedores

Se você está construindo um agente de IA, o artigo sugere:

  1. Não olhe apenas para a precisão. Um sistema pode ter 90% de precisão, mas custar 100x mais para rodar do que um de 70%.
  2. Trate a "Escrita" como um trabalho de segundo plano. Não faça o usuário esperar para que a IA arquive suas notas. Faça isso em segundo plano.
  3. Escolha a ferramenta certa para o trabalho. Se você precisa de fatos simples, use o classificador de "Fichas de Índice". Se precisa de raciocínio profundo, use o "Erudito Sumarizador", mas esteja preparado para o alto custo de "preparação".
  4. Cuidado com a "Obsolescência". Se o seu sistema demora muito para arquivar as notas, sua IA estará respondendo com base nas notícias de ontem.

Em suma: A Memória de Agente é uma ferramenta poderosa, mas não é gratuita. O artigo nos ensina que os sistemas de memória "mais inteligentes" são frequentemente os mais caros e lentos para configurar, por isso precisamos escolhê-los cuidadosamente com base no que estamos dispostos a pagar por eles.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →