← Últimos artigos
🤖 AI

Memory in the Loop: In-Process Retrieval as ExtendedWorking Memory for Language Agents

Este artigo argumenta que o deslocamento da recuperação de memória de um armazenamento de rede externo e lento para um armazenamento em processo rápido a transforma em uma memória de trabalho estendida eficaz para agentes de linguagem, eliminando, assim, a degradação de desempenho induzida pela latência que atualmente força os agentes a limitar a recuperação a uma vez por turno.

Autores originais: Yusuf Khan, Carlo Lipizzi

Publicado 2026-07-08
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Yusuf Khan, Carlo Lipizzi

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Problema Central: O "Bibliotecário Lento" vs. O "Caderno"

Imagine que você está tentando resolver um quebra-cabeça complexo. Você tem um assistente brilhante (o agente de IA) que é muito inteligente, mas tem um tempo de atenção muito curto. Para ajudá-lo, você lhe dá um caderno (a "janela de contexto") onde ele pode anotar fatos importantes.

O Jeito Antigo (IA Atual):
Atualmente, se o assistente esquece algo ou precisa verificar um fato que não está em seu caderno imediato, ele tem que parar, caminhar até uma biblioteca enorme na rua de baixo (um banco de dados na nuvem), pedir um livro ao bibliotecário, esperar o bibliotecário encontrar e caminhar de volta.

  • O Problema: Essa viagem leva muito tempo (cerca de 100 milissegundos). Se o assistente tiver que consultar a biblioteca cada vez que pensa em um novo passo, todo o processo trava. Como a viagem é tão lenta, os engenheiros dizem ao assistente: "Vá à biblioteca apenas uma vez no início da tarefa, depois apenas adivinhe o resto". Isso leva a erros porque o assistente esquece coisas que aconteceram durante a tarefa.

A Nova Ideia (Memory in the Loop):
Os autores deste artigo perguntaram: "E se a biblioteca não estivesse na rua, mas sim na própria mesa do assistente?"
Eles construíram um sistema de memória minúsculo e super-rápido que vive dentro do cérebro do assistente (in-process). Consultar essa memória leva apenas 0,0001 segundos (100 microssegundos).

  • O Resultado: O assistente agora pode consultar sua memória cada vez que dá um passo, sem perder velocidade. É como ter um caderno que se atualiza instantaneamente, em vez de ter que caminhar até uma biblioteca.

A Grande Descoberta: A Velocidade Muda a Forma Como Pensamos

O artigo argumenta que a velocidade não é apenas sobre economizar tempo; ela muda a natureza da memória.

  • A Analogia da "Ferramenta" vs. O "Mente":
    • Se você tem que caminhar 10 minutos para pegar uma ferramenta, essa ferramenta é um objeto externo. Você tem que planejar usá-la e pode esquecer de trazê-la.
    • Se a ferramenta está no seu bolso e você pode pegá-la instantaneamente, ela se torna parte do seu corpo. Você a usa automaticamente, sem pensar.
    • O artigo afirma que, como esta nova memória é tão rápida, ela deixa de ser um "banco de dados que a IA consulta" e se torna uma "memória de trabalho que a IA possui". Ela permite que a IA raciocine continuamente sem quebrar seu fluxo.

Os Experimentos: Provando que Funciona

Os pesquisadores testaram isso com dois cenários principais:

1. O Teste do "Planejador de Viagens" (Consegue lembrar de fatos?)

  • A Configuração: A IA tinha que planejar uma viagem baseada em 5 regras específicas (ex: "Sem cachorros", "Deve ser barato"). A conversa era longa, então as regras acabariam "caindo" do caderno de curto prazo da IA (a janela de contexto).
  • O Resultado:
    • Sem a memória rápida, a IA esqueceu as regras completamente (0 de 5 corretas).
    • Com a memória rápida, a IA lembrou da maioria das regras (3,6 a 4,8 de 5 corretas).
    • Nota: Os pesquisadores também descobriram que, se você apenas dissesse à IA para "repetir as regras em cada frase", funcionaria perfeitamente. Mas isso é caro (como reescrever um livro inteiro toda vez que você adiciona uma página). A memória rápida alcançou resultados semelhantes sem esse custo pesado.

2. O Teste do "Guarda de Loop" (Consegue parar de repetir erros?)

  • A Configuração: A IA tinha que verificar uma lista de alertas de segurança. Alguns alertas eram duplicatas de outros que ela já havia visto. O objetivo era impedir que a IA investigasse a mesma coisa duas vezes.
  • O Testo: Eles desaceleraram artificialmente a velocidade da memória para ver o que acontecia.
    • Memória Rápida (0,0001s): A IA verificou cada alerta contra sua memória. Ela cometeu zero erros.
    • Memória Lenta (0,1s): A IA não podia se dar ao luxo de verificar cada alerta porque demoraria muito. Ela pulou verificações e repetiu ações 7 vezes de 12.
    • A Lição: A IA não ficou "mais burra". Ela apenas não podia se dar ao luxo de consultar sua memória rápido o suficiente. Quando a memória foi instantânea, a IA parou de cometer erros redundantes.

O Gargalo Escondido: O "Tradutor"

Os pesquisadores descobriram um detalhe. Embora a memória em si fosse instantânea, a IA ainda precisava "traduzir" o que estava pensando para um formato que a memória pudesse entender (chamado de "embedding").

  • Se essa tradução ocorresse pela internet, era lenta.
  • A Solução: Ao usar um tradutor minúsculo e local (um modelo de IA pequeno rodando no mesmo computador), eles fizeram com que todo o processo (pensar + traduzir + consultar a memória) levasse apenas 0,00004 segundos. Isso é rápido o suficiente para acontecer em cada passo do raciocínio da IA.

Resumo das Alegações

  1. A Velocidade é o Porteiro: A razão pela qual os agentes de IA não consultam sua memória constantemente não é porque seja uma má ideia; é porque os atuais bancos de dados na nuvem são lentos demais.
  2. In-Process é a Solução: Ao mover a memória para o mesmo computador que a IA (in-process), a velocidade aumenta em 1.000 vezes.
  3. Isso Muda o Comportamento: Quando a memória é instantânea, a IA para de cometer erros "redundantes" (fazer a mesma coisa duas vezes) porque pode verificar seu histórico em cada passo.
  4. Não é Magia: A IA não ficou mais inteligente; o sistema ao redor dela ficou mais inteligente. A IA ainda comete erros se a verificação da memória for lenta, mas com a memória rápida, o sistema evita esses erros automaticamente.

Em resumo: Este artigo prova que, se você der a uma IA um "caderno super-rápido" que vive dentro de seu próprio cérebro, ela pode parar de esquecer coisas e de repetir erros, transformando efetivamente o armazenamento externo em uma verdadeira parte de seu processo de pensamento.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →