← Últimos artigos
💬 NLP

Learning Query-Aware Budget-Tier Routing for Runtime Agent Memory

Este artigo apresenta o BudgetMem, um framework de memória para agentes em tempo de execução que emprega um roteador baseado em aprendizado por reforço para selecionar dinamicamente níveis de orçamento conscientes da consulta entre módulos de memória, otimizando efetivamente o equilíbrio entre desempenho da tarefa e custo computacional.

Autores originais: Haozhen Zhang, Haodong Yue, Tao Feng, Quanyu Long, Jianzhu Bao, Bowen Jin, Weizhi Zhang, Xiao Li, Jiaxuan You, Chengwei Qin, Wenya Wang

Publicado 2026-05-21
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Haozhen Zhang, Haodong Yue, Tao Feng, Quanyu Long, Jianzhu Bao, Bowen Jin, Weizhi Zhang, Xiao Li, Jiaxuan You, Chengwei Qin, Wenya Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um detetive tentando resolver um mistério. Você tem um arquivo maciço cheio de milhares de arquivos de casos antigos, registros de bate-papo e anotações (esta é a sua memória). Uma nova pergunta chega: "Quem roubou o biscoito?"

O Jeito Antigo: "Construir Uma Vez, Usar Sempre"

A maioria dos sistemas de IA atuais funciona como um bibliotecário que, todas as noites, lê cada arquivo único no armário, resume-os e empurra os resumos para uma caixinha minúscula.

  • O Problema: Se você fizer uma pergunta simples como "Qual é o clima?", o bibliotecário ainda passou a noite inteira lendo os arquivos sobre o roubo do biscoito. É um desperdício de tempo e energia. Pior ainda, se o resumo perdeu um detalhe minúsculo sobre o biscoito, o bibliotecário não pode voltar e verificar porque os arquivos originais já foram "processados" e descartados.

O Jeito Novo: BudgetMem

O artigo apresenta o BudgetMem, um sistema mais inteligente que trata a memória como uma cozinha de restaurante com um orçamento flexível.

Em vez de cozinhar tudo de antemão, a cozinha espera até que você faça um pedido (a consulta). Então, decide exatamente quanto esforço gastar na preparação dos ingredientes para aquele pedido específico.

1. Os Três Níveis de Orçamento (Baixo, Médio, Alto)

Cada etapa na cozinha tem três maneiras de preparar o mesmo prato:

  • Orçamento Baixo (O Lanche Rápido): Use uma regra simples ou um ajudante rápido e pequeno. É barato e rápido, mas pode perder sabores sutis.
    • Analogia: Usar uma busca por palavra-chave básica ou um robô pequeno e rápido para escanear os arquivos.
  • Orçamento Médio (A Refeição Padrão): Use uma ferramenta um pouco mais inteligente ou um pouco mais de pensamento. Custa um pouco mais, mas é mais preciso.
    • Analogia: Usar um modelo de IA de tamanho médio ou uma abordagem de "Cadeia de Pensamento" (pensando passo a passo).
  • Orçamento Alto (O Banquete Elegante): Use o chef mais poderoso e complexo e um processo de múltiplos passos. É caro e lento, mas acerta os detalhes com mais precisão.
    • Analogia: Usar um modelo de IA massivo e superinteligente que raciocina profundamente e verifica seu próprio trabalho.

2. O Garçom Inteligente (O Roteador)

A mágica do BudgetMem é um roteador leve, que age como um garçom inteligente.

  • Quando você pede "Qual é o clima?", o garçom olha para o pedido e diz: "Não precisa chamar o chef elegante! Vamos usar apenas a busca rápida de Orçamento Baixo. É rápido e barato."
  • Quando você pede "Quem roubou o biscoito e por quê?", o garçom vê que este é um mistério complexo. Ele diz: "Ok, para a parte do 'Quem', vamos usar Orçamento Médio. Mas para a parte do 'Por quê', precisamos do chef de Orçamento Alto para realmente pensar nisso."

O garçom aprende esse comportamento usando Aprendizado por Reforço (tentativa e erro). Ele recebe uma "pontuação" baseada em duas coisas:

  1. Você obteve a resposta correta? (Desempenho)
  2. Gastos demais dinheiro? (Custo)

Com o tempo, o garçom aprende o equilíbrio perfeito: gastar apenas o dinheiro suficiente para obter a resposta correta, mas não um centavo a mais.

3. Três Maneiras de Alterar o Orçamento

O artigo testou três maneiras diferentes de criar esses "níveis" para a cozinha:

  • Escalonamento de Implementação: Mudar quem faz o trabalho. (Baixo = Regras simples; Médio = Uma IA pequena; Alto = Uma IA gigante).
  • Escalonamento de Raciocínio: Mudar como eles pensam. (Baixo = Adivinhar imediatamente; Médio = Pensar passo a passo; Alto = Pensar, verificar e repensar).
  • Escalonamento de Capacidade: Mudar o tamanho do cérebro. (Baixo = Um cérebro minúsculo; Médio = Um cérebro médio; Alto = Um cérebro gigante).

Os Resultados

Os pesquisadores testaram esse sistema em três diferentes "jogos de mistério" (conjuntos de dados):

  1. LoCoMo: Conversas longas.
  2. LongMemEval: Lembrar detalhes ao longo de longos períodos.
  3. HotpotQA: Perguntas complexas que exigem múltiplas pistas.

O que eles descobriram:

  • Quando o dinheiro não é problema (Orçamento Alto): O BudgetMem superou todos os outros sistemas, obtendo respostas melhores do que os métodos de "construir uma vez".
  • Quando o dinheiro está apertado (Orçamento Baixo): O BudgetMem ainda foi muito bom. Ele sabia quando cortar cantos sem estragar a resposta, enquanto outros sistemas ou desperdiçavam dinheiro ou davam respostas ruins porque eram muito rígidos.
  • O "Ponto Ideal": O sistema provou que você não precisa usar o chef de "Orçamento Alto" para cada pergunta. Ao misturar os níveis Baixo, Médio e Alto de forma inteligente, você pode obter os melhores resultados pelo menor valor de dinheiro.

Em Poucas Palavras

BudgetMem é um sistema que impede que a IA desperdice energia. Em vez de processar tudo cegamente, ele usa um "garçom" inteligente para decidir exatamente quanto poder de processamento gastar em cada pergunta específica, garantindo que você obtenha a melhor resposta possível sem pagar mais do que precisa.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →