← Últimos artigos
💻 computer science

SWE-MeM: Learning Adaptive Memory Management for Long-Horizon Coding Agents

O SWE-MeM é um framework de treinamento que equipa agentes de engenharia de software com capacidades adaptativas de gerenciamento de memória sob demanda por meio de uma ferramenta flexível e GRPO consciente de memória, permitindo que eles otimizem dinamicamente o uso de contexto e alcancem um desempenho superior em tarefas de codificação de longo horizonte em comparação com métodos estáticos existentes.

Autores originais: Shuzheng Gao, Wenhao Zeng, Zhaojian Yu, Jianqiao Wangni, Chaozheng Wang, Kai Cai, Shilin He, Michael R. Lyu

Publicado 2026-06-30
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Shuzheng Gao, Wenhao Zeng, Zhaojian Yu, Jianqiao Wangni, Chaozheng Wang, Kai Cai, Shilin He, Michael R. Lyu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Problema: O Engarrafamento de "Informação Demais"

Imagine que você é um brilhante detetive de software (um agente de IA) contratado para corrigir um erro em um edifício massivo e complexo (um repositório de código). Você inicia sua investigação, mas, conforme trabalha, deixa um rastro de notas, fotos e gravações de cada passo que dá.

  • O Problema: No mundo real, essas "notas" (o histórico da conversa) continuam se acumulando. Eventualmente, a pilha torna-se tão grande que bloqueia a porta. Seu cérebro de detetive (o modelo de IA) tem um espaço limitado para olhar as coisas ao mesmo tempo (a "janela de contexto"). Se a pilha ficar grande demais, você ou não consegue ver as novas pistas, ou fica tão sobrecarregado por detalhes irrelevantes antigos que esquece o que estava tentando resolver.
  • O Jeito Antigo: Métodos anteriores tentavam resolver isso sendo rígidos. Eles eram como um bibliotecário rigoroso que diz: "Toda vez que você escrever 100 páginas, eu vou automaticamente jogar fora as primeiras 50 páginas e substituí-las por um resumo genérico". Isso é ruim porque, às vezes, as primeiras 50 páginas contêm a única pista de que você precisa, e às vezes as últimas 50 páginas são apenas você reclamando do tempo (que você pode descartar com segurança).

A Solução: SWE-MeM (O Assistente Pessoal Inteligente)

Os autores criaram o SWE-MeM, um novo framework de treinamento que ensina o agente de IA a ser seu próprio assistente pessoal inteligente. Em vez de um bibliotecário rígido, o agente aprende a gerenciar sua própria memória de forma proativa.

Veja como funciona, dividido em três partes simples:

1. A Ferramenta Flexível (Decidindo Quando e o Quê)

O SWE-MeM dá ao agente uma ferramenta especial chamada compress (comprimir). O agente aprende a se perguntar três questões antes de usá-la:

  • Quando? Eu preciso limpar agora? (Minha mesa está ficando muito bagunçada?)
  • O Quê? Quais partes das minhas notas são lixo? (Isso é uma longa lista de tentativas de teste falhas ou é um trecho de código crítico?)
  • Como? Como eu resumo isso? (Eu apenas mantenho a conclusão ou mantenho a mensagem de erro específica?)

Analogia: Imagine que você está escrevendo um diário. Um sistema rígido deleta a primeira página toda vez que você escreve uma nova. O SWE-MeM é como um editor inteligente que olha para o seu diário e diz: "Ei, você passou três dias apenas encarando uma parede branca (baixo valor). Vamos resumir isso como 'Dia 3: Travado'. Mas você encontrou o cano quebrado no Dia 5 (alto valor). Vamos manter esse detalhe exatamente como está".

2. O Método de Treinamento (Aprendendo Fazendo)

Como você ensina uma IA a ser tão inteligente? Você não pode apenas dizer; ela tem que praticar. Os autores usaram um processo de treinamento de três etapas:

  • Sintetizando Trajetórias (A Simulação): Eles criaram milhares de "casos de detetive" falsos. Eles usaram uma IA super inteligente para agir como um juiz, decidindo quando o detetive deveria ter limpado suas notas. Eles construíram um conjunto de dados onde o agente pratica comprimir as coisas certas nos momentos certos.
  • Aprendizado por Currículo (Escolaridade): Eles ensinaram o agente em estágios. Primeiro, ensinaram o básico: "Aqui está como você escreve um resumo". Assim que ele aprendeu isso, passaram para a aula avançada: "Agora, aprenda a resumir antes de ficar sem espaço, não apenas quando for forçado a isso". É como ensinar um aluno a arrumar a mala antes da viagem, em vez de esperar até que a mala esteja estourando.
  • GRPO Consciente de Memória (O Sistema de Recompensa): Esta é a parte mais técnica, mas pense nisso como um sistema de pontuação de videogame.
    • No treinamento normal, a IA só recebe um ponto de "Vitória" se ela consertar o erro no final de tudo.
    • No SWE-MeM, o sistema observa a jornada inteira. Se a IA tomou uma ótima decisão de compressão no meio do caminho que a ajudou a resolver o problema mais tarde, ela ganha um ponto de bônus. Se ela comprimiu algo importante e ficou travada, ela recebe uma penalidade. Isso ensina à IA que o bom gerenciamento de memória é parte de vencer o jogo.

3. Os Resultados (Vencendo o Jogo)

Os autores testaram o SWE-MeM no SWE-Bench Verified, um benchmark difícil onde agentes de IA precisam corrigir bugs de software do mundo real.

  • A Pontuação: Com um modelo pequeno (4 bilhões de parâmetros), o SWE-MeM resolveu 43,4% dos problemas. Com um modelo maior (30 bilhões), resolveu 60,2%.
  • A Eficiência: Não apenas resolveu mais problemas, mas também usou menos tokens (palavras/caracteres) e deu menos passos do que outros métodos.
  • A Comparação: Superou todos os métodos anteriores de "bibliotecário rígido". Provou que deixar o agente decidir quando limpar sua memória é muito melhor do que forçá-lo a limpar em um cronograma.

Resumo

SWE-MeM é como atualizar um detetive de alguém que tritura papéis freneticamente quando a mesa fica cheia, para um detetive que sabe exatamente quais pistas manter, quais resumir e quando arrumar a mesa para que possa continuar resolvendo casos de forma eficiente sem ficar sem espaço. Ele ensina a IA a ser proativa, flexível e eficiente, resultando em correções de código melhores com menos esforço desperdiçado.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →